
10 分钟上车ComfyUI 装好 H3 节点第一段 2K 有声视频这样出【免费下载链接】Minimax-H3-ComfyUI项目地址: https://ai.gitcode.com/hf_mirrors/Alissonerdx/Minimax-H3-ComfyUI2026 年 8 月初MiniMax 开源了通用全模态视频模型 H3一套权重同时打通文生视频、图生视频、首尾帧控制与全模态参考原生输出 2K 分辨率、24fps、最长 15 秒的带同步立体声视频。社区反响几乎是两级的——一边是开源视频终于上桌吃饭的兴奋一边是权重版本太多、依赖复杂、显存门槛到底多高的劝退。本文不聊参数表只讲一件事在已有 ComfyUI 的前提下如何在 10 分钟内装好 H3 节点、配好参数跑出你的第一段 2K 有声视频并把常见的坑提前排掉。文中所有参数与路径均来自本仓库的预置工作流与文档可对照复现。一、10 分钟倒计时节点安装与环境检查1.1 开工前先做三件事装 H3 前建议先花一分钟核对三张配置清单社区里大量失败案例都倒在这一步ComfyUI 本体H3 节点对 ComfyUI 版本有要求社区实测在 ComfyUI 0.30.0 Ubuntu 24.04 RTX 4090 的环境上可稳定跑通量化版。版本过旧会导致节点 API 不匹配、报unknown node type。显卡与显存H3 是 33B 级全模态模型社区实测结论是——INT8 量化版可压到 8GB 显存设备运行480P 生成耗时 5–10 分钟12GB 的 RTX 3060 可跑单张 24GB 显卡即可完成常规部署。显存紧张时KV Cache 是最大瓶颈社区还出现将 Block Cache 显存直降约 10G 的优化方案。依赖节点本仓库预置工作流依赖ComfyUI-KJNodes提供 SetNode、EmptyMiniMaxH3LatentAV等节点、ComfyUI-VideoHelperSuiteVHS 系列VHS_LoadVideoFFmpeg、VHS_VideoCombine以及 Comfy-Org 的 MiniMax H3 官方节点MiniMaxH3AddGuide、MiniMaxH3ReferenceToVideo、MiniMaxH3SigmaShift等。这些依赖的节点名都直接写在工作流 JSON 的properties.aux_id与type字段里用 ComfyUI Manager 一键安装即可。1.2 权重放对位置比下载更重要H3 的 ComfyUI 适配版权重由多个文件组成本仓库工作流的加载器节点给出了完整的路径约定见 workflows/minimax_h3_live_wallpaper_workflow.json角色工作流中的实际文件建议放置目录扩散模型UNetminimax_h3_ref2va_pruned_int8_convrot.safetensorsINT8 剪枝版ComfyUI/models/diffusion_models/文本编码器 1minimax/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/clip/子目录可省略文本编码器 2qwen3-vl-4b-heretic_int8_dynamic_convrot.safetensorsComfyUI/models/clip/视频 VAEminimax/minimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/音频 VAEminimax/minimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/注意音频 VAE 与视频 VAE 是两个独立文件H3 的音画联合生成依赖音频 VAE 单独解码漏掉它会导致输出只有画面没有声音。若内存压力大社区建议优先用 INT8 量化版扩散模型 AWQ 量化文本编码器组合这是8GB 显存也能玩的关键。LoRA 类增强权重则统一放在ComfyUI/models/loras/见 README。本仓库自带的 7 个 LoRA 全部遵循该约定直接拷贝即可被LoraLoaderModelOnly节点识别。二、文生视频工作流参数速配H3 在 ComfyUI 里的管线非常规整核心是空 latent → 双 pass 生成 → 音画各自解码 → 合成保存。预置工作流如 workflows/minimax_h3_lms_workflow.json、workflows/minimax_h3_live_wallpaper_workflow.json里已经把这套骨架搭好文生视频只需把参考图/参考视频输入替换为纯文本提示词参数规则完全一致。2.1 分辨率与帧数先记住一条硬规则H3 的帧数不是任意的必须是17n 5n 为正整数即 5、22、39、56、73、90、107、124……。预置工作流中的EmptyMiniMaxH3LatentAV节点给出的是1344 × 768 分辨率、124 帧16:9 宽画幅而MiniMaxH3ReferenceToVideo节点的 First Pass 设置为672 × 384、107 帧。两组数据都严格落在 17n5 上107 17×65124 17×75。这并非巧合——仓库 README 明确要求输出宽高比与源素材匹配、帧数使用 H3 支持的 17n5 序列。实操要点宽高比决定一切。改变分辨率时务必保持 16:9或与源素材一致的画幅否则会出现主体拉伸、构图偏移。想加长视频按 17n5 递增帧数不要随手填一个顺眼的数字。双 pass 的帧数必须一致First Pass 与 Second Pass 共用同一时间网格。2.2 采样参数CFG1采样器别乱换预置工作流的采样设置高度统一CFG 1CFGGuider节点这是 H3 类扩散模型的常见设定高 CFG 反而容易产生过曝与运动崩坏。采样器 eulerKSamplerSelectVFX Edit 工作流使用dpmpp_sde_gpu两条路线都验证过。步数控制社区在低显存调优时强调步数优先、显存次之的顺序Turbo 类 LoRA4 步/3 步版本可大幅缩短生成时间——本仓库 live wallpaper 工作流中就串了一个minimax_h3_taomate_3step_lora_avg_rank_19_bf16.safetensors作为提速手段。普通权重下 20–30 步是稳妥起点。2.3 双 pass 管线低清打底2K 收尾这是 H3 出 2K 的核心机制不要试图用单次生成直出高分辨率First Pass以较低分辨率672×384先生成完整时间序列负责确定构图、运动与叙事结构Second Pass接入MinimaxH3LatentUpscaler3D节点将 latent 上采样到目标分辨率预置参数为 1280×704再走一遍生成补齐细节。本仓库还提供了一个专用的 latent upscaler 权重FP16与 LMS 锐化数据集同源微调 2000 步可在第二 pass 叠加使用让 2K 输出更锐利。社区评测中2K 有声视频即来自这套 First Pass Second Pass 的组合。需要说明的是upscaler 是研究型 checkpoint对缺失的文本、logo 等细节做不到可靠重建别把它当超分万金油。2.4 音频参数从空音频开始H3 的有声能力在 ComfyUI 里由三件套构成EmptyAudio节点预置为44100 Hz、双声道立体声时长按视频秒数设定、音频 VAE 解码节点VAEDecodeAudio、以及带音频的SaveVideo/VHS_VideoCombine输出24fps、H.264、CRF 12见工作流 JSON 中的VHS_VideoCombine参数。提示词里对声音的描述环境音、人声、节奏会随视频一同生成这是 H3 相比画面生成后再另配音频方案的直接优势——声音与画面在同一时间网格上生成天然对齐。仓库 examples/comparison-2-audio.mp4 等对比示例即是带音轨的输出。2.5 提示词结构触发词 单句 句尾收束本仓库的 LoRA 全部采用触发词前缀协议live_wallpaper:、style_transfer:、vfx_edit:、head_swap:详见 docs/lms.md、docs/live-wallpaper.md 等文档这套结构同样适用于纯文生视频明确镜头锁定镜头、缓慢推进、摇镜、后拉——H3 对镜头指令的响应显著不写清楚镜头模型会自行发挥导致运动不可控R64 版 live wallpaper LoRA 的 295 条训练标注中锁定镜头占比 52.9%其余为推拉摇移的组合说明镜头语料越具体越可控。一句话说完保持一条简洁的英文句子先写动作/事件再写环境与氛围最后以约束句收尾。句尾收束参考 live wallpaper 模板的while preserving the original subject and composition文生视频同样建议以保持光影一致、主体稳定、无闪烁类的约束收束降低生成中途漂移的概率。中文提示词社区多篇实测确认 H3 的中文理解明显优于同类开源模型中文描述可直接使用但触发词前缀仍需保留原文。三、首段 2K 有声视频出片验收3.1 出片清单四样都齐才算过按上面参数跑完用这份清单验收画质输出应为 2K 级别约 1280×704 以上无块状伪影、无整体过曝时长124 帧 ÷ 24fps ≈ 5 秒起步如需 15 秒按 17n5 拉长社区称 H3 最长支持 15 秒有声输出声音视频自带音轨且与画面同步用VAEDecodeAudio节点确认音频被解码出来运动主体无闪烁、无变形漂移镜头运动符合提示词描述。3.2 高频坑位与对策把社区踩坑记录与本仓库工作流设计对照以下问题几乎人人会遇到症状根因对策出片无声未加载音频 VAE或EmptyAudio时长小于视频补minimax_h3_audio_vae_fp32.safetensors音频时长 ≥ 视频时长OOM显存不足KV Cache 峰值过高换 INT8 量化扩散模型 AWQ 文本编码器开启 CPU offload用 Turbo LoRA 降步数主体拉伸/构图歪宽高比与源素材不匹配锁定 16:9改分辨率时成对改宽高别单改一边运动卡顿/跳变帧数不是 17n5或双 pass 帧数不一致帧数设为 5/22/39/56/73/90/107/124……双 pass 保持同一帧数参考图场景串扰多参考时两 pass 的图不一致双 pass 使用同一批参考图、同一顺序见 docs/live-wallpaper.md 的明确要求2K 输出细节糊upscaler 无法重建已缺失的细节优先保证 First Pass 质量再上 upscaler文本/logo 等关键细节在提示词中显式声明还有一个容易被忽略的隐性坑若使用本仓库的增强 LoRALMS锐化建议强度 1.0style transfer 若发现动作被改变过多可降到约 0.7head swap 建议 0.5 起调——LoRA 强度不是越高越好高强度的代价往往是运动保真度下降。3.3 从出片到生产别忘了三件事第一段视频跑通之后向生产级工作流靠近还需要补齐一是双 pass 的种子对齐保证低清与高清两阶段运动一致二是批量任务队列社区实践表明 H3 更适合一批分镜脚本连续出片的短剧/漫剧场景单条调试远不如批量划算三是合规边界尤其涉及人物替换类 LoRAhead swap务必确认素材授权与用途合规仓库 docs/head-swap.md 对此有专门声明。回到开头的问题H3 值不值得装如果你已经有一块 8–24GB 的显卡和 ComfyUI10 分钟完成节点安装与参数配置后你将获得的是一个能出 2K、能带原生立体声、能理解中文导演级提示词的本地视频生产线。它当然不是终点——动作闪烁、长片段质量、细节重建仍是社区公认的短板但作为开源生态里少有的音画一体方案这套工作流值得你亲手跑一遍再决定要不要把它放进日常创作流程。【免费下载链接】Minimax-H3-ComfyUI项目地址: https://ai.gitcode.com/hf_mirrors/Alissonerdx/Minimax-H3-ComfyUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考