多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4创作案例:6秒480×864视频生成实战

Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4创作案例:6秒480×864视频生成实战 Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4创作案例6秒480×864视频生成实战【免费下载链接】Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4项目地址: https://ai.gitcode.com/hf_mirrors/sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4是一款针对MiniMax-H3视频生成的无审查文本编码器采用NVFP4混合精度量化技术文件大小仅15.7GB可在单张16GB显卡上流畅运行为普通创作者提供了高效的视频生成解决方案。 为什么选择这款文本编码器对于没有80GB高端显卡的创作者来说Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4是理想选择。创意工作不应受限于数据中心级硬件量化技术的意义就在于让更多人能够参与到视频创作中。与其他版本相比它具有明显优势版本大小是否适配16GB显卡Heretic INT8-ConvRot上游版本26.4 GB否需要内存卸载Heretic NVFP4本项目15.7 GB是Comfy-Org NVFP4有审查15.7 GB是它与Comfy-Org官方NVFP4编码器大小相同是直接替代品只需将CLIPLoader指向此文件其余MiniMax-H3工作流程保持不变。 实测性能数据使用MiniMax-H3fl2va剪枝INT8扩散模型、res_multistep20步、ComfyUI 0.30.0、Sage Attention开启生成6秒480×864垂直带音频视频的实测数据如下项目数值GPU1× RTX PRO 2000 Blackwell16 GBsm_120生成期间峰值VRAM~9.9 GB编码器加载到VRAM14.9 GB动态加载ComfyUI进程使用系统内存~36 GB在相同提示和种子下将输出与上游INT8-ConvRot版本进行比较两者视觉效果相当——量化不会改变编码器的描述内容。 文件与安装项目包含以下文件qwen3vl_32b_heretic_minimax_h3_nvfp4.safetensors 15.7 GB安装步骤克隆仓库git clone https://gitcode.com/hf_mirrors/sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4将文件放置在ComfyUI/models/text_encoders/目录下在CLIPLoader中选择类型minimax你还需要从Comfy-Org/MiniMax-H3获取扩散模型和VAE。⚙️ 技术原理与注意事项旋转权重处理上游权重经过旋转其comfy_quant元数据为{format: int8_tensorwise, convrot: true, convrot_groupsize: 256, per_row: true}ConvRot将每个权重已乘以归一化的Hadamard矩阵W_stored W Hᵀ每256宽组并在运行时旋转激活以匹配。如果不解开旋转就将这些权重反量化并重新量化为普通NVFP4会得到一个能加载、运行但生成完全无关视频的文件。修复方法是在重新量化前再次乘以Hfrom comfy_kitchen.backends.eager.convrot_w4a4 import _build_hadamard def unrotate(w, gs256): # w: 反量化 [out, in] out_f, in_f w.shape h _build_hadamard(gs, devicew.device, dtypetorch.float32).to(w.dtype) return torch.matmul(w.reshape(out_f, in_f // gs, gs), h).reshape(out_f, in_f)混合精度处理350个线性层为NVFP4TensorCoreNVFP4Layout组大小16。model.embed_tokens151936 × 5120 778 M参数保留为INT8——与Comfy-Org在官方NVFP4版本中的选择相同。量化它对大小收益不大且是在烘焙过程中会导致16GB显卡OOM的层。ComfyUI读取每层comfy_quant元数据因此混合文件无需特殊处理即可加载。烘焙过程在单张16GB GPU上约两分钟即可完成。 常见问题如果输出与提示无关而非仅仅质量较低可能是旋转不匹配而非量化问题。此版本继承上游INT8舍入直接从BF16烘焙会略好但我们没有这些权重。NVFP4需要硬件支持本项目使用Blackwellsm_120进行烘焙和推理。 来源与许可无审查/Heretic工作ethanfel原始编码器Qwen3-VL-32B阿里巴巴/Qwen团队适用于MiniMax-H3MiniMax-H3MiniMaxAIComfyUI打包约定和量化布局Comfy-Org此NVFP4重新量化Lna-Lab(Tono_Ken3)许可遵循上游仓库MiniMax-H3模型权重本身受MiniMax H3社区许可约束。【免费下载链接】Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4项目地址: https://ai.gitcode.com/hf_mirrors/sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表