多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

单卡加速265倍!北大清华阿里发布首个视频生成加速三阶段框架,含开源权重

单卡加速265倍!北大清华阿里发布首个视频生成加速三阶段框架,含开源权重 「首次定义“高稀疏陷阱”」目录01 稀疏度从 90% 到 97%不是简单地再省 7%02 问题不在某一步而在整条轨迹03 解开陷阱的关键从“逐步监督”转向“终端对齐监督”04 SparkDiffusion 的关键把团队两项子方法接成完整链路05 RoLA为极高稀疏率保留全局信息06 CrossDistill3 步兼顾质量与多样性07 从算法减法到真实的 GPU 加速08 写在最后一段约5秒、81帧的720P视频扩散生成时间从4769秒缩短到18秒。这是 SparkDiffusion 在 Wan2.1-T2V-14B 上给出的结果单张 RTX 5090265 倍加速换到 H100同一任务从 1757 秒降至 8 秒加速220 倍。在 Wan2.1-T2V-1.3B-480P 上生成同样为 81 帧、约 5 秒的视频RTX 5090 仅需1.3 秒H100 仅需0.6 秒。北京大学、清华大学、阿里巴巴集团等机构联合构建了首个支持稀疏注意力、少步蒸馏与低精度量化一体化部署含开源权重及训练代码的视频生成加速框架及代码库。SparkDiffusion打通了从模型训练、轨迹校正到 GPU 部署的完整链路。随着分辨率提高视频 token 序列迅速变长稠密注意力的二次复杂度愈发突出因此SparkDiffusion 的稀疏计算优势会在高分辨率场景下更加显著。图1SparkDiffusion 覆盖 Wan2.1/Wan2.2、文生视频与图生视频以及 480P/720P 等多种设置。但在实现这一加速之前团队首先发现了一个反常现象训练损失还在下降生成的视频却越来越差。01 稀疏度从 90% 到 97%不是简单地再省 7%视频 DiT 需要在长时空序列上反复计算注意力。稀疏注意力只保留重要的 query-key 块是最直接的降本方式之一。但从 90% 稀疏提升到 97% 稀疏保留的注意力块实际上从 10% 降到了 3%稀疏分支的计算量仅剩前者约 30%。虽然速度空间更大但是信息损失也骤然加剧。研究团队在 Wan2.1-T2V-14B-480P 上发现80% 和 90% 稀疏时结果仍接近稠密模型到 95% 和 97%人物、道路和背景结构开始明显破碎。图2生成质量在 95%—97% 稀疏区间显著下降。这并非“训练还不够”。诊断模型训练到 10000 步、数据扩大到约 30000 个视频后逐步监督损失仍在下降最终视频质量却没有恢复增大补偿分支容量同样收效甚微。团队将这种现象称为高稀疏陷阱high-sparsity trap。02 问题不在某一步而在整条轨迹扩散模型沿着去噪轨迹逐步生成视频。逐步损失衡量的是当前预测是否准确最终视频却取决于每一步误差如何传递和累积。研究者做了一项干预实验仅在一小段采样区间中用稠密教师替换稀疏学生的预测。在 97% 稀疏率下只修正最高噪声的 5 步就能移除大部分终点误差用相同预算修正最低噪声的 5 步改善却很有限。图3相同修正预算下高噪声阶段对最终结构、时序稳定性和感知质量的影响更大。03 解开陷阱的关键从“逐步监督”转向“终端对齐监督”上述诊断说明监督目标与最终生成质量发生了错位。Flow Matching 等常规逐步监督只要求模型在某个噪声时刻预测正确的速度却不直接约束这一步与后续轨迹组合后最终会生成什么。极高稀疏率使得速度误差更大、方向更一致即使每一步的平均损失持续下降也可能沿轨迹累积为明显的终点偏差。终端对齐监督terminal-aligned supervision正是解决高稀疏陷阱的有力方法。它的监督目标来自当前时刻之后的轨迹状态、教师组合轨迹或最终样本因此不仅关注“这一步是否准确”还约束“这一步最终会把生成结果带到哪里”。论文在六种二维序列分布上进行了受控实验。95% 稀疏模型训练至验证损失收敛后多步轨迹在临近终点时仍明显偏离数据分布加入轨迹级终端对齐蒸馏后少步学生的终点距离重新接近稠密教师。图4红色虚线为已完成逐步训练的多步稀疏模型绿色为加入终端对齐蒸馏的稀疏学生后者在六种分布上的轨迹末端误差均显著下降。这说明继续延长逐步训练并不是最有效的修复方式。更直接的路径是先用逐步监督让高稀疏模型形成可用的粗略先验再用终端对齐监督修正最终分布。这一原则并不局限于某一种稀疏结构或蒸馏目标也是 SparkDiffusion 三阶段设计的核心出发点。04 SparkDiffusion 的关键把团队两项子方法接成完整链路SparkDiffusion 不是从头提出一个孤立模块而是将团队此前的两项关键方法——RoLA与CrossDistill放入“稀疏预热—少步蒸馏—低精度部署”的统一框架。其中RoLA 建立高稀疏粗略先验CrossDistill 则将终端对齐监督落实到完整噪声轨迹上。图5SparkDiffusion 依次完成稀疏结构适配、轨迹混合蒸馏和 FP8 部署优化。05 RoLA为极高稀疏率保留全局信息SparkDiffusion 默认采用团队提出的RoLARotary-Positioned Low-Rank Linear Attention for Efficient Diffusion Transformers作为稀疏注意力模块。RoLA 一边通过块稀疏分支保留高能量 query-key 交互一边用带旋转位置信息的低秩线性分支补回被稀疏化舍弃的全局上下文。SparkDiffusion 先对 RoLA 模块进行短暂的稀疏预热让稠密预训练模型适应 97% 稀疏结构形成可用于后续蒸馏的粗略生成先验。不过RoLA 解决的是“极高稀疏下如何保留信息”仅靠逐步训练仍无法消除高稀疏陷阱中的终点误差。为此框架进一步接入团队的另一项工作 CrossDistill。06 CrossDistill3 步兼顾质量与多样性SparkDiffusion 的少步蒸馏采用团队提出的CrossDistillBalancing Quality and Diversity via Trajectory-Level Hybrid Few-Step Distillation。CrossDistill 在噪声轨迹上设置交叉点。PCM 一致性目标和 DMD 分布匹配目标都不是只拟合孤立时刻而是利用后续轨迹或最终输出构造监督因此都属于终端对齐监督高噪声阶段使用 1 个 PCM 一致性步骤跟随教师的粗结构与运动轨迹并保留不同随机种子带来的多样性低噪声阶段使用 2 个 DMD 分布匹配步骤直接修正终点可见误差增强细节与真实感。最终得到一个3 步、无 CFG的学生模型。它一方面用终端对齐信号跨过高稀疏陷阱另一方面通过高低噪声分工平衡生成质量与多样性。在 97% 稀疏设置下纯 PCM 的 VBench / VBench-2.0 为 81.94 / 56.41纯 DMD 为 82.56 / 57.38CrossDistill 达到83.15 / 58.05。图6多步稀疏模型出现结构漂移接入 CrossDistill 后3 步学生模型重新接近稠密教师。07 从算法减法到真实的 GPU 加速完成 RoLA 稀疏预热与 CrossDistill 蒸馏后SparkDiffusion 再将注意力和前馈网络中的线性投影量化为W8A8 FP8 E4M3并融合激活缩放、类型转换等操作减少显存访问和 Kernel 启动开销。因此最终加速来自三部分RoLA 97% 稀疏减少每一步的注意力计算CrossDistill 3 步无 CFG将模型调用次数从 NFE100 降至 NFE3FP8 与融合算子把理论计算收益转化为实际延迟。团队还将这套训练、蒸馏与部署流程整理为统一 代码库使稀疏、蒸馏和量化不再是彼此割裂的加速组件而可以在同一框架中完成训练、组合与硬件落地。这一设计尤其面向高分辨率生成。分辨率越高、帧数越多时空 token 越长稠密注意力成本增长越快稀疏注意力跳过的冗余计算也随之增加因此 SparkDiffusion 在更高分辨率下具有更大的潜在加速收益。图7所有测试均生成 81 帧视频480P 对应 480×832720P 对应 720×1280。主要结果如下Wan2.1-T2V-14B-720PRTX 5090 上4769 秒 → 18 秒265×Wan2.1-T2V-14B-720PH100 上1757 秒 → 8 秒220×Wan2.1-T2V-1.3B-480PRTX 5090 上182 秒 → 1.3 秒140×Wan2.2-T2V-A14B-720PRTX 5090 上4545 秒 → 25.1 秒181×。在Wan系列模型下SparkDiffusion与Full Attention的对比08 写在最后SparkDiffusion 把注意力稀疏率推到 97%同时构建了首个将稀疏、蒸馏与量化整合到一体化部署含开源权重的视频生成加速后训练框架及代码库。RoLA 负责在极高稀疏率下保留全局上下文CrossDistill 负责修正完整生成轨迹并将采样压缩到 3 步FP8 与融合算子则负责把计算节省兑现为真实速度。在这套组合下一段 81 帧、约 5 秒的 720P 视频可以在单张 RTX 5090 上用 18 秒完成扩散生成。随着生成分辨率和序列长度继续提升稀疏计算相较稠密注意力的优势还会进一步放大。接下来团队将继续把这套方法扩展到高分辨率全模态生成模型与 AR 自回归模型。对于需要处理更长视觉序列、跨模态上下文或分块自回归生成的模型高噪声结构误差与跨块误差传播同样关键也为 SparkDiffusion 的统一加速思路提供了更大的应用空间。高分辨率、全模态与自回归生成的后续进展敬请期待。SparkDiffusion 论文SparkDiffusion: Mitigating the High-Sparsity Trap — A Unified Framework for up to 265× Single-GPU Acceleration of Visual Generationhttps://arxiv.org/abs/2609.23153RoLA 论文https://arxiv.org/abs/2609.06712CrossDistill 论文https://arxiv.org/abs/2609.14725项目主页https://sparkdiffusion.github.io/代码地址https://github.com/AlibabaResearch/SparkDiffusion研究机构北京大学、清华大学、阿里巴巴、电子科技大学、哈尔滨工业大学
返回列表