多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

自回归模型在视觉生成领域:从 Infinity 到 GRN 的三条路

自回归模型在视觉生成领域:从 Infinity 到 GRN 的三条路 本文整理自 QCon 北京 2026《韩剑 - 自回归模型在视觉生成领域的应用》通过AI音视频转录总结工具Ai好记视频转文字整理以下为精炼整理后的会议笔记内容。扩散模型在视觉生成里如鱼得水但自回归模型其实一直憋着一股劲。韩剑在 QCon 北京 2026 的分享讲的是字节跳动团队在自回归视觉生成上的完整探索从 Infinity 证明自回归能追平扩散到 InfinityStar 扩展到视频再到提出「生成式精炼网络」GRN 这条视觉生成的第三条道路。这篇把技术路线对比、三项核心创新和背后的权衡整理成一份完整笔记。一、路线之争自回归和扩散各自的账先看清两条主流路线的底牌。扩散模型在连续空间操作重建质量高但理解能力受限不太擅长做深度推理传统自回归模型在离散空间操作理解能力强但量化误差大、误差累积而且缩放规律没那么明显。那为什么还要赌自回归因为自回归模型工作在离散的 token 空间这跟文本 token 是天然兼容的。这就意味着它特别适合做统一的多模态建模和深度理解潜力上限更高。问题是生成质量这个短板得先补上。二、Infinity先把量化误差这个老大难解决掉自回归视觉生成最大的痛点是量化误差和误差累积。韩剑团队用「Infinity」模型靠三项关键技术把它处理掉了比特级 Tokenizer把传统的离散 token 精细化到比特级从源头降低量化误差无限大词表分类器突破词表规模限制让模型有更强的表达能力比特级自我纠正训练时模拟自回归生成可能出现的错误随机翻转已经生成 token 的部分比特再让模型基于这个「错误」的中间状态重新预测并纠正后续 token。这三板斧下来Infinity 证明了自回归模型能达到不输于扩散模型的效果把最难受的误差问题按住了。三、InfinityStar把自回归扩展到视频验证了图像这条路能走通之后团队把自回归范式扩展到视频生成这就是 InfinityStar。视频比图像多了一个时间维度生成难度陡增。InfinityStar 的处理思路是时空金字塔建模把时空结构分层组织语义尺度重复在不同尺度上复用语义信息时空稀疏注意力降低长序列下的计算开销。这套方法实现了高效、统一的图像与视频生成让自回归在动态内容上也能站住脚。四、GRN视觉生成的第三条道路沿着技术演进再往前一步团队提出了「生成式精炼网络」简称 GRN。它的定位很妙是想结合两条老路线的优点。核心是两大机制层级二值量化不增加维度而是通过多轮二叉树式的二分操作指数级降低量化误差在保持高压缩率的同时逼近连续特征的重建质量。这跟传统向量量化要增加潜在特征维度、指数级膨胀参数量的做法形成对比。精炼预测每一步都重新预测所有 token并随机选择一部分更新到输入里。之前填充的 token 在后续步骤里可能被丢弃或修改这就拥有了强大的动态纠错能力。GRN 的效果是兼具离散 token 空间利于理解和迭代式生成利于纠错的优势在图像和视频任务上都达到新的 SOTA。五、三合一技术路线的完整对照把三种方案放一起看权衡就清晰了方案操作空间优势短板扩散模型连续重建质量高理解能力受限传统自回归离散理解强、利于多模态生成质量有瓶颈GRN离散 迭代精炼理解与纠错兼顾新范式、有待验证GRN 的野心是在离散空间做迭代式精炼生成把「理解」和「纠错」两件事都占住。六、自适应生成按内容复杂度动态花算力GRN 还有一个很实用的设计自适应生成。模型在生成过程中会输出每个 token 的预测概率。如果整体预测置信度高熵低说明内容简单可以提前停止精炼步骤如果置信度低熵高说明内容复杂需要更多精炼步骤。这实现了根据内容复杂度动态调整计算量简单图省算力、复杂图保质量。七、为什么自回归值得押注把整场分享串起来韩剑的底层判断是自回归模型工作的离散 token 空间与文本天然兼容这给统一多模态建模和深度推理留出了更大的想象空间。视觉生成的终局很可能不是和语言模型各干各的而是走向同一种语言。落地思考对做生成式 AI、视觉大模型的团队这场分享最有价值的三个点量化误差是自回归视觉生成的命门比特级 Tokenizer 和层级二值量化是两条典型的解法。迭代式精炼是新的平衡点GRN 用「可改」的 token 换来动态纠错思路值得借鉴。自适应生成是降本的好设计按熵决定精炼步数简单内容省算力。这类硬核技术演讲听一遍很难消化全部细节。我一般会用 Ai好记 把演讲视频转成图文笔记自动生成精华速览和思维导图把 Infinity、InfinityStar、GRN 这些模型的关键点结构化地抓出来事后对照翻查特别方便。做技术学习笔记这已经是我固定的整理方式。FAQ视觉生成自回归路线高频问题Q为什么作者觉得自回归比扩散更有前景A自回归工作在离散 token 空间和文本 token 天然兼容便于统一多模态建模和深度理解潜力上限更高。Q比特级自我纠正是怎么工作的A训练时模拟自回归生成的错误随机翻转已生成 token 的部分比特再让模型基于错误中间状态重新预测并纠正后续 token从而学会自我纠错。QGRN 的精炼预测和掩码预测有什么区别A根本区别在可修改性。掩码预测填充后就改不了而 GRN 每步重新预测所有 token 并随机更新之前填充的也能被修改动态纠错能力更强。Q层级二值量化相比向量量化优势在哪A向量量化靠增加维度降误差但会指数级膨胀参数量层级二值量化不增维度用多轮二分操作指数级降误差保持高压缩率的同时逼近连续特征重建质量。Q自适应生成怎么节省算力A模型根据每个 token 的预测置信度熵判断内容复杂度简单内容熵低提前停止精炼复杂内容熵高多花精炼步数动态调整计算量。以上内容由 Ai好记 转录整理。Ai好记是一款支持音视频转图文笔记的AI知识库工具支持B站、小红书、抖音、小宇宙等平台链接及本地音视频文件视频转文字后自动生成精华速览、思维导图和结构化图文笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。
返回列表