
「再证「生成即理解」」目录01 视觉领域长期无解的底层痛点02 把文生扩散改造成前馈通用感知器2.1 核心改造迭代扩散转为单步前馈推理2.2 统一表征稠密、稀疏任务共用一套3通道RGB输出空间2.3 可规模化合成数据训练管线03 性能、数据效率、涌现能力三重突破3.1 多任务统一SOTA单模型对标数十款专用专家模型3.2 碾压级数据效率仅竞品1/7~1/500训练量即可持平精度3.3 三大原生涌现能力04 工程落地价值与长远行业影响4.1 短期落地场景价值4.2 中长期行业变革意义4.3 待解决开放问题05 写在最后大语言模型依靠自预测预训练完成大一统但计算机视觉长期停留在“单一任务专用模型”的碎片化阶段做深度估计要用DepthAnything分割依赖SAM人体姿态、相机位姿、3D关键点又要单独训练专属网络。Google DeepMind联合MIT、牛津大学等机构在ECCV 2026发表的最新论文给出了一个颠覆性结论大规模文生视频扩散模型就是视觉领域等价于LLM“下一个Token预测”的通用预训练目标。在此基础上提出的GenCeption用一套统一主干统一损失依靠文本提示就能完成深度估计、表面法线预测、分割、相机位姿估计和3D关键点预测等数十类视频感知任务。训练数据量仅为现有SOTA模型的1/71/500还诞生了仿真到真实、跨类别零样本等多项涌现能力。01 视觉领域长期无解的底层痛点如今计算机视觉赛道分工极度割裂根源在于三类无法同时兼顾的历史预训练方案缺陷这也是GenCeption全部设计逻辑的出发点。1. 专用任务模型路线DepthAnything、SAM、Sapiens等模型各司其职主干、解码器、损失函数全部独立设计。新增一类感知任务就要完整重训一套网络研发成本极高模型之间无法复用时空、3D几何先验对动态视频时序一致性建模能力薄弱只能处理静态图像。图 | DepthAnything2. 传统自监督视觉预训练VideoMAE、V-JEPA以掩码重构、特征预测为目标缺少原生图文对齐能力无法用自然语言指令调度任务仅能提取视觉特征不内置4D时空、物体物理交互先验想要做深度、法线这类几何任务必须额外搭建下游专用头数据利用效率极低。图 | VideoMAE3. 图像扩散复用方案Marigold、Diception仅基于静态图像扩散处理连续视频时预测结果会剧烈时序抖动只能覆盖少量稠密视觉任务无法拓展3D关键点、相机位姿这类稀疏结构化输出通用性存在天然天花板。图 | Marigold三类方案全都无法同时满足通用视觉模型三大硬性要求内置4D时空物理先验、原生图文对齐、可规模化拓展全品类感知任务。而文生视频扩散模型的训练目标天然同时满足三点这是GenCeption的核心立论根基。02 把文生扩散改造成前馈通用感知器整套框架以开源文生视频模型WAN 2.1的DiT扩散Transformer为主干核心改造思路是抛弃扩散迭代采样将多步去噪流程转为单步前馈推理搭配统一表征方案、合成数据多任务微调流水线全程一套主干、一套损失搞定所有视觉任务。2.1 核心改造迭代扩散转为单步前馈推理图 | GenCeption完整架构流程图输入视频文本提示单步前馈输出稠密/稀疏视觉结果传统文生视频需要数十步迭代去噪速度慢不适合感知推理。GenCeption做了关键简化输入不再是噪声潜向量直接送入原始视频干净潜特征时序步长固定t0整流流模型终止状态仅单次前向传播输出预测。原文整流流DiT预测速度项v模型输出取-v即可对齐目标潜空间无需多轮迭代。这套改造完全保留预训练阶段学到的全部时空、几何、图文先验不改动主干网络权重结构只调整输入输出逻辑兼顾预训练权重复用与推理速度。图 | 范式变迁总览图左侧GenCeption完整技术路线右侧传统专用模型与统一通用模型架构对比1.3B小规模模型单段81帧480×832视频推理仅5.92秒14B大模型10秒完成完全满足视频实时感知需求。2.2 统一表征稠密、稀疏任务共用一套3通道RGB输出空间这是实现“无任务专属网络”最关键的设计所有视觉输出全部映射至0~1三通道像素空间仅靠文本提示如“输出深度”“输出3D关键点”切换任务不用更换解码器、损失。1. 稠密任务深度、表面法线、分割、射线图单通道信息深度图直接复制填充RGB三通道3维法线直接使用R/G/B分别对应XYZ三轴相机位姿这类高维射线数据设计“罗斯科分块射线图”图5旋转、平移分量分区域塞入同一帧RGB画面适配统一VAE解码器。图 | 罗斯科射线图将6维相机射线信息压缩至单张3通道图像2. 稀疏任务2D/3D人体关键点新增一组可学习序列Token追加至视频潜序列经过独立轻量MLP回归坐标。为匹配预训练时序位置编码采用位置插值适配视频长度仅新增极少量参数不会破坏主干预训练时空建模能力。所有任务统一使用单一L2损失不再为深度、分割、姿态分别设计定制损失函数。传统多任务训练需要反复调平衡权重GenCeption直接把任务差异转移到数据预处理阶段深度图采用对数归一化消除尺度歧义法线统一值域不同任务仅调整训练数据混合比例大幅降低多任务调参成本。2.3 可规模化合成数据训练管线图 | 深度、法线预测定性效果示例现实带标注高质量视频数据集稀缺尤其是同时包含深度、法线、分割、人体关键点、相机位姿多标签素材。GenCeption完全以合成虚拟视频作为主要训练数据仅指代分割补充少量真实数据集。数据生成流程采用800组人物3D资产200套CMU动作捕捉动画搭配多样HDRI场景、可变相机焦距生成7500段合成视频Blender批量渲染多模态真值深度、掩码、人体关节。训练前统一将RGB输入、多模态目标全部编码缓存为潜向量大幅加速训练速度。这套数据方案的核心优势无需大量人工标注、可无限扩充人物动作与场景同时带来极强仿真到真实世界迁移能力也是模型数据效率碾压竞品的关键。03 性能、数据效率、涌现能力三重突破实验不单纯罗列刷榜数字分层解读指标真实价值同时对比V-JEPA、VideoMAE等主流预训练基线明确GenCeption行业定位。3.1 多任务统一SOTA单模型对标数十款专用专家模型图 | 左多任务雷达图通用模型vs各领域专家模型右数据效率对比曲线左雷达图覆盖表面法线、深度、相机位姿、前景抠图、文本指代分割、3D人体六大主流视频感知任务。14B GenCeption通用模型在绝大多数基准上和DepthAnything3、SAM3、D4RT、Sapiens等专用模型持平甚至超越仅少数细分任务略低于单任务专家微调版本但差距极小。图 | 多任务定量对比节选14B通用模型在Hi4D法线mAE11.47KITTI深度AbsRel0.156EMDB人体MPJPE71.8对比专用模型没有明显短板。需要客观说明指标边界现有SOTA专用模型大多采用百万级真实标注视频训练GenCeption仅依靠少量合成数据达到同等精度纸面性能差距意义远不及数据效率优势。3.2 碾压级数据效率仅竞品1/7~1/500训练量即可持平精度图 | 数据效率曲线直观体现核心工程优势在深度估计统一测试基准上D4RT、VGGT-Ω需要百万级训练帧GenCeption仅需0.9M1.23M帧数据量缩减7500倍仍能实现相近AbsRel误差。图 | 预训练基线横向对比同等微调数据下基于文生视频WAN主干的GenCeption全面超过V-JEPA、VideoMAE最大版本模型。核心原因是视频扩散预训练强制模型学习真实世界4D时序因果、物体恒存、物理交互而掩码自监督仅学习局部视觉纹理缺少全局几何逻辑。图 | 迁移不同预训练层数的训练损失曲线从零随机初始化DiT训练损失几乎不下降随着迁移预训练层数增加收敛速度与最终精度同步提升完整预训练层损失最低证明视频生成预训练得到的世界先验是通用视觉的核心底座。3.3 三大原生涌现能力这是传统专用视觉模型完全不具备的特性也证明视频扩散模型学到了通用世界表征而非单一任务拟合特征。1. 仿真到真实零样本迁移模型全程仅用人形合成视频训练无需真实人物素材直接适配户外、室内各类真实视频深度、分割细节甚至优于渲染合成素材图6人物发丝、动物毛发精细预测。单物体训练支持多实例真实场景推理训练视频单帧仅包含单人但输入多人、多物体真实画面可精准区分不同目标完成分割、姿态预测图10a。图 | 泛化能力效果图多人物实例泛化2. OOD域外类别零样本泛化训练集只有人类输入猫、猩猩、河马、机器人等完全未训练物体依旧能精准输出深度、掩码、3D关键点图10b。图 | 泛化能力效果图跨类别零样本动物、人形机器人指代分割测试中训练未出现“火箭”输入提示词the rocket仍可精准分割目标。图 | 文本指代分割定性结果支持颜色、空间、运动、未知物体推理该特性意味着模型掌握物体通用几何结构而非记忆人类专属特征距离通用世界模型更近一步。04 工程落地价值与长远行业影响4.1 短期落地场景价值1. 多模态视频分析平台安防、影视后期、虚拟拍摄仅部署单套模型通过提示词切换深度、抠图、人体姿态、镜头位姿分析替代5~10款独立推理模型大幅降低显存与算力开销。2. 数字人、虚拟内容生产依靠合成数据训练无需大量真人拍摄标注一次性完成人体法线、关键点、前景分割大幅降低虚拟资产制作标注成本。3. 低成本机器人视觉感知室内机械臂、巡检机器人依靠少量仿真数据训练同时完成深度、物体分割、关键点检测无需分别训练感知网络降低机器人数据采集风险与成本。4.2 中长期行业变革意义长久以来计算机视觉和NLP存在巨大鸿沟NLP依靠生成式预训练实现大一统视觉却始终任务割裂。GenCeption直接证明文生视频生成是视觉领域等价于LLM下一词预测的通用预训练范式。未来视觉基础模型不再需要分别训练分割、深度、姿态专用底座一套文生视频预训练主干通过统一表征文本提示即可适配绝大多数感知任务彻底改变视觉模型研发流水线。同时涌现的跨类别、仿真转真实能力为通用机器人世界模型、具身智能提供全新训练路径。4.3 待解决开放问题平衡稠密像素输出与稀疏关键点两类任务的表征冲突缩小通用模型与单任务专家精度差距拓展流式长视频推理适配监控、自动驾驶长时序连续感知扩充合成数据物体、极端环境覆盖范围提升恶劣工况、非常规物体泛化能力轻量化蒸馏方案让通用视觉模型落地嵌入式边缘设备。05 写在最后GenCeption打破计算机视觉长期碎片化研发模式证实大规模文生视频扩散模型内置完整4D时空、几何、图文世界先验可作为通用视觉基础模型的预训练底座。通过将迭代扩散改造为单步前馈架构、统一多模态输出至RGB像素空间、合成数据多任务微调三大创新实现单主干通吃深度、法线、分割、3D人体、相机位姿等数十类视频感知任务数据效率远超传统自监督与专用模型路线同时诞生仿真到真实、跨类别零样本等涌现能力。尽管通用多任务训练存在小幅精度损失、轻量化落地受限等短板但该工作打通了“生成模型反向作为感知底座”全新技术路线为统一通用视觉大模型、具身智能世界模型提供极具参考的完整框架或将重塑后续视觉基础模型的研发思路。Ref论文标题Video Generation Models areGeneral-Purpose Vision Learners论文链接https://arxiv.org/abs/2607.09024项目链接https://genception.github.io/