大模型预训练新范式——视觉预训练反哺语言智能

发布时间:2026/7/23 17:16:00
大模型预训练新范式——视觉预训练反哺语言智能 “柏拉图表征假说”提出文字与图像并非彼此割裂的信息形态而是同一底层现实在不同模态中的投影。知识也从不只栖身于文字。科学文献、教材与专业书籍本就是图文交织的知识载体示意图呈现运行机制分子结构记录空间构型几何图形揭示位置关系统计曲线刻画变化趋势—它们以各自的方式共同表达着自然规律。文字可以描述和转述这些信息却难以无损地保留其中的空间结构与视觉逻辑。因此当模型仅从文本中学习时它所接触到的或许只是科学知识的一种投影而非知识的完整形态。然而当前大语言模型 (LLM) 的主流预训练范式仍以纯文本上的“下一词预测”为核心。文档、网页等视觉信息丰富的知识载体通常需要先经过 OCR 与文档解析被转换为一维的文本序列后才能进入模型。这种处理方式便于规模化训练却也在无形中舍弃了原始内容中的版面结构、图文关系、公式形态与空间逻辑使模型读到的知识从一开始便不再完整。一项来自上海人工智能实验室和国内高校的联合研究挑战了“语言模型必须基于纯文本表征进行预训练”的默认假设。研究团队提出了一种视觉预训练范式通过在连续视觉表征空间中预测下一个视觉单元模型得以直接从视觉文档中获取知识。该研究基于国产昇腾算力平台开展并完成了面向大规模训练场景的系统适配与优化。相关技术已应用于上海人工智能实验室的科学多模态基础大模型书生Intern-S2-Preview 35B/397B系列模型的预训练有效提升了模型科学推理和多模态理解能力。论文标题Scalable Visual Pretraining for Language Intelligence论文链接https://arxiv.org/abs/2607.09657HuggingFace链接https://huggingface.co/papers/2607.0965735B模型链接:https://huggingface.co/internlm/Intern-S2-Preview397B模型链接:https://huggingface.co/internlm/Intern-S2-Preview-397B图1在统一表征空间进行视觉预训练图2相同语料在视觉预训练和文本预训练对比示意图实验发现发现一从视觉文档中也能学到更强的语言智能研究首先验证了一个核心预期如果原始文档页面比解析后的纯文本保留了更完整的知识那么直接从这些视觉文档中学习也应当为模型带来更强的科学推理能力。实验结果验证了这一判断。在保持科学文献来源、初始模型、训练设置和监督微调数据完全一致的情况下VP 在 MMLU-Pro、GPQA Diamond、AIME 2025 和 HLE 等纯文本推理基准上全面优于使用解析文本训练的 TP。该趋势在 Qwen3.5、Qwen3、Llama 3.2 Vision 和 Llama 3.1 等不同模型架构上均稳定出现其中 GPQA Diamond 最多提升 3.22 分MMLU-Pro 最多提升约 2.1 分。图3视觉预训练和基线的模型能力评测对比这正是视觉预训练希望实现的目标输入模型的虽然是文档页面但模型学习到的并不只是图像的表面特征而是公式、图表、空间关系与文本内容共同承载的知识。这些最终体现为更强的语言推理能力。换言之语言智能并不只能从语言中习得。只要建立合适的预测目标视觉同样可以成为基础模型学习知识、形成推理能力的有效载体。发现二视觉预训练的收益随训练规模持续增长呼应Scaling law一种预训练范式能否支撑基础模型发展关键不仅在于它是否有效更在于它能否从不断扩大的数据与计算规模中持续获益。实验表明VP展现出了清晰的 Scaling 趋势随着科学文档训练量持续增加VP 相对于文本预训练的优势并未趋于饱和而是在 MMLU-Pro、GPQA Diamond 和 AIME 2025 等多个基准上稳定扩大。在完整训练规模下VP 相对于初始模型的能力增益分别达到文本预训练的 1.27 倍、2.02 倍和 2.88 倍。图4视觉预训练增益随着训练规模增大这意味着模型读取的视觉文档越多从公式、图表、空间结构与复杂版面中吸收的知识也越丰富并能够进一步转化为不断增长的语言推理能力。视觉预训练因此不只是一个在有限数据上有效的训练目标也展现出了成为可扩展基础模型预训练范式的潜力。进一步分析显示VP 的收益与页面中的视觉结构密度密切相关。在以文字为主、视觉结构较少的样本上VP 与文本预训练表现接近随着公式、图表、表格与复杂版面的占比增加VP 的优势显著扩大。这说明VP 的收益并非简单来自额外训练而主要来自文本解析难以完整保留的视觉与空间信息。更重要的是这种增长建立在更紧凑的视觉表示之上。对于完全相同的科学 PDF解析后的文本约包含 800 亿个 Token而经过前景筛选的视觉表示仅包含约 200 亿个视觉 Token。换言之VP 仅使用约四分之一的文档 Token便取得了超过文本预训练的效果体现出更高的信息密度与扩展效率。发现三无需显式图文配对监督也能促进跨模态对齐传统多模态预训练通常依赖大量图文对、图片描述或人工标注。VP 使用的却只是未经标注的原始文档页面没有显式的图文配对监督。尽管如此经过视觉预训练后模型中的视觉与文字表征仍然变得更加接近配对图文表征的余弦相似度由 0.631 提升至 0.907表征空间的全局结构与局部邻域也呈现出更强的一致性。图5视觉预训练和基线的模型多模态能力评测对比这种跨模态对齐进一步迁移到了实际任务中。在 MMMU-Pro、SFE、ChartQAPro 和 MathVista 等多模态基准上VP 在不同模型架构下均优于匹配的文本预训练其中ChartQAPro 提升约 5.4 分MathVista 最多提升 4.8 分。这意味着即使不依赖人工构造的图文对模型也可能通过预测原始文档中的视觉内容在已有语言知识与视觉结构之间建立联系。方法介绍视觉预训练的核心是 Next visual latent prediction。首先原始 PDF 被直接渲染为页面图像并通过冻结的视觉编码器转换为一系列连续的视觉表征。系统过滤页边距、空白区域等低信息 Patch同时保留前景内容的空间位置将其输入语言模型。训练过程中文本与视觉文档共享同一个自回归模型文本数据仍然采用“下一词预测”视觉文档则采用“下一视觉表征预测”。通过这种方式模型在保留原有语言学习能力的同时也能在不依赖 OCR 文本提取、人工标注或显式图文配对的情况下直接从原始文档页面中吸收知识。与直接生成原始像素不同VP 预测的是冻结视觉编码器提取的连续潜表征。这一目标弱化了颜色噪声、像素偏差等低层细节的影响而能够更多地学习视觉内容所承载的知识例如公式中的符号关系、图表中的变量关联与变化规律、表格中的多维对应以及复杂版面中的跨区域逻辑。关键的是文字与视觉文档训练的是同一个自回归模型。视觉预测产生的训练信号会直接更新承载语言能力的共享模型参数使视觉文档中的知识不只是停留在外部视觉编码器中而是逐步进入语言模型的内部表征空间。经过后续的文本监督微调这些从视觉文档中获得的知识便可以通过语言形式被重新组织和调用并最终体现在科学推理任务上。展望从“阅读文字”到“预测世界”这些实验共同指向一个结论从预测语言的下一个符号到预测世界的下一种表征基础模型正在获得一种超越文字的学习方式。未来随着预测目标进一步拓展到图像、视频与交互数据模型或许能够逐步建立对现实更完整的内部表征。视觉预训练正是迈向这一方向的一步——改变的不只是进入模型的数据形式更是模型获取知识、建立预测与理解世界的方式。