多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

InternVL3_5-30B-A3B-Instruct训练管线全解:从CPT、SFT到Cascade RL强化学习

InternVL3_5-30B-A3B-Instruct训练管线全解:从CPT、SFT到Cascade RL强化学习 InternVL3_5-30B-A3B-Instruct训练管线全解从CPT、SFT到Cascade RL强化学习【免费下载链接】InternVL3_5-30B-A3B-Instruct项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-30B-A3B-InstructInternVL3.5-30B-A3B-Instruct是 OpenGVLab 开源的多模态大模型系列中的轻量高效成员总参数 30.8B但每个 token 仅激活约 3BMoE 架构单张 A100 显卡即可部署。本文将带你完整看懂它的训练管线——多模态继续预训练CPT、监督微调SFT与级联强化学习Cascade RL新手也能轻松理解每一步在做什么。一图看懂训练管线全景InternVL3.5 的训练分为四个阶段逐层递进CPT多模态继续预训练→ SFT监督微调→ MPO离线强化学习→ GSPO在线强化学习后两步 MPO GSPO 合称为Cascade Reinforcement Learning级联强化学习Cascade RL是 InternVL3.5 的核心创新先用离线 RL 稳定打基础再用在线 RL 精细调优以较少的 GPU 成本换来了显著的性能提升。模型系列按训练进度开放了不同半成品权重方便研究者对比实验模型后缀已完成的训练阶段-PretrainedCPT-Instruct本文主角CPT SFT-MPOCPT SFT MPO离线 RL无后缀如 InternVL3.5-30B-A3B全流程 CPT SFT Cascade RL⚠️ 官方提醒不确定用哪个版本时请选无后缀的完整版——它走完了全部训练管线推理能力最强。本仓库对应的-Instruct版本完成了 CPT SFT 两个阶段是构建下游应用与二次微调的理想基座。阶段一CPT 多模态继续预训练CPTContinual Pre-Training是整个管线的地基。这一阶段用大规模文本 图文混合语料联合更新全部参数让视觉编码器InternViT-300M与语言模型Qwen3-30B-A3B MoE真正学会说同一种语言。核心要点训练目标标准 Next Token Prediction损失计算在文本 token 上进行前缀 token 可以是文本也可以是图像平方平均重加权对话样本只对回答部分计损失并用1/√NN 为样本长度重新加权避免模型偏向过长或过短的回答随机 JPEG 压缩训练时对图像做随机 JPEG 压缩提升模型对真实世界低质量图片的鲁棒性CPT 之后的产物就是-Pretrained模型——它懂图像、懂文本但还不会好好回答问题。阶段二SFT 监督微调——教会模型思考SFTSupervised Fine-Tuning阶段沿用 CPT 的损失函数与平方平均策略但把上下文窗口扩大到32K tokens以适应长上下文。真正让 InternVL3.5 与上一代拉开差距的是 SFT 数据的三个来源指令跟随数据复用 InternVL3 的高质量指令数据保持视觉-语言任务的广泛覆盖思考模式多模态推理数据先用大模型描述图像再把描述喂给 DeepSeek-R1 采样出带详细推理过程的回答过滤掉答案错误的样本覆盖数学、科学等专家领域——这正是模型深度思考能力的来源能力扩展数据GUI 交互、具身智能、矢量图SVG等新技能本仓库-Instruct版本就是 CPT SFT 完成后的产物已经具备强大的对话、理解与推理能力。阶段三Cascade RL 级联强化学习——粗到精的两段式训练Cascade RL 是 InternVL3.5 的杀手锏分两步走3.1 离线 RLMPO 混合偏好优化高效热身MPOMixed Preference Optimization的损失由三部分加权组成$$ \mathcal{L}_{\text{MPO}} w_p\mathcal{L}_p w_q\mathcal{L}_q w_g\mathcal{L}_g $$偏好损失DPO 形式学习什么是更好的回答质量损失BCO 形式锚定高质量回答的标准生成损失LM 形式保证语言能力不退化作为离线RLMPO 基于预先准备好的偏好数据训练收敛稳定相当于高效的热身——为下一阶段提供高质量的 rollout模型自生成回答。3.2 在线 RLGSPO精雕细琢GSPO 是面向在线 RL 的算法基于模型自己生成的回答继续优化输出分布类似 GRPO对同一问题采样的多条回答做奖励归一化计算优势重要性采样比取逐 token 比的几何平均训练更稳无需参考模型约束对稠密模型与 MoE 模型都有效——这对 30B-A3B 这样的 MoE 架构尤为友好为什么级联更好单用离线 RL 容易过拟合固定数据单用在线 RL 冷启动成本高、波动大。级联策略让离线阶段打稳地基、在线阶段快速冲刺官方消融实验显示其在 MMMU、MathVista 等推理基准上显著优于单一方案且 GPU 成本更低。30B-A3B 架构为什么部署如此便宜理解训练管线后再看看这个主角本身的架构设计ViT–MLP–LLM 三段式视觉编码器 InternViT-300M → MLP 投影层 → Qwen3-30B-A3B 语言模型MoE 稀疏激活每层含 128 个专家每个 token 只激活 8 个见 config.json 中num_experts: 128、num_experts_per_tok: 8配置总参数 30.5B 但激活参数仅约 3B动态高分辨率沿用 InternVL1.5 的动态切块策略max_dynamic_patch: 12最多将图像切成 12 块送入 ViT专家权分层分片语言模型各层专家权重按层存成独立分片layer-0-ep-0-of-1.safetensors…layer-47-ep-0-of-1.safetensors共 48 个分片由 model.safetensors.index.json 统一索引支持按需加载模型结构与对话模板定义在 modeling_internvl_chat.py、configuration_internvl_chat.py 与 conversation.py 中视觉编码器实现在 modeling_intern_vit.py 与 configuration_intern_vit.py权重存于 vision.safetensors。关键参数数值含义总参数 / 激活参数30.8B / ~3BMoE 稀疏激活推理成本低语言模型层数48 层对应 48 个专家权重分片专家数 / 每 token 激活数128 / 8路由选择机制上下文窗口32KSFT 设定支持长文档长视频部署门槛单张 A10030B 级别可单卡运行进阶能力Thinking 模式与测试时扩展-Instruct版本已包含 SFT 注入的思考能力开启方式只需一条系统提示词官方推荐do_sampleTrue、temperature0.6避免重复深度思考Deep Thinking让模型先在think标签内分步推理、校验中间结论再给出最终答案并行思考Parallel ThinkingBest-of-N 策略用 VisualPRM 视觉过程奖励模型从多条推理候选中选出最优扩展推理广度官方论文实验均未默认开启测试时扩展TTS——因为感知类任务收益有限TTS 只在数学/推理类基准上进一步放大优势。如何获取完整管线产物若你希望使用走完CPT SFT Cascade RL全流程的版本即无后缀的InternVL3.5-30B-A3B可直接通过 git 拉取官方仓库获取权重与说明git clone https://gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-30B-A3B-Instruct模型基于 transformers 生态加载建议transformers4.52.1配合trust_remote_codeTrue即可使用仓库自带的 modeling_internvl_chat.py 自定义代码部署侧 LMDeploy 与 vLLM 均可支持。常见问题 FAQQ1-Instruct、-MPO、无后缀版本到底差在哪A差在训练管线的进度。-Instruct CPTSFT会对话-MPO 再加离线 RL推理更强无后缀 再加在线 RL推理最强、最完整。追求最佳效果选无后缀版本。Q2为什么 MoE 版本训练/部署都更划算A128 个专家中每 token 只激活 8 个计算量只花3B 的力气却拥有 30.5B 的知识容量。这也是 GSPO 特意去掉了参考模型约束仍能有效的原因——它对小激活参数量的 MoE 更稳。Q3Cascade RL 比单阶段 RL 强多少A相比 InternVL3InternVL3.5 整体推理性能最高提升16.0%推理速度提升4.05×而级联设计本身让强化学习阶段用更少的 GPU 时间达到更好效果。Q4想自己微调该用哪个版本作基座A日常指令微调选-Instruct本仓库即可若做推理类任务建议以-MPO或完整版为基座起点更高。总结InternVL3.5-30B-A3B-Instruct 背后的训练管线是一条教科书式的能力递进链CPT让视觉与语言对齐奠定理解能力SFT注入对话规范与思考模式产出本仓库权重MPO离线 RL稳定热身建立偏好判断GSPO在线 RL自我博弈精调推理能力登顶作为 HuggingFace 镜像中可直接下载的资源这套权重 自定义代码结构清晰、文档完备无论是多模态应用开发、二次微调还是训练方法研究都是从 CPT、SFT 到 Cascade RL 全解的绝佳样本。【免费下载链接】InternVL3_5-30B-A3B-Instruct项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-30B-A3B-Instruct创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表