
Reflection AI 发布 Beam501B MoE 亿级 Agentic RL后训练 Scaling 进入新阶段发布时间北京时间 2026 年 10 月 6 日凌晨状态Early Access。Reflection AI 已正式发布 Beam但截至发布时权重、完整技术报告和 model card 尚未全部开放。Reflection AI 发布首个前沿模型Beam。它采用稀疏 MoE 架构拥有501B 总参数、23B 激活参数预训练规模约23.8T tokens支持最长1M context。相比参数规模Beam 更值得关注的是其Agentic RL 训练规模Reflection 使用约10,500 张 NVIDIA GB300进行约 4 周后训练生成超过1 亿条 RL rollouts执行约13 亿次 sandbox任务池接近100 万个 coding、agentic 和 STEM environments。1. 501B MoE但每次只激活 23BBeam 采用 Sparse MoE。模型虽然有 501B 总参数但单个 token 只调用约 23B 参数相当于只激活约 4.6%。这种设计的核心是把模型容量单 token 计算量尽可能解耦。因此Beam 延续了 DeepSeek 等模型已经验证的路线通过大量专家提高模型容量同时通过稀疏路由控制推理成本。2. 真正的重点1 亿级 Agentic RL RolloutBeam 最大的技术信号不是 501B而是 Reflection 把后训练 RL推到了新的基础设施规模。传统预训练的数据单位是 token而 Agentic RL 的数据单位更接近完整轨迹问题 → 推理 → 工具调用 → 环境反馈 → 再推理 → 验证 → Reward这意味着模型能力的 Scaling 正在从更多参数 更多 Token扩展为预训练 Scaling 后训练 RL Scaling Test-time Compute Scaling对于 coding / agent 模型而言高质量环境、sandbox 和 verifier 正在成为新的“训练数据”。3. 异步 RL核心难点其实是系统工程Beam 使用大规模异步 RL平均同时运行约11 万条 rollout最高支持约17 万个并发 sandbox。异步训练的优势是 GPU 不必等待最长任务结束但会引入一个关键问题Policy Staleness。也就是说某条轨迹可能由旧版本模型生成而训练器已经更新了很多次。Reflection 称其系统在部分经验落后107 个模型版本时仍可保持训练稳定。这说明前沿 RL 的问题已经不只是算法而是RL 算法 推理集群 Sandbox 权重同步 Verifier之间的联合优化。4. 为什么 13 亿次 Sandbox 很重要Agent 训练和普通语言模型最大的区别是答案必须真正“执行”。例如 Coding Agent 需要不断读代码 → 修改 → 测试 → 报错 → 修复 → 再测试因此一次 rollout 往往包含多次真实执行。Reflection 的13 亿次 sandbox execution表明Agentic RL 的基础设施正在从“GPU 训练集群”升级为GPU Cluster Execution Environment Verifier Rollout Infrastructure未来真正稀缺的资源可能不只是网页文本而是可以自动判断成功或失败的高质量任务环境。5. Benchmark 怎么看Reflection 公布的部分结果包括BenchmarkBeamSWE-Bench Verified80.9Terminal-Bench 2.180.1GPQA Diamond90.5这些结果说明 Beam 已进入当前前沿开放模型的竞争区间。但需要注意目前结果主要来自厂商自测且 Beam 的权重和完整技术材料尚未全部公开。真正可靠的横向比较还需要等待第三方评测。结论Beam 最值得关注的不是501B 参数而是它展示了一种新的 Frontier Model 训练范式大模型竞争正在从“堆预训练 Token”转向“堆可执行环境、Agent trajectory、Verifier 和 RL 基础设施”。如果这一趋势持续未来 Scaling 的核心单位可能不再只是Token而是Trajectory Environment Interaction。参考资料Reflection AIIntroducing BeamReutersReflection unveils first AI model BeamTechCrunch Reflection debuts Beam