
5/16 基准第一、GDPval 却垫底Atria Dawn 是『偏科生』还是『潜力股』【免费下载链接】Atria-Dawn-Preview项目地址: https://ai.gitcode.com/InternLM/Atria-Dawn-Preview2026 年 9 月上海人工智能实验室在几乎没有发布会的背景下把 Atria Dawn Preview 的权重与配套文档推上了开源平台。744B 参数的 MoE 智能体模型、MIT 许可、256K 上下文、1 亿 token 免费额度——这些数字足够让社区躁动。但真正引爆讨论的是它那份割裂感极强的成绩单在 16 项智能体基准中拿下 5 项第一却在 GDPval 上排到对比模型的倒数第二SkillsBench 以 0.3 分之差输给 Qwen 3.8 Max。头条上一篇流传甚广的帖子直接下了判断八张图它只拿了两张第一……GDPval 干脆掉到倒数第二。同样是官方数据为什么有的榜单读出来是五项第一有的读出来是偏科生翻车答案不在模型本身而在于我们用哪把尺子量它。本文基于仓库源码与官方评估表拆解这份争议。争议从哪来两榜第一 vs GDPval 倒数第二的观感撕裂先还原事实。仓库 README_CN.md 的性能评估章节给出了 16 项基准、7 个模型的完整对比表DeepSeek V4 Pro 0813、KIMI K3、Qwen 3.8 Max、GLM 5.3、GPT 5.6 sol、Claude Opus 5并配有汇总图表。按官方表格加粗标注Atria Dawn Preview 拿下第一的 5 项是基准Atria Dawn Preview对比最强对手DeepSearchQA96.0KIMI K3 95.9BrowseComp92.5KIMI K3 91.2BFCL v477.0GLM 5.3 74.1AutomationBench53.8Qwen 3.8 Max 49.7CyberGym86.5GLM 5.3 84.5这五项横跨深度检索、网页浏览、函数调用、流程自动化、网络安全正好对应 README 里模型定义的 Discovery 与 Cybersecurity 两条能力轴。另有 SkillsBench66.4仅落后 Qwen 3.8 Max 的 66.7、Workspace-Bench65.0、Workspace-Bench-Lite68.2三项目前位列第二。所谓5/16 基准第一、3 项第二的官方口径与社区只拿了两张第一的说法并不矛盾——后者截取的是 8 张图里的自动化与网络安全两榜口径不同而已。真正的观感撕裂集中在长程专业任务上GDPval1583 分7 个模型中仅高于 DeepSeek V4 Pro 的 1517低于 KIMI K3 的 1611、GLM 5.3 的 1667、GPT 5.6 sol 的 1682、Qwen 3.8 Max 的 1722、Claude Opus 5 的 1768倒数第二JobBench50.3仅高于 GPT 5.6 sol 的 45.4而 Claude Opus 5 拿到 68.0SWE-bench Pro59.6只压过 DeepSeek V4 Pro 的 58.3Claude Opus 5 高达 74.7。一个能跑赢全网模型的深度检索体为什么一进入办公交付和终端编码就掉队这是争议的核心也是理解 Atria Dawn 的关键切口。长程专业任务为何是硬伤从源码里找答案先说结论GDPval、JobBench、SWE-bench Pro 属于典型的交付型长程任务——要求智能体在数小时级的多步流程中持续理解环境、自主纠错、并把中间产物沉淀为最终交付物。这与 Atria Dawn 的训练定位存在系统性错位而错位在仓库源码里可以找到三重证据。证据一纯文本输入模态的硬约束。翻开 tokenizer_config.json词汇表里其实保留了|begin_of_image|、|begin_of_video|、|begin_of_audio|等多媒体标记但再看 chat_template.jinja 的visible_text宏遇到 image/video/audio 类型内容时模板会把它替换为一段固定提示——reminderYou are unable to process this ~ media_type ~ because you dont have multi-modal input ability. Try different methods./reminder也就是说模型在架构层面就屏蔽了多模态输入。而 GDPval 这类办公交付任务恰恰高度依赖对截图、表格截图、设计稿等视觉信息的读取——README 的 Codex 接入章节也专门强调必须通过input_modalities: [text]声明纯文本模态否则客户端附加图片会直接触发400 Atria-Dawn-Preview is not a multimodal model。这是模型面向科研与工程场景的主动取舍代价则是交付类任务的第一手信息获取能力被砍掉一截。证据二输出长度与任务形态的错配。在 config.json 中可以看到max_position_embeddings高达 10485761M而官方在线 API 的上下文窗口为 256K、单次输出上限 65536 tokenREADME 的 Kimi Code 配置段明确写了max_output_size 65536并警告超出会被拒绝。长程交付任务一旦上下文膨胀触发截断社区教程里反复出现的finish_reasonlength排障整条任务链就会断裂——而这恰恰是 GDPval/JobBench 这类过程极长、结果极具体的基准最容易踩的坑。证据三能力轴与基准轴的错位。README 把模型能力定义为 Discovery检索组织证据、把研究问题转为实验方案、Creation构建软件与应用、Delivery把文档/数据/设计要求转为报告等结构化成果、Cybersecurity授权环境下的安全分析与修复。对照评估表Discovery 轴的 DeepSearchQA/BrowseComp 全部第一Cybersecurity 轴的 CyberGym 第一Tool Use 轴的 BFCL v4、AutomationBench 第一——但在 Delivery 轴上Workspace-Bench、Workspace-Bench-Lite、GDPval、JobBench 四项全部被 Claude Opus 5 压制。社区文章也指出其弱项集中于终端编码类任务。换言之Atria Dawn 的偏科不是随机波动而是训练数据与评估基准在同一张能力坐标系上的投影。给『偏科生』翻案基准选择与智能体定位的关系争议的另一半在于该不该用 GDPval 一票否决。如果只盯着一个基准任何模型都能被找出短板——Claude Opus 5 的 DeepSearchQA 数据为空、GPT 5.6 sol 在 BFCL v4 上缺席、Qwen 3.8 Max 在 BrowseComp 上缺席这些缺失项同样值得审视。但 Atria Dawn 的定位决定了我们更该看它的设计意图而非把它当作全能选手。README 的引言写得很清楚这是一个将开放性问题推进为可执行、可验证、可复现结果的模型设计上强调持续理解环境、调用工具、完成多步任务并特别点明协助用户——注意是协助。这一点与它配套公布的人机协作实证研究互为表里基于 56 名参与者、769 条任务记录的分析显示96.5% 的任务启用了 AI 参与执行但人类保留了 93.4% 的目标设定权和 85.5% 的最终决策权76% 的困难任务关键推动来自人类AI 则高频提出方案选项55.4%并执行绝大多数代码与文本生成。这组数字精准解释了偏科的成因Atria Dawn 被训练成项目级伙伴强项在于接到明确目标后检索证据、设计路径、密集调用工具并执行而 GDPval/JobBench 这类基准默认智能体要在近乎无人值守的条件下完成整条交付链恰好落在它刻意保留给人类的那一侧。换句话说GDPval 的倒数第二不是能力上限而是分工设计的副产品。从 config.json 的架构细节也能看到这种为 Agent 而生的取向78 层、hidden_size 6144、256 个路由专家、每 token 激活 8 个专家、引入 indexer 与共享专家层的glm_moe_dsa架构配合 generation_config.json 中 temperature 1.0 / top_p 0.95 的宽松采样为的是在长链条工具调用中保留探索性chat_template.jinja 里则内置了think推理块、Reasoning Effort 分级与tool_call/tool_response结构化工具协议为 Codex、Claude Code、Kimi Code 等终端代理框架做了原生适配。这套组合拳表明它追求的不是每个基准都第一的六边形战士而是检索、工具调用、安全自动化这条垂直轴上的尖刀。所以偏科生还是潜力股的答案其实是同一个偏科是定位潜力也在定位。当一家实验室愿意把 744B 模型以 MIT 许可开源、公开 769 条人机协作记录、并诚实地在 README 里列出 GDPval 的 1583 分时它给出的不是一张完美的成绩单而是一份可验证的能力边界说明——这在动辄全榜刷屏的智能体竞赛里反而更接近工程意义上的诚实。对开发者而言正确的打开方式不是问它能不能什么都做而是问我的任务是 DeepSearchQA 式的证据检索还是 GDPval 式的无人交付前者Atria Dawn 是目前开源阵营的第一梯队后者请给它的下个版本留一张观察席。【免费下载链接】Atria-Dawn-Preview项目地址: https://ai.gitcode.com/InternLM/Atria-Dawn-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考