
SWE-bench 75.6 分从哪来Ornith 自改进训练框架逐层拆解【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUFSWE-bench Verified 75.6 分是 Ornith-1.0-35B-A3B 在 2025 年发布的成绩单也是社区讨论开源编程模型黑马时的起点一个总参数 35B、单 token 仅激活约 3B 参数的 MoE 模型在真实 GitHub issue 修复任务上压过了同期同规模的 Qwen3.6-35B-A3B73.4。而它的继任者 Ornith-1.5-35B-A3B 把这一数字推到了 79SWE-bench Pro 更是从 50.4 直接跃升到 59.6。分数的跃迁并非靠堆数据、堆算力而是训练范式本身的改变官方博客给出的关键词是end-to-end self-improvement端到端自改进——模型自己出题、自己搭评测脚手架、自己生成解题轨迹再用强化学习把这三件事联合优化。本文结合仓库模型卡与官方技术博客逐层拆解这套自改进训练框架到底改了哪些环节、奖励如何设计、分数从哪些细节里长出来以及这套方法能否被其他团队复制。一、先给75.6 分定位它处在哪张坐标系里75.6 这个数字出自 SWE-bench Verified——以真实 GitHub issue 为题干、要求模型在完整代码仓库中定位问题并产出可合并 patch 的基准。它衡量的是Agent 级编码而非函数级代码补全因此分数直接反映模型在真实工程场景中的修复能力。在 README.md 的评测表中Ornith 三代同堂的分数关系一目了然基准Ornith-1.5-35B-A3BOrnith-1.0-35B-A3BQwen3.6-35B-A3BGemma-4-31BMuse-Glimmer-30BQwen3.5-397BSWE-bench Verified7975.673.4527676.4SWE-bench Pro59.650.449.535.751.251.6SWE-bench Multilingual71.469.367.251.7—69.3三个关键事实值得注意。第一Ornith-1.0 的 75.6 分本就领先 Qwen3.6-35B-A3B 约 2 分而 1.5 把这个差距拉大到 5.6 分第二在更难的 SWE-bench Pro 上1.5 相比 1.0 涨了 9.2 分是所有子集中涨幅最大的第三一个激活 3B 参数的模型在 Verified 上已经反超 Qwen3.5-397B76.4与稠密模型 Muse-Glimmer-30B76这在大模型评测史上并不常见。分数可信度还取决于评测口径。模型卡注明了 SWE-bench 系列的评测设置使用 OpenHands harnesstemperature1.0, top_p0.95256K 上下文窗口并且全程施加防作弊保护——本地仓库镜像删除 Git 历史防止模型读取既往提交、禁用网络访问防止检索外部信息。这排除了背诵答案和偷看测试两条捷径说明 79 分是在一个相对干净的隔离环境下拿到的。二、自改进循环从 Self-Scaffolding 到 Self-Improvement如果只是把人工标注的 SWE-bench 数据拿来微调分数涨几个点并不稀奇稀奇的是 Ornith 的训练数据本身是模型现出的。模型卡README 开篇与官方博客完整描述了这套框架的演化路径Ornith-1.0在 Qwen3.5 / Gemma 4 基础上做继续预训练CPT、mid-training 与 post-training训练阶段只对 scaffold解题脚手架指令、工具、任务拆解策略、编排方式与 rollout解题轨迹做优化即 self-scaffoldingOrnith-1.5把优化对象扩展到三个环节——任务生成task generation、脚手架构建scaffold construction、解题 rollout三者联合优化不再依赖固定的人工课程与手工设计的评测 harness。每个训练周期是一个三段闭环给定环境或代码库、任务类型的高层指令、以及模型过去的解题历史系统先提出比已解决问题更难一步的新任务暴露能力缺口、持续前推训练边界随后针对每个任务生成或精修专属脚手架最后策略模型在脚手架约束下产出解题 rollout。奖励信号从 rollout 反向传播到三个环节于是模型不仅学会产出更好的答案还学会出更有用的题、搭更有效的脚手架。2.1 任务奖励有效性 × 前沿难度 × 新颖性官方博客给出了任务奖励的乘性定义R_task V(q, s) × D(q, s, {τ_i}) × N(q)V(q,s)有效性题目是否可解、脚手架能否稳定执行并可靠评估候选解。V 可以充当硬性闸门——V 0时整个任务奖励归零防止畸形任务靠看起来难来骗分D前沿难度对每个任务采样 N 条 rollout统计经验成功率 p奖励靠近目标前沿 p* 的任务D exp(-(p-p*)²/2σ²)。p* 取 0.2即有点难但还练得出成功轨迹的难度。随着模型变强、任务成功率自然上升D 下降从而把题目生成器推向更难的问题——课程表随能力自动进化N新颖性N 1 - max sim(q, q_j)与历史任务库中的最大相似度做差压制重复出题但权重次于有效性与难度。2.2 Harness 与 Rollout 奖励反奖励黑客生成的评测 harness 也参与优化奖励拆成三项的乘积C与任务说明的吻合度×F奖励对解质量的忠实度×H抗奖励黑客能力——能抵抗求值器失效、捷径与 hack 行为。每条 rollout 直接由 harness 打分R_rollout(τ_i) h(q, τ_i)可验证任务上就是二值的 pass/fail复杂环境上则可叠加正确性、完成度、效率与约束满足。三个环节各自用 GRPO 优化各自的奖励——这是框架的联合所在题目生成器、harness 生成器与策略模型在同一循环里共同进化。这也是社区报道如 36KrAI 自己出题自己练把两个月迭代解读为约 11 个百分点编码能力跃升的技术背景训练分布从人写的静态题库变成了模型自己生成的动态课程。这套机制在深度代理任务上的收益最直观。模型卡中有一组长期被忽略的数字基准Ornith-1.5-35B-A3BOrnith-1.0-35B-A3BQwen3.6-35B-A3BQwen3.5-397BDeepSWE22001Frontier-Bench v0.15.11.41.41.4NL2Repo46.234.629.436.8DeepSWE 是从零建仓库级项目的长链路任务1.0 与 Qwen3.6 均得 0 分而 1.5 一举拿到 22。这说明自改进课程训练出来的不是会刷题的能力而是在开放式、长程、多文件场景下的规划—执行—验证闭环——这恰恰是 SWE-bench Pro 想测的东西。三、分数拆解9.2 的 Pro 涨幅说明训练对了场景把三张表放在一起看1.0 → 1.5 的涨幅分布很有信息量SWE-bench Verified75.6 → 793.4。基数已高剩余空间有限属于巩固盘SWE-bench Multilingual69.3 → 71.42.1。多语言修复涉及更多领域知识自生成课程对跨语言覆盖的提升相对温和SWE-bench Pro50.4 → 59.69.2。Pro 子集要求跨文件、跨模块的长期修改探索空间大、解空间稀疏正是前沿难度 稀缺成功轨迹训练信号最稀缺也最有价值的地方。自改进循环用 p*0.2 的难度锚点刻意制造这种稀缺再用稀疏的成功轨迹做 GRPO 更新与刷会高频题的静态 SFT 形成本质区别。再横向看 1.5-35B 与同代的对照Terminal-Bench 2.1Terminus-2 口径67.8 对 Qwen3.6 的 52.5、对 Gemma-4-31B 的 42.1MCP-Atlas 70.2、Toolathlon 48.7、BrowseComp 67.6。Agentic 维度全线领先这与训练阶段脚手架 工具调用 rollout 联合优化的设计一一对应——训练时模型就在自己生成的工具环境中反复试错评测时自然更擅长与工具生态协作。四、框架可复制性方法论开放落地门槛更低对开源社区而言Ornith 这套框架最有价值的资产不是某一版权重而是**任务—脚手架—rollout三段 GRPO 闭环本身可以脱离 Ornith 模型独立复刻**任务生成器、harness、策略三者都是可替换组件任何具备可验证任务环境的团队都能套用同一奖励配方V × D × N / C × F × H。这也是社区文章将 Ornith 称为Agent 编码行为优化层而非单纯新模型的原因——它把强化学习课程设计的活从人工搬到了模型自己手里。落地侧本仓库Ornith-1.5-35B-A3B-GGUF提供了从 BF16 到 Q4_K_M / Q5_K_M / Q6_K / Q8_0 五种 GGUF 精度并附带多模态投影权重mmproj-Ornith-1.5-35B-BF16.gguf。BF16 体量约 70GB模型卡说明Q4_K_M 约 20GB已进入消费级显卡可部署区间。模型卡给出了完整的服务化路径# llama.cpp / Atomic.chat一条命令起 OpenAI 兼容服务 llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF --port 8000 -c 262144 # Ollama 直接拉取运行 ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF需要 256K 长上下文与工具调用解析时官方推荐 vLLM≥ 0.19.1或 SGLang≥ 0.5.9并显式启用 reasoning 解析器与 qwen3_xml 工具解析器上下文不够时可用内置的 YaRN 缩放factor4.0 时窗口扩展至约 1M tokens。模型卡的通用采样建议是temperature0.6, top_p0.95, top_k20复现评测成绩则用temperature1.0——后者对 Agent 任务的探索性至关重要。不过社区对 Ornith-1.5 的讨论也并非一边倒。叫板 DeepSeek V4但仔细看分数事情没那么简单的观察背后是评测口径的复杂性旗舰 397B 在 Terminal-Bench 2.186.1与 DeepSWE56上与 Claude Opus 4.885.0 / 59.0互有胜负但在 HLE、MCP-Atlas 等推理与工具基准上仍与闭源旗舰存在差距各模型成绩都依赖具体 harness、温度与防作弊设置跨模型横向比较时应以模型卡声明的口径为准。对复刻者而言同样如此——自改进循环放大了评测即训练信号的收益也放大了 reward hacking 的风险官方评测中删 Git 历史、断网络的做法应当成为任何自改进训练与评测的默认纪律。五、结语回看75.6 分从哪来这个问题答案其实清晰它来自一个不再依赖人工题库的强化学习闭环——模型自己出题有效性 × 前沿难度 × 新颖性三重约束、自己搭评测对齐 × 忠实 × 抗 hack、自己解GRPO 稀疏奖励更新三者在迭代中互相喂养。Ornith-1.5-35B-A3B 用 79 / 59.6 / 71.4 的成绩验证了这条路的规模效应更强的策略出更难更高质量的题更难的题又训练出更强的策略。当开源模型开始自己给自己布置作业SWE-bench 榜单上的数字就不再只是算力与数据的函数了。【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考