小米Agent团队重磅开源:可像搭乐高一样随便拼的Harness!

发布时间:2026/7/29 3:15:05
小米Agent团队重磅开源:可像搭乐高一样随便拼的Harness! 此前绝大多数 Agent 开发者会忽视 Harness 调度层一味堆基座大模型最近人们发现大模型 Agent 的表现并不只看基座模型中间那层把模型、提示词、工具、记忆和控制流串起来的运行时 Harness 才是关键。它决定了任务怎么拆、工具怎么调、决策怎么流转。可眼下市面上几乎所有 Agent 框架LangChain、AutoGen、Claude Code、DeerFlow 的 Harness 全靠人工静态开发换模型、工具、领域就要重写脚手架轨迹数据也无法用于自动优化。更麻烦的是提示词、工具封装、重试、记忆全搅在同一条代码里改一处容易牵一发动全身跨场景复用只能复制粘贴。更致命的是二者优化互不连通Harness 产出的轨迹白白浪费模型提升也无法同步更新调度双重性能天花板难以突破。为解决这一问题来自小米的研发团队Darwin Agent Team 提出了一套将 AI Agent 的运行时框架“代码化、可组合、可观测、可演化”的工程系统HarnessX。在五个基准测试ALFWorld、GAIA、WebShop、tau^3-bench 和 SWE-bench Verified中HarnessX 平均涨幅为 14.5%最高可达 44.0%同场景下基座模型越弱提升幅度越大弱模型Qwen 在 ALFWorld 从 53% → 97%强模型 Sonnet 4.6 仅提升 11.2%/9.7%/10.9%。论文标题HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry论文链接https://arxiv.org/abs/2606.14249github链接https://darwin-agent.github.io/HarnessX/01可像搭乐高一样随便拼的Harness研究团队把 Harness 当成能像乐高积木一样随意拆装的“一等公民”即能序列化、能哈希、能直接替换。最小积木块是 Processor八个生命周期钩子把控制点卡死再配上九维行为分类把模型选择、上下文、记忆、工具、沙箱、奖励、安全、追踪到训练桥接全覆盖。想加功能、换逻辑、删组件就像搭乐高一样直接安全插拔冲突自动拦住其他代码一行都不用动。02会自己看轨迹越跑越聪明的AEGIS进化引擎HarnessX 的核心就是让 AEGIS 自己“看轨迹、学教训、越跑越聪明”。它把 Harness 演化直接映射成强化学习MDP当前配置加历史轨迹库是状态安全编辑加工具、改提示、重构流程是动作任务得分加完整轨迹是奖励。四阶段流水线全由同一个元大模型驱动先压缩海量原始轨迹抓关键故障再规划哪些坑踩过、哪些方向还没试接着生成类型安全的候选 Harness 修改方案。最后 Critic 盯着奖励欺骗reward hacking确定性闸门强制“新方案不能让任何已解决任务变差”进而解决灾难性遗忘。再配上变体隔离多套 Harness 并行跑、任务自动路由改一类任务绝不会把另一类搞崩。03模型与Harness一起越变越强的闭环Harness 演化和模型 RL 训练共享同一个回放缓冲区Harness 这边用 AEGIS 做无参数符号化编辑模型这边用跨 Harness 的 GRPO 做参数微调。同任务下不同脚手架跑出来的轨迹放一组比相对优势模型就能学会在各种执行流程里都能找到最优策略而不是死磕单一固定套路。离线复用轨迹几乎零额外环境交互成本Harness 和模型可以在同一闭环中共同提升。04性能评估1实验配置在 GAIA、ALFWorld、WebShop、τ³-Bench 和 SWE-bench Verified 上用 Claude Sonnet 4.6、GPT-5.4 和 Qwen3.5-9B 作为任务模型固定用 Claude Opus 4.6 做元进化任务智能体分三档覆盖强弱模型Claude Sonnet 4.6、GPT-5.4、Qwen3.5-9B对比 Static Harness 和 Claude Code SDK最多跑 15 轮连续 3 轮没提升就提前停用 Pass2 成功率来衡量。2核心结果如表4所示在仅进化 Harness模型冻结的主实验中15 组「模型 基准」实验中 14 组性能提升平均绝对提升 14.5%最高提升 44.0%如表5所示在针对同模型(GPT-5.4)同数据集(GAIA)的消融实验1中全局单 Harness峰值 73.8%最终跌至 49.5%严重灾难性遗忘总 token 消耗为143.7M变体隔离峰值最终 87.4%无退化token 仅 107.8M算力节省 25%。如表6所示在针对AEGIS 四阶段 vs 单阶段 Claude Code SDK 进化器的消融实验2中虽然最终精度差距极小87.4% vs 86.4%但 AEGIS 节省 14% token 消耗轨迹压缩带来更高效率与可解释性。如图5所示在 GAIA 与 WebShop 数据集下对比 “AEGIS” 与 “Co-Evolution” 两条曲线单独进化调度框架最高仅达 37.4%、49.0%启用联合优化后峰值分别上涨至 41.7%、54.0%充分验证协同闭环可解决单一优化存在的性能上限瓶颈。05展望目前这套方案已经在同分布任务上验证了 Harness 可组合、轨迹驱动自动进化以及与模型协同优化的可行性展现出打破传统静态脚手架双重天花板的潜力。不过局限也很明显1进化过程只在同分布任务上做过测试域外泛化能力尚未验证2当前主要面向文本离散动作的 Agent对连续控制或多模态场景的支持还是空白3整个进化引擎高度依赖能力较强的元模型成本与可及性仍有约束。未来如果能补上跨域泛化实验、扩展到更丰富的动作空间并降低对超强 LLM 的依赖这条路径有望真正把 Agent 的运行时层从“手工搭建”推向“持续自我进化”。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】