
AgentScope 多智能体框架实战SWE-Bench 修复率 63.4% 是怎么做到的【免费下载链接】agentscopeBuild and run agents you can see, understand and trust.项目地址: https://gitcode.com/GitHub_Trending/ag/agentscopeAgentScope 是一个开源多智能体框架核心能力是让多个分工明确的 Agent 协作完成单个模型干不动的任务。官方公布的数字是在它跑出的 SWE-Bench 代码修复实验中修复率达到 63.4%比单智能体基线高出 20 多个百分点。对刚接触 AgentScope 多智能体协作的朋友来说这套流程可以直接照搬。先说痛点让一个模型单干修 bug 会栽在哪上下文装不下一个 bug 往往牵扯多个模块单一 Agent 的上下文里塞不进全部依赖关系容易修 A 处坏 B 处。环境不一致自动跑修复脚本时依赖版本、权限边界稍有出入就失败重试全靠运气。多方案难取舍并行产出几个补丁后哪个更好没有量化标准靠 LLM 口头点评稳定性差。整体思路两阶段流水线分工 投票整个架构用三句话就能说清第一阶段把修 bug拆给复现、修复、验证三个专业化 Agent 依次接手第二阶段不再让 LLM 凭感觉当裁判而是用一个微调过的奖励模型给各方案打分取最高分。阶段之间靠框架自带的事件系统和消息总线同步状态不用自己造通信轮子。拆开看关键设计三个 Agent 各管一段复现 Agent 读 PR 描述先写出能稳定触发 bug 的测试修复 Agent 结合代码差异分析定位根因、生成补丁验证 Agent 跑回归测试确认没引入新问题。单点出错只影响一段不会让整个流程陪葬。执行-验证循环内置在框架里修完了算不算修好由框架内置的 GoalPipeline 管住执行者干活验证者验收不过就带着失败原因再来一轮直到达标或到达轮数上限不用手写这个循环。from agentscope.pipeline import GoalPipeline goal GoalPipeline( executorrepair_agent, # 干活 verifiercheck_agent, # 验收 max_iters10, )验证者还能判定impossible目标不可达主动终止避免 Agent 空转烧 token。奖励模型投票替代 LLM 直接评审各 Agent 产出的补丁轨迹先统一格式再由基于 Qwen2.5-Coder-Instruct 微调的奖励模型从代码质量、功能完整性、性能影响等维度打分取最高分方案。官方公布相比直接用 LLM 当裁判打分方差降低了 67%评审更稳。隔离与权限兜底框架提供 Docker 工作空间和权限引擎Agent 在隔离环境里操作越界行为被规则拦住自动修代码时不用提心吊胆。效果怎么衡量官方公布的对比数据如下指标单智能体基线AgentScope 多智能体SWE-Bench 修复率42.1%63.4%平均修复耗时8.7 分钟5.2 分钟回归问题率15.3%6.8%解读修复率提升 21.3 个百分点是修得多耗时降四成是修得快回归率从 15.3% 压到 6.8% 才是多智能体分工真正值钱的地方——修好且不再弄坏。上手与调优跑通前clone 仓库后按官方示例配置建议用 Docker 工作空间跑保证环境和官方实验一致长期记忆、TTS 等能力以中间件形式挂上即可不侵入主流程入口示例见 examples/agent_service/。调参要点把max_iters当成成本旋钮任务简单时调小省时间复杂任务调大并配合验证者上下文重置多方案投票时按任务难度决定并行 Agent 数量别无脑拉满。功能动态可关注 docs/NEWS.md源码入口在 src/agentscope/。团队规模再大通信走消息总线、验收走验证者这套骨架不变往里面加新 Agent 只是加一段分工框架本身不会变。想动手的话一条命令就能开始git clone https://gitcode.com/GitHub_Trending/ag/agentscope cd agentscope uv pip install -e .【免费下载链接】agentscopeBuild and run agents you can see, understand and trust.项目地址: https://gitcode.com/GitHub_Trending/ag/agentscope创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考