Anthropic定义四种Loop设计方式,教你设计高质量循环工程

发布时间:2026/7/20 0:11:27
Anthropic定义四种Loop设计方式,教你设计高质量循环工程 7月7日Anthropic的Claude Code团队在X 上发布了一份循环设计指南系统拆解了他们是怎么设计loop的。这份指南读下来你会发现一个有意思的信号Agent工程的重心正在从写好指令转向设好规则。四种循环从手动到自循环Claude Code团队把loop分成了四种类型。它们之间的差异不在于技术实现而在于你把多少控制权交给了Agent。轮次循环Turn-based loop每次你给Claude Code发一个提示词就启动了一个轮次循环。它的运作方式是Claude收到指令后收集上下文、采取行动、检查结果、在需要时重复、最后回复你。这个过程里由它自己决定什么时候停下来例如它判断自己完成了任务或者需要你提供更多上下文。所以你其实一直在用loop只是没意识到。但问题也在这里。Claude判断它完成了的标准和你的预期之间往往有差距。你觉得有些东西还没做好但它觉得已经可以交差了。这个差距就是轮次循环最大的短板。怎么缩小这个差距Claude Code团队的答案是不要靠prompt去描述你该怎么做而是靠SKILL.md去定义做完之后必须验证什么。举个例子。如果你只是写了一句“帮我在这个页面加一个点赞按钮”Claude加完代码就会停。但如果你的SKILL.md里写了这么一段绝对不要仅基于成功的编辑就报告UI更改已完成。像人类评审员一样对其验证启动开发服务器在浏览器中打开页面直接与更改交互截图对比修改前后状态检查控制台有无新错误运行Core Web Vitals审计。任何步骤失败回到第一步重新来。这个SKILL.md就是一个**可执行的验收清单**它把你脑子里那些隐性的判断标准翻译成了Agent可以自动执行的检查清单。目标循环Goal-based loop轮次循环解决的是Agent怎么干活但更复杂的任务还需要解决另一个问题Agent怎么知道自己什么时候真的干完了这就是目标循环要解决的问题。使用/goal指令你给Claude设定的是一个具体的、可验证的目标而不是一个模糊的期望。比如/goal 将主页Lighthouse分数提升到90分或以上尝试5次后停止。如果只是说“请优化主页性能”Claude会根据自己的判断决定优化到什么程度算够好了。这个判断通常是保守的它倾向于早点交差。而“Lighthouse分数到90分”的判断是客观的如果没达到就继续。这里有一个很容易被忽视的设计细节目标循环的工作原理不是让Claude更加努力而是引入了一个评估层。每次Claude尝试停止时一个独立的评估模型会检查目标条件没达标就驳回继续工作。这个评估层是全新的上下文它不受主Agent推理过程的影响。这很关键。Agent在执行任务时会产生某种思维惯性认为自己做的修改都是合理的。一个独立的评估者正好打破这个惯性。目标循环的优势在于可量化的完成标准比任何精心措辞的prompt都可靠。不是prompt写得不够好而是prompt再怎么好最终的够好了仍然依赖Agent自己的主观判断。而数字不会通融90分就是90分少一分都不行。时间循环Time-based loop前两种循环都是你来触发。但如果Agent的工作需要跟外部系统交互呢比如你的Pull Request收到了新的审阅意见或者CI跑失败了。这些事件发生在你不在电脑前的时候等你回来再手动触发Agent处理黄花菜都凉了。时间循环就是为这种场景设计的。/loop指令让Claude定时重新执行任务/loop 5m 检查我的PR处理评审意见修复失败的CI。每5分钟Claude自动检查你的PR状态发现问题就自己动手修。/schedule是/loop的云端版本把定时任务从你的本地机器搬到服务器上运行。关了电脑也不会停。Claude Code团队的建议是尽量让时间间隔跟变化频率匹配不要太频繁。如果你每1分钟轮询一次大部分检查都是在空跑什么都没变白烧Token。如果你的PR平均3小时才收到一次评审那每30分钟检查一次已经足够快了。此外能基于事件就别基于时间。如果你的代码仓库支持webhook通知PR有新评论时推送事件用事件触发远比定时轮询更高效。时间循环只是当你没有事件机制时的一个替代方案。主动循环Proactive loops主动循环不是一种全新的循环类型而是前三种的组合包。它把/schedule触发、/goal目标定义、动态工作流任务编排和自动模式免确认运行串起来构成一条完整的自动化流水线。举一个原文里的例子/schedule 每小时检查project-feedback频道中的Bug报告。/goal直到本次运行中发现的每个报告都经过分类、处理并回复才停止。在修复Bug时使用工作流在三个并行工作树中探索三种解决方案并让评审智能体进行对抗性审查。这段指令相当于告诉Claude“我不参与了每小时你自己看着办”。从设计的角度来看主动循环体现了一个关键的工程思路复杂系统的可靠性不来自于某个厉害的组件而来自于合理组合简单、可靠的组件。/schedule负责触发/goal负责边界工作流负责分工评审Agent负责质量。每个组件只做一件事做好自己的事组合起来就是一条能自主运行的流水线。三大工程原则四种循环的拆解提供了操作手册什么时候用什么。但Claude Code团队的这份指南里还藏着三条更深层的设计原则它们解释了为什么loop能生效而不仅仅是loop怎么用。原则一验证闭环决定质量上限这份指南里有一句话循环输出的质量取决于它周围的系统。loop本身只是一个执行框架它告诉Agent去干、检查、不行就再来。但如果检查这一步是糊弄的loop做得越多错得越多。验证系统的设计有三个层次。第一层把人的隐性判断变成可执行的检查项。如果SKILL.md里的验证步骤不是文档是代码Agent真的会去执行。要求检查控制台有没有新错误Agent就会去读console log。要求对比修改前后的截图Agent就会真的截两张图放在一起看。验证越具象、越可量化loop就越不容易跑偏。第二层引入独立评审者打破思维惯性。Agent执行任务时会形成自己的推理链顺着这个推理链往下走很容易忽略自己犯的错误。这就是为什么Claude Code在目标循环里加了一个独立的评估模型全新上下文不受主Agent推理过程影响只看结果不看过程。这个设计跟人类团队的Code Review逻辑完全一致写代码的人自己是审不出所有问题的必须要一个没参与写代码的人来审。第三层对抗性审查。在主动循环那个Bug修复的例子中Claude Code不仅让一个Agent修Bug还让评审Agent做对抗性审查。不是你改完了我看看就过了而是我专门来找你漏洞的。你的修复方案有没有引入新问题有没有边界情况没覆盖测试用例够不够四种循环的本质差异就是验证自动化程度的不同。轮次循环验证全靠人你手动检查Agent的输出目标循环验证部分自动化可量化的标准由系统检查时间循环验证全自动化Agent自己检查、自己修复主动循环验证流水线化多个Agent交叉验证loop能不能跑稳不取决于loop本身取决于你花了多少心思设计验证。原则二停止条件比prompt更重要有多少人写prompt的时候会在最后加一句请确保质量足够好问题是什么是足够好Agent想要交差你说质量还不够好。你们之间没有一个共识因为你没说清楚好到底指什么。Claude Code团队在设计loop的停止条件时分了明确的三个层级任务级目标达成Lighthouse上90分了测试全通过了资源级最大轮次到了尝试5次了该停了经济级Token预算耗尽不用无限循环烧钱这三层里任务级的停止条件是唯一真正定义完成的。它的设计原则很明确必须是可量化的、可自动判断的不能依赖Agent的主观评价。让代码质量变好不是一个合格的停止条件因为谁也判断不了什么叫变好。所有测试通过是Lighthouse分数≥90分是构建时间减少至少20%是。这个原则挑战了一个写prompt时的常见习惯我们总喜欢在prompt里描述质量的期望而不是定义质量的度量。但loop的设计思路刚好相反别告诉Agent怎么做得好告诉它什么叫达标。只要达标了就停没达标就继续。原则三代码库本身就是质量基础设施Claude Code认为干净的代码库是loop能高效工作的前提。这不是空话。Agent不是凭空理解你的项目的。它通过读取现有代码、分析文件结构、学习代码风格来建立上下文。如果代码库本身混乱风格不统一、命名不规范、到处都是死代码Agent的理解就会出错基于错误理解做出的修改自然好不到哪去。更关键的是成本。Claude Code团队明确区分了两种操作方式的成本差异运行脚本 vs 逐步推理。如果有一个PDF表单填充的脚本Agent只需要调一次脚本就完成了。如果没有脚本Agent需要每次重新推导表单填充的逻辑这中间的Token消耗可能是几十倍的差距。这个原则深层含义是别把所有事情都丢给Agent去推理。能做脚本的就写成脚本能工具化的就工具化。Agent的推理能力是稀缺资源把它用在真正需要判断的地方而不是用在可以标准化的重复性工作上。Claude Code提供/usage命令来查看Token消耗按技能、子Agent和MCP工具细分。Claude Code团队的建议是大规模跑loop之前先用小规模试点看消耗。动态工作流可能一次跑出几百个子Agent成本变化是指数级的。从写指令到设规则传统的Agent开发思路是prompt越写越长越写越精妙试图用一段完美的指令覆盖所有可能的情况。loop的设计思路反过来了prompt不需要完美系统才需要。只要你把验证条件定义清楚了、停止边界设好了、工具链搭好了Agent自己会迭代到对为止。当前Agent设计的重心已经从指令层上移到了系统层。你在系统层面付出的每一分设计成本验证步骤、停止条件、工具链最终都会转化为Agent输出的可靠性。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】