
刚开始使用 Superpowers 时我觉得自己找到了 AI 编程的正确答案。它要求模型先澄清需求再设计方案设计通过后编写实施计划然后用 TDD 开发、调用子代理、执行代码审查最后验证结果。这套流程非常专业而且确实有效。尤其当你使用的是规划能力、工具调用能力或长任务稳定性不够强的模型时Superpowers 能够显著改善结果。它就像一套工程护栏约束模型不要凭感觉写代码也不要在没有验证的情况下宣布任务完成。但换到 GPT-5.6尤其是gpt-5.6-sol后我逐渐发现了一个奇怪的现象安装了 Superpowers 的 GPT-5.6有时反而没有“裸奔”的 GPT-5.6 聪明。它不是不会写代码而是越来越不愿意直接解决问题。你让它改一行配置它想先写设计文档让它修一个原因明确的 bug它要先讨论成功标准让它执行一个已经非常清楚的任务它仍然不断向你确认。于是我关闭了全局启用的 Superpowers转向一个简单得近乎寒酸的技能Grill Me。结果反而更好。Superpowers 解决的是什么问题Superpowers 本质上不是一个单独的技能而是一整套面向 AI 编程的软件开发方法论。它主要解决模型常见的几个问题没理解需求就开始写代码遇到复杂任务时缺乏规划写到一半忘记最初目标不写测试也不验证结果修改范围不断失控自信地宣布一个并未完成的任务已经完成因此Superpowers 给模型规定了一套严格流程先头脑风暴再输出设计设计确认后编写实施计划按计划开发执行测试驱动每个阶段都进行检查、审查和验证。对于能力还不够强的模型这套方法非常有价值。它们可能不能稳定判断什么时候应该澄清、什么时候应该探索代码库也不一定能自己维持一个持续数十步的开发计划。Superpowers 把这些原本依赖模型判断的事情转化成了一套明确的操作程序。换句话说当模型缺乏工程判断时Superpowers 用工程流程替它做判断。这不是缺点恰恰是它最重要的价值。为什么到了 GPT-5.6情况发生了变化GPT-5.6 Sol 本身已经具备很强的代理能力。它能够主动检查代码库、理解项目结构、拆解复杂任务、调用工具、验证结果并根据任务风险决定下一步行动。这时再叠加一套全局强制流程新增价值就开始下降副作用却会逐渐增加。Superpowers 中包含不少严格规则例如只要技能有一点可能适用就必须调用所有创意工作都必须先完成设计即使任务非常简单也不能跳过设计阶段用户没有批准设计之前禁止开始实施设计完成后还要写文档、提交并再次等待确认能力较弱的模型需要这些规则来避免失控。但 GPT-5.6 的问题恰恰相反它的指令遵循能力很强所以会认真执行每一道流程。结果就是它把大量注意力放在“是否遵守了工作流”上而不是“怎样最有效地完成任务”。这就像带领两名不同经验的工程师。对于新人你可能需要提供详细的开发规范、检查清单和审批流程对于经验丰富的工程师你只需要说明目标、约束和验收标准。如果还要求他修改一个按钮颜色也必须提交完整设计方案流程就会开始拖累效率。不同能力的模型需要不同程度的约束Superpowers 和 Grill Me 不是简单的替代关系。它们更适合不同能力水平的模型。对于能力一般的模型Superpowers 可以提供稳定的任务分解方法明确的阶段目标强制的用户确认节点测试驱动开发约束防止范围失控的检查机制完成前必须验证的质量底线这些流程能够降低模型遗漏需求、跳过测试或盲目实现的概率。而对于 GPT-5.6 Sol 这样的强模型更合适的方式通常是给出清晰目标提供必要上下文说明关键约束定义授权和审批边界设置明确的完成标准只在需要时调用专项技能弱一些的模型需要别人告诉它“每一步怎么走”。强模型更需要知道“要去哪里、什么不能做、怎样才算完成”。为什么提示词越多模型可能越笨很多人认为给 AI 更多规则它就会表现得更专业。实际情况并非如此。每增加一条指令模型就多了一个需要同时满足的目标。规则之间可能重复、竞争甚至互相冲突。模型原本只需要考虑怎样正确完成这个任务加入复杂工作流后它还要考虑是否应该先调用另一个技能是否已经完成需求澄清是否可以进入实施阶段是否需要创建设计文档是否必须等待用户确认是否违反了某项工作流规则对于能力较弱的模型这些问题提供了必要的行为框架。对于已经能够自主做出这些判断的模型它们却可能成为额外负担。OpenAI 当前的 GPT-5.6 提示指南也建议使用更精简的提示词每条规则只陈述一次只提供当前任务需要的工具删除重复的说明和示例在一组内部编码代理评测中精简系统提示词曾让模型得分提高约 10%–15%同时减少 41%–66% 的 token 消耗。具体结果会因任务而异但它说明了一个重要趋势模型能力越强提示词越应该关注目标和边界而不是重复规定过程。Grill Me 为什么更适合 GPT-5.6Grill Me 没有试图接管完整的软件开发过程。它只做一件事在你需要时狠狠拷问你的方案。它会围绕一个计划逐项追问你真正要解决的问题是什么为什么选择这个方案有哪些没有验证的假设最坏情况下会发生什么哪些边界条件还没有考虑有没有更简单的替代方案怎样判断最终结果是否成功它一次只问一个问题并为每个问题提供推荐答案。能够从代码库或环境中查到的事实它会主动查找真正涉及取舍的决策才交给用户。更重要的是Grill Me 通常由用户主动触发。你可以在真正需要它时说我要重构权限系统。先不要写代码grill me。讨论清楚后Grill Me 的任务就结束了。接下来GPT-5.6 可以恢复自己的原生工作方式完成设计、实施和验证。Grill Me 没有试图替代模型的判断能力。它只是临时把模型的审查能力放大。我的选择不是“Superpowers 没用了”关闭 Superpowers不代表它已经过时更不代表设计、测试和代码审查不重要。真正需要改变的是使用方式。如果模型经常出现以下问题Superpowers 仍然非常适合接到需求便立刻写代码不能稳定完成多阶段任务容易偏离原始目标经常忘记运行测试修改范围不断扩大缺少设计和验证意识工具调用不稳定需要明确流程才能保持一致性但如果使用 GPT-5.6 Sol并且它已经能够稳定地规划、执行和验证任务那么更适合采用轻量、按需的技能组合简单明确的修改直接实施并验证需求模糊时使用 Grill Me复杂功能开始前调用 brainstorming疑难故障出现时调用 systematic debugging高风险改动才要求完整设计和审批是否采用 TDD根据项目和任务决定这不是抛弃工程纪律而是让流程与任务风险、模型能力相匹配。最后的结论Superpowers 最适合解决的是模型能力不够稳定怎样用流程约束它Grill Me 更适合解决的是模型已经很强怎样让它在关键决策上挑战我对于能力一般的模型Superpowers 是一套非常有价值的工程护栏。它能够弥补模型在规划、测试、验证和长期任务执行上的不足。对于 GPT-5.6 Sol继续全局强制执行同样的流程却可能限制它根据实际情况调整策略的能力。此时像 Grill Me 这样轻量、单一、按需触发的技能往往更加合适。能力不足的模型需要 Superpowers 告诉它每一步怎么走。能力足够强的模型只需要 Grill Me 在关键路口问一句你真的想清楚了吗