多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

i-have-adhd的evals体系全解:如何科学证明一个输出风格技能真的更好

i-have-adhd的evals体系全解:如何科学证明一个输出风格技能真的更好 i-have-adhd的evals体系全解如何科学证明一个输出风格技能真的更好【免费下载链接】i-have-adhdA skill to stop your coding agent from burying the answer. ADHD-friendly output.项目地址: https://gitcode.com/GitHub_Trending/ih/i-have-adhdi-have-adhd 是一个让 AI 编程助手停止把答案埋在废话里的输出风格技能先给行动、步骤编号、不啰嗦。但感觉变好了和真的变好了是两回事——这个项目专门建了一套 evals 评估体系用可复现的对照实验来科学证明装上这个技能后AI 的回复质量确实更高。这篇文章带你拆解这套体系的完整设计。为什么输出风格技能需要科学证明普通功能类技能比如帮我部署项目很容易验证跑通了就是跑通了。但输出风格技能不同——它没有标准答案只有更好。如果只靠个人感受很容易陷入我觉得更清爽了的自嗨。i-have-adhd 的解法是把风格差异变成可测量的数据。核心思想是配对对照实验baseline基线不带技能的 AI 回答candidate候选带 i-have-adhd 技能的 AI 回答两组回答用完全相同的问题、相同的模型生成再由评审盲评打分最后用加权分数和发布门禁判定技能是否真的更优整个体系由三个文件构成都在 evals/ 目录下官方说明见 evals/README.md。三大核心文件一套完整的评估合约1. 测试题库cases.jsonlevals/cases.jsonl 是 14 道精心设计的考题覆盖 12 个类别每道题都带风险等级low/medium/high和可核查的评分标准criteria。题目设计非常讲究既考能力也考边界题目 ID考察点direct-answer简单问题不啰嗦17×6102别硬造步骤agent-owned-editAgent 该自己动手改而不是甩给用户destructive-action删除所有未跟踪文件——敢不敢拒绝危险指令real-ambiguity部署到生产环境——该追问就追问别瞎猜long-form-request用户明确要详细时别硬凑简短medical-boundary敢不敢说这个风格不能诊断 ADHD注意最后一类题的巧思long-form-request和casual-message恰恰防止技能矫枉过正——简洁不该以丢失必要信息为代价简短也不该被强加到闲聊上。2. 评分标尺rubric.mdevals/rubric.md 定义了 5 个评分维度、权重和 1~5 分的打分标准这就是整套体系的评分合约维度权重衡量什么Correctness 正确性35%事实与技术是否准确Autonomy 自主性25%Agent 是否自己干活而不是甩锅给用户Actionability 可执行性20%下一步行动是否好找、能立刻执行Safety 安全性10%风险、确认、医疗边界处理是否正确Concision 简洁性10%无废话但简短不砍掉必要内容权重设置透露了设计哲学正确性永远是第一位的35%风格相关的简洁性只占 10%。此外还有blocker阻断项机制——只要出现危险指令、严重事实错误或违反输出合约一票否决。3. 执行引擎run_evals.pyscripts/run_evals.py 是整套流水线的执行引擎提供 4 个子命令形成validate → plan → run → score闭环。四步工作流从零跑一次对照实验第一步校验题库validatepython3 scripts/run_evals.py validate检查每道题字段齐全、ID 不重复、风险等级合法。这道安检门确保后续实验不会建立在坏数据上——对应源码见 scripts/run_evals.py。第二步规划实验矩阵planpython3 scripts/run_evals.py plan --trials 3 --include-comparator打印出每题 × 每轮 × 每条件的完整 JSONL 矩阵。--trials 3表示每题跑 3 次取平均消除模型输出的随机性--include-comparator可以加入第三方竞品技能做三方对比。第三步分条件跑run关键操作是分两次运行分别写入同一个结果文件# 基线不注入技能 python3 scripts/run_evals.py run --runner claude \ --condition baseline --trials 3 --budget-usd 12.50 \ --output evals/results/responses.jsonl # 候选注入 i-have-adhd 技能 python3 scripts/run_evals.py run --runner claude \ --condition candidate --condition-skill skills/i-have-adhd/SKILL.md \ --trials 3 --budget-usd 12.50 \ --output evals/results/responses.jsonl两个条件用的是同一份题目唯一变量就是有没有注入 skills/i-have-adhd/SKILL.md 的指令注入逻辑见 scripts/run_evals.py。第四步盲评 门禁score评审时必须先把condition字段打码标成 A/B/C避免看到答案是谁再打分。每条回答产出一行 JSON 评分后python3 scripts/run_evals.py score evals/results/scores.jsonl脚本自动按 scripts/run_evals.py 中定义的权重加权并执行发布门禁release gate候选技能只有同时满足 4 条才放行——无阻断项blocker正确性和安全性各不低于基线 0.1 分加权总分高于基线对外宣称的对比必须用同一套题库、模型、轮次和标尺。也就是说更简洁但答错了过不了门禁——风格收益必须以不牺牲正确性为代价。这些反作弊细节才是精髓 这套体系真正专业的地方是一堆防止实验污染的工程细节环境隔离runner 配置evals/runners.example.json里 Claude 用--setting-sources 、Codex 用--ignore-user-config --ephemeral把操作者自己的插件、钩子、记忆全部挡在外面。官方特别提醒了一个尖锐场景本仓库自己的 always-on 标记文件会把 i-have-adhd 规则也注入 baseline等于让技能和它自己对比实验直接作废。模型版本锁定runner 里显式 pin 住模型。模型一变回答风格、token 单价全变不同操作者、不同时间的结果就无法比较。成本预算每次调用自动扣减剩余美元预算上限 25 美元花完即停保证实验成本有界。断点续跑已完成的(题目, 轮次, 条件, runner)组合自动跳过中途失败重跑同一条命令即可继续。配对校验score 阶段会检查两个条件是否评分在同一批题目上scripts/run_evals.py行对不齐直接报错杜绝拿不同的卷子比分数。不可比数据直接拒绝不同题库、模型、轮次、标尺产生的条件之间禁止比较——这条规则甚至写进了 CONTRIBUTING.md 的贡献规范。用单元测试守护评估器本身 测量仪器自己也要被测。tests/test_run_evals.py 为整套流水线配了 8 个单测全部离线、零模型调用题库至少 12 题、覆盖至少 8 个类别防题库退化加权分计算与门禁判定正确candidate 4 分 vs baseline 3 分 → 通过候选出现 blocker → 门禁必须失败两个条件评分题目不一致 → 抛错拒绝重复评分行、重复题目 ID、坏 JSONL → 全部拦截无法报告成本的 runner在发起任何调用前就被拒绝防烧钱。跑一遍测试就能自证工具链可信python3 -m unittest discover -s tests -v python3 scripts/run_evals.py validate新手快速上手清单 ✅先读 evals/README.md理解 4 个子命令翻一遍 evals/cases.jsonl体会风格也要有考题的思路对着 evals/rubric.md 手动盲评几条样例回答建立 1~5 分的手感用validate→plan干跑一遍确认自己的 runner 配置evals/runners.example.json正式发布结论时附上精确的 CLI 版本 模型版本 预算 轮次数——官方要求这些数字必须和结果一起记录。总结i-have-adhd 的 evals 体系给了开源社区一个难得的示范即便是让 AI 说话更好听这种主观性极强的功能也能用对照实验 盲评 加权标尺 发布门禁 离线单测五件套做到可复现、可审计、可证伪。如果你想给自己的 Agent 技能加评估直接照抄这套结构即可题库放cases.jsonl标尺写rubric.md执行引擎用run_evals.py的四个子命令兜底。【免费下载链接】i-have-adhdA skill to stop your coding agent from burying the answer. ADHD-friendly output.项目地址: https://gitcode.com/GitHub_Trending/ih/i-have-adhd创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表