斯坦福等提出 LLM-as-a-Verifier:通用验证框架提升任务表现

发布时间:2026/7/31 23:10:47
斯坦福等提出 LLM-as-a-Verifier:通用验证框架提升任务表现 一句话讲清楚斯坦福等机构提出 LLM-as-a-Verifier 不靠额外训练直接对评分 token 的 logit 分布取期望得到连续分数再沿粒度、重复评估、准则分解三条轴扩展验证算力在 Terminal-Bench 、 SWE-Bench 、机器人与医疗四个基准上刷到 SOTA 还能当 Agent 进度条和 RL 稠密奖励用。Agent 跑长任务时常见尴尬是同一条 prompt 采样五次三次能过、两次翻车——问题往往不在「会不会」而在「选没选对那条轨迹」。大模型能力这几年靠预训练、后训练、测试时扩展三条轴往上堆生成侧 Scaling Law 写得明明白白验证侧却长期停在「让模型吐一个 1–5 分」——离散、易平局、区分度粗。斯坦福、伯克利、 NVIDIA Research 联合团队的新论文把verification scaling 验证扩展单拎成第四条轴不改权重、不训奖励模型只靠 API 返回的 logprobs 把 Judge 升级成 Verifier 。结果在编码 Agent 、软件修复、机器人操作、医疗 Agent 四条线上同时登顶。跨编码、机器人、医疗三个领域的整体成绩 Terminal-Bench V2 86.5%、 SWE-Bench Verified 78.2%、 RoboRewardBench 87.4%、 MedAgentBench 73.3%。验证为什么成了瓶颈论文开头画了一张「四大扩展范式」对照图预训练、后训练、测试时扩展都已成熟验证扩展几乎是空白。LLM 能力扩展的四条路径验证 Verification Scaling 此前缺乏系统化方法。直觉上很多 Agent 任务「模型其实会只是没选对那条轨迹」。团队在 Terminal-Bench V2 上做了 Oracle 实验假设有一个永远选对轨迹的验证器把同一任务采样 条轨迹再挑最好的成功率随 单调上升全榜候选池拼起来能到 98.9%——接近把整张卷子做完。Oracle Pass 随采样轨迹数增加而上升说明「会做题」和「选对答案」之间有很大空隙。空隙就在验证器身上。标准 LM Judge 的做法是 prompt 模型输出离散评分 token 取概率最高的那个作为最终分数。复杂轨迹一多两条路经常打成同一个分——Terminal-Bench 上平局率高达 27%。另一条路是训专门的奖励模型 PRM/ORM 但受训练数据域限制跨编码、机器人、医疗很难一套权重通吃。团队要的是零训练、可插拔、细粒度。核心机制 Judge 与 Verifier 差在哪论文把角色分得很清楚Judge 下整体结论 Verifier 核对正确性需要更细的刻度。做法并不神秘——利用模型本来就会输出的评分 token 论文用字母刻度 ONE…TWENTY 避免和数字 token 混淆不取 argmax 而是对 logit 分布做期望逐项拆一下■任务描述候选轨迹代码步骤、工具调用序列等■评分粒度——从 1 个 token 到 20 档字母分■同一对轨迹重复评估次数做蒙特卡洛降噪■准则条数——把「对不对」拆成规范符合、输出格式、错误信号等子项■模型给第 档分的概率从 API logprobs 读■把 token 映射到数值再线性归一化到两条轨迹谁更好用 Bradley–Terry 模型把连续分数差转成偏好概率连续分数的好处很直接几乎不会出现精确平局细差别能反映在 的小数部分上。统一验证框架多模态输入 → 对评分 token 分布取期望 → 沿粒度/重复/分解三维扩展 → 用于测试时选优、进度监控、 RL 奖励。三维验证扩展多花钱在哪论文用 Terminal-Bench V2 上的pairwise accuracy成功轨迹是否比失败轨迹分更高量化三条扩展轴。看 Figure 4 三张子图趋势一致钱花得越细验证越准。左评分粒度 从 1 提到 20 准确率 73.1%→77.5%中重复评估 从 1 到 16 74.7%→77.5%右准则分解与集成单准则约 75–76%三准则集成 78.3%。粒度离散 Judge 相当于 。粒度加大后信号噪声比 SNR 从 0.775 升到 0.799——正确与错误轨迹的分数差更稳定 pairwise 判断更可靠。重复单次评估会被 prompt 偶然性带偏对 次独立打分求平均方差按 1/K下降。左图里在k16时到k1起平局率就是k1时仍有k16$ 也还有 5.5%。连续 Verifier 蓝对比离散 Judge 橙准确率全程更高且 Verifier 不产生平局。准则分解编码 Agent 任务里「整体是否正确」太笼统。团队拆成 Specification 是否满足任务要求、 Output 最终输出格式、 Errors 日志/工具是否报错三条分别打分再平均。任一子准则单独用只有 75–76%集成后 78.3%。案例 SQL 优化任务上的 88 次平局附录里有个 query-optimize 案例很说明问题两条轨迹都能让 SQL 跑得更快但失败那条根本没在原始库上做等价性校验而是另建了一个库——逻辑硬伤。Gemini 2.5 Flash 的评语其实是分得清的「略干净」「稍微更直接」但离散 1–5 分 Judge 在 100 次重复里88 次打出平局 5 vs 5 。换成连续期望后 0 次平局 69 次正确排序 时正确排序 77 次。同一个模型、同一对轨迹换读分方式判别力差了一个量级。概率枢轴锦标赛 条候选怎么省预算测试时扩展常采样 条轨迹再选最优。朴素做法是 round-robin 所有 对两两比成本 稍大验证费就爆。团队提出Probabilistic Pivot Tournament PPT 五阶段流水线(1) 候选池 → (2) 环状配对消除位置偏差 → (3) 选 top- 枢轴 → (4) 非枢轴/枢轴两两比 → (5) 按归一化胜场选冠军复杂度从 降到 。关键设计有两处1.环状首轮 Ring pass 随机哈密顿环上相邻轨迹配对每条轨迹在 A/B 槽位各出现一次抵消模型「偏爱某一侧」的位置偏差。2.枢轴集环上得分靠前的 条进入枢轴集后续只比「非枢轴 vs 枢轴」和「枢轴 vs 枢轴」把预算集中在最可能正确、也最难区分的头部候选。论文默认 编码任务用三准则分解同一套超参跨四个基准零微调这是「通用验证框架」说法的底气。四个基准上的成绩单主结果表汇总了各榜 baseline 、 Pass1 、 Oracle 上界和本文方法各基准 baseline 前三名、 Pass1 、 Oracle Pass 与 LLM-as-a-Verifier 成绩右列「 Ours 」均为该基准 SOTA 。读表时抓住三个数Pass1是随便取一条的成功率Oracle是「验证器永远选对」的理论上限Ours是 PPT 验证扩展实际达到的水平。基准设定要点Pass1OracleOursTerminal-Bench V2GPT-5.5 采样 5 条 Gemini 2.5 Flash 验证83.1%92.1%86.5%SWE-Bench Verified异构池 Opus 4.5 / G3 Flash / M2.5 各 1 条76.1%84.4%78.2%MedAgentBenchOpus 4.8 采样 5 条医疗 EHR 工具链70.2%75.0%73.3%RoboRewardBench500 对机器人视频轨迹偏好——87.4%Terminal-Bench V2长程 shell 任务文件操作、工具失败恢复都考。 Capy 脚手架 GPT-5.5 生成验证后 83.1%→86.5%超过当时榜一 NexAU-AHE 的 84.7%。SWE-Bench Verified 500 个真实 GitHub issue 要改对代码并通过隐藏测试。这里故意用三家不同模型各出一条的异构池考验验证器能不能跨风格选优——78.2% 高于池内任一单模型。RoboRewardBench输入是多帧操作视频要和 RoboReward-8B 、 Robometer-4B 等专门训过的机器人奖励模型比偏好准确率。零样本 Qwen 3.6 35B 连续验证87.4%离散 Judge 同骨干只有 70.8%。对人标奖励的 MAE 也从 1.11 降到 0.72 。重复评估 从 1 增到 16 轨迹偏好准确率 81.5%→87.4%。RoboRewardBench 上重复评估次数增加轨迹偏好准确率稳步上升。MedAgentBench模拟电子病历环境的医疗 Agent 验证错了有真实安全风险。 Opus 4.8 Pass1 70.2%验证后 73.3%超过同池单模型。不止选最优验证分还能当「进度条」选好轨迹之外连续分数随步骤推进的变化也有意义。团队定义VOC Value-Order Correlation 步骤时间顺序与对应前缀验证分的 Spearman 秩相关越接近 1 说明「分越高做得越靠后」。Terminal-Bench 上成功轨迹 VOC0.848失败轨迹0.769差距 0.079 。机器人 held-out 集上 VOC0.966超过 RoboReward-8B 0.877 和 TOPReward 0.565 ——后者常在开头就把 打到 1.0 失败后无法反映中段退步。pytorch-model-cli 任务成功轨迹绿验证分单调上升失败轨迹红因误装 torchvision 占满磁盘分数长期低迷。这条性质直接落地成TurboAgent插在 Claude Code 等 OpenAI 兼容客户端与后端模型之间的推理代理并行跑 条轨迹、 PPT 选优并提供 Web 面板实时看验证曲线——长跑 Agent 任务可以在写坏磁盘前刹车。顺手解决 RL 的信用分配难题验证分还能当稠密奖励不用另训 reward model 。离策略 LIBERO 机器人 DSRL-SAC 每步用 VLM 对子轨迹前缀打进度分 塑形奖励 。同样成功率目标环境步数少约 1.8 倍最终成功率 0.76 vs 稀疏奖励 0.69 。在策略 MATH 推理 Qwen3-8B GRPO 早期常出现「一组回答全错、组内优势全零、没梯度」。给每条推理链加验证器排序分 优化步数少约 10% 1.1× 样本效率。左 LIBERO ketchup 任务 DSRL-SAC 右 MATH 上 GRPO 。稠密验证奖励橙对比稀疏 baseline 灰的学习曲线。我的判断验证扩展值得单独记账这篇论文的价值是把「测试时多采样」后半段一直含糊的「谁来挑」做成了可扩展工程。连续期望先解决离散 Judge 的平局病是零训练前提下性价比最高的改动粒度、重复、分解三维扩展则给出花钱地图——预算紧先加 再叠 和准则分解。 PPT 让「采样 条再验证」在大 时仍可负担把 Oracle 98.9% 的理论空间里挖出了一大块 86.5% 已吃掉 Pass1 到 Oracle 之间约一半增益。也要清醒依赖 logprobs API闭源模型若不给 logprob 就难复现验证成本随候选数线性涨 很大时仍贵准则分解目前有人工设计成分全自动拆 rubric 还没解决。对做 Agent 平台的团队短期可试的路径很明确在现有「多路径采样 投票/最长输出」旁边加一条连续验证选优支路长跑任务把 VOC 曲线暴露给用户比事后看 log 有用得多。验证这条轴终于能和训练、推理并列记账了。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】