多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

Google DeepMind双盲AI评测深度解析:模型看不到考题、评测方看不到权重——机密计算如何根治基准污染

Google DeepMind双盲AI评测深度解析:模型看不到考题、评测方看不到权重——机密计算如何根治基准污染 引言:一场AI评测的信任危机2026年8月27日,Google DeepMind联合新加坡AI安全研究所(Singapore AISI)、OpenMined、AVERI和MLCommons,正式发布了全球首个面向专有前沿模型的双盲评测(Double-Blind Evaluation)试点。这不是一次普通的榜单跑分,而是对"AI评测过程本身能否被信任"的一次根本性工程化尝试。这个方案的核心思想极其简洁,但技术实现极其精密:让保密基准和模型权重在机密计算环境中相遇,评测方看不到模型权重,模型方看不到基准测试题,双方都看不到对方资产,只得到可验证结果。为什么AI评测需要"双盲"?想象一个学生即将参加一场高风险的考试。如果他在考前意外看到了试题,那么满分成绩就不再是能力的真实反映,而是信息泄露的结果。这正是当前AI行业评估前沿模型时面临的挑战——基准污染(Benchmark Contamination)。基准污染是指模型在训练过程中无意或有意地"记住"了测试集中的数据,导致评测分数不能反映真实能力。根据Freelan等人2026年发表的论文,在对17个前沿语言模型和18个公开基准的大规模测量中,整体污染率达到57.3%,所有模型和所有基准都有可检测的污染迹象。更令人担忧的是,Schaeffer等人(2026)的研究表明,测试集污染不仅会虚高分数,而且这种虚高程度会随着污染程度和模型规模的增长而增长。来源:Freelan, D. (2026). “Measuring Benchmark Data Contamination in Frontier Language Models at Scale.” NE2NE. https://ne2ne.com/static/papers/contamination_paper.pdf一、基准污染:AI评测的"房间里的大象"1.1 什么是基准污染?基准污染发生在模型的训练数据中包含了评测基准的测试集。当一个模型在训练时已经"见过"考题,它在评测中的高分就不再是真实能力的体现,而是记忆力的体现。┌─────────────────────────────────────────────────────────────────────┐ │ 基准污染(Benchmark Contamination)全景图 │ │ │ │ ┌─────────────────────┐ ┌──────────────────────────────────┐ │ │ │ 训练数据收集阶段 │ │ 公开互联网数据爬取 │ │ │ │ │ │ │ │ │ │ Common Crawl ──────┼───│ MMLU测试题 ✓ │ │ │ │ GitHub ────────────┼───│ HumanEval代码 ✓ │ │ │ │ arXiv论文 ─────────┼───│ GSM8K数学题 ✓ │ │ │ │ Reddit讨论 ────────┼───│ BIG-bench子集 ✓ │ │ │ │ 维基百科 ──────────┼───│ HotpotQA ✓ │ │ │ └─────────────────────┘ └──────────────────────────────────┘ │ │ │ │ │ ▼ │ │ ┌──────────────────────────────────────────────────────────────┐ │ │ │ 模型训练过程 │ │ │ │ │ │ │ │ 预训练阶段:模型在万亿token上学习,无意中"记住"了测试题 │ │ │ │ 微调阶段:人工标注数据可能包含基准题目 │ │ │ │ RLHF阶段:偏好数据中可能混入标准答案 │ │ │ │ 持续训练:新数据批次可能包含最新发布的基准 │ │ │ └──────────────────────────────────────────────────────────────┘ │ │ │ │ │ ▼ │ │ ┌──────────────────────────────────────────────────────────────┐ │ │ │ 评测结果失真 │ │ │ │ │ │ │ │ 模型在MMLU上得分85% → 但30%的题目已在训练数据中出现过 │ │ │ │ 真实能力可能只有55% → 评测分数虚高30个百分点 │ │ │ │ 用户根据虚高分数选模型 → 部署后实际表现远不如预期 │ │ │ └──────────────────────────────────────────────────────────────┘ │ │ │ │ 污染类型: 无意污染(爬虫数据包含基准) │ 有意污染(针对性训练) │ │ 检测难度: 几乎无法完全检测 │ 可通过行为探针发现 │ └─────────────────────────────────────────────────────────────────────┘1.2 基准污染有多严重?多项研究揭示了基准污染的严重性:大规模测量结果:Freelan等人(2026)对17个前沿模型和18个基准的测试显示:整体污染率:57.3%开放权重模型(Llama、Mistral、DeepSeek、Qwen):74-79%闭源API模型(GPT-4、Claude、Gemini):40-64%污染最严重的基准:HotpotQA、QuAC、FEVER(维基百科衍生数据集)污染最轻的基准:MATH、HellaSwag(数学和常识推理类)行为退化证据:Schaeffer等人(2026)发现,将MMLU测试题改为间接引用形式后,模型准确率平均下降7个百分点,法律和伦理类题目下降高达19.8个百分点——这恰恰是污染最严重的领域。1.3 传统评测方式的困境在双盲评测出现之前,外部评测方和模型提供方面临一个"双重机密困境":┌──────────────────────────────────────────────────────────────────────────┐ │ 传统评测模式:无法回避的权衡 │ │ │ │ 模式A:评测方提供测试题,模型方运行评测 │ │ ┌──────────────┐ 测试题明文 ┌──────────────┐ │ │ │ 评测方 │ ──────────────────────── │ 模型方 │ │ │ │ (测试题) │ │ (权重+代码) │ │ │ │ │ ──────────────────────── │ │ │ │ └──────────────┘ 返回结果 └──────────────┘ │ │ ⚠️ 风险:测试题可能被模型方看到,泄露到训练数据中 │ │ │ │ 模式B:模型方提供权重,评测方本地运行评测 │ │ ┌──────────────┐ 模型权重明文 ┌──────────────┐ │ │ │ 评测方 │ ──────────────────────── │ 模型方 │ │ │ │ (测试题+权重) │ │ (权重+代码) │ │ │ └──────────────┘ └──────────────┘ │ │ ⚠️ 风险:模型权重可能被评测方泄露,知识产权受损 │ │ │ │ 模式C:通过API调用,双方签署NDA和零日志协议 │ │ ┌──────────────┐ API调用(含测试题) ┌──────────────┐ │ │ │ 评测方 │ ──────────────────────── │ 模型方 │ │ │ │ (测试题) │ NDA + 零日志 │ (权重+API) │ │ │ └──────────────┘ └──────────────┘ │ │ ⚠️ 风险:依赖信任而非技术保障,法律约束不等于技术保障 │ │ │ └──────────────────────────────────────────────────────────────────────────┘如DeepMind官方博客所述:“历史上,高风险的第三方评测需要一种权衡。要么评测方交出测试题(冒着模型提供方提前看到题目的风险),要么模型方交出模型权重(冒着知识产权泄露的风险)。”来源:Isaac, W., Messing, S., Lum, K. (2026). “Piloting the world’s first double-blind AI evaluations.” Google DeepMind Blog. https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/二、双盲评测:技术方案深度解析2.1 双盲评测的总体架构Google DeepMind的双盲评测(DBE)框架建立在Google Cloud Confidential Computing产品组合中的Confidential Space之上,结合Intel TDX主机内存加密和NVIDIA H100 80GB Confidential GPU,实现了硬件级的机密计算环境。┌─────────────────────────────────────────────────────────────────────────────┐ │ 双盲评测(Double-Blind Evaluation)整体架构 │ │ │ │ ┌──────────────────┐ ┌──────────────────────────────────┐ │ │ │ 模型方(DeepMind) │ │ 机密计算飞地(Enclave) │ │ │ │ │ │ │ │ │ │ ┌─────────────┐ │ 加密通道 │ ┌──────────────────────────┐ │ │ │ │ │ Gemini 2.5 │ │ ────────│ │ Intel TDX加密内存 │ │ │ │ │ │ Flash Lite │ │ │ │ ┌────────────────────┐ │ │ │ │ │ │ 模型权重 │ │ │ │ │ NVIDIA H100 GPU │ │ │ │ │ │ │ JAX推理代码 │ │ │ │ │ 机密GPU飞地 │ │ │ │ │ │ └─────────────┘ │ │ │ └────────────────────┘ │ │ │ │ │ │ │ │ PySyft Datasite运行时 │ │ │ │ └──────────────────┘ │ └──────────────────────────┘ │ │ │ │ ▲ │ │ │ ┌──────────────────┐ │ │加密通道 │ │ │ │ 评测方(MLCommons)│ │ ┌──────────────────────────┐ │ │ │ │ │ │ │ AILuminate保留基准 │ │ │ │ │ ┌─────────────┐ │ 加密通道 │ │ CBRNE/网络攻击/仇恨言论 │ │ │ │ │ │ 私有测试题 │ │ ────────│ │ AI安全评测脚本 │ │ │ │ │ │ 评测脚本 │ │ │ └──────────────────────────┘ │ │ │ │ │ 评分标准 │ │ └──────────────────────────────────┘ │ │ │ └─────────────┘ │ │ │ │ └──────────────────┘ ▼ │ │ ┌──────────────────┐ │ │ │ 可验证聚合结果 │ │ │ │ (双方均不可见 │ │ │ │ 对方资产) │ │ │ └──────────────────┘ │ │ │ │ ✅ 评测方看不到模型权重 ✅ 模型方看不到测试题 │ │ ✅ 双方独立验证远程证明 ✅ 结果可密码学验证 │ │ ✅ 计算完成后飞地立即销毁 ✅ 无中间数据泄露风险 │ └─────────────────────────────────────────────────────────────────────────────┘2.2 机密计算TEE原理双盲评测的基础是硬件级可信执行环境(TEE),其核心信任根建立在芯片制造商的硬件安全机制之上。┌─────────────────────────────────────────────────────────────────────────────┐ │ 机密计算TEE(可信执行环境)原理 │ │ │ │ ┌──────────────────────────────────────────────────────────────────┐ │ │ │ 云服务器物理硬件 │ │ │ │ │ │ │ │ ┌──────────────────────────────────────────────────────────┐ │ │ │ │ │ 主机操作系统(Hypervisor) │ │ │ │ │ │ ❌ 无法访问TEE内部内存 ❌ 无法篡改TEE内部代码 │ │ │ │ │ └──────────────────────────────────────────────────────────┘ │ │ │ │ │ │ │ │ │ ┌──────────────────────────────────────────────────────────┐ │ │ │ │ │ │ TEE安全飞地(Enclave) │ │ │ │ │ │ │ │ │ │ │ │ │ │ ┌─────────────────────────────────────────────┐ │ │ │ │ │ │ │ │ 硬件级内存加密(Memory Encryption) │ │ │ │ │ │ │ │ │ - 所有RAM中的数据自动加密 │ │ │ │ │ │ │ │ │ - 密钥仅存在于芯片内部,OS无法读取 │ │ │ │ │ │ │ │ │ - 即使物理拔插内存条也无法获取明文 │ │ │ │ │ │ │ │ └─────────────────────────────────────────────┘ │ │ │ │ │ │ │ │ │ │ │ │ │ │ ┌─────────────────────────────────────────────┐ │ │ │ │ │ │ │ │ 远程证明(Remote Attestation) │ │ │ │ │ │ │ │ │ - 芯片内置唯一密钥,生产时烧录 │ │ │ │ │ │ │ │ │ - 对运行中所有软件栈进行哈希签名 │ │ │ │ │ │ │ │ │ - 外部方可通过签名验证飞地可信性 │ │ │ │ │ │ │ │ └─────────────────────────────────────────────┘ │ │ │ │ │ │ │ │ │ │ │ │ │ │ ┌─────────────────────────────────────────────┐ │ │ │ │ │ │ │ │ 可信计算基(TCB) │ │ │ │ │ │ │ │ │ - 固件 / 客户内核 / 初始化系统 │ │ │ │ │ │ │ │ │ - 容器运行时 / 应用镜像 │ │ │ │ │ │ │ │ │ - 可复现构建:每层均可从源码重建验证 │ │ │ │ │ │ │ │ │ - SSH/键盘/鼠标/屏幕全部禁用 │ │ │ │ │ │ │ │ └─────────────────────────────────────────────┘ │ │ │ │ │ │ └─────────────────────────────────────────────────────┘ │ │ │ │ │ │ │ │ 硬件信任根:Intel TDX / AMD SEV-SNP / NVIDIA H100机密GPU │ │ │ │ - CPU微码和固件为闭源,信任CPU厂商 │ │ │ │ - 厂商公钥证书链确保芯片签名真实可信 │ │ │ │ - 如云厂商和硬件厂商共谋可攻破,但双方共谋概率极低 │ │ │ └──────────────────────────────────────────────────────────────────┘ │ └─────────────────────────────────────────────────────────────────────────────┘2.3 双盲评测的七步流程根据DeepMind技术报告,双盲评测的完整流程分为七个关键步骤:┌─────────────────────────────────────────────────────────────────────────────┐ │ 双盲评测完整流程时序图 │ │ │ │ 模型方(DeepMind) 机密飞地(Enclave) 评测方(MLCommons)│ │ │ │ │ │ │ │ (1) 发布模拟接口 │ │ │ │ │ ─────────────────────────│ │ │ │ │ │ │ │ │ │ │ (2) 使用模拟接口开发测试脚本 │ │ │ │ │ ────────────────────────── │ │ │ │ │ │ │ │ │ (3) 双方独立验证远程证明 │ │ │ │ │ ─────────────────────────│ ────────────────────────── │ │ │ │ 验证硬件签名TCB哈希 │ 验证硬件签名TCB哈希 │ │ │ │ │ │ │ │ │ (4) 加密上传模型权重 │ │ │ │ │ ─────────────────────────│ │ │ │ │ │ (4) 加密上传测试题和脚本 │ │ │ │ │ ────────────────────────── │ │ │ │ │ │ │ │ │ (5) 双方审批对方代码 │ │ │ │ │ ─────────────────────────│ ────────────────────────── │ │ │ │ 审核代码仅调用白名单方法 │ 审核代码仅调用白名单方法 │ │ │ │ │ │ │ │ │ │ (6) 飞地执行评测 │ │ │ │ │ ├─ 加载模型权重到GPU │ │ │ │ │ ├─ 运行推理 │ │ │ │ │ ├─ 计算聚合指标 │ │ │ │ │ └─ 加密输出结果 │ │ │ │ │ │ │ │ │ (7) 接收加密聚合结果 │ (7) 接收加密聚合结果 │ │ │ │ ─────────────────────────│ ──────────────────────────│ │ │ │ 仅可见约定的指标 │ 仅可见约定的指标 │ │ │ │ │ │ │ │ │ │ 飞地销毁,所有数据清零 │ │ │ │ │ │ │ └─────────────────────────────────────────────────────────────────────────────┘2.4 关键技术组件本次试点使用的技术栈非常丰富:组件用途技术细节Google Cloud Confidential Space机密计算平台提供硬件级隔离的虚拟机环境Intel TDXCPU内存加密Trust Domain Extensions,主机内存加密
返回列表