跳转到内容

双盲 AI 评测:模型和题目都不必交给对方

高级

来源:Google DeepMind · 发布于 2026-08-27最近复核于 2026-08-30

AI 评测的“双盲”不是把模型名称遮住,而是同时保护两类秘密:模型提供方不拿到未公开题目,评测方也不拿到模型权重。可信结果来自可验证的执行协议,包括隔离环境、远程证明、输入输出承诺和运行回执,而不是双方口头承诺“没有偷看”。

前沿模型常因权重、系统提示或部署栈敏感,不能直接交给外部评测者;高价值评测集又怕泄漏后被专项训练。让一方把资产交给另一方,会造成知识产权、题库污染和结果选择性披露风险。完全不共享则无法运行,评测只能退回模型方自报。

Google DeepMind 的试点把模型与评测代码带入受保护的 Confidential Space 和 GPU enclave。执行前,双方检查环境身份和将要运行的软件;题目、模型及配置以加密形式进入隔离区。哈希用于承诺“本次究竟用了哪份输入”,receipt 用于证明约定流程确实产生了某个结果。隔离区负责计算,但协议仍要回答谁能解密输出、日志包含什么、失败后能否重跑,以及运行者能否通过网络或时序旁路带走秘密。

双盲因此是端到端属性。只把 GPU 包进 enclave,却让明文题目出现在外部日志,或允许模型方替换镜像,仍然不成立。

本站不需要先搭机密 GPU。可以从“承诺—执行—核验”三件事练习:冻结题目包、模型适配器和评分器,各自计算摘要;运行器只接收声明过的版本;结束后输出包含摘要、时间、退出状态和结果摘要的 receipt。秘密内容不进入 receipt,只记录可核对的身份。

把威胁模型写在配置旁边:要防题目提前泄漏、模型被复制,还是防结果被删选?不同目标需要不同密钥持有者和披露策略,不能用“上了 enclave”一笔带过。

输入: 两个互相不可读的加密文本包、一个本地隔离运行脚本和约定的评分器。

步骤:

  1. 双方分别发布密文与明文摘要承诺,不交换明文。
  2. 在临时隔离环境中解密、运行并立即清理,禁止外网和调试日志。
  3. 生成只含输入摘要、镜像身份、退出码和分数的签名 receipt。
  4. 故意替换一个包,确认核验失败。

成功证据: 任一输入被替换都会导致摘要不符;外部日志不含秘密;双方能仅凭承诺和 receipt 确认运行身份与结果绑定。

停止线: 密钥与运行者由同一无审计主体控制、环境身份无法证明、输出可泄露原始题目,或把本地模拟称为机密 GPU 复现时停止。

  • 哈希可以保密:哈希用于完整性承诺,低熵内容仍可能被猜中。
  • enclave 自动解决全部信任:密钥、镜像、日志和输出策略都属于信任边界。
  • “世界首个”已经独立证实:这是 Google DeepMind 的厂商表述,不是本站核验结论。

原文介绍的是试点协议及其受控环境。本站没有访问对应 Confidential Space、GPU enclave 或私有资产,也未复现其安全保证。

本文是原创中文实践解读,不是逐句翻译。阅读英文原文。