Featured image of post 深度解析:DeepMind 推出全球首个双盲 AI 评估框架,用密码学保障测评公正性

深度解析:DeepMind 推出全球首个双盲 AI 评估框架,用密码学保障测评公正性

DeepMind 联手新加坡 AI 安全研究院等机构,推出基于 Confidential Space 的双盲评估方案。

一、事件核心:全球首个双盲 AI 评估框架落地

一、事件核心:全球首个双盲 AI 评估框架落地
一、事件核心:全球首个双盲 AI 评估框架落地|新闻截图

2026 年 8 月 27 日,Google DeepMind 正式推出全球首个针对 proprietary(专有)前沿 AI 模型的双盲评估框架,旨在解决 Benchmark 污染(benchmark contamination)这一行业顽疾。该方案通过密码学手段,确保模型与测评题库互相不可见,从根本上提升评估可信度。

核心要点如下:

  • 发布时间:2026 年 8 月 27 日
  • 评估对象:Gemini Flash Lite 模型
  • 技术底座:Google Cloud 的 Confidential Computing(可信计算)组件之一——Confidential Space
  • 测评性质:双盲(double-blind)——模型提供方与测评方均无法获知对方核心数据
  • 开放状态:非开源;测评环境为封闭的加密沙箱
  • 合作机构:新加坡 AI 安全研究院(Singapore AISI)、OpenMined、AVERI、MLCommons

双盲评估的核心逻辑:传统外部测评存在根本矛盾——要么将题库交给模型方(风险是模型提前训练),要么将模型权重交出(风险是泄露商业机密)。双盲框架通过密码学证明模型运行在可信环境中,使题库与模型实现物理隔离。

二、技术路径与多方协同机制

本次评估基于加密沙箱技术。Confidential Space 提供"加密执行环境"(Encrypted Execution Environment),运行其中的模型程序对 Google 完全不可见;同时,测评题库也通过加密方式存储,评估结束后即销毁。独立评估方无法查看 Gemini Flash Lite 的权重,Google 也无法获取其测评题库。

这一流程包含三重保障机制:

  1. 密码学可验证性(cryptographically verifiable):运行期间所有指令与输出均可被外部验证,但内部权重与题库不暴露
  2. 零日志协议(zero-logging):环境运行不记录模型输入与中间计算过程
  3. 责任分离架构:题库所有方、模型提供方、评估方三方权限严格隔离

值得特别指出的是,DeepMind 明确指出:该框架首次实现对专有前沿模型的双盲评估——此前主流测评(如 MMLU、TruthfulQA)均基于公开模型或有限授权访问,密钥管理与执行过程缺乏可验证保障。业内通常认为专有模型难以公网测评;而此次用技术手段打破这一认知,构成事件最大的反差点。

合作方背景亦体现其权威性:新加坡 AISI 为国家级 AI 安全监管机构;OpenMined 为隐私计算开源基金会;AVERI 专注评估标准研究;MLCommons 则主导 MMLU、HELM 等主流基准。四家机构组成评估联合体,确保方法论与执行分离。

三、双盲评估为何关键?

Benchmark 污染已被证实是模型测评领域的系统性风险。当模型在训练数据或公开测试集中预见到测评题时,其得分会显著虚高。 DeepMind 强调:政策制定者、研究人员与企业客户亟需可靠数据,以判断 AI 真实能力与安全边界;若测评失真,将误导技术部署决策。

该框架尤其适用于以下高敏感场景:

  • 网络安全类测评(题库若泄露将暴露防御盲点)
  • 政府采购或合规认证(需保留模型与题库双重主权)
  • 多模型横向对比(避免因污染导致排名失真)

值得一提的是,传统双盲设计多见于医学临床试验,用于 AI 模型尚属首次。DeepMind 引用教育考试类比——如同高考前严禁学生接触原卷——评估必须保障"未知性"才能反映真实水平。

四、落地建议与行动参考

  • 适合立即尝试者:需对第三方测评高度敏感的企业(如金融风控、医疗诊断系统供应商);参与 AI 安全审计的第三方机构;对测评公正性存疑的研究团队
  • 建议再观望者:希望基于通用 benchmarks 选型的中小模型开发者(当前仍可依赖公开模型+公开题库组合);不涉及高敏感场景的教育/科普用途

写在最后

双盲评估并非要取代现有测评体系,而是为高信任要求场景补充一层技术保障。当 AI 模型日益成为基础设施,测评公正性本身也需通过密码学等工程手段加固——这是 AI 治理从"制度约束"走向"代码可验"的关键一步。