桃子桃子快讯
返回首页
行业动态

DeepMind 推出全球首次双重盲测 AI 模型评估

Google DeepMind 联合多家机构,在密码学安全环境中对 Gemini Flash Lite 模型进行双重盲测…

2026.08.27 · 周四2 分钟阅读

Google DeepMind 宣布完成全球首次面向前沿闭源大模型的双重盲测(double-blind evaluation),在密码学构建的「黑箱」环境中运行外部评估,使模型无法在测试前接触考题,以此提升基准测试的可信度。此次试点由 Google DeepMind 与新加坡 AI 安全研究所(Singapore AISI)、OpenMined、AVERI 和 MLCommons 共同完成,被测模型为 Gemini Flash Lite。

为什么需要双重盲测

随着大模型能力不断增强,评测环节面临一个长期困扰:基准污染(benchmark contamination)——即模型在训练阶段已经「见过」测试题或提示词,从而导致跑分虚高。这与学生提前偷看试卷后拿满分的逻辑类似:分数虽高,却无法反映真实水平。

DeepMind 指出,政策制定者、研究者和企业都依赖基准来判断模型的能力与安全性,一旦模型能提前窥探评测内容,得分就会被人为抬高,损害对评测体系的信任。虽然零日志协议和严格的合同条款此前已在一定程度上保护了外部测试提示词的机密性,但引入技术与密码学层面的防护仍被视为重大进步。

多层次评测体系的补充

Google 内部在大模型开发与部署全周期使用广泛的评测手段,但并不完全依赖内部测试。为发现盲区,DeepMind 与多元化的外部伙伴合作,包括专业研究实验室、公民社会团体以及各国 AI 安全与保障研究所(AISI),借助其专长对模型进行压力测试。此次试点正是这一外部评估框架的升级——在保留多样评测视角的同时,用密码学隔离进一步封堵污染风险。

局限与展望

原文在「双重盲测如何运作」一节提供了技术框架入口,但未披露具体的技术实现细节、所用基准名称、评估指标或量化结果,例如测试集规模、任务类型、被测 Gemini Flash Lite 的具体版本号,以及与传统评测方式的分数对比等关键数据均暂未公开。因此该方法对业界实际评测流程的渗透程度,以及对排行榜(benchmark leaderboard)文化的具体影响,仍有待后续披露与独立验证。

信源