谷歌DeepMind正在尝试用密码学方法阻止AI模型提前看到测试题,以解决AI基准测试中的信任问题。该公司宣布,首次对专有前沿AI模型进行双盲评估,试点项目与新加坡AI安全研究所等合作,测试对象为Gemini Flash Lite系列模型。外部测试题被锁在加密“盒子”中,模型无法在训练或优化时利用这些题目,从而防止基准污染。
基准污染是AI评估中的核心难题:如果模型在训练时已经见过测试题,那么即使取得满分,结果也毫无意义。谷歌DeepMind用一张图片形象地说明了这一问题。为了应对,该公司采用谷歌云机密计算产品Confidential Space,通过密码学验证确保外部测试数据和模型各自保持私有——评估者看不到Gemini的权重,谷歌也看不到测试提示。
此前,外部评估通常依赖零日志协议和合同保障来保护测试提示的机密性。谷歌DeepMind表示,增加技术和密码学保护是安全模型评估的一大进步。这种方法旨在消除传统评估中的两难选择:要么评估者交出测试提示,让模型提供商提前看到问题;要么提供商交出模型权重,冒着知识产权泄露的风险。
一个近期例子是Anthropic的Fable 5模型在ARC-AGI基准上的评估被推迟,因为该公司对其最强模型执行30天数据保留政策。双盲评估有望消除这种权衡。
谷歌DeepMind强调,这种方法对高度敏感的评估最为重要,例如网络安全测试或政府机构的测试。独立组织可以在不放弃数据主权或安全性的前提下,严格测试先进模型。谷歌希望这一努力能为模型监管树立新标准,帮助行业构建更可靠、更受信任的AI系统。
该公司在技术报告中详细介绍了方法论和结果。这一举措反映了AI行业对基准可信度的日益关注,也为第三方评估提供了更安全的技术路径。