谷歌DeepMind正在嘗試用密碼學方法阻止AI模型提前看到測試題,以解決AI基準測試中的信任問題。該公司宣佈,首次對專有前沿AI模型進行雙盲評估,試點專案與新加坡AI安全研究所等合作,測試物件為Gemini Flash Lite系列模型。外部測試題被鎖在加密“盒子”中,模型無法在訓練或最佳化時利用這些題目,從而防止基準汙染。

基準汙染是AI評估中的核心難題:如果模型在訓練時已經見過測試題,那麼即使取得滿分,結果也毫無意義。谷歌DeepMind用一張圖片形象地說明了這一問題。為了應對,該公司採用谷歌雲機密計算產品Confidential Space,通過密碼學驗證確保外部測試資料和模型各自保持私有——評估者看不到Gemini的權重,谷歌也看不到測試提示。

此前,外部評估通常依賴零日誌協議和合同保障來保護測試提示的機密性。谷歌DeepMind表示,增加技術和密碼學保護是安全模型評估的一大進步。這種方法旨在消除傳統評估中的兩難選擇:要麼評估者交出測試提示,讓模型提供商提前看到問題;要麼提供商交出模型權重,冒著智慧財產權洩露的風險。

一個近期例子是Anthropic的Fable 5模型在ARC-AGI基準上的評估被推遲,因為該公司對其最強模型執行30天資料保留政策。雙盲評估有望消除這種權衡。

谷歌DeepMind強調,這種方法對高度敏感的評估最為重要,例如網路安全測試或政府機構的測試。獨立組織可以在不放棄資料主權或安全性的前提下,嚴格測試先進模型。谷歌希望這一努力能為模型監管樹立新標準,幫助行業構建更可靠、更受信任的AI系統。

該公司在技術報告中詳細介紹了方法論和結果。這一舉措反映了AI行業對基準可信度的日益關注,也為第三方評估提供了更安全的技術路徑。