Google DeepMind 正在為 Gemini Flash Lite 測試一項經密碼學保護的雙盲基準測試,目標是減少污染並重建對 AI 評估的信任。

當模型開發者可能看過評估提示,或測試資料可能進入訓練管線時,AI 基準測試分數越來越難以解讀。Google DeepMind 目前正在測試一項經密碼學保護的雙盲評估,旨在阻止該流程的雙方存取對方的敏感資訊。
這項試點由 Singapore AI Safety Institute 及其他合作夥伴共同進行,使用 Gemini Flash Lite 系列的模型對照機密基準測試。Google 表示,這種做法旨在防止基準污染,同時讓獨立評估者在不取得權重的情況下測試專有模型。
這個專案之所以重要,是因為基準測試結果會影響模型選擇、研究主張、採購決策與安全監督。不過,目前可用的證據只涵蓋評估方法,並非新的模型效能結果。沒有已報告的分數,也沒有關於系統是否提升測得準確率的獨立評估。
根據 The Decoder 的報導,Google DeepMind 正使用 Google Cloud 的 Confidential Space 為這項試點建立受保護的環境。這項安排旨在讓外部測試提示對 Google 保持隱藏,同時也防止評估者檢視 Gemini 模型權重。
核心概念是雙盲交換。評估機構提供問題或任務,但不讓模型供應商看到。供應商在不轉移底層權重的情況下提供模型供測試。接著,密碼學控制會驗證約定的組件是否在預定的環境中運作。
Google 將此描述為首個針對專有前沿 AI 模型的雙盲評估;然而,這項說法是 The Decoder 轉述的公司主張,並非獨立建立的業界事實。試點模型是 Gemini Flash Lite,但目前可取得的來源並未說明是哪個版本、基準任務、測試規模或最終結果。
技術基礎是 Confidential Space,屬於 Google 的機密運算產品組合。原則上,機密運算可以使用硬體支援的保護與驗證,限制操作人員在受保護工作負載中能看到的內容。在這個案例中,目標是讓模型與評估資料之間建立可驗證的分隔。
當基準測試的問題對被測系統來說是新的時候,基準才最有用。如果提示或答案出現在訓練資料中,或模型是專門為測試調整過的,那麼高分可能反映的是先前接觸,而不是廣泛的推理或任務能力。
這個問題通常稱為基準污染。它可能透過公開資料集、網路規模訓練或重複的內部測試而意外發生。當一項基準被廣泛討論,而模型開發者有時間針對它進行最佳化時,它也可能成為戰略性的顧慮。
評估流程本身也會帶來另一項風險。外部組織可能會猶豫是否將敏感提示提供給模型公司,因為這樣做可能會暴露專有資料、政府資訊或資安測試素材。另一方面,模型開發者通常也不希望交出代表珍貴智慧財產的權重。
The Decoder 描述了像零記錄協議與合約限制這類傳統保障措施,但 Google 認為密碼學保護增加了更強的技術層。提議中的系統並未消除對軟體、硬體與操作程序的信任需求;它的目標是減少任何單一參與者必須承擔的信任量。
目前可用報導中最強的主張來自 Google DeepMind 對該試點的描述。Google 表示,其方法可以讓測試問題不被供應商看到、模型權重不被評估者看到,同時協助防止模型利用機密問題去針對特定測試進行最佳化。
這些是設計目標,而非本報導可取得材料中經獨立驗證的結果。The Decoder 報導指出,Google 已在一份技術報告中公布方法細節與結果,但所提供的證據並未包含該報告的發現,也沒有對實作進行外部稽核。
Gemini Flash Lite 的使用也限制了可推論的範圍。它可能證明該評估設置能與專有模型一起運作,但並不能證明每一種前沿模型、每一類基準或每一種部署環境都能以合理成本與速度採用相同流程。
仍有幾個實務問題尚未解答。來源沒有說明評估執行需要多久、Confidential Space 會帶來多少運算額外負擔、如何處理失敗情況,或評估者如何確認被測模型就是預定的那個模型。它們也沒有解釋這種方法如何處理受保護執行前後的資料外洩問題。
對 AI 研究者而言,成功的雙盲工作流程可使獨立評估更容易進行,而不必在敏感測試資料與專有權重之間做選擇。這對資安評估、政府測試及其他涉及受限制資訊的評估尤其重要。
對模型供應商而言,這種方法可在限制系統曝露的同時,提供取得可信外部結果的途徑。它也可能減少關於供應商是否在評估前看過測試提示的爭議。不過,密碼學控制本身並不能保證基準測試能衡量有用能力、避免不良任務設計,或預測實際部署中的表現。
如果評估機構開始發布來自受保護測試、且在不同供應商之間更具可比較性的結果,企業買家可能會受益。採購團隊可能會比起模型開發者以未揭露程序產生的分數,更重視由第三方獨立執行的評估。
商業上的問題在於,這種方法是否能在試點之外變得可行。安全執行、驗證、可重現性與稽核存取都可能增加營運複雜度。較小的研究團隊可能沒有足夠的基礎設施或資金來執行同樣的流程,這可能使高信任度評估集中在大型雲端與模型供應商手中。
下一個重要訊號是技術報告的細節程度。開發者與評估者應留意對密碼架構、驗證流程、記錄政策、模型身份檢查與失敗模式的描述。
獨立重現將比公告本身更重要。來自 Singapore AI Safety Institute 或其他參與機構的證據,可能有助於釐清該流程在實務上是否能阻止供應商存取提示,以及評估者是否能確認模型權重仍受到保護。
來自更多模型系列與更敏感基準測試的結果,也將顯示這種方法究竟是通用評估標準,還是範圍較窄的示範。成本、延遲與存取需求將決定它能否常態使用,而不只是高關注度測試。
Google DeepMind 的試點處理了 AI 基準測試中的一個真實弱點:參與者通常必須彼此信任,不會檢視、保留或針對敏感評估材料進行最佳化。把部分信任轉移到可驗證的技術控制上,是一個有價值的方向,尤其適用於安全與政府評估。
但這項公告應被視為評估基礎設施的實驗,而非證明基準分數如今已可靠。這種方法的價值將取決於獨立稽核、透明協定,以及證明受保護測試能改變研究者、企業與監管者所做決策的品質。