Google DeepMind 測試雙盲 AI 基準測試,以解決評估信任問題

Google DeepMind 正在為 Gemini Flash Lite 測試一項經密碼學保護的雙盲基準測試,目標是減少污染並重建對 AI 評估的信任。

AI News

當模型開發者可能看過評估提示,或測試資料可能進入訓練管線時,AI 基準測試分數越來越難以解讀。Google DeepMind 目前正在測試一項經密碼學保護的雙盲評估,旨在阻止該流程的雙方存取對方的敏感資訊。

這項試點由 Singapore AI Safety Institute 及其他合作夥伴共同進行,使用 Gemini Flash Lite 系列的模型對照機密基準測試。Google 表示,這種做法旨在防止基準污染,同時讓獨立評估者在不取得權重的情況下測試專有模型。

這個專案之所以重要,是因為基準測試結果會影響模型選擇、研究主張、採購決策與安全監督。不過,目前可用的證據只涵蓋評估方法,並非新的模型效能結果。沒有已報告的分數,也沒有關於系統是否提升測得準確率的獨立評估。

Google 正在測試什麼

根據 The Decoder 的報導,Google DeepMind 正使用 Google Cloud 的 Confidential Space 為這項試點建立受保護的環境。這項安排旨在讓外部測試提示對 Google 保持隱藏,同時也防止評估者檢視 Gemini 模型權重。

核心概念是雙盲交換。評估機構提供問題或任務,但不讓模型供應商看到。供應商在不轉移底層權重的情況下提供模型供測試。接著,密碼學控制會驗證約定的組件是否在預定的環境中運作。

Google 將此描述為首個針對專有前沿 AI 模型的雙盲評估;然而,這項說法是 The Decoder 轉述的公司主張,並非獨立建立的業界事實。試點模型是 Gemini Flash Lite,但目前可取得的來源並未說明是哪個版本、基準任務、測試規模或最終結果。

技術基礎是 Confidential Space,屬於 Google 的機密運算產品組合。原則上,機密運算可以使用硬體支援的保護與驗證,限制操作人員在受保護工作負載中能看到的內容。在這個案例中,目標是讓模型與評估資料之間建立可驗證的分隔。

為什麼基準污染很重要

當基準測試的問題對被測系統來說是新的時候,基準才最有用。如果提示或答案出現在訓練資料中,或模型是專門為測試調整過的,那麼高分可能反映的是先前接觸,而不是廣泛的推理或任務能力。

這個問題通常稱為基準污染。它可能透過公開資料集、網路規模訓練或重複的內部測試而意外發生。當一項基準被廣泛討論,而模型開發者有時間針對它進行最佳化時,它也可能成為戰略性的顧慮。

評估流程本身也會帶來另一項風險。外部組織可能會猶豫是否將敏感提示提供給模型公司,因為這樣做可能會暴露專有資料、政府資訊或資安測試素材。另一方面,模型開發者通常也不希望交出代表珍貴智慧財產的權重。

The Decoder 描述了像零記錄協議與合約限制這類傳統保障措施,但 Google 認為密碼學保護增加了更強的技術層。提議中的系統並未消除對軟體、硬體與操作程序的信任需求;它的目標是減少任何單一參與者必須承擔的信任量。

證據、主張與剩餘限制

目前可用報導中最強的主張來自 Google DeepMind 對該試點的描述。Google 表示,其方法可以讓測試問題不被供應商看到、模型權重不被評估者看到,同時協助防止模型利用機密問題去針對特定測試進行最佳化。

這些是設計目標,而非本報導可取得材料中經獨立驗證的結果。The Decoder 報導指出,Google 已在一份技術報告中公布方法細節與結果,但所提供的證據並未包含該報告的發現,也沒有對實作進行外部稽核。

Gemini Flash Lite 的使用也限制了可推論的範圍。它可能證明該評估設置能與專有模型一起運作,但並不能證明每一種前沿模型、每一類基準或每一種部署環境都能以合理成本與速度採用相同流程。

仍有幾個實務問題尚未解答。來源沒有說明評估執行需要多久、Confidential Space 會帶來多少運算額外負擔、如何處理失敗情況,或評估者如何確認被測模型就是預定的那個模型。它們也沒有解釋這種方法如何處理受保護執行前後的資料外洩問題。

對 AI 開發者與企業的影響

對 AI 研究者而言,成功的雙盲工作流程可使獨立評估更容易進行,而不必在敏感測試資料與專有權重之間做選擇。這對資安評估、政府測試及其他涉及受限制資訊的評估尤其重要。

對模型供應商而言,這種方法可在限制系統曝露的同時,提供取得可信外部結果的途徑。它也可能減少關於供應商是否在評估前看過測試提示的爭議。不過,密碼學控制本身並不能保證基準測試能衡量有用能力、避免不良任務設計,或預測實際部署中的表現。

如果評估機構開始發布來自受保護測試、且在不同供應商之間更具可比較性的結果,企業買家可能會受益。採購團隊可能會比起模型開發者以未揭露程序產生的分數,更重視由第三方獨立執行的評估。

商業上的問題在於,這種方法是否能在試點之外變得可行。安全執行、驗證、可重現性與稽核存取都可能增加營運複雜度。較小的研究團隊可能沒有足夠的基礎設施或資金來執行同樣的流程,這可能使高信任度評估集中在大型雲端與模型供應商手中。

接下來要觀察什麼

下一個重要訊號是技術報告的細節程度。開發者與評估者應留意對密碼架構、驗證流程、記錄政策、模型身份檢查與失敗模式的描述。

獨立重現將比公告本身更重要。來自 Singapore AI Safety Institute 或其他參與機構的證據,可能有助於釐清該流程在實務上是否能阻止供應商存取提示,以及評估者是否能確認模型權重仍受到保護。

來自更多模型系列與更敏感基準測試的結果,也將顯示這種方法究竟是通用評估標準,還是範圍較窄的示範。成本、延遲與存取需求將決定它能否常態使用,而不只是高關注度測試。

Creati.ai 觀點

Google DeepMind 的試點處理了 AI 基準測試中的一個真實弱點:參與者通常必須彼此信任,不會檢視、保留或針對敏感評估材料進行最佳化。把部分信任轉移到可驗證的技術控制上,是一個有價值的方向,尤其適用於安全與政府評估。

但這項公告應被視為評估基礎設施的實驗,而非證明基準分數如今已可靠。這種方法的價值將取決於獨立稽核、透明協定,以及證明受保護測試能改變研究者、企業與監管者所做決策的品質。

廣告