Google DeepMind 完成全球首例「雙盲」AI 評測:誰都無法偷看
DeepMind 攜手 AVERI、OpenMined 與 MLCommons,在密碼學隔離環境中評測 Gemini 2.5 Flash-Lite——評測方看不到模型權重、Google 看不到測試題目,基準污染在技術上成為不可能。
想像一個學生即將參加一場高風險考試。如果他不小心提前瞥見了考題,滿分就不再代表任何意義。這正是 AI 產業每次將前沿模型送去外部評測時所面臨的困境——而 2026 年 8 月 27 日,Google DeepMind 宣布已經解決了這個問題。DeepMind 攜手 AI 驗證與評測研究機構(AVERI)、OpenMined、MLCommons 以及新加坡 AI 安全研究所,完成了它所稱的全球首例針對專有前沿級 AI 模型的「雙盲」評測:在這場審計中,評測方看不到模型,模型的所有者也看不到考題。
基準污染問題
這篇由 DeepMind 的 William Isaac、Sol Messing 與 Kristian Lum 撰寫的公告,直指 AI 評測中一個悄悄侵蝕信任的核心問題:基準污染(benchmark contamination)。如果模型在訓練過程中——無論刻意或無意——已經見過測試題目,它的分數就會以難以審計的方式被灌水。政策制定者、研究人員與企業都需要基準測試如實反映模型的真實能力與安全性;一旦模型可以提前「偷看」評測內容,這份信任便隨之瓦解。
長期以來,高風險的外部評測迫使各方做出不舒服的取捨:要麼評測方交出測試題目——冒著模型供應商吸收題目、針對未來測試優化的風險;要麼供應商交出模型權重——讓地球上最珍貴的智慧財產之一暴露於竊取與外洩的風險之中。零日誌政策與保密協議長期以來勉強填補這個缺口,但承諾終究不是證明。
雙盲機制如何運作
這項於 2026 年 7 月至 8 月進行的試點,用硬體消除了這種取捨。評測在安全飛地(secure enclave)中執行——這是一種可信執行環境(TEE),採用 Google Cloud 機密運算組合中的 Confidential Space 進行配置。硬體會在任一方的資產進入環境之前,以密碼學方式驗證即將執行的程式碼;雙方都會審查並核准這段程式碼,然後飛地才執行它,且只將約定的輸出交付給約定的接收者。
根據 AVERI 的試點報告,實際的安排是一場四方協作:
- Google DeepMind 提供了一個生產級模型——Gemini 2.5 Flash-Lite——其權重從未暴露給任何外部方。
- MLCommons 提供了一套從未使用過的提示詞,來自其 AILuminate 安全基準家族,涵蓋的危險領域包括化學、生物、放射、核子與爆炸物(CBRNE)風險、網路攻擊、仇恨言論、自殘與暴力犯罪誘導。這些提示詞是在嚴格保密與原創要求下產生的,連工作小組成員之間都沒有廣泛共享。
- AVERI 使用不與任何其他方共享的私鑰對提示詞加密,與 DeepMind 利用 OpenMined 構建並調整的軟體共同執行評測,然後解密輸出並依 AILuminate 標準評分。
- OpenMined 提供了飛地管理軟體,定義飛地被允許執行哪些運算——其作者稱之為結構化透明(structured transparency):介於「全部共享」與「完全保密」之間、由技術強制執行的中間地帶。
最終的結果是由晶片與密碼學、而非合約條文所保障的雙盲性。DeepMind 在技術上無法收集、儲存 MLCommons 的提示詞,也無法拿它們去訓練模型;AVERI、OpenMined 與 MLCommons 同樣無法檢視模型權重。AVERI 向 DeepMind 交付了一份機密報告,總結觀察到的成功模式與失敗模式,並附上量化基準結果——而提示詞與原始輸出始終保持私密。
從概念驗證到生產環境
這並不是安全飛地第一次被提出用於 AI 評測——而這段延續性至關重要。在 2024 年的一項試點中,OpenMined 曾與 Anthropic 及英國 AI 安全研究所合作,證明兩個組織可以在 NVIDIA H100 GPU 飛地中共同核准並執行一項評測。但那項早期實驗使用的是替代品:以 GPT-2 作為前沿模型的替身,以五列資料的評測作為機密生物安全基準的替身。運算在一分多鐘內端到端完成,證明了機制可行,但沒有人冒險投入真正的資產。
2026 年的試點跨過了那條線。一個專有的、生產級的 Gemini 模型,接受了真正機密、真正未使用過的基準評測,且雙方的隱私都獲得保障。這是首次有示範證明:領先 AI 公司的閉源模型可以在任何一方都不交出鎮店之寶的情況下接受獨立基準測試。
為什麼監管機構應該在意
時機並非偶然。第三方評測正迅速從「禮貌」變成法律要求。在歐盟 AI 法案的通用目的 AI 行為準則下,簽署方必須確保合格的獨立評測者能在充分的存取權、資訊與時間下執行模型評測。在美國,伊利諾州 SB 315 法案將自 2028 年起要求大型前沿開發商每年接受第三方審計——包括審計他們是否遵守自身的安全政策——其他州與聯邦提案可能更早強制要求更深入的存取。然而這些法律要求審計保護安全與隱私,卻幾乎沒有說明如何同時落實兩者。
AVERI 的報告把政策論點講得明白:政策制定者應該從這些結果中獲得鼓勵,「大膽要求提供深度、安全的存取權」,因為基於政策的需求訊號將加速飛地審計技術的發展。安全飛地還打開了一扇長期被認為卡死的門:國際查證。像查證國際 AI 協議遵行情形這類場景,恰恰需要這種在互不信任的各方之間、由密碼學強制執行的相互保密。
誠實的但書
兩個組織都謹慎界定了這項試點沒有證明的東西。其安全設計解決了開發商理論上篡改評測的許多(但並非全部)途徑——在風險更高、信任更低的場景中,還需要額外的保證。模型評測也不等於 AI 審計的全部:雙盲保證尚未延伸到 AI 系統的非模型組件,或公司的資料實務、內部文件與運算硬體。而「低科技」審計——人類閱讀文件、提出問題、行使判斷——將繼續扮演核心角色。如何將基於飛地的結果轉化為正式的審計標準,被明確留作未來的工作。
意義所在
對基準測試生態系而言,這項試點提供了一條出路,擺脫公開基準隨訓練資料吸收而衰退的軍備競賽。對審計機構與各國 AI 安全研究所而言,它提供了更深入存取、更少取捨的路徑。對 DeepMind 而言,這是一場聲譽賭注:賭「可驗證的評測」——而非漂亮分數——將成為前沿 AI 信任的通用貨幣。如果基於飛地的雙盲評測成為常規,「我們測過了,而且這是沒有人作弊的密碼學證明」就會成為可審計的主張,而非新聞稿。在超過 100 家公司連署公開信、警告抵禦 AI 威脅「時間窗口有限」的這一年,用於驗證模型安全主張的基礎設施,或許正是那扇窗口真正需要的東西。
Sources
- [1] https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
- [2] https://www.averi.org/ourwork/averi-pilot-report-the-worlds-first-double-blind-eval
- [3] https://www.techrepublic.com/article/news-google-deepmind-gemini-tests-apac-singapore/
- [4] https://explainx.ai/blog/google-deepmind-double-blind-ai-evaluation-benchmark-contamination-august-2026