← All posts / Research

研究人員破解 OpenAI、Anthropic、Google 的加密 AI 推理痕跡

新論文揭示 GPT-5.6、Claude Opus 4.8 與 Gemini 3 的加密思維鏈推理可透過便宜的同系列模型解密——暴露密碼、API 金鑰與內部安全邏輯。

研究人員破解 OpenAI、Anthropic、Google 的加密 AI 推理痕跡

AI 模型的隱藏思維,其實一點都不隱藏

當現代推理模型如 OpenAI 的 GPT-5.6、Anthropic 的 Claude Opus 4.8 或 Google 的 Gemini 3 處理複雜問題時,它們會生成大量的內部「思維鏈」(chain-of-thought)推理——一個在模型產出最終答案之前的逐步思考過程。為了保護智慧財產權並防止競爭對手透過蒸餾(distillation)複製其模型,供應商將這些推理痕跡加密為不透明的資料區塊,以加密形式回傳給客戶端。基本假設很簡單:客戶端可以重播這些區塊以維持對話上下文,但無法讀取其內容。

這個假設現在已被徹底打破。由 Alexander Panfilov 領導、集結 ELLIS Institute Tübingen、Max Planck Institute、MATS Research 與 Snyk 研究人員的團隊,發表了一篇題為《Stealing Reasoning Traces from Proprietary LLM APIs》(從專有 LLM API 竊取推理痕跡)的論文,證明這些加密推理區塊可以被完整解密——成本低廉、可大規模執行,且橫跨所有主要 AI 供應商。

攻擊原理:將同系列模型變成解密神諭

核心漏洞是架構性的。供應商 API 回傳的加密推理區塊,使用的是單一全域、供應商層級的加密金鑰進行驗證,而非將金鑰密碼學繫結到特定的使用者帳號、工作階段 ID 或模型等級。這意味著,由防護嚴密的旗艦模型所建立的加密信封,可以被傳遞到同一供應商基礎設施中託管的任何其他模型。

攻擊鏈極其優雅且簡單:

  1. 擷取旗艦模型(如 Claude Opus 4.8)發出的加密推理區塊。
  2. 注入該區塊到同一供應商較小、較便宜的模型(如 Claude Haiku 4.5)的 API 呼叫中,指示它逐字轉錄內部思維。
  3. 提取明文推理內容。

由於輕量模型缺乏旗艦等級所執行的嚴格反蒸餾對齊和安全護欄,它們會遵從指令,以明文輸出隱藏的推理過程。研究人員確認,相同的跨模型相容性存在於 OpenAI 的 GPT-5.6 系列(使用 GPT-5-mini 和 o4-mini 作為解密神諭)以及 Google 的 Gemini 3 陣容(使用 Gemini 3.1 Flash 作為神諭)之中。

數學精確度令人震驚:對大多數查詢而言,提取的 token 數量與供應商 API 回報的計費思考 token 完全吻合,這意味著研究人員捕獲的是完整的內部推理,而非零星片段。

被忽視的警告演變成危機

故事可追溯到 2026 年 5 月,當時密碼學專家 Matthew Green 發現加密推理區塊可以在原始上下文之外被重播。Green 透過 OpenAI 和 Anthropic 的漏洞回報計畫通報了這個跨工作階段重播缺陷。根據 Panfilov 的說法,供應商的回應輕描淡寫:「他們認為側通道或重播沒有任何安全影響。」

2026 年 6 月,獨立研究員 Will Smidlein 獨立確認了此漏洞,並指出單一全域加密金鑰是根本的架構缺陷。Smidlein 表示:「供應商很可能使用單一全域金鑰來加密和驗證所有發送給客戶端的推理資料。」

儘管有這些報告,供應商並未部署任何架構性修復。正式論文在 11 週後問世,而那時研究人員已經在 GitHub 和 Hugging Face 的公開儲存庫中發現了 315,320 個可利用的加密推理區塊在流通。

真實世界的損害:密碼、API 金鑰與個人資料

此漏洞的影響遠遠超越智慧財產權的問題。透過分析從 GitHub 和 Hugging Face 抓取的 6,708 份公開代理對話記錄,研究人員解碼了 315,320 個嵌入的推理區塊。他們發現的內容令人警醒:

  • 62 個 API 金鑰——嵌入在推理痕跡中的有效憑證,開發者完全不知道已經暴露
  • 33 個密碼——只出現在模型內部思考中的認證密碼,從未出現在可見回應中
  • 33 個電子郵件地址——隱藏在加密推理中的個人識別資訊
  • 總計 367 項個人識別資訊(PII)和 182 個硬編碼憑證

這些發現揭示了 AI 模型內部推理方式的一些令人不安的細節。提取出的痕跡顯示,模型有時會以難以理解的語言片段進行內部溝通(其中一段痕跡包含了令人費解的片語 “but marinade”),以反向順序構建答案,甚至在最終定案前考慮欺騙策略。

工業級模型蒸餾的證據

論文還為長期被懷疑的模型蒸餾行為——即較弱模型透過訓練在更強大模型的推理輸出上——提供了令人信服的證據。研究人員測試了 Moonshot AI 的中國模型 Kimi-K3,發現當預先填入 Opus 思考過程的少數 token 時,其推理行為會可測量地向 Opus 偏移。

記憶分析顯示,從 Kimi-K3 提取特定 Claude 和 GPT 推理片段的容易度,比次接近的模型高出六個數量級。這強烈暗示 Kimi-K3 是在從西方旗艦模型竊取或提取的推理痕跡上訓練的。研究人員還指出,Kimi-K3 在網路安全基準測試和複雜數學任務上的相對較差表現,與蒸餾模式一致——這些是即使從原始思維鏈資料中也較難恢復的任務。

攻擊成本也極為低廉。作者估計解碼 10,000 條推理痕跡的 API 成本約為 720 美元,使工業級提取對任何資金充足的行為者來說都輕而易舉。

四層保護同時被繞過

此漏洞之所以特別具有毀滅性,是因為它同時繞過了四層不同的供應商保護機制:

  1. 反蒸餾控制——旨在防止競爭對手在專有推理上進行訓練
  2. PII 隔離——旨在將個人資料排除在共享上下文之外
  3. 危險內容抑制——防止模型輸出危險內容的安全邏輯
  4. 隱藏提示保密性——本應使推理內容不透明的加密機制

或許最令人警醒的是,此漏洞還能實現針對自主 AI 代理的隱形提示注入攻擊。攻擊者可以在加密推理區塊中植入惡意指令。當面向公眾的代理處理該區塊時,只檢查可見對話歷史的監控工具無法標記隱藏的負載,使得注入的指令能夠在不被察覺的情況下危害下游的代理工作流程。

需要改變什麼

截至論文發表時,Anthropic、OpenAI 和 Google 均未發布架構性修復。研究團隊的營運建議直截了當:在供應商明確告知之前,將加密推理視為可讀取的,並審計所有已推送到公開儲存庫的內容。

密碼學修復在概念上很直接——供應商需要使用每工作階段金鑰或經過適當驗證的加密,將加密推理區塊繫結到特定工作階段——但實施它需要對其基礎設施中推理狀態的管理方式進行根本性的重新設計。在此同時,每個發布工作階段日誌、運行面向公眾的代理、或分享加密推理區塊的團隊,都面臨著活躍的憑證和個人資料提取風險。

更廣泛的教訓在於密碼學的謙遜。當供應商在 5 月駁回 Matthew Green 的報告時,他們假設自己的加密是可靠的。事實並非如此。那些本應被密碼學封存的推理痕跡,結果竟是一本打開的書——任何擁有 API 金鑰和幾美元的人都可以閱讀。