← All posts / Meta

竊取推理軌跡:研究人員破解 Anthropic、OpenAI 與 Google 模型的加密思維鏈

一篇 116 頁的預印本論文證明,前沿 LLM API 回傳的加密推理區塊可跨連線、跨用戶、跨模型互通——藉由「解密越獄」手法,研究人員從公開儲存庫解出 315,320 條隱藏推理軌跡、367 個個人資料與 182 組憑證。

竊取推理軌跡:研究人員破解 Anthropic、OpenAI 與 Google 模型的加密思維鏈

每一家的推理模型 API——OpenAI、Anthropic、Google——都會隨回應附上一段不透明的 Base64 區塊。那是模型隱藏版的思維鏈(chain-of-thought),經過加密後交給客戶端,讓客戶端能在多輪對話間攜帶狀態,卻讀不到模型的內部推理。設計初衷很合理:供應商保護智慧財產權、避免未過濾的中間思考外流,同時支援無狀態 API、零資料保留(ZDR)模式與工具迴圈。

2026 年 8 月 10 日,一支研究團隊發表了一篇 116 頁的預印本論文,證明這個設計是坏的。這篇名為《Stealing Reasoning Traces from Proprietary LLM APIs》(arXiv:2608.09867)的論文,由 ELLIS 圖賓根研究所與馬克斯普朗克智慧系統研究所的 Alexander Panfilov、David Schmotz、Ilia Shumailov、Luca Beurer-Kellner、Joachim Schaeffer、Ameya Prabhu、Jonas Geiping 與 Maksym Andriushchenko 合著。核心發現不是程式臭蟲,而是架構層級的缺陷:加密推理區塊在同一供應商生態系內,可跨連線、跨用戶、跨模型完全互通。

「解密越獄」如何運作

攻擊手法相當迂迴而優雅:你完全不必去攻擊前沿模型的安全訓練。只要把強模型產生的加密推理區塊,注入到同一家供應商的較弱模型的對話中。供應商會在輸入時透明地解密該區塊——這是協議本來的運作方式——較弱模型於是把前沿模型的明文推理當成合法上下文,只要適當提示,它就會一字不差地把推理內容抄出來。

強模型的安全護欄從頭到尾沒有被觸發。真正「讀稿」的,是同家族中更小、更便宜、防護更弱的模型。按論文自己的說法:Haiku 4.5 可以讀到 Opus 4.8 的思緒。研究人員證實同樣手法在 Anthropic、OpenAI、Google 三家都行得通。

跨帳戶可攜性還暗示了一件令人不安的事:供應商幾乎可以確定是用單一把全域金鑰加密所有客戶的推理內容,而非按帳戶或連線派生金鑰。如果金鑰是以帳戶為範圍,A 帳戶的區塊在 B 帳戶下根本解不開。這一點對依賴零資料保留承諾的客戶影響最大——ZDR 意謂供應商不儲存你的對話,但在全域金鑰下,你的推理狀態並未與其他客戶做密碼學隔離。

四種攻擊向量

論文列舉了這個缺陷的四種後果:

  1. 繞過反蒸餈防護。 大規模萃取專有模型的原始推理軌跡——在三家供應商上皆已示範成功。隱藏思維鏈本是防止競爭對手收割前沿推理來訓練自家模型的主要防線之一;論文指出這道防線一直有個洞。

  2. 大規模私人資料萃取。 開發者經常把完整的 agent 連線日誌公開分享——放在 bug 報告、gist、部落格文章、commit 的除錯輸出裡——並把加密區塊當成不可讀的雜訊。但它們從來不是不可讀的。研究人員爬取公開儲存庫,解碼了 315,320 個推理區塊, recovered 367 個個人可識別資訊(PII)與 182 組憑證。更糟的是,推理區塊可能包含可見對話中沒有的內容:模型讀了 .env 檔、對找到的金鑰做了一番推理、最後寫出的答案隻字未提——那把金鑰已經進了它的思維鏈。

  3. 危險資訊揭露。 即使模型最終的可見輸出正確拒絕了惡意請求,隱藏推理中仍可能含unsafe內容。

  4. 隱形提示注入。 攻擊者可把惡意酬載完全藏在加密區塊內——人工審查與多數日誌掃描器都看不見,因為這種 blob 本來就該是無意義雜訊。酬載於是混在公開的 agent 執行紀錄中流通,看起來就像正常的 API 簽章資料。

「提報被駁回」本身就是個發現

這個缺陷早就被提報過——然後被打了回票。2026 年 5 月 29 日,約翰霍普金斯大學密碼學家 Matthew Green 發表了一篇週末研究成果,結論與本論文多有重合:區塊可在同一連線內、跨連線、甚至跨完全不同的帳戶重放;在 OpenAI 甚至可跨模型重放。Green 還證明這些區塊在語意上是「活」的——在其中一次實驗裡,某個連線中推理過的社會安全號碼,在區塊重放後於另一個帳戶的不同連線中未經提示地再度出現。

Green 透過兩家供應商的漏洞回報計畫提報了這些結果。據他的記述,OpenAI 表示無法重現;Anthropic 則認為側通道與重放沒有安全影響。十週後,這篇預印本以同一個底層缺陷為基礎,示範了規模化的憑證萃取、跨模型推理竊取與隱形提示注入。

Green 的結構分析如今看來仍具參考價值:Anthropic 的區塊有個標示為「signature」的欄位,實測裡根本沒有簽章;12 位元組的 IV 暗示使用 GCM 或 ChaCha,且長度可能過短;OpenAI 的格式疑似基於 Fernet token 標準。最關鍵的不對稱是:竄改任何密文位元組會收到乾淨的 API 拒絕,而原封不動重放區塊則完全不會報錯。

另外還有一條密碼學修不好的側通道:若能誘使模型進行「依秘密而異」的推理——隱藏位元為 0 時算得快、為 1 時算得慢——差異會反映在推理 token 數、區塊長度與回應時間上。Green 示範了逐位元抽取一個位元組。洩漏的不是模型寫了什麼,而是它「想了多少」。

供應商該修什麼——你今天該做什麼

論文提出的緩解方案直接對應失效模式,沒有一項是尖端技術:把區塊綁定到連線識別碼(擋跨連線重放)、按帳戶派生金鑰(擋跨帳戶重放並修正 ZDR 隔離)、把區塊綁定到產出模型(擋跨模型解密越獄)、輪換金鑰、強制 nonce 或序號單調性。把 token 綁定到產生它的連線與身分,本來就是標準做法;缺了它,才是缺口。

對建立在這些 API 之上的團隊,三個持久的結論:

  • 加密不等於隔離。「你讀不到」不等於「別人讀不到」。你讀不懂的 blob,可能被任何能把它重放進合作模型的人讀懂。
  • Agent 連線日誌從此是敏感性資產。 到你的儲存庫、gist、issue 裡搜尋貼上的 agent 對話——留意 thinking、reasoning、signature 欄位裡的長串 Base64——輪替該次連線碰過的一切憑證,並在未來發布前先剝除推理區塊。
  • 隱藏推理作為 IP 護城河,比想像中脆弱。 如果思維鏈保密是你競爭防線的一環,這篇論文把它大幅收窄了。

截至發稿,各實驗室尚未公開說明修補進度——請查閱其資安公告。但更深一層的教訓早於任何修補存在:當三家前沿實驗室不約而同出了同一種密碼學捷徑,代表這個產業對新型協議設計的安全審查腳步,已經跟不上這些系統出貨的速度。