← All posts / Meta

48 小時 1.6 萬次請求:OpenAI 粉碎與月之暗面有關的隱藏推理竊取行動

OpenAI 9 月 30 日的干擾行動報告,揭露一場協同式的「對抗性蒸餾」攻擊:兩天內湧入 1.6 萬次萃取請求、來自 4,000 多個帳號,核心叢集指向與 Moonshot AI(月之暗面)有關的個人——也讓每一家前沿實驗室都必須正視加密推理軌跡這個新建的攻擊面。

48 小時 1.6 萬次請求:OpenAI 粉碎與月之暗面有關的隱藏推理竊取行動

2026 年 9 月 30 日,OpenAI 發布了一篇名為《Disrupting a coordinated model-distillation campaign》(干擾一場協同式模型蒸餾行動)的安全通報——也藉此掀開了當前 AI 時代最具份量的基礎設施爭議之一:模型的隱藏思維鏈究竟屬於誰。該公司表示,它辨識並瓦解了一場旨在萃取其模型「受保護推理」(protected reasoning)的協同行動,並將其中一個核心叢集的活動歸因於與 Moonshot AI(月之暗面,Kimi 模型家族的開發商)有關的個人。最早觀察到的活動出現在 2026 年 7 月第一週。

究竟發生了什麼事

OpenAI 將這些活動描述為符合「對抗性蒸餾」(adversarial distillation)的特徵——系統性、未經授權地使用某個模型的輸出或推理,來訓練、重製或改進另一個模型。攻擊目標並不是一般意義上的用戶資料。營運者沒有破解 OpenAI 的加密、沒有入侵資料庫,也沒有取得儲存的用戶對話內容。相反地,他們操縱與模型的互動方式,讓「受保護推理」——模型處理任務時的內部紀錄——能夠以請求者可見的形式被重現,且是協同、大規模地進行,違反了該公司的服務條款。

OpenAI 披露的時間線相當精確。活動始於 2026 年 7 月 1 日,初期流量很低。到了 7 月 24 日與 25 日突然爆量:兩天內出現 16,000 次使用相關萃取模式的請求,來自 4,000 多個用戶。報告中的註腳特別澄清,這些數字描述的是「嘗試」萃取的次數,未必是成功的萃取。後續調查又辨識出橫跨 15,000 多個用戶叢集的相關提示模式活動,OpenAI 表示已在 7 月 28 日前完全瓦解。這些活動在行動期間不斷演變——公司將此細節視為證據,說明對抗性蒸餾是一個需要多層次、適應性防禦的廣泛安全挑戰,而非一次性事件。

攻擊核心的解密手法

技術上最耐人尋味的,是萃取究竟「怎麼做到」的。前沿模型供應商為了保護智慧財產,會隱藏模型的逐步推理過程,把推理軌跡以「加密文字區塊」的形式回傳給客戶端,再由客戶端在後續每次請求時傳回。OpenAI 觀察到的一種手法是:把一場對話中的加密推理複製出來,然後在另一場對話中要求模型將隱藏內容解密並逐字謄寫出來。

OpenAI 特別強調,這種操縱手法並非其模型獨有的漏洞。獨立安全研究人員——在 2026 年 8 月 10 日提交至 arXiv 的論文中(作者為 Alexander Panfilov、David Schmotz、Ilia Shumailov、Luca Beurer-Kellner、Joachim Schaeffer、Ameya Prabhu、Jonas Geiping 與 Maksym Andriushchenko)——早已描繪出這個架構性弱點:加密推理區塊在同一供應商生態系內,跨對話、跨用戶、跨模型是完全相容且可互換的。這種可互換性實現了所謂的「可擴展解密越獄」:把能力較強模型的加密軌跡注入同一供應商某個較弱、防護較少的模型,迫使它以明文逐字解碼輸出該軌跡——全程無需直接越獄那個更強的模型。研究人員在 Anthropic、OpenAI 與 Google 三家都展示了這類攻擊,並報告了四種攻擊向量:繞過反蒸餾機制;大規模私有資料萃取(他們從公開儲存庫抓取的 315,320 個推理區塊中,解出 367 個個人識別資訊物件與 182 組憑證);即使模型可見輸出安全地拒絕了惡意請求,推理過程中隱藏的危險資訊仍可能意外揭露;以及完全內嵌於加密區塊、對外不可見的提示注入。OpenAI 表示,負責任揭露的流程證實了這些攻擊路徑真實存在,並加速了其緩解措施。

小心措辭的歸因

OpenAI 的歸因措辭刻意收窄。該公司表示「尚不清楚相關期間觀察到的所有營運者是否源自單一行為者」,並將「核心叢集」的活動歸因於與 Moonshot AI 有關的個人——而非 Moonshot AI 這家公司本身。Moonshot 並未立即回應 CNBC 的置評請求。

然而大背景難以忽視。2026 年 9 月 8 日,美國國家安全局(NSA)、網路安全與基礎設施安全局(CISA)與聯邦調查局(FBI)發布聯合資安通告 AA26-251A,指 Moonshot AI 自 2025 年中以來,持續對美國前沿 AI 公司發動大規模蒸餾行動——據稱萃取了大量 Claude Fable 5 的資料來訓練 Kimi-K3、萃取 GPT-4o 資料來訓練 Kimi-K2,並利用美國模型蒸餾監督微調、強化學習、軟體工程與數學能力。更廣泛地,該通告聲稱——很可能在中國政府知悉下——DeepSeek、Moonshot AI、阿里巴巴、MiniMax、StepFun 與 Z.AI 自 2024 年底以來,已從 Claude、GPT、Gemini 與 Grok 的各版本萃取了數十億個 token、橫跨數百萬次互動,並透過原生 API、遠端雲端服務商、第三方聚合器,以及被稱為「轉接站」(transfer stations)的 API 代理灰色市場來路由請求。而在 OpenAI 發文前幾週,Anthropic 才公開指控包括 Moonshot 與阿里巴巴在內的中國開發商,秘密使用 Claude 來訓練自家系統。

OpenAI 的回應

緩解工作沿三條線推進。帳號執法:封禁或限制詐欺帳號,強化註冊與基礎設施控制,提高協同養號的難度。技術控制:關閉「已持有他人加密推理者可重放並還原內容」的路徑,並新增偵測與攔住可能暴露推理之串流輸出的檢查——相關保護橫跨用戶、工作區、組織與模型家族加以強化。夥伴協調:與第三方服務商合作,在相關活動轉移至其服務時辨識並切斷帳號,並透過前沿模型論壇(Frontier Model Forum)與政府情資分享管道同步發現。

有兩個前瞻性警告值得注意。第一,OpenAI 點出「合作夥伴託管的部署,需要與第一方服務相同的保護」——等於坦承同一個模型經由雲端市集或經銷商提供時,可能成為防線上的薄弱環節。第二,該公司警示工具輸出攻擊需要檢視的不僅是普通可見文字,且任何支援「可攜式或可重放推理工件」的系統,都面臨同一類風險。

為何這件事遠超出單一事件

剝掉地緣政治的外衣,這其實是前沿模型架構上一條結構性斷層線的故事。推理軌跡同時是(a)模型的皇冠上的寶石——競爭者能觀察到、最接近模型內部演算法的東西——又是(b)一種「設計上就必須跨越信任邊界」的客戶端工件,因為 API 是無狀態的,推理必須伴隨每次請求往返。解密重放攻擊剝削的正是這個張力,而且它無法靠一個分類器修補了事。OpenAI 自己也預期,隨著前沿模型進步、行為者尋找更便宜的能力模仿途徑,對抗性蒸餾的嘗試只會越來越精細。

安全框架也值得審視,因為它在 OpenAI 的論述中扮演實質角色。被萃取的推理可能被用來訓練另一個模型,卻不保留原始模型在用戶可見輸出上施加的安全防護——意味著被偷走的能力是與護欄脫鉤到手的。大規模蒸餾讓行為者無需投入相應的安全成本就能取得先進能力,而隨著模型獲得雙重用途能力,這個疑慮只會更尖銳。無論是否接受國安框架(The Register 就以「諷刺警報」奚落 OpenAI 自身的訓練資料爭議),營運層面的結論依然成立:推理軌跡如今是「受爭奪的基礎設施」,而每一家把加密推理回傳給客戶端的供應商,都在守衛同一個攻擊面。

對整個產業而言,這起事件在三個月內鞏固了一套新常態:美國情報機構聯合發布點名外國 AI 公司的通告、受害公司公布附帶用戶數與請求量的干擾報告、發現透過前沿模型論壇共享、緩解劇本橫跨雲端夥伴蔓延。前沿 AI 安全已經開始長得像一門情治學科——有歸因但書、有揭露時間線、有協同應變。這場 15,000 帳號的行動已被瓦解。它所剝削的攻擊類別,哪裡也不會去。