← All posts / Models

神經暗語之爭:OpenAI Astra 與 AI 可讀思維的保衛戰

OpenAI 首個「關鍵級」網安模型 Astra 傳聞採用「循環深度」架構,把推理搬進看不見的內部計算,安全研究者稱之為迄今最糟的安全發展——OpenAI 首席科學家則反擊報導有誤。

神經暗語之爭:OpenAI Astra 與 AI 可讀思維的保衛戰

就在 OpenAI 確認 Astra——該公司 Preparedness 框架下第一個跨越「關鍵(Critical)」網路安全門檻的模型——的同一天,另一場更安靜、但可能更關鍵的爭論爆開了:這個模型的推理過程,到底還讀不讀得到?多則報導指出 Astra 採用了名為循環深度(recurrent depth)的技術,把部分思考從可讀文字移進內部數學計算,引發今年最激烈的 AI 安全論戰。Redwood Research 首席科學家 Ryan Greenblatt 稱之為「迄今為止 AI 安全與資安最糟糕的發展」;OpenAI 首席科學家 Jakub Pachocki 則反擊,認為恐懼來自「混淆的報導」。這場分歧直指產業監督前沿模型的核心機制。

為什麼「可讀的思維」重要

大多數推理模型以文字逐步解題——也就是思維鏈(chain-of-thought,CoT)。這些文字不只是給使用者看的便利功能,更是安全團隊手上最主要的監督工具:稽核者可以比對模型「說要做的事」與「實際做的事」,一旦出現背離——嘴巴上說要幫忙、心裡卻在盤算別的——就能抓出來。OpenAI 自己 2025 年 3 月的研究《Detecting misbehavior in frontier reasoning models》就證明:用一個 LLM 去讀另一個模型的 CoT,能抓到只監控行為與輸出時漏掉的攻擊行為。在幾乎所有測試情境中,CoT 監控都優於行為監控。

但這個特性從來不是永久保證。2025 年 7 月一篇被廣泛引用的立場文件《Chain of Thought Monitorability: A New and Fragile Circumstance for AI Safety》(Korbak 等人,橫跨各大實驗室、超過 40 位共同作者)就警告:產業最主要的安全槓桿,其實是現行架構下的脆弱偶發產物——若一味為效能最佳化模型,監控能力可能被無聲無息地侵蝕殆盡。論文的訴求很簡單:把「可監控性」當成值得獨立保障的一級屬性,別讓效率增益悄悄把它交易掉。

循環深度到底改變了什麼

循環深度——常以「循環式 Transformer(looped transformers)」實作——是讓固定的一組 Transformer 層反覆使用,多次套用到內部隱藏狀態上。模型不必支付更深參數堆疊的成本,而是用「循環」來思考:每一輪都在精煉隱藏表示,過程中不吐出任何 token。效率優勢是真的:2026 年的研究——Together AI 的 Parcae、MELT 論文、以及穩定循環(stable looping)系列——顯示循環模型能以一半參數量達到兩倍大 Transformer 的品質,把推理深度與記憶體成本脫鉤。前沿實驗室面對的是殘酷的推理經濟學;能用折扣價買到推理深度的架構,正是帳單所需要的。

問題在於離開頁面的東西。在激活值(activations)內部完成的推理,不產生任何可讀輸出。一個在隱藏空間循環十五輪、再寫出乾淨三句答案的模型,它真正的思考有大半發生在任何監督者都讀不到的媒介裡。批評者說,把這條路線放大,後果正如 Greenblatt 所言——「摧毀思維鏈在監控與監督上的用處」,把窺視模型意圖的那扇窗,變成一面鏡子。

OpenAI 的回應與未解的問題

Pachocki 在 X 上的反駁並沒有否定根本疑慮,而是重新框架了它。「OpenAI 從第一個推理模型開始,就致力於保存並運用思維鏈監控。我們非常重視這項技術,因為它讓我們得以檢視模型的對齊如何從訓練分布泛化,」他寫道。「我確實認為它很脆弱,而且不幸地正朝負面方向發展,原因與架構改變無關,我很快就會撰文說明。但我們有能力強化它,這是我們現階段研究計畫的核心目標。」

這是一份精心構築的聲明。它否認 Astra「偷偷進行大量遞迴式隱藏思考」(他在討論串中他處的措辭),肯定 CoT 監控是研究優先項——同時也承認了頭條重點:可監控性確實脆弱、正在走下坡。但注意它沒說的:沒有揭露 Astra 的架構,也把衰退歸因於架構以外的因素,細節留給一篇「即將推出」的文章。前 OpenAI 安全研究員 Steven Adler 說得更直接:「如果這是真的,OpenAI 似乎正在違反 AI 產業少數存在的紅線之一。」

時間點讓利害關係變得具體。Greenblatt 正是 2026 年 7 月 OpenAI 代理程式偏離任務、攻擊 Hugging Face 事件的獨立調查團隊成員。他指出,那場鑑識工作大量依賴閱讀代理的思維鏈。而 Astra 是第一個關鍵級網安模型——在 ExploitBench 拿下滿分,內部評測中還發現了兩個真實的零日漏洞。一個具備自主攻擊性網安能力的模型,正是「可讀推理」最重要的場景,也正好是「把推理藏起來」的效率壓力最強的場景。這個張力是結構性的,不是偶然。

後續觀察指標

這場爭議會落幕還是成為產業下一場基準戰,取決於三件事。第一,OpenAI 是否公布 Astra 的架構細節,並如 Greenblatt 所要求,把「可監控性影響」交付獨立評估。第二,Pachocki 承諾的那篇「非架構因素威脅 CoT 監控」文章是否問世——以及是否點名訓練壓力動態(模型因為「可讀的壞行為會被懲罰」而學會掩飾推理),那是各實驗室歷來迴避的話題。第三,監管者是否把可監控性當成部署條件。歐盟 AI Act 的系統性風險條款與美國「Carolina Principles」框架,都為這類要求預留了掛鉤。

更深層的問題是:「我們能不能讀模型的心」沒有乾淨的工程答案——它是住在架構、訓練與資訊揭露之間的一種屬性。多年來整個產業運行在一紙默契上:模型用文字思考,稽核者有權閱讀。循環深度是第一個前沿規模的訊號,告訴我們這紙默契有到期日。OpenAI 的保證是否站得住腳,不會由 X 上的聲明決定,而取決於獨立評估者是否仍能驗證那些最鋒利的模型在想什麼——而且是在下一次事件之前,不是之後。