不動心的機器:Ataraxos 以 DeepMind 千分之一的訓練成本橫掃西洋軍棋世界強手
MIT、CMU、NYU 與 Stanford 研究團隊在《Nature》發表 Ataraxos——這套西洋軍棋 AI 以 15勝1負4和擊敗世界冠軍,訓練資料量卻不到 DeepNash 的百分之一,僅用 16 張 H100 訓練一週。
2026 年 9 月 30 日,《Nature》刊出一篇論文,主角的名字取自一個希臘字——形容一個人「不動心」(ataraxos)、不受焦慮所擾。這個名字起得恰到好處。由 MIT、卡內基美隆大學(CMU)、紐約大學(NYU)與史丹佛大學研究團隊開發的 Ataraxos,走進西洋軍棋(Stratego)世界錦標賽,在頂尖人類棋手之間繳出 39 勝 2 敗的戰績,並以 15 勝 1 敗 4 和的懸殊差距擊敗全球最強的西洋軍棋玩家。
而它燒掉的訓練成本,只有過去頂尖系統的一個零頭。
為什麼西洋軍棋特別難
每隔幾年,AI 就攻下一種遊戲,世界為之側目。西洋棋倒了、圍棋倒了、撲克也倒了。西洋軍棋——一種常被形容為「軍事版西洋棋」的雙人棋盤戰棋——卻一直默默擋在 AI 面前,而且原因不是偶然,而是結構性的。
西洋軍棋是「不完全資訊賽局」。雙方各自在棋盤己側佈置 40 枚棋子,對手棋子的身分一律隱藏,直到兩枚棋子相撞,階級較低者被消滅。可能的棋子配置超過 10 的 66 次方——比西洋棋的搜尋空間大上指數倍。你無法靠窮舉找到最佳一步。
論文資深作者、MIT 電機電腦科學系(EECS)副教授、資訊與決策系統實驗室(LIDS)主持人 Gabriele Farina 說:「在西洋軍棋裡,你必須面對的可能局面向外爆炸。為撲克發展的那套 AI 技術在這個場景完全無法擴展。」
更深層的問題在於,隱藏資訊打破了「最佳解恆定」的假設。論文第一作者、CMU 博士生 Samuel Sokota 解釋:「你越是虛張聲勢,對手就越預期你會這麼做,每次唬人的價值就越低。要怎麼推理這件事並不明顯。這和西洋棋非常不同——在西棋裡,最佳一步不管你下過多少次都還是最佳一步。」
Google DeepMind 的 DeepNash 是先前的高標,但即使動用了運算成本極高的精密操作,該系統始終無法明確擊敗頂尖人類西洋軍棋玩家。
雙管齊下的方法
Ataraxos 結合了兩種技術,研究團隊表示這正是達成超人類表現的「缺失的那一塊」。
第一,用高效自我對弈學出「藍圖策略」。模型與自己對戰數百萬次,學出一套強而有力的基礎策略。團隊設計了特別有效率的訓練演算法,讓 Ataraxos 的學習速度遠快於過去的方法,同時確保它不會陷入預測每一條可能分支的泥淖。成本優勢就在這裡:Farina 說:「我們的系統達到嚴格高於 DeepNash 的棋力,訓練樣本數卻不到它的百分之一,自我對弈局數不到三十分之一——效率上的巨大進步。」
整個訓練只用了 16 張 H100 GPU 跑一週——這是大學實驗室負擔得起的預算,而非超大規模雲端業者的專利。
第二,用生成式模型做決策時規劃。實際對局時,藍圖只是起點。Ataraxos 行動前會即時精煉自己的選擇:一個生成式模型以機率估計對手隱藏棋子的可能身分,系統再針對這個估計評估未來的各種選擇,才決定下一步。Farina 說:「我們不是盲目猜測,而是用決策時規劃找出棋盤最可能的狀態。這個生成式模型讓我們能真正聚焦在眼前這個特定棋局和特定對手上。」
這種即時的對手建模,正是系統名字的由來。Farina 指出:「Ataraxos 擅長以人類做不到的方式計算風險。人類最重要的棋子暴露時可能會開始慌,但這個 bot 可以出奇地沉著。它不會過度修正,也不會因此洩露自己的秘密。」
不只會一種遊戲
為了驗證這套方法不是西洋軍棋的專屬 hack,研究團隊把 Ataraxos 改編到另外幾種規則與設計截然不同的不完全資訊遊戲:Barrage Stratego(節奏更快、棋子更少的變體)、Hanabi(多人合作紙牌遊戲)、以及鬥地主(兩人聯手對抗第三人的中國紙牌遊戲)。Ataraxos 在每一種都達到超人類表現——證明「高效自我對弈+生成式決策時規劃」是一份通用配方,而非針對單一遊戲的特調。
為什麼這件事不止於棋盤
不完全資訊不是某種遊戲類型的冷知識——它是真實世界的預設狀態。金融市場的交易者不知道別人交易背後的理由;軍隊對敵方位置沒有完整情報;談判者、資安防禦者、拍賣競標者,全都在局部可見的條件下推理,而且每個行動都會洩漏資訊、改變對手的信念。
MIT 團隊對企圖心毫不掩飾:這類系統有朝一日可以協助決策者在軍事調度、商業談判或資安防禦中選擇理想策略——這些都是「你往往沒有奢侈把所有可能性逐一列舉」的領域,如 Farina 所言:「可能性實在太多了。擁有通用、且可證明能把這項艱難任務做得這麼好的 AI 演算法,是一大步前進。」
效率這個角度讓意義更尖銳。如果在地道的不完全資訊賽局中達到超人類表現,過去要花數百萬美元的訓練運算,現在只要 16 張 H100 跑一週,那麼策略型 AI 的進入門檻已經下降了幾個數量級。這一方面讓研究民主化,另一方面也同樣降低了對抗性應用的門檻。
但願意之前,先能審計
研究團隊對下一步非常謹慎。在這種系統能夠於重大決策場景中向人類提供建議之前,它的推理必須可被稽核。Farina 說:「是否採納建議,最終必須由人類拍板。所以在實際採用之前,我們需要能審計模型決策的方法。我們還有很長的路要走,但我希望這些演算法能成為後續許多研究的基礎。」團隊的下一步,是為 Ataraxos 加入可解釋性機制,讓它能以人類看得懂的方式解釋自己的決策。
這篇論文《Scalable decision-making for games of imperfect information》作者包括 Samuel Sokota(CMU)、Eugene Vinitsky(NYU)、Zico Kolter(CMU)、Hengyuan Hu(Stanford)、Zhiyuan Fan(MIT)與 Gabriele Farina(MIT)。研究部分經費來自美國海軍研究辦公室(ONR)、國家科學基金會(NSF)、NYU 的 C2SMART 中心,以及 Schmidt Sciences 的 AI2050 早期職業研究獎學金。
一台從不慌張、會推測你在隱藏什麼、然後據此規劃的機器——而且只花大學實驗室的預算。在這個 frontier 實驗室新聞轟炸的星期裡,「不動心的冠軍」可能是最值得注意的 AI 故事。