機器算出了未來:AI 首度奪下 Metaculus 盃冠軍,擊敗所有人類預測者
AI 預測系統史上第一次贏得季節性 Metaculus 盃冠軍——而奪冠的並非一線大廠,而是一位德州獨立開發者,只花了不到 150 小時與幾千美元的算力。
多年來,預測競賽一直是人類智識尊嚴最後的舒適堡壘。西洋棋淪陷了、圍棋淪陷了、蛋白質折疊也淪陷了——但要用校準過的機率去預測地緣政治、經濟與科技走向?那向來被認為是「超級預測者」(superforecaster)的地盤,是那些獲得 Philip Tetlock 背書、擁有十年以上實績的頂尖人類。本週,這座堡壘的大門也被推開了。
發生了什麼事
史上第一次,AI 系統贏得季節性 Metaculus 盃——這項每週舉行的預測競賽,長年來被視為各路預測者的試金石,題目涵蓋選舉結果、武裝衝突升級、科學突破等各種事件。《經濟學人》引述 Forecasting Research Institute 的分析指出,AI 系統已經在一組持續演進的預測題目上,達到與超級預測者平起平坐的水準。
而且冠軍並非僥倖。其他 AI 系統分別拿下第二與第五名,把人類擠到了第三、第四。排行榜的整體結構已經翻轉:機器不再是「擠進前十」的挑戰者,而是直接佔據了前排席位。
贏家不是你想像的那種
這個故事比「AI 又打敗人類」的例行標題更有意思的轉折在於:奪冠的機器人名叫 laertes,它不是 OpenAI、Google DeepMind 或哪家資金雄厚的預測新創的作品,而是由一位住在德州、自稱「博學者」(polymath)的 Jeffrey Liang 獨立打造。根據《經濟學人》的報導,他總共只投入了不到 150 小時與幾千美元的算力。
這個預算連一線實驗室一天的訓練費用都付不起。而 Liang 的機器人目前還在一場純 AI 的 Metaculus 競賽中領先,顯示這場勝利具有普遍性,並非單一賽事的運氣。
對這個領域裡那些募了大量資金的新創來說,這個結果無異於一記悶響的耳光——laertes 擊敗了好幾家資源遠勝於它的公司系統。這也呼應了自 LLM Agent 競賽出現以來反覆出現的模式:在通用模型外圍加上聰明的工程腳手架——檢索、推理迴圈、有紀律的問題拆解——往往勝過天真地堆疊算力。
不是氣象模型,而是通用推理者
《經濟學人》報導中有一個重要細節:這些系統並非氣象模型那類的窄域專用系統。基於 LLM 的預測者會廣泛閱讀新聞與數據、形成明確的機率判斷,而且——關鍵在這裡——能用淺白的語言解釋自己的推理。最後這一點在實務採用上,比原始準確率更重要:避險基金或政府分析單位可以審問一台「有展示推理過程」的機器,卻無法審問一個只會吐數字的黑箱。
目前競爭優勢來自新創公司在前端 LLM 之上疊加的各種技巧:
- 多模型辯論與調查——針對同一問題跑多個模型,強迫它們調和彼此衝突的證據
- 付費牆內的冷門數據——最近募得 2,500 萬美元、立志打造「超級人類」預測 AI 的英國新創 Mantic,餵給系統的是人類難以低成本取得的數據
- 名嘴戰績評分——Preseen 對媒體名嘴的歷史準確度計分,讓機器人依「被驗證過的可靠度」加權消息來源
- 反事實情境的記憶清除——重設模型上下文,以便在不同假設下乾淨地重跑同一問題
對人類而言,經濟學面殘酷至極
整個故事裡影響最深遠的,或許是成本結構。人類超級預測者——也就是精品顧問等級的選項——一份預測報告的價格可以超過 10,000 美元,且需要一週時間交貨。而 AI 預測公司未來搜尋(FutureSearch)賣的同級預測,是幾美元、幾分鐘到手。
Scott Alexander 七月撰文分享自己使用 AI 超級預測者的經驗時提到,一份詳細預測「花了我五分鐘和 8 美元的點數」。當千倍的成本崩跌遇上大致的品質平價,市場的裁決不會含糊。FutureSearch 上個月才結束公開測試,宣告其 AI 預測能力「接近超級人類」,並自稱在一項有 194 個參賽者的競爭性 AI 預測排行中名列第一。
誠實的但書
《經濟學人》對這個結論劃下了謹慎的界線,我們也應該如此:
- 參賽者未必是全球最強。參加 Metaculus 競賽的人類預測者確實很強,但他們並不是頂尖預測者的全體普查;許多頂級專業人士根本不參加每週盃賽。
- 四個月的視野。Metaculus 盃的題目以季為單位結算。多年期預測——那些由典範轉移、黑天鵝與複合不確定性主導的題目——可能仍偏向人類,或至少對機器而言仍是未證明的領域。
- 是平價,不是碾壓——目前為止。研究發現的是「達到與超級預測者平價」,不是「超級人類的預測」。令人警覺的是趨勢線,而非現狀水位。
為什麼這件事重要
預測位於幾乎所有昂貴決策的最上游——投資、政策、招聘、兵推。如果 AI 系統能以千分之一的成本、百分之一的延遲,達到與精英人類判斷相當的水準,那麼「校準預測」就不再是精品顧問產品,而是基礎設施。每一份戰略簡報、每一份情報評估、每一個補助決定,都會被悄悄重新定價。
還有一層更深的認識論轉變。Metaculus 與其同類平台的創立論點之一,是「聚合大量校準過的人類判斷,勝過依賴單一專家」。如果機器現在連「聚合者」都超越了,下一個問題就是:誰來審計機器?因為一個能解釋自己推理的預測者,同樣是一個學得會為特定結論辯護的預測者。讓 LLM 預測者具有說服力的特質,也正是讓它們「可被說服」的特質。
2026 年夏季 Metaculus 盃不會被記住為「AI 變擅長預測」的那一刻。它會被記住為「預測不再是能讓你每週請款 10,000 美元的職業」的那一刻——而已經開跑的 2026 年秋季盃,將告訴我們人類能不能討回任何一城。
Sources
- [1] https://www.economist.com/science-and-technology/2026/09/16/artificial-intelligence-now-beats-some-of-the-best-human-forecasters
- [2] https://www.metaculus.com/tournament/metaculus-cup-fall-2026/
- [3] https://www.reddit.com/r/Metaculus/comments/1wj22i8/ai_forecaster_wins_metaculus_cup_for_the_first/
- [4] https://www.astralcodexten.com/p/the-ai-superforecasters-are-here