42 題拿 30 分、全程開源:NVIDIA 公開 Nemotron IMO 金牌背後的完整配方
NVIDIA 釋出自然語言數學證明管線的全部成果——兩個後訓練檢查點、訓練資料、推理程式碼、競賽實際提交的解答,以及 200 題全新奧林匹亞基準,在不依賴形式證明器的條件下達到 IMO 金牌門檻 30/42。
今年數學奧林匹亞金牌級別的成績不少,但幾乎每一個都包在黑盒子裡。NVIDIA 這次反其道而行。在一篇標題為《An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics》的論文(arXiv:2609.10712)中,由 Ivan Moshkov 與 Igor Gitman 領軍的團隊不只公開了分數——在 2026 年國際數學奧林匹亞(IMO)拿下 42 分中的 30 分,超過 29 分的金牌門檻——更公開了產生這個分數的整套機械:兩個後訓練(post-trained)檢查點、訓練資料、訓練與推理程式碼、競賽中實際提交的解答,以及全新的 200 題奧林匹亞級基準 Nemotron-IMO-Bench。
這批成果本週以「Nemotron Labs IMO 2026」系列的形式低調登上 Hugging Face,而它值得關注的原因,恰恰在於它拒絕隱藏任何東西。
這套系統到底是什麼
剝掉品牌光環,這條管線在概念上相當簡潔,而這正是它重要的原因之一。系統以 Nemotron 3 Ultra 為起點——就是 NVIDIA 今年持續開源開放權重的同一個模型家族——在其上訓練兩個專家檢查點:一個透過監督微調(SFT)學習精選的證明資料,另一個再透過強化學習(RL)疊加其上。論文的核心問題非常務實:奧林匹亞級的表現,究竟有多少來自後訓練,又有多少來自推理階段的設計?
答案出乎意料地是:兩者密不可分。三個 Nemotron 3 Ultra 檢查點——正式發布的通用版本加上兩個專家版——驅動一個迭代搜尋迴圈:生成候選證明、嘗試驗證、再對失敗之處精煉修正。之後由一個獨立的高算力選擇階段,從搜尋產出的所有結果中挑出每題的最終提交。
有兩個限制條件讓這個結果格外值得注意。第一,系統全程只用自然語言運作:沒有 Lean、沒有 Isabelle、沒有任何形式定理證明器。第二,沒有外部工具、沒有網路存取——模型不能打電話求救、不能呼叫符號代數引擎、不能查任何資料。每一份證明都由模型自己用數學英文生成、檢查、打磨。
為什麼「純自然語言」很重要
前沿實驗室的大多數奧林匹亞頭條成績都倚賴形式化方法或工具增強管線,由驗證器機械式地確認每一步。這種做法買到了嚴謹性,卻也限縮了系統能嘗試的範圍:形式化成本高昂,許多競賽題目也難以乾淨地編碼進證明器。純自然語言管線沒有這層保護網,這使得金牌分數本身、以及論文中公开的驗證與精煉迴圈都更有看頭——團隊明確把檢查點選擇、驗證、精煉當作獨立變數來研究,並逐一報告各自的貢獻。
對開源社群而言,意義很直接:任何擁有足夠算力的人現在都可以重現這套方法、做消融實驗、或進一步推進。兩個專家檢查點可以下載。RL 資料集(系列中的 Nemotron-Math-Proofs-v3-RL 及其前作)可以下載。負責編排「生成—驗證—精煉」的推理程式碼可以下載。更關鍵的是,IMO 2026 實際跑分時提交的解答也在釋出清單中——分數本身可以被審計,而不是憑信心接受。
Nemotron-IMO-Bench:200 題不曾外流的新題目
這次釋出中最低調的明星可能是基準測試。資料污染是數學評測的慢性病:任何曾在網路上流傳的題目,都早已進入每個前沿模型的訓練資料,讓報告分數的意義逐漸稀釋。Epoch AI 最近宣佈 FrontierMath Tier 4 飽和——GPT-6 Astra 在十四個月內把最高分從 5% 推到 98%——正是最新的症狀。
NVIDIA 的回答是 Nemotron-IMO-Bench:200 題為此次釋出全新撰寫、從未公開的奧林匹亞級題目。一個這種難度、與可重現金牌管線同時釋出的乾淨基準,讓社群同時拿到了一根尚未洩漏進訓練語料庫的量尺,以及一個已知的優良基準線。可以預期,接下來幾個月內所有認真做數學推理的團隊都會開始在它上面報分數。
脈絡:開放權重正在快速追趕
這次釋出也落在更大的轉型浪潮之中。同一週,Epoch 指出 GPT-6 Astra 在 FrontierMath 的飽和過程中,多個題目上模型「利用了非預期的捷徑」——而這種細微的失敗模式,只有透明的管線與未受污染的基準才找得出來。開放權重陣營則持續疊加戰果:Moonshot 的 Kimi K3 以 2.8 兆參數成為 Cognition 近前沿 SWE-2 編碼代理的底座;NVIDIA 自己也在 2026 年以近乎每月一次的頻率推出用於代理、程式與推理的 Nemotron 變體。
在這個背景下,公開完整的 IMO 金牌配方看起來不像炫技,更像一個策略性押注:奧林匹亞數學的護城河正在蒸發,價值正轉移到能夠「可重現地證明」自家系統實際表現的人手中。NVIDIA 押的是:做那個攤開來給大家看的實驗室,才能贏得長期賽局。
你能拿它做什麼
對研究者來說,這篇論文是在「驗證本身就很難」的領域中,對測試時算力(test-time compute)的一次乾淨消融研究。對工程師來說,這個系列是在開放模型上搭建迭代式「生成—驗證—精煉」系統的現成模板——這個模式遠不限於數學,同樣適用於程式碼審查、設計的形式驗證,以及任何需要模型自我查核的領域。對其他人來說,它是一個提醒:數學推理的前沿,已經不再被封存在少數幾間實驗室裡了。
完整系列位於 huggingface.co/collections/nvidia/nemotron-labs-imo-2026,論文位於 arXiv:2609.10712。42 題拿 30 分,沒有證明器、沒有工具、沒有秘密。