← All posts / Research

535 分滿分 600:NVIDIA Nemotron 成為首個在 IOI 2026 擊敗所有人類的 AI

NVIDIA 開放權重的 Nemotron-3-Ultra-CC 在 IOI 2026 拿下 535.4/600 —— 在與人類選手完全相同的比賽規則下現場擊敗最高分人類(498.27)與金牌門檻(361.12),關鍵在於 GenCorrect 回饋驅動的測試時運算策略。

535 分滿分 600:NVIDIA Nemotron 成為首個在 IOI 2026 擊敗所有人類的 AI

將近四十年來,國際資訊奧林匹亞競賽(IOI)一直是全球最具天賦的年輕程式設計者的試煉場——這些高中生花了數年時間鑽研大多數專業工程師一輩子都不會碰到的演算法推理。2026 年 9 月 2 日,這個時代悄悄劃下句點。NVIDIA 研究團隊發表在 arXiv 上的論文,記錄了作者們認為史上第一個在 IOI 試題上超越最高分人類選手的 AI 系統:Nemotron-3-Ultra-CC 在 IOI 2026 拿下 600 分滿分中的 535.4 分,領先最高分人類選手的 498.27 分達 37.1 分,更超出金牌門檻 361.12 分超過 174 分。

這個結果與常見的「AI 又打敗人類了」頭條不同之處,在於它達成的條件。這不是在已公開題目上做事後跑分,而是在實際比賽進行期間現場運行——在題目公開之前,並遵守與人類選手完全相同的限制:禁止上網、僅允許本機程式執行、每題最多 50 次提交、每分鐘最多提交一次。這是一次嚴格的前瞻性評測:沒有重跑、沒有事後調校、沒有第二次機會。

完整管線:22,000 道題目、120 萬條合成推理軌跡

這篇論文《Post-Training Language Models for Gold-Medal Performance in Coding Competitions》(arXiv:2609.02849)由 Aleksander Ficek、Sean Narenthiran、Mehrzad Samadi、Somshubra Majumdar 與 Boris Ginsburg 合著。它的核心訴求是方法論上的透明:過去的 AI 競賽程式設計成果——OpenAI 的 ICPC 實驗、DeepSeek 的嘗試等——多是封閉系統,把資料、規模、後訓練與推論時運算的改變全部綁在一起,讓人無法區分到底是哪個環節起了作用。

NVIDIA 的管線則被完整解剖:

  • 題目篩選。 精選 22,000 道競賽程式設計題目,每題附帶測資、輔助檔案與參考解答。只有參考解與生成解都能產生一致判題結果的環境才被保留。所有 IOI 2025、ICPC 2025 與 LiveCodeBench Pro 的題目都被排除在訓練資料外,並針對評測集做了去重。
  • 合成推理軌跡。 用 DeepSeek-V4-Flash 為小模型生成 120 萬條推理軌跡,為大模型生成 477,642 條。
  • SFT + RL。 Nemotron-3-Nano-CC(總參數 30B、啟動參數 3B)接受了監督微調與基於 GRPO 的強化學習;Nemotron-3-Ultra-CC(總參數 550B、啟動 55B)僅做 SFT——在那個規模上做 RL 超出了可用的運算預算。

RL 設定的簡潔值得一提:每步對 64 個 prompt 各取樣 16 次(共 1,024 個 rollout),溫度 1.0,生成的 C++17 解會被編譯執行,完整拿分獎勵 1、否則為 0。沒有參考策略的 KL 懲罰,使用 token 級裁剪策略梯度——是非常乾淨的可驗證獎勵式 RL。

GenCorrect:測試時運算的乘數效應

整篇論文最有趣的貢獻是 GenCorrect——一種回饋驅動的測試時運算策略,透過迭代生成、評估、精煉多樣化解法來提升表現。系統不是取樣一次就祈禱好運,而是跑多輪循環:利用自己先前提交的回饋來引導下一批候選解,早期每題生成 200 個解、最後一輪放大到 1,000 個,經聚类確保多樣性,再用「得分盲排序」在每題 10 次提交的實際預算內挑選要送出的答案。

消融實驗清楚顯示每個階段的貢獻。在 IOI 2025 上,基礎版 Nemotron-3-Nano 得 130 分;SFT 之後 280 分;RL 之後 291 分;五輪 GenCorrect 之後:468 分——輕鬆超過 IOI 2025 的金牌門檻 438.3 分,而這只是一個啟動參數僅 3B 的模型。通用版 Nemotron-3-Ultra-CC 在同樣題目上拿到 502 分。作者自己的結論是:SFT 帶來最大的單樣本提升,RL 增加的幅度較小,而 GenCorrect 把訓練好的模型能力成倍放大。

最後一輪的擴大選擇借鑑了 GenCluster 的做法:讓模型自己生成 50 個針對特定題目的測試輸入產生器與驗證器,執行並過濾到剩下 100 個有效測試輸入,再用這些輸入對 1,000 個候選解做執行式排序。系統等於在決定提交什麼之前,先為每道題建立了自己的私有測試套件。

比賽規則下的工程取捨

現場部署需要嚴謹的系統工程。IOI 2026 期間,系統的峰值配置動用了多達 760 張 NVIDIA GB300 GPU。量化取捨被明確量化:現場配置使用 NVFP4 精度、FP8 KV 快取、關閉前綴快取、多 token 預測深度 5——在 736.8 tokens/s/GPU 的吞吐下達到 52.8% 的 Score@1。與 BF16 基線相比,這犧牲了 6.6 個百分點的單樣本準確率,換來 3.7 倍的吞吐提升——正是這個取捨讓 GenCorrect 需要的大型候選批次能在五小時的比賽窗口內完成。

另外兩個針對比賽的調整:Ultra 模型的 SFT 改用 GLM-5.2 生成的資料(GLM-5.2 在 IOI 2025 上作為 SFT 教師勝過 DeepSeek-V4-Flash),以及限制輸出長度——較短的輸出讓固定推論窗口內能容納更多候選解。

為什麼重要

三個層面的意義特別突出。

一、「開源 vs. 閉源」的框架持續被瓦解。 Nemotron-3 是開放權重模型家族,這篇論文更以 CC BY 4.0 授權公開完整配方——資料篩選、SFT、RL 與測試時策略。第一個在 IOI 打敗所有人類的系統,是任何人都可以下載、檢視、重現的。

二、測試時運算已與「模型本身」不可分割。 同一份權重,得分分別是 304(Ultra 基線)、502(五輪 GenCorrect)、535.4(比賽調校的現場運行)。2026 年我們說「模型能力」時,指的其實是一個系統屬性——權重加上推論策略——而不是單一 checkpoint 的屬性。

三、前瞻性評測成為新的黃金標準。 因為系統在題目公開前就完成運行,資料污染的疑慮在結構上被消除。這是監管機構、企業買家與基準設計者應該更多要求的方法論。

必須誠實面對的限制

持平而論,仍有一些不對稱必須指出。人類選手是獨自在一台機器上作答的高中生;Ultra-CC 則是一個 550B 參數的模型,背後是高達 760 張資料中心 GPU,以及一年來在 IOI 2025 上反覆優化的提交策略。「遵守相同比賽限制」成立的是規則面向,不是資源面向。作者自己也把貢獻定位在「釐清哪些元件真正重要」,而不是宣稱某種一般意義上的人類平價。

而且 IOI 是一種特定類型的測試——有可驗證答案與乾淨獎勵訊號的演算法謎題。它恰好獎勵這套管線所依賴的可驗證獎勵 RL 與執行式精煉。同樣的技術堆疊能否移植到模糊、真實世界的軟體工程,仍是真正的開放問題。

即便如此,這個里程碑是真實的,支撐它的論文也罕見地完整易讀。AI 在奧林匹亞「拿牌」的時代結束了——第一個站上 scoreboard 頂端的,已經出現。