← All posts / Research

NVIDIA 的 AVO 智慧代理在 ARC-AGI-3 拿下滿分——靠的是幫 Claude Opus 5 穿上更好的「外骨骼」

NVIDIA 的 Agentic Variation Operators 架構在 ARC-AGI-3 公開測試集拿下 100.00 滿分,把 Claude Opus 5 單獨應考時約 30% 的成績一路推到全破——這是「代理系統設計而非模型原始能力決定長程自主性上限」迄今最有力的證據。

NVIDIA 的 AVO 智慧代理在 ARC-AGI-3 拿下滿分——靠的是幫 Claude Opus 5 穿上更好的「外骨骼」

8 月 21 日,NVIDIA 研究團隊發布了一個乍看像「刷榜」、細想卻意義深遠的結果:一套名為 AVO(Agentic Variation Operators,代理變異算子) 的智慧代理系統,在 ARC-AGI-3 公開測試集上拿下 100.00 RHAE 滿分,破解了 25 個遊戲環境、共 183 個關卡。而它底層用的模型,是 Claude Opus 5——同一個模型在 ARC Prize 官方排行榜上以 High 推理強度單獨應考時,成績只有約 30%。

沒有訓練新模型,沒有發表新權重。從 30% 到 100% 的全部差距,都來自包在模型外層的系統設計(harness):持久記憶、監督迴圈,以及一套為長程任務打造的執行架構。NVIDIA 自己的總結一針見血:評測一個模型,不等於評測一個代理。

ARC-AGI-3 到底在測什麼

ARC-AGI-3 是 François Chollet 抽象推理測試的第三代,屬於互動式推理基準。代理被丟進一個陌生的遊戲環境:沒有說明書、沒有明示的規則、甚至沒有告訴你目標是什麼。它必須透過互動去探索、從自身行動的後果反推環境的運作邏輯與目標,然後在難度遞增的關卡中有效率地規劃行動。

計分採用 RHAE(Relative Human Action Efficiency,相對人類行動效率)——一個把任務完成度與每關行動效率結合、以首次接觸的人類基準為參照的指標。後半段是關鍵:一個靠蠻力亂試、最終也能破關的代理,會被 RHAE 重罰。想拿高分,必須能跨關卡保存有用的知識、從先前的互動中學習、從錯誤中恢復,並精打細算地使用每一次環境行動。

換句話說,它測的正是當前前沿模型最弱的一環:在沒有人類幫忙重置 context window 的情況下,長時間維持連貫且可累積的進展。

從 30% 到 100% 的拉升

NVIDIA 公開測試集成績的重點數字:

  • 橫掃全部 25 個環境、183 關全破,RHAE 100.00
  • 總共只用了 6,624 次環境行動——前一個最強的直接互動系統 VISTA,在同樣 183 關、同樣使用 Claude Opus 5 的條件下,回報使用了 7,542 次。跨系統比較下,AVO 硬是少用了約 12% 的行動
  • 觀測採純文字:每個遊戲狀態以精確的 64×64 文字網格呈現,不送任何圖片或影像 token——相較 VISTA 主要配置的 512×512 渲染 PNG,是一個相當大的簡化

NVIDIA 對這些數字能證明什麼相當節制。文章明言與 VISTA 的比較「不應視為受控消融實驗」——兩套系統在代理後端、觀測表示、記憶與 context 管理上全都不同;而 30% 的 Opus 5 基準來自不同的推理設定與評測環境,因此這個差距是「示意」而非「測量」AVO 的貢獻。此外,這項成績只涵蓋公開集,不包括 ARC Prize 發獎金用的半私有與全私有競賽集。

但即便守住這些但書,這個發現的形狀依然難以反駁:同一個模型,包進不同的系統機制,就能產出天差地遠的代理智慧。

AVO 的出身:七天連續跑 GPU 核心

AVO 並非為了打遊戲而生。它最初是為自主 GPU 核心最佳化打造的——回饋來自編譯器、分析器與硬體基準測試,堪稱比遊戲更嚴苛的長程紀律測試。

在 NVIDIA 的注意力核心研究中,AVO 連續運行了七天,探索超過 500 個最佳化方向,提交了 40 個核心版本。在 DGX B200 系統上,產出的多頭注意力核心在評測組態中比 cuDNN 快最多 3.5%、比 FlashAttention-4 快最多 10.5%。之後代理又只花約 30 分鐘的自主作業,就把演化出的核心改寫成群組查詢注意力(GQA)版本。

這套架構有兩根承重柱,而且都能跨領域通用:

持久記憶把先前的實作、評測結果、編譯器與分析器輸出、累積的推理過程全部帶著走——讓代理能「從現在的狀態繼續」,而不是每次 context 滾動就把搜尋進度打掉重練。在一個「第 n 關學到的教訓往往是第 n+1 關的鑰匙」的基準上,這就是「學習」與「失憶」的差別。

監督迴圈則是第二雙眼睛,監控整體軌跡是否停滯、是否陷入重複的無效循環,並在進度卡死時把主代理導向替代策略。主代理依然掌握「檢查什麼、改什麼、測什麼、提交什麼」的決定權;監督者的任務是讓搜尋持續向前。

真正有趣的是 NVIDIA 的「可遷移」論證:GPU 最佳化與 ARC-AGI-3 表面上毫無相似之處,但底層都是同一個迴圈——形成假設、透過外部介面行動、觀察後果、保存有用狀態、修正對問題的理解、從錯誤假設中恢復、然後繼續。團隊寫道:「會遷移的不是領域知識,而是讓推理與回饋得以隨時間複利的機制。」

一套架構,多個模型

AVO 在設計上也對模型中立。在一組具挑戰性的遊戲子集上,NVIDIA 把它換搭 GPT-5.6 Sol,初步結果展示了互補的操作輪廓:在多個案例中 Sol 以更快的實際時間抵達相同關卡,而 Opus 5 在同關卡比較中用了更少的環境行動。團隊把系統性比較留給未來工作,但方向很清楚——harness 正在成為可攜帶的資產,模型反而變成其中可替換的零件。

為什麼「系統優於模型」的論點一再應驗

AVO 是今年持續升溫的趨勢中,最新也最乾淨的一個數據點。VISTA 率先用 Claude Code 與 Codex harness 證明了這一點;Tycho 從反方向進攻,用顯式的可執行世界模型攻同一個基準;而在 8 月 23 日發布的 Prime Intellect nanoGPT 極速調校賽中,Claude Fable 5 的奪冠很大程度上也歸功於模型能否維持「最佳化—測試—修正」的自主迴圈。這些結果指向同一課:掛對鷹架的中階模型,打得過裸奔的前沿模型。

對開發者來說,這是真正的好消息。它意味著代理能力有一部分是工程問題——記憶設計、監督迴圈、工具介面、錯誤恢復策略——而不純粹是「誰買得起最大的模型」。NVIDIA 並未說明 AVO 會不會以開源框架形式釋出,還是僅止於內部研究展示,而這正是懸在這個結果上方、最關鍵的未決問題。

還有一個基準治理的層面。當 harness 能把模型從 30% 拉到公開集滿分,只回報裸模型分數的排行榜,對真實代理效能的說服力只會越來越低。ARC Prize 的半私有與私有集正是為了防 overfitting 而存在,而對本週消息最誠實的解讀是:公開集已經實質飽和了。 前沿已經移動:問題不再是「哪個模型最聰明」,而是「哪套系統能把模型智慧轉化成持續、有效率的行動」。

NVIDIA 的結論可以印在貼紙上,而每一個代理開發者都該把它刻在心裡:模型很重要,但模型不等於代理的全部。