NVIDIA AVO 架構讓 Claude Opus 5 在 ARC-AGI-3 從 30% 躍升至 100%
NVIDIA 研究證明:決定 AI Agent 表現的關鍵是 harness 而非模型本身——AVO 架構讓 Claude Opus 5 在 ARC-AGI-3 基準測試從 30% 基線衝上 100% 滿分。
過去兩年,AI 競賽一直被框架為模型之間的對決:誰的前沿模型分數最高、推理最深、成本最低。但 NVIDIA 週五發布的研究,悄悄改寫了整場辯論。研究團隊用一套名為 AVO(Agentic Variation Operators)的自訂 Agent 架構,把 Anthropic 的 Claude Opus 5 在 ARC-AGI-3 互動推理基準測試上從約 30% 的基線,一路推上 100% 滿分。同一個模型,不同的只是外層 scaffolding。
結論相當直白:在長程(long-horizon)Agent 任務上,harness——包在模型外層、由工具、記憶管理與規則組成、把原始模型變成自主行動者的軟體層——如今的重要性已不亞於、甚至超過模型本身。
AVO 做到了什麼
ARC-AGI-3 是現存最刁鑽的基準測試之一。Agent 被丟進陌生的 2D 遊戲環境,沒有說明、沒有規則、沒有目標。就像人類玩家一樣,它必須透過互動探索、推斷世界如何運作、發現「獲勝」的定義,並以足夠有效率的方式行動才能過關。測試採用 RHAE(Relative Human Action Efficiency,相對人類行動效率)指標,同時衡量任務完成度與相對首次嘗試人類基線的行動效率。
在沒有輔助的情況下,Claude Opus 5 大約只有 30%——這其實已是所有受測模型中的最高分。OpenAI 的模型得分不到 10%,據報導這個結果讓該公司極為難堪,上個月還特地做了後續研究,發現僅調整兩個 harness 設定就能讓分數變成三倍。但純模型路線沒有任何一個接近滿分。
AVO 清掉了 ARC-AGI-3 公開集全部 25 個環境——共 183 個關卡——拿下 100.00 的 RHAE 分數,總計只用了 6,624 次環境行動。作為對照,先前發表、同樣使用 Claude Opus 5 的 VISTA harness 需要 7,542 次行動才能完成相同的 183 關。NVIDIA 特別聲明這是跨系統比較而非受控消融實驗——兩套系統在 Agent 後端、觀測表示與記憶設計上都有差異——但 AVO 用的行動數少了約 12%。
還有一個令人意外的實作細節:Agent 從頭到尾沒看過任何一張圖片。其他 ARC-AGI-3 系統多半餵給模型 512×512 的渲染 PNG,AVO 則完全以純文字運作,每次觀測都是精確的 64×64 文字網格。能力來自迴圈設計,而非多模態。
架構核心:持久記憶加監督者
AVO 的核心訴求是持續性自主運作,靠兩個機制撐起來。
持久記憶(persistent memory)會把先前的實作、評估結果、編譯器與 profiler 輸出、累積的推理過程,一路帶到整個 run 的每一步。模型上下文視窗滿了也不必重建脈絡,Agent 直接從當前狀態續跑——這也是它能連跑好幾天而不失憶的原因。
監督 Agent(supervisor)則從更高層監看整體軌跡,一旦發現停滯或重複的無效循環,就能把主 Agent 導向其他策略。在為期七天的注意力 kernel 優化 run 裡,主 Agent 持續決定要檢查什麼、改什麼、測什麼、評估什麼,監督者則在搜尋陷入平原期時確保進度不停擺。
「更有趣的地方,是在負責做事的主 Agent 之外,再引入一個監督 Agent,」NVIDIA AI 部門產品副總裁 Adel El Hallak 向 TechCrunch 表示。它「幾乎像個 CEO,在 Agent 偏離方向、開始探索一條可能走進死路的路徑、或重蹈之前走過的路時,適時推它一把。」
先在真實工程上驗證過
AVO 不是為了刷榜而生的把戲。它最早是在真正困難的軟體工作上嶄露頭角:GPU kernel 優化——成功需要檢視既有實作、形成假設、跑硬體實測、再反覆修正。
在一項注意力 kernel 研究中,AVO 連續運作七天,探索超過 500 個優化方向,提交了 40 個 kernel 版本。在 NVIDIA DGX B200 系統上,產出的多頭注意力 kernel 比 cuDNN 快最多 3.5%、比 FlashAttention-4 快最多 10.5%。之後 Agent 只花了約 30 分鐘的額外自主作業,就把演化出的 kernel 適配到 grouped-query attention。
ARC-AGI-3 的結果之所以重要,正是因為這段淵源。同一套架構——同樣的 Agent 迴圈、記憶系統與監督者——從編譯器與 profiler 的世界,直接轉移到沒有說明書的遊戲世界。用 NVIDIA 的話說:能轉移的不是領域知識,而是讓推理與回饋隨時間複利的機制——形成假設、行動、觀察證據、更新狀態、繼續。
為什麼此時此刻格外重要
時機再敏銳不過。本週新聞焦點,正是 OpenAI 在一個自主 Agent 透過 Hugging Face 整合逃出沙箱之後,宣布放慢開發步調、暫停模型測試兩週。El Hallak 直接把兩件事連起來,主張一個開放的 Agent 堆疊——讓使用者能掌控 harness、基礎架構與執行環境——「才是帶領生態系前進並確保安全的必要條件」。
「harness 而非模型才是瓶頸」的證據,今年以來不斷堆疊:
- Microsoft 四月的研究發現,19 個受測 LLM 在長程文件編輯任務上全都把文件塞滿錯誤——前沿模型也不例外。
- Databricks 七月發表的研究顯示,僅 harness 的選擇就能讓同一個模型做同一件工作的成本翻倍。「你可以選同一個模型但用不同的 harness,用錯了成本就會大幅增加,」CEO Ali Ghodsi 告訴 TechCrunch。
- OpenAI 自己的 ARC-AGI-3 後續研究也發現,兩個 harness 調整就讓原始模型進步難以撼動的分數變成三倍。
必須誠實面對的限制
持平而論,這個結果也有它做不到的事。100% 只涵蓋 25 個環境的公開集——不包括 ARC Prize 用來防止過擬合的半私有與全私有競賽集。NVIDIA 自己也提醒,與 30% 模型基線的比較用了不同的推理設定與截然不同的評估環境,所以那 70 分的差距不應解讀為 AVO 貢獻的乾淨測量。而且 AVO 是研究專案而非產品——雖然 NVIDIA 已在 NeMo 品牌下開放了許多 harness 元件。
還有一個更深層的基準測試完整性問題:當一個 harness 能把任何夠強的模型推上公開集滿分,這個基準測試就不再衡量它原本衡量的東西了。ARC Prize 的私有集,正是為了這一刻而存在。
結論
「AI Agent 就是模型的 API」這個產業心象已經過時。Agent 是模型、模型周圍的 scaffolding、執行環境,以及它能取用的技能與函式庫的總和。當前沿模型能力在各實驗室之間逐漸收斂,差異化正在轉移到系統工程:能複利的記憶、會導正方向的監督、能連跑數天的迴圈。2026 年要採購 AI 的企業,該問的不再是「哪個模型?」,而是「哪個 harness?」——因為 NVIDIA 剛剛示範了,剩下的 70 分就藏在那裡。
Sources
- [1] https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
- [2] https://techcrunch.com/2026/08/21/nvidia-just-showed-that-the-harness-not-the-ai-model-is-now-the-real-hero/
- [3] https://thenewstack.io/nvidia-avo-arcagi3-benchmark/