Yutori Navigator n2:270 億參數的電腦操作模型,以十分之一價格擊敗前沿巨頭
前 Meta AI 主管創辦的 Yutori 推出 Navigator n2,這個 270 億參數的電腦操作模型在 OSWorld 2.0 拿下 65.2%,超越 GPT-5.6 Sol,API 定價僅每百萬 token 0.5/4 美元,更在 MyPCBench 領先 Claude Opus 4.8 二十個百分點。
本週 AI 領域最有趣的數字不是參數量,而是 1.46 美元——這是新創公司 Yutori 的 270 億參數電腦操作模型 Navigator n2,在公認最困難的智能體基準測試之一 OSWorld 2.0 上完成一項完整長程任務的 API 成本。在該基準的部分得分指標上,n2 拿到 65.2%,領先 OpenAI 的旗艦模型 GPT-5.6 Sol(62.6%),距離 Claude Opus 5 的 70.6% 也只差五個百分點——而後者每百萬輸入 token 的價格大約是 n2 的十倍。
這項發布(8 月 26 日刊登於 Yutori 部落格)是 2026 下半年一個趨勢最清晰的例證:電腦操作(computer use)——也就是能操作真實桌面、瀏覽器與終端機的智能體——正成為新的競爭前沿,而專精化的中型模型正在成本效能曲線上擊敗通用前沿巨頭,這是前沿實驗室難以匹配的。
Navigator n2 實際上做什麼
Yutori 先前的模型 Navigator n1 與 n1.5 專攻瀏覽器操作,n2 則是通用電腦操作模型,能在 Linux、macOS 與 Windows 上操作完整桌面環境。它的訓練重點是交錯運用電腦提供的所有介面:需要視覺互動時點擊 GUI、執行系統操作時呼叫 shell、需要結構化資料時呼叫工具、效率更高時直接撰寫簡短的程式碼。
最後這一點是該公司的核心設計主張,值得直接引述:「不是強迫模型完全按照人類的方式使用電腦,而是讓它能聰明地運用電腦能做的一切。」把 100 張照片從 IMG_1337.jpg 改名為 paris-trip-001.jpg,用 shell 寫一個 for 迴圈一步就能完成;若堅持用 GUI,就得重複一百次右鍵、重新命名、輸入、確認。能在每一步選對介面的模型,完成任務更快、更便宜、也更可靠。
Yutori 公布的基準成績橫跨五個測試套件:
- OSWorld 2.0:65.2%——對比 Claude Opus 5 的 70.6%、GPT-5.6 Sol 的 62.6%、Gemini 3.7 Flash 的 47.9%、Muse Spark 1.1 的 47.3%、GPT-5.6 Luna 的 45.6%。OSWorld 2.0 由 XLANG 實驗室於六月發布,將評測單位改為完整的長程工作流程,智能體必須跨應用程式傳遞資訊。
- OSWorld-Verified:85.3%——些微領先 Claude Fable 5(85.0%)與 GPT-5.6 Sol(83.0%)。
- MyPCBench:82.6%——壓倒性勝利。Claude Opus 4.8 只有 62.0%,GPT-5.6 Sol 為 55.4%。MyPCBench 測的是跨使用者自身應用程式、帳號與數位足跡的個人化電腦操作。
- MacAgentBench:83.1%——涵蓋 25 個應用程式的真實 macOS 任務,次高的 GPT-5.5 為 66.7%。
- WeaveBench:70.3%——測試需要結合 GUI、CLI 與程式碼執行的任務,Claude Opus 4.7 得 53.2%,Gemini 3.1 Pro 僅 22.3%。
在 OSWorld 2.0 上,成本差距讓分數差距進一步放大。n2 定價為每百萬輸入 token 0.50 美元(快取後 0.05 美元)、每百萬輸出 token 4.00 美元,與它同場較勁的前沿模型處於完全不同的經濟區間——Claude Opus 5 於 7 月 24 日上市時定價為 5/25 美元。一項任務動輒數百個智能體步驟,這個價差在生產規模下會累積成真正的金錢。
遞迴式訓練迴圈
這次發布技術上最有趣的部分,是訓練資料的產生方式。Yutori 的洞見是:為電腦操作產生資料,本身就是一項電腦操作任務。
團隊不是依照說明文件手工編寫任務,而是用電腦操作智能體的 rollout 去探索原生應用程式,確認每個環境中實際可行的事情,讓新任務扎根於真實的應用邏輯。每個任務都配有對應的驗證器(verifier)——這是一種檢查環境最終狀態的測試,而不是相信智能體的自我報告。有些驗證器是程式化的:查詢資料庫、比對檔案差異、確認行事曆邀請確實存在;其他則是 LLM 式的評分標準,用於成功定義較為軟性的任務。
接著是對抗性測試。候選任務與驗證器會再經過更多智能體 rollout 的壓力測試,找出偽陽性(行為錯誤但驗證器通過)、偽陰性(行為正確但驗證器拒絕)與獎勵作弊(結果正確但透過非預期手段達成)。每個失敗案例都成為新的測試案例,任務、驗證器、甚至模擬環境本身都會隨之修正。兩個月下來,這套流程產生了超過一萬個任務,橫跨數百個應用程式——從生產力工具、通訊軟體、工程環境、資料分析到創作與科學工作流程。
這個迴圈的遞迴性是強意義上的:更好的電腦操作模型幫忙創造更好的訓練資料,更好的資料又訓練出更好的模型,而更好的模型會暴露更深層的失敗模式,供下一輪修正。n2 先經監督微調(SFT)再經強化學習(RL)訓練,RL 資料集持續更新——已能穩定解決的任務畢業進入 SFT,RL 則轉向更難的任務與新發現的弱點。訓練過程特別著重長程規劃、動態介面選擇與自我上下文壓縮,讓模型能應付需要數百步驟的任務。
Yutori 也報告了線上策略自我蒸餾(on-policy self-distillation,OPSD)的早期成果:相較於群組 rollout 式的 RL,OPSD 以四分之一的世界時間達到峰值效能,而且在當前策略成功率為零的任務上學習效率特別高——等於讓資料前沿跑在模型能力之前。
Yutori 是誰,為什麼背景重要
Yutori 於 2024 年由 Devi Parikh、Dhruv Batra 與 Abhishek Das 共同創立,三人都是前 Meta AI 的高層,曾主導該公司最受矚目的多模態研究。公司於 2025 年 3 月完成 1,500 萬美元種子輪,此後低調打造智能體基礎設施:附帶基礎設施的瀏覽器操作、會「使用」網路而非只是搜尋網路的研究智能體、全天候監控網路的 Scouting 智能體,以及讓智能體安全登入網站的 Local 產品。
Scout 的背景直接反映在 n2 的設計上。一家讓智能體整天待在瀏覽器與桌面裡的公司,負擔不起每一步都用前沿模型的價格,也無法容忍智能體卡在次優介面上原地打轉。Yutori 引用的 OSWorld 2.0 官方分析發現,如今的前沿模型正是在這裡掙扎:不是頑固地堅持用次優介面,就是在介面之間來回跳躍而毫無進展。n2 的訓練迴圈正是衝著這個失敗模式而來。
意義何在
有兩層啟示特別值得注意。第一,電腦操作排行榜不再是前沿實驗室的雙頭壟斷。一家種子階段的新創公司,用一個單節點就能跑動的 270 億參數模型,在最難的基準上與 Claude Opus 5 差距縮小到五分以內,並在個人化操作的測試套件上全面超越其他對手。能力前沿在智能體領域被拉平的速度比聊天領域更快,原因很可能是電腦操作更吃專注的訓練資料與驗證器品質,而非純粹的規模。
第二,這個定價重塑了電腦操作產品的營運成本結構。每項 OSWorld 任務 1.46 美元,代表操作使用者真實電腦的智能體,對消費者與中小企業產品而言變得可行,而不只是企業自動化的專利。Yutori 透過相容於 OpenAI Chat Completions 的 API 提供 n2,對已經採用標準智能體技術棧的團隊來說,轉換摩擦相當低。
警告仍是老幾樣。多數基準數字是公司自行回報的,不過 OSWorld-Verified 與 OSWorld 2.0 可以外部重現;n2 並未開放權重——僅提供 API,不同於本月 Zhipu、騰訊與 DeepSeek 的開源浪潮;MyPCBench 與 WeaveBench 也是較新、未經長期考驗的套件。但這個結果的形狀——一個小型專精模型重劃了整個能力類別的成本效能帕累托前沿——正是 2026 年的縮影,而它本週來自一家大多數人沒聽過的公司。