← All posts / Models

兩個模型、一條前緣:Sakana 的 Fugu Max 與 Fugu Ultra v2 押注「編排」擊敗巨型單體模型

Sakana AI 發布 Fugu Max(輸出價格比 Sonnet 5、GPT 5.6 Terra 低 40-60%)與 Fugu Ultra v2(8 項基準中 5 項奪冠——而且模型池裡根本沒有 GPT-6-Astra 或 Fable 5)。

兩個模型、一條前緣:Sakana 的 Fugu Max 與 Fugu Ultra v2 押注「編排」擊敗巨型單體模型

過去十年,AI 產業沿著單一軸線競速:把基礎模型做得更大。2026 年 9 月 11 日,總部位於東京的 Sakana AI 使勁推向另一個方向,一次發布兩個「編排器」(orchestrator)——Fugu Max 與 Fugu Ultra v2——主張真正的前緣是二維的:一軸是能力,另一軸是成本。這次發布值得關注的不只是基準分數,還有旗艦版一個大膽的設計選擇:Fugu Ultra v2 在模型池裡完全沒有任何封閉前緣模型的情況下,拿到了前緣級別的分數。

核心命題:智慧是一個路由問題

Sakana 的核心主張——歷經五個月、一連串快節奏的迭代發布淬煉而成——是「最強大的 AI 永遠不會來自單一巨型模型」。能力來自一個協調層:拆解任務、把每一小塊路由到池中最輕量、夠用的模型,再驗證結果。該公司認為,動用多兆參數模型去回答一個簡單查詢的系統並不聰明,只是浪費。

Fugu Max 與 Fugu Ultra v2 是同一套編排架構,針對兩種不同任務調校:

  • Fugu Max 問的是:在最低成本下,能交付的最好輸出是什麼?
  • Fugu Ultra v2 問的是:在複雜多步驟任務上,能達到的絕對最高能力是什麼?

Fugu Max:帕累托前緣的打法

Fugu Max 編排的是 Sakana 迄今最大的開放權重與專用模型池——包括透過八月宣布的合作夥伴關係、整合進來的 NVIDIA Nemotron 系列。公司公布的數據頗有針對性:

  • 六項基準取得最佳總分,包括 Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench,以及 SWEFish(Sakana 用自家真實編碼挑戰打造的內部基準)。
  • 定價為每百萬輸入 token 2 美元、每百萬輸出 token 6 美元——公司表示輸出價格比 Sonnet 5、GPT 5.6 Terra 與 Kimi K3 低 40–60%。
  • 在十項基準中的七項擴展了成本—效能帕累托前緣,意思是對照組裡沒有任何單一模型能同時匹配它的品質與價格。

換言之,Fugu Max 並不宣稱自己是市面上最聰明的系統——它宣稱自己占據了能力—成本曲線上一個「單一模型供應商永遠到不了」的點,因為單一模型無法同時對簡單任務便宜、對困難任務強大,而編排器可以:把簡單工作路由給小模型就辦到了。

Fugu Ultra v2:前緣分數,不用前緣模型

更引人注目的是 Fugu Ultra v2,針對持續性多步推理、自主研究與全端軟體開發調校。關鍵數字:

  • 八項基準中五項取得最佳或並列最佳:GDP.pdf、Chartography、SWEFish、DeepSWE 與 Toolathon,且八項中有七項進入前二。
  • Chartography(視覺推理與資料判讀):48.3 分,對比 Opus 5 的 27.3 與 Fable 5 的 29.5——差距近 20 分。
  • DeepSWE(真實世界軟體工程):74.3 分,勝過每 token 成本高出三到五倍的模型。
  • SWEFish 稱王,展現真實編碼場景的實力。

讓這一切有趣的前提,藏在基準圖表的附註裡:Fugu Ultra v2 的模型池不含 Fable 5、Fable 5.1 或 GPT-6-Astra(訓練資料截止於 2026 年 8 月 28 日,封閉前緣模型被排除在池外)。這些分數是靠協調一群可替換的開放與專用模型達成的。這個論述直接打向 2026 年企業 AI 買家最大的兩個焦慮:供應商鎖定與服務無預警中止——兩者今年都真實上演過。Sakana 把它包裝成「AI 主權」(AI sovereignty):一種與生俱來的供應鏈韌性,池中任何模型都能替換,系統架構無須重寫。

五個月,從 beta 假說到企業級引擎

發布節奏本身就說明了「編排」作為產品類別成熟得多快:

  • 四月——beta 版:證明多代理編排可以作為統一的基礎模型運作。
  • 六月——正式上線加上 Fugu Ultra v1,展示編排層能在困難基準上匹敵封閉前緣模型。
  • 七月——Fugu-Cyber 與 Claude Code 介面,把編排特化到網路安全與編碼環境。
  • 八月——Sakana Chat 把編排帶進日常消費級應用,NVIDIA 合作開始整合 Nemotron 開放模型。
  • 九月——Fugu Max 與 Fugu Ultra v2。

分析:經濟學可能比基準分數更重要

實驗室對自家系統的基準宣稱,向來該打折扣——SWEFish 是 Sakana 的內部基準,而編排器在「獎勵拆解與驗證」的基準上本來就占結構性優勢。但有兩點讓這次發布的分量超過分數本身。

第一,經濟學是可稽核的,基準不是。如果 Fugu Max 真能以每百萬輸出 token 6 美元的價格,交付貼近一線模型的輸出,那麼相對 Sonnet 5、GPT 5.6 Terra 與 Kimi K3 的 40–60% 成本差距,在企業規模下會以複利方式放大。路由本身是成熟技術——難的是協調策略,而 Sakana 已經在消費級聊天、資安與編碼場景連續跑了五個月的生產環境迭代。

第二,時機敏銳。這次發布落在這樣一週:OpenAI 因需求超出負荷而暫停 ChatGPT Pro 新註冊,監管機構與企業都對「依賴少數封閉供應商」感到不安。一個能證明「前緣級結果不需要最稀缺的封閉模型」的系統,等於是在論證:稀缺性本身——以及它帶來的定價權——是可以被繞過的。

反方論點同樣清楚:編排用延遲換品質(Fugu Ultra 的技術報告自己就這麼寫)、增加架構複雜度、放大失效模式。對延遲敏感的應用,單一強模型仍然更簡單。而 Sakana「編排恆優於孤立模型」的宣稱,還需要獨立評測來檢驗,不能只看公司自己的圖表。

兩個模型現已透過 Sakana 的 OpenAI 相容 API 開放;現有 Fugu 用戶只需改一行參數即可升級。技術報告發布於 arXiv。無論編排最終會不會取代巨型模型的規模競賽,帕累托前緣剛剛變得更擁擠——也更便宜了。