模型池裡沒有前沿模型:Sakana AI 的 Fugu Max 與 Fugu Ultra v2 靠編排開源模型超越 GPT-6 Astra 級表現
Sakana AI 的新編排模型在 DeepSWE、Chartography 等高難度基準上登頂,代理池中完全沒有 Fable 5 或 GPT-6 Astra——只靠可替換的開源與專用模型群,而 Fugu Max 的價格更比前沿模型低 40-60%。
過去十年,AI 產業沿著單一軸線競賽:打造更大、更貴的單體模型,調高每個 token 的售價,然後重複。由前 Google Brain 研究員創立的東京新創 Sakana AI,剛釋出了迄今最激進的反證:9 月 11 日,該公司發布了 Fugu Max 與 Fugu Ultra v2 兩個「編排模型」(orchestration model),在單一 OpenAI 相容 API 背後,動態調度一個可替換的開源權重與專用模型池——而它們如今已站上、甚至越過了由各家單一前沿模型所劃定的性價比前沿(Pareto frontier)。
最值得整個產業停下來注意的細節是:Fugu Ultra v2 的代理池裡完全沒有 Claude Fable 5、Fable 5.1 或 GPT-6 Astra。它的頂尖成績純粹來自對開源與專用模型的編排。在企業愈來愈擔心供應商鎖定、API 被撤銷、模型突然被棄置的 2026 年,這不是基準測試的註腳,而是一個採購層級的論證。
兩個模型,一套架構
Fugu Max 與 Fugu Ultra v2 與其說是兩個產品,不如說是同一套編排引擎針對兩種任務的最佳化。Fugu Max 問的是:在最低成本下,我們能交付的最好輸出是什麼?Fugu Ultra v2 問的是:在複雜多步驟任務上,我們能達到的絕對最高能力是什麼?
這條產品線的演進又快又短。2026 年 4 月,Fugu 以測試版亮相,證明多代理編排可以作為統一的基礎模型運作;6 月進入正式版並推出 Fugu Ultra v1,證明編排層能在高難度基準上匹敵閉源前沿模型;7 月加入 Fugu-Cyber 與 Claude Code 介面,把編排特化到資安與程式開發工作流;8 月的 Sakana Chat 把系統帶進日常消費級應用,同時與 NVIDIA 展開合作,開始整合 Nemotron 系列開源模型。9 月的這次發布是集大成:Fugu Max 把可編排的模型池擴大到史上最大,而 Fugu Ultra v2 則把性能天花板推得更高——而且明確地不依賴它所調度的那些前沿模型。
關鍵數字
Fugu Max 主打成本效率。它在六項基準上取得最佳總分——Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench,以及 SWEFish(Sakana 基於自身程式開發挑戰建立的內部基準)。定價為每百萬輸入 token 2 美元、每百萬輸出 token 6 美元,輸出價格比 Sonnet 5、GPT 5.6 Terra 與 Kimi K3 低 40-60%。在十項基準中,它把性價比前沿向外擴展了七項。訴求很直白:以低二至六倍的成本,換取與頂尖模型在射程範圍內的性能。
Fugu Ultra v2 負責拉高天花板。它在八項高難度基準中的五項拿下最佳或並列最佳——GDP.pdf、Chartography、SWEFish、DeepSWE 與 Toolathon——並在七項中穩居前二。兩個結果特別醒目:
- Chartography(視覺推理與資料判讀):Fugu Ultra v2 得分 48.3,而 Opus 5 為 27.3、Fable 5 為 29.5——差距大到是層級之別,不是誤差範圍。
- DeepSWE(真實世界軟體工程):74.3,勝過每 token 成本高出三至五倍的模型。
有一個方法學細節值得稱許:Sakana 明確揭露 Fugu Ultra v2 的訓練截止日為 2026 年 8 月 28 日,且 Fable 5、Fable 5.1 與 GPT-6 Astra 不在其模型池中。基準污染的爭議一整年來困擾著整個產業;主動聲明編排器看得到、看不到哪些模型,是其他實驗室都該仿效的透明度。
為什麼是編排,為什麼是現在
2026 年的三股潮流,讓這次發布不只是學術上的有趣。
第一,開源模型已成為生態系中成長最快、最多樣的一塊——Sakana 自己如此總結——而它們被編排起來協同工作時,遠比單獨使用有用得多。性價比前沿正日益由許多開源、專用模型的協作構成,而不是一個什麼都做的巨型模型。
第二,供應鏈韌性已成了董事會層級的議題。整個夏天的地緣政治動盪、API 撤銷事件,以及持續中的美中模型出口角力,讓「如果我們的模型供應商切斷服務怎麼辦」成為企業架構審查中的真實問題。一個可替換的代理池——任何單一模型都能被換掉而無需重新架構——是結構性的解答。Sakana 把這包裝成「AI 主權」(AI sovereignty),而這一次,行銷術語確實對應到真實的技術特性。
第三,經濟學開始發威。在 AI 基礎設施支出引發投資人與分析師對「降速泡沫」疑慮之際,一個能把任務路由到最有能力處理的輕量模型的系統——而不是派出兆級參數模型去執行簡單資料查詢——正好回應了批評者持續點名的浪費。正如發布說明裡的冷幽默:那樣的系統「不是智慧,是浪費」。
但要留意什麼
誠實的但書仍然存在。編排意味著更多活動零件、更大的延遲變異,以及對路由決策品質的依賴——一個被錯誤路由的任務會落到扛不住它的模型上。Sakana 的基準多半是自家挑選的組合,SWEFish 更是內部基準;獨立驗證還需要時間。相對於它所對標的超大規模雲端巨頭,Sakana 的體量很小,而且如果這條路線被證明可行,編排層很容易被大廠模仿——OpenAI、Google 與 Anthropic 都有各種路由式功能正在推出。
但這正是重點所在:即使這家公司不是唯一受益者,這個想法正在獲勝。如果前沿實驗室內部採納編排,Sakana 的論點就得到驗證;如果它們不採納,Sakana 就繼續公開地把性價比前沿往外推。無論哪種情況,產業競爭的基本單位都在從「模型」轉向「管理模型的系統」。
立即可用
兩個模型現在都可透過 Sakana 的 OpenAI 相容 API 使用。既有的 Fugu 用戶只需改一行參數即可升級——無需遷移,API 介面不變。對於這一年來眼看模型供應商整合、棄置、重新定價的團隊來說,這份穩定性本身就是產品的一部分。
河豚向來是一種防禦性的生物——牠靠著「吞下它比放過它更麻煩」在巨物環伺中生存。作為一家小實驗室在巨頭之間靠架構上的不可取代性求存的隱喻,意外地貼切。
Sources
- [1] https://sakana.ai/fugu-max-release/
- [2] https://www.marktechpost.com/2026/09/10/sakana-ai-launches-fugu-max-and-fugu-ultra-v2-for-cheaper-stronger-multi-agent-orchestration/
- [3] https://gigazine.net/gsc_news/en/20260914-fugu-ultra-v2/
- [4] https://datanorth.ai/news/sakana-ai-launches-fugu-max-and-fugu-ultra-v2