三組開放權重對決封閉 API:深入 Abacus.AI 為企業 Agent 而生的 Smaug 模型家族
Abacus.AI 新推出的 Smaug Agentic、Flash 與 Mini,分別微調自 Kimi K3、DeepSeek V4 Flash 與 Qwen3.8 27B,在多項 Agent 基準測試上超越 Claude Sonnet 5——而且權重可以直接下載。
當前 AI 領域最值得關注的爭論,不是哪個前沿模型在聊天排行榜上稱王,而是:企業實際部署的 Agent,究竟該跑在 Anthropic 與 OpenAI 的封閉 API 上,還是採用可以下載、在自己的 VPC 裡託管、還能針對自身工作負載微調的開放權重模型?9 月 10 日,Abacus.AI 為這場論戰投入了三份新證據——Smaug 模型家族(Smaug Agentic、Smaug Flash、Smaug Mini)正式登場。這是一系列專為 Agent 工作負載微調的開放權重模型,而且分別建立在當今最強的三個開放權重基座之上。
一套方法、三個基座、三種工作負載
Smaug 家族並非新的基礎架構,而是一套應用在現有開放權重模型上的微調方法論——這正是它最有意思的地方。Abacus.AI 的做法結合了人工篩選的真實 Agent 軌跡(agent 實際完成任務的日誌),以及以困難樣本為基礎生成的合成資料。該公司宣稱這套方法可以遷移:應用在多個開放權重基座上,都能在真正影響生產級 Agent 的基準測試——Agent 式編碼、工具呼叫、自動化與長上下文推理——帶來一致的提升。
家族中每個模型各佔據「能力—效率」曲線上不同的位置:
Smaug Agentic 微調自 Moonshot AI 的 Kimi K3——這個前沿規模的多模態混合專家(MoE)基座擁有 2.8 兆總參數、每 token 約激活 1,040 億參數、896 個路由專家,上下文長度達 1,048,576 token。它是旗艦,瞄準長程編碼與工具呼叫迴圈:Agent 讀取程式庫、編輯檔案、執行測試、解讀失敗原因,然後在不計其數的相依步驟間重複這個循環。
Smaug Flash 微調自 DeepSeek V4 Flash 0731,定位為「主力馬」——持續運轉的企業 Agent,負責處理訊息、文件、API 呼叫與跨越多輪的工作流程。Abacus.AI 對選擇這個基座的原因相當坦白:DeepSeek Flash 對高頻 Agent 任務來說效率高又穩健,但「在長上下文的 Agent 工具使用中容易出現打轉與混亂」。Smaug Flash 保留了基座的百萬 token 上下文與 serving 佈局,因此既有的推論服務系統無需架構修改即可載入。
Smaug Mini 則把阿里巴巴的 Qwen3.8 27B 微調成緊湊、具多模態能力的套件,單張 GPU 就能容納——瞄準一次性的有界任務:例如客服 Agent 檢視使用者上傳的圖片、调出帳戶紀錄,然後起草回覆。
基準測試說了什麼
Abacus.AI 公布的數字才是這次發布真正的重點,因為它們讓開放權重與封閉前沿正面交鋒。
Smaug Flash 的 LiveBench 總分為 77.4,高於 DeepSeek 基座的 74.2,也高於 Claude Sonnet 5 的 76.0。在 LiveBench Agent 式編碼上差距更為懸殊:Smaug Flash 拿下 61.1,基座只有 46.8,Sonnet 5 則是 59.4。在 AutomationBench(公開 600 題、嚴格通過標準)上它拿到 38.83,勝過 Sonnet 5 的 34.67;在 NL2repo-bench 上則是 73.3 對 66.34。一個中等規模、強調效率的基座的微調版本,在 Agent 式編碼上超越 Anthropic 的生產主力——這種結果足以讓企業平台團隊重新思考他們的 API 帳單。
Smaug Mini 在小規模上訴說著類似的故事。在 AutomationBench 上它拿到 41.8,領先 Claude Sonnet 5(36.2)、Claude Opus 4.6(25.5)與 GPT-5.6 Luna(34.8)。它的 JobBench 分數(官方協議、65 項任務)為 50.5,比基座 Qwen3.8-27B 的 33.4 高出十七分,也領先 Sonnet 5 的 46.4 與 GPT-5.6 Luna 的 43.3。
最大的 Smaug Agentic「守住陣線,甚至在多項關鍵基準上領先」GPT-5.6 Sol 與 Claude Fable 5:GPQA Diamond 94.1(與 GPT-5.6 Sol 持平,高於 Fable 5 的 92.6)、AA-LCR 長上下文推理 75.7(全表最佳)、DeepSWE 69.9 對基座 Kimi K3 的 67.5,LiveBench Agent 式編碼 64.6 對 GPT-5.6 Sol 的 56.2。封閉前沿在 Terminal-Bench 2.1(GPT-5.6 Sol 88.8 對 86.5)與 MMMU-Pro 上仍然領先——但差距已經很薄,而這邊的權重是可直接下載的。
為什麼要專門為 Agent 微調
這裡的技術前提值得細看。Agent 工作負載與聊天有本質差異,而通用訓練無法完全解決:長上下文、重複的工具呼叫,以及 prompt 快取隨時間間隔拉長而失效的複合問題。一個連續運行數小時的 Agent 會累積狀態、回頭修正早先的決策,還必須在數百個步驟間保持連貫。基座模型——即使是非常優秀的基座——恰恰在這些條件下退化,這正是 DeepSeek V4 Flash 會在長程 Agent 迴圈裡「打轉」的原因。
Abacus.AI 的押注是:針對真實 Agent 軌跡做定向微調,就能在不更動架構的前提下填補這個落差。基準表格支持了這個論點的一部分:最大的增益(Smaug Flash 在 LiveBench Agent 式編碼 +14.3 分;Smaug Mini 在 JobBench +17.1 分)恰好都出現在長程多步驟任務上。但限制同樣明顯:這些是廠商在自己評測環境下跑出的成績(部分參考分數標註為「官方報告值,非本廠測試」),獨立的生產環境驗證仍然有限。
開放權重的企業級訴求
這次發布同時也是一份戰略宣言。三個模型都在 Hugging Face 上提供,沿用各自基座的授權條款,Abacus.AI 並強調它們可以在企業 VPC 內運行。這等於把對資料、基礎設施與模型行為的控制權,從「可選的合規功能」重新定位為產品主張的一部分。
換句話說,真正的競爭不是 Abacus.AI 對上某一家模型廠商,而是「開放權重、可自架的 Agent 基礎設施」對上「提供便利但保留營運控制權的封閉 API」。如果一個微調過的 27B 模型能在自動化基準上打敗 Claude Opus 4.6,同時還塞得進你自家雲端的一張 GPU,Agent 部署的經濟學就變了——「必須用封閉前沿」的假設也隨之鬆動。
對於打造持續運轉的自進化 Agent 的企業來說,Smaug 家族提供了一條可信的中間路線:接近前沿的 Agent 能力、開放權重,以及對應每種工作負載的尺寸。至於基準測試上的優勢能否在真實生產流量中存活,就是下一季要回答的問題了。
Sources
- [1] https://abacus.ai/smaug
- [2] https://www.remio.ai/post/abacus-ai-smaug-models-challenge-the-closed-model-route-for-enterprise-agents
- [3] https://huggingface.co/abacusai/Smaug-Agentic
- [4] https://www.hpcwire.com/aiwire/2026/09/11/abacus-ai-launches-smaug-open-weight-models-optimized-for-enterprise-agentic-ai/