← All posts / Models

Liquid AI 發布 LFM2.5-2.6B:能在手機上運行的開源代理模型

Liquid AI 的 2.6B 參數模型能夠在裝置端進行規劃、呼叫工具、執行多步驟代理任務,速度達每秒 220 tokens,完全不需雲端或 GPU。

Liquid AI 發布 LFM2.5-2.6B:能在手機上運行的開源代理模型

Liquid AI 於 2026 年 8 月 4 日發布了 LFM2.5-2.6B,這是一款在當前 AI 領域中真正與眾不同的模型:一個小型、開放權重、專為裝置端代理工作流程設計的模型。當整個產業的注意力被需要數千億美元算力的前沿模型所佔據時,Liquid AI 一直在默默打造能在口袋手機上運行的模型——而且成果令人矚目。

這個定位非常明確。LFM2.5-2.6B 是一個擁有 26.9 億參數的模型,能夠在本機硬體上進行規劃、呼叫工具並執行多步驟代理任務。它只需要不到 2.5 GB 的記憶體。在 Apple M5 Max 上解碼速度達每秒 220 tokens,在 Ryzen AI Max+ 395 上達每秒 113 tokens,即使是在手機上也能維持每秒 30 tokens。不需要雲端 API 呼叫,沒有按 token 計費的成本,資料也不會離開裝置。

裝置端代理為什麼重要

基於雲端的 AI 代理的經濟學一直是一個限制因素。前沿模型透過 API 產生的每個 token 都要花錢,這意味著開發者必須仔細控制他們的代理被允許做多少推理、探索和迭代。這從根本上限制了代理架構能嘗試的事情。那些需要消耗數百萬 tokens 的背景任務——持續監控、推測性探索、大規模並行——在財務上根本不可行。

Liquid AI 的論點是:當推論成本降為零(因為在本機硬體上運行),整個等式就改變了。代理可以被部署到任何地方,持續不斷地運行,而不用擔心帳單。一整排商用機器上的代理群,甚至個別手機上的代理,都能全天候以零邊際成本運作。

隱私方面的優勢同樣重要。裝置端代理在本機處理資料,消除了將敏感資訊發送給第三方 API 的需求。對於醫療、金融、法律和企業等資料駐留不可妥協的使用場景來說,這不是便利性的問題——而是基本要求。

架構與訓練

LFM2.5-2.6B 預訓練於約 34 兆 tokens。詞彙量加倍至 128K——通過原地擴展既有分詞器而非從零重新訓練——以改善對非拉丁文字的支援。中期訓練包含一個專門的 128K 上下文擴展階段,讓模型能處理代理工作流程所需的長輸入。

後訓練流程是真正有趣的地方,分為四個階段:

1. 監督微調(SFT): 兩個連續的 SFT 階段——先是廣泛覆蓋,然後針對優先技能(如代理任務、推理和工具使用)進行重點塑造。SFT 訓練混合資料量約為 Liquid AI 較大的 LFM2.5-8B-A1B 模型的七倍,在工具使用、網路搜尋、軟體工程和代理軌跡方面有很高的權重。

2. 教師專業化: 從共享的 SFT 檢查點出發,Liquid AI 透過聚焦式 SFT 加上可驗證獎勵的強化學習(RLVR),為每個目標領域訓練一個專家。這些專家涵蓋指令遵循、數學、包含幻覺控制的知識、程式碼、工具使用和長上下文。分開訓練讓每個專家能在自己的領域深度優化,不會受到不相關目標的競爭性更新干擾。

3. 多領域同策略蒸餾(MOPD): 專業化後的專家作為教師,將其能力蒸餾到單一學生模型中。與離策略蒸餾(學生從另一個模型產生的軌跡中學習)不同,MOPD 讓學生在自己的策略下展開。每個提示被路由到對應領域的教師,教師提供 token 級別的回饋。由於教師與學生從同一個 SFT 檢查點分支出來,回饋能保持在學生的分佈附近,避免訓練不穩定。

4. 代理強化學習: 最終階段在真實代理環境中訓練模型。多輪代理強化學習通過實際的代理框架運行,模型在其中處理真實的生產力任務——研究、寫作、編碼、資料分析、文件管理、工具使用和工作流程自動化。模型使用 GRPO 進行優化,獎勵結合了 LLM 評審員的評分標準、程式化檢查和嚴格的安全門檻。關鍵的是,直接在 Hermes Agent 和 OpenClaw 等框架中訓練,讓模型暴露在它們的工具、系統提示和互動模式下。

基準測試表現

儘管是 Liquid AI 比較集中最小的模型,LFM2.5-2.6B 的競爭力令人驚訝。它在所有測試的指令遵循基準(IFBench、Multi-IF、IFStruct)上都領先,在幾乎所有工具使用基準上也領先,僅在 BFCLv4 上落後於 Qwen3.5-9B。在代理任務上,它在各項目都優於兩個 Gemma 模型,並與較大的 Qwen 模型表現接近。

具體亮點包括:AIME25 得分 51.87(超越兩個 Gemma 模型和 Qwen3.5-4B),BFCLv4(函式呼叫)56.88,ToolSandbox 77.83,PinchBench 68.22。較大模型保持明顯優勢的唯一領域是程式碼——LiveCodeBenchv6 的分數顯示 8B 和 9B 模型明顯領先。

對於一個 2.6B 模型與 5B、8B 和 9B 替代方案競爭來說,這些結果驗證了 Liquid AI 效率優先的架構。這個模型並不試圖在所有方面都是最好的——它要成為能放在手機上的最佳代理,而在這個標準上它確實做到了。

推論與部署

LFM2.5-2.6B 在第一天就支援完整的推論生態系統:

  • llama.cpp — 用於高效邊緣推論的 GGUF 檢查點
  • MLX — 針對 Apple Silicon 優化
  • vLLM — 用於生產吞吐量的 GPU 加速服務
  • SGLang — 用於生產的 GPU 加速服務
  • ONNX — 跨不同加速器的跨平台推論

在 GPU 上,該模型在高並行情況下於單一 H100 上達到近每秒 15,000 個輸出 tokens,相當於每天約 13 億 tokens。這樣的吞吐量不僅讓它適合邊緣部署,也適合 token 成本至關重要的大批量生產服務。

設置本機代理只需兩步:將 LFM2.5-2.6B 服務於 OpenAI 相容端點之後,然後將代理框架指向它。它開箱即用地與 Hermes Agent、OpenClaw 和 Pi 相容——無需任何修改。

更大的圖景

LFM2.5-2.6B 出現的時機,正是 AI 產業走向分歧的時刻。一方面,OpenAI、Anthropic 和 Google 等公司投入巨額資源打造越來越大的前沿模型,運行在龐大的雲端基礎設施上。另一方面,一股日益壯大的力量正在朝向高效、可部署的模型發展,將智慧帶到邊緣裝置。

Liquid AI 由來自 MIT CSAIL 的 Ramin Hasani、Mathias Lechner 及其團隊於 2023 年創立,自那時起就一直在追求這個效率優先的願景。LFM 架構——基於液態神經網路,專為計算效率設計——是他們的押注:AI 的未來不僅僅是規模,還在於智慧存在於哪裡。

該模型完全開放權重,可從 Hugging Face 免費下載,沒有任何限制。開發者可以自由微調、修改和部署。對於開源社群來說,這是日益壯大的小型能力模型目錄中的又一個重要補充——而且是專門針對定義當前 AI 應用開發前沿的代理使用場景優化的。

LFM2.5-2.6B 是否會成為裝置端代理的預設選擇,還有待觀察。但代理能力、開放權重、極致效率和真實世界基準測試表現的結合,使其成為任何需要在本機、私密且大規模運行代理的開發者的有力選擇。