← All posts / Models

Meta 的絕地反攻:Muse Code、Muse Spark 1.2 與開放權重的 Muse Glimmer

Meta 超級智慧實驗室發布了終端編碼代理 Muse Code(beta)、背後的 Muse Spark 1.2 模型,並以 Apache 2.0 授權開源 30B 的 Muse Glimmer —— 這是 Meta 在轉向閉源 API 之後,正式重返開放權重陣營。

Meta 的絕地反攻:Muse Code、Muse Spark 1.2 與開放權重的 Muse Glimmer

Meta 正發動自 Llama 時代以來最猛烈的一次 AI 攻勢,而且這次是三管齊下。由前 Scale AI 執行長 Alexandr Wang 領軍的 Meta 超級智慧實驗室(Meta Superintelligence Labs, MSL)發布了 Muse Code(beta)——一個由全新 Muse Spark 1.2 模型驅動的終端編碼代理,同時推出 Muse Glimmer,一個 300 億參數的代理式模型,權重已以寬鬆的 Apache 2.0 授權開放下載。三項發布合起來,是 Meta 在今年初推出閉源、僅限 API 的前代模型、拱手讓出開源影響力之後,一次經過協調的全面反攻。

具體發布了什麼

核心是 2026 年 8 月 5 日以早期 beta 形式推出的 Muse Code。它是一個基於終端機的編碼代理,在 macOS 或 Linux 上一行 curl 指令即可安裝,專為 Meta 所謂的「長時程軟體工程」而設計:在大型程式庫中規劃變更、撰寫程式碼並驗證結果。Meta 在自家的 Terminal Bench 編碼測試上報出了 82.9% 的分數,直接與 Claude Code、Codex 以及今年如雨後春筍般出現的開源編碼代理正面交鋒。

驅動它的是 Muse Spark 1.2——Muse Spark 1.1 的編碼強化版,具備 100 萬 token 的上下文視窗。Meta 表示這一版大幅增加了編碼任務的訓練算力,而且有個值得注意的做法:模型與 Muse Code 代理框架共同訓練,把拒絕取樣得來的代理軌跡餵回訓練流程,讓模型與自家代理執行環境搭配時發揮最佳表現。

第三塊拼圖、也是戰略意義最大的,是 8 月 10 日登場的 Muse Glimmer。這是一個專為「常駐型本地代理工作流」打造的 300 億參數模型,小到可以跑在一台 Mac 或一張消費級顯卡的 PC 上。Meta 已把權重放上 Hugging Face,採用 Apache 2.0 授權、無需申請門檻,llama.cpp、MLX 與 ExecuTorch 的最佳化整合在幾天內陸續到位。AMD 也宣布旗下 Ryzen AI Max+ 系列 SoC 第一天就支援,包括新款 Ryzen AI Halo 小型主機。

讓 Glimmer 跑在本機的工程細節

Muse Glimmer 的官方部落格對技術限制相當坦白:300 億參數的模型若以全精度載入,需要超過 55 GB 的記憶體——遠超任何消費級顯卡。Meta 的解法是量化技術,把語言模型壓縮到約 4 位元精度、縮小到 20 GB 以內,同時保留一個專用的感知編碼器處理多模態輸入。最終成果:在 RTX 5080 或 RX 7900 XTX 這類 24 GB VRAM 的硬體上,就能做到文字與影像交錯理解、截圖解讀與圖表判讀。

Glimmer 的訓練分三個階段。預訓練採用來自更大教師模型 Muse Spark 的 logit 蒸餾,使用相近的資料組合;中段訓練轉向更長上下文、更偏代理任務、帶有更豐富推理軌跡的資料;後訓練則結合監督式微調、線上策略蒸餾與強化學習,涵蓋通用、推理、編碼與代理四大領域。Meta 讓它與 Google 的 Gemma4-31B 和阿里巴巴的 Qwen3.6-27B 對比,宣稱在同級模型中於 DeepSearch QA、MCP-Atlas、τ-Bench、SWE-Bench 等代理基準上表現強勁。

能力清單讀起來就像本地自主代理的檢核表:端到端任務完成、以精確 schema 進行可靠的工具呼叫、長時程多步推理、失敗恢復(診斷失敗的工具呼叫並重試,而非直接中斷)、與 OpenClaw 等編排框架的相容性、可調節的推理強度,以及涵蓋超過 100 種語言的訓練資料。

Muse Code 的執行環境:常駐子代理與可重播的事件日誌

Muse Code 的架構與多數編碼代理「每個任務臨時生成子代理」的模式不同。它採用一個簡單的主代理迴圈,加上一組貫穿整個工作階段存活的非同步背景代理,由它們執行後續步驟、自行判斷何時回報主代理。Meta 主張這種常駐設計能降低延遲,減少困難多步驟任務中的人工介入。

同樣值得注意的是執行環境設計:每一次模型呼叫、工具執行、核准與編輯,都會附加到一份本地事件日誌,作為唯一事實來源。執行環境可精確重播、當機後可安全重啟——代理能從中斷處原地恢復。對得跑上好幾個小時的任務來說,這是很關鍵的特性。Meta 也真的展示了這一點:在一個核心最佳化案例研究中,Muse Spark 1.2 歷經超過 1,000 次工具呼叫、長達 24 小時,反覆撰寫、編譯並剖析 NVIDIA Hopper GPU 上 KDA 與 MLA 核心的 Triton 實作——而且代理被禁止直接包裝現成的第三方核心庫,必須從頭重新推導演算法。

Muse Code 還內建了一組技能:/plan 把任務轉成需要核准的計畫、/grill 反覆拷問計畫直到站得住腳、/goal 則朝指定目標持續推進,並支援為每個任務協調多個常駐子代理。

為什麼重要:Meta 重返開放權重

脈絡在這裡很關鍵。Meta 曾以 Llama 建立了現代開放權重運動,隨後卻跌了一跤:Llama 4 落後對手、Llama 4 Behemoth 在發表超過一年後至今未出,而今年四月隨 Muse Spark 1.0 轉向閉源、僅限 API 的策略,更讓多年來以 Llama 為最佳化對象的開發者社群大失所望。Moor Insights 分析師 Anshel Sag 稱這波新發布是「重返顛峰狀態」,CNBC 則把開放權重的決定解讀為祖克柏推動美國在開放 AI 領域維持領導地位的一步。

時機並非偶然。今年幾乎每一個大型開放權重模型都來自中國實驗室——DeepSeek、阿里巴巴的 Qwen、Moonshot 與智譁——西方實驗室大多把最強的模型留在閉源世界裡。透過以 Apache 2.0(比 Llama 社群授權更寬鬆、且無申請門檻)開源一個有競爭力的 300 億參數代理模型,Meta 把自己擺回西方陣營的對抗位置,而 Muse Spark 1.2 的權重也預定以修改版 Llama 社群授權跟進開源。

商業邏輯同樣清楚。Muse Spark 1.2 同時在 Muse Code 內與 Meta Model API 上提供,Moor Insights 指出其每任務成本定價具競爭力。編碼代理今年已成為前沿模型的殺手級應用;Meta「模型與框架彼此最佳化」的共同訓練手法,正呼應了讓 Claude Code 與 Codex 如此難纏的垂直整合策略。

幾點保留

熱情之餘,仍該打上幾個問號。82.9% 的 Terminal Bench 分數是 Meta 在自家基準上的自行呈報;Muse Code 還是 beta;Muse Spark 1.2 的開放權重在本文撰寫時尚未真正釋出,「修改版 Llama 社群授權」也意味著相較 Glimmer 乾淨的 Apache 2.0 可能仍有限制。此外,Muse Glimmer 的比較對象是同尺寸級距的模型——沒有人宣稱它打得贏前沿模型,重點在於它把接近前緣的代理能力帶到人們手中現有的硬體上。

不過方向已經很明確。在旁觀望超過一年之後,Meta 重新開始出貨——一個編碼代理、一個為該代理調校的編碼模型、加上一個真正開放的本地模型,全部在一週之內。自今年春天以來由中國實驗室主導的開源 AI 版圖,重新迎回了一位重量級的美國參賽者。