← All posts / Models

一樣的答案,一半的 Token:Fireworks 如何訓練 Ember-1 不再過度思考

Fireworks Research 以 Kimi K3 為基礎打造 Ember-1,這個專用模型最多可砍掉 71% 的推理 token,卻在編碼與 Agent 基準上追平甚至超越原版——週末更攻佔 Hacker News 頭版。

一樣的答案,一半的 Token:Fireworks 如何訓練 Ember-1 不再過度思考

現代推理模型最燒錢的部分不是答案,而是「思考」。像 Kimi K3 這樣的前沿推理模型,產生的 token 中經常有超過 90% 花在內部推理過程,而不是最終回覆。在多輪 Agent 工作負載中,帳單更是以殘酷的方式複利成長:每一輪都會把之前所有推理重新餵回模型,因此 context——以及成本——會隨輪數呈近似二次方增長。

本週,Fireworks AI 發布了 Ember-1,這是其新成立的 Fireworks Research 部門推出的專用模型,直接瞄準這個經濟學問題。Ember-1 以 Kimi K3 為基礎打造,透過訓練學會更有效率地推理:整體 token 減少約 40%——在 Agent 任務上推理 token 減幅最高達 71.3%——同時在七個公開基準和兩家客戶的線上生產流量中維持甚至提升答案品質。這次發布在週末登上 Hacker News 首頁,拿下超過 500 分與 220 則留言,因為它戳中了當前每位 AI 工程師的痛處:Agent 規模化之後的推論成本。

問題:思考模型想太多

Fireworks 的起點觀察,任何跑過 Agent 編碼工作負載的團隊都心有戚戚。Kimi K3 是最強的開源推理模型之一,但冗長的思考軌跡讓大規模自動化編碼變得昂貴。最直覺的解法——調低 K3 的推理強度(reasoning effort)設定——行不通:強度一降低,品質就跟著掉太多。模型需要的不是「想少一點」,而是學會「想得有效率」,這意味著必須重新訓練。

關鍵在於,並非所有推理都是浪費。自我反思——重新檢視假設、回應環境回饋、把結果回溯到先前的決策——正是模型從錯誤中恢復的機制。Fireworks 團隊的洞見是:超出這個有用核心的多餘推理,可以在不影響最終答案的前提下移除,而且這種行為可以被「教會」,而不是靠一個旋鈕調降。他們的實驗顯示,K3 的推理可以縮短 35–50% 而不損失準確率。

50 次訓練實驗、200 次評估

這不是改個 prompt 就能做到的事。Fireworks Research 跑了超過 50 次訓練實驗與 200 次以上的評估,並沿途開發新的訓練演算法,在不損失準確率的前提下縮短推理。訓練資料集橫跨數學、編碼、指令遵循、對話、搜尋、工具使用與軟體工程——同時涵蓋單獨的問題與多輪延伸互動,並以任務回饋引導 on-policy 規劃,讓模型學會根據觀察與結果調整推理方式。

一個值得企業界注意的細節:Fireworks 明言訓練只使用自家資料,沒有用任何客戶資料。整個計畫跑在 Fireworks Serverless Training 上,公司將快速迭代歸功於此——不需佈建 GPU、按次付費,從研究到上線的時間與成本只有傳統流程的一小部分。

數據:在每個基準上都坐落於 Pareto 前沿

在編碼方面,Ember-1 對上不同推理強度的 Kimi K3 成績如下:

基準樣本數K3 LowK3 HighK3 MaxEmber-1成本 vs K3 Max
Terminal Bench 2.18976.4%77.6%80.9%82.0%−51.9% / −$23.1
SWE-bench Verified50080.4%86.0%93.2%92.2%−15.5% / −$68.1
SWE-Interact756.7%13.3%21.3%20.0%−32.5% / −$60.8
DeepSWE 1.111355.8%62.8%66.4%75.2%−23.7% / −$126.9
τ-2 Bench Airline5064%64%64%66%−5.9% / −$0.3

仔細看:在 Terminal Bench 和 DeepSWE 上,Ember-1 不只是追平最大推理強度的 K3——而是超越它,且每個任務的成本只有約四分之一到二分之一。成本數字採用 Kimi K3 公開 API 定價計算(未快取輸入 $3/百萬 token、快取輸入 $0.30/百萬、輸出 $15/百萬)。在所有樣本數超過 50 的基準上,Ember-1 都坐落於或貼近成本—品質 Pareto 前沿,以遠低的花費匹配 K3-max 的品質,並嚴格優於(dominate)K3-low。

Fireworks 也將 Ember-1 拿到 Doximity 的 Bedside Bench 上評測——這是醫師驗證、涵蓋 10 個專科、500 個臨床案例的基準,作為其新推出的 Specialized Intelligence Index(SII)一環。在那裡,Ember-1 在成本/任務上跨開源與閉源模型——包括 GPT-5.6 Sol、GPT-6 Astra 與 Claude Opus 5——立下了新的 Pareto 前沿。該公司對 GPT-6 Astra、Claude Opus-5 與 GLM 5.3 的更廣泛分析也發現 Ember-1 在該前沿上領先。

真實流量,不只基準

最有說服力的驗證來自兩家客戶線上編碼工作負載的 A/B 測試:每個任務減少約 35% 的 token、品質相當,而下游產品指標——任務完成率、成功分數、失敗率——都持平或改善。其中一家客戶已將 Ember-1 推上線上生產環境,並計畫全面擴大、完全取代基礎模型。

在 Fireworks 自家內部開發者流量上,Agent 式的數字更驚人:

模型分數步數輸出 token推理 token 減幅總 token 減幅
Kimi K30.75123.849.3K——
Ember-10.75321.429.9K71.3%39%

一樣的分數、更少的步數、少 40% 的輸出 token——推理開銷砍掉 71%。Fireworks 最引以為傲的內部結果是「沒有新聞」:開發者完全沒發現模型被換掉了,token 消耗卻悄悄下降。對一個訴求是「一樣的答案、更少的 token」的產品來說,無感升級就是最強的訊號。

Research Preview,以及開源模型的下一步訊號

Ember-1 正以 Research Preview 形式在 Fireworks Serverless 上推出,與基礎版 Kimi K3 並行提供。該公司同時引入新的發布模式:新研究模型獲得兩週的 serverless 存取,再依社群需求決定是否轉正——一種明顯由需求驅動的做法。Fireworks 亦為 Ember-1 開放訓練支援,讓企業能用自家工作負載微調出專屬的 token 高效變體。

Hacker News 討論串點出了更大的問題:這些技術能推廣嗎?留言者立刻點名希望同樣的處理能套用到 DeepSeek 的 Flash 系列與 Qwen 3.8——後者在小模型端也有類似的過度思考問題。如果「高效率推理訓練」變成開源基礎模型上的一層商品化能力——就像量化與蒸餾曾經那樣——開源生態系就會取得複利式的經濟優勢,而靠原始 token 量變現的閉源實驗室推動這件事的誘因相對小得多。

這個框架讓 Ember-1 不只是一次漸進式發布。前沿競賽多半圍繞能力;Ember-1 主張開源模型的下一個競爭軸線是每個正確答案的成本。對任何跑著 Agent 工作負載、帳單由推理 token 主宰的人來說,這才是真正重要的指標。