← All posts / Tools

每秒 1,500 tokens 的代價:Cerebras 上架 Qwen 3.8 27B,揭露推論經濟學的真相

Cerebras 以晶圓級 SRAM 將阿里巴巴的 Qwen 3.8 27B 推到約每秒 1,500 tokens——但快取輸入全額計費的 150k TPM 上限與 128k 上下文天花板,讓長時間代理式編碼比慢速對手貴上 5 倍。

每秒 1,500 tokens 的代價:Cerebras 上架 Qwen 3.8 27B,揭露推論經濟學的真相

在前沿模型發布的喧囂之間,一場關於 AI 基礎設施未來的低調辯論,正在按量計費的推論端點上悄悄分出勝負。2026 年 9 月 3 日,Cerebras 將阿里巴巴的 Qwen 3.8 27B 加入其公開推論服務,速度約每秒 1,500 tokens——這是任何 GPU 託管服務都無法匹敵的生成速度,更別說只在每百萬輸入 tokens 0.99 美元的價位。消息在幾小時內衝上 Hacker News 首頁,累積近 700 分,留言串讀起來像一場對 2026 年推論經濟學的即時審計。

頭條數字是真的。多位測試者在實際使用中獨立測得約 1,500 tok/s,與 Cerebras 公布的數據一致。有人乾脆地總結:「輸出快得驚人,就像你期待的 1500t/sec……輸入則看不出比其他模型快。」這種不對稱——生成飛快、提示詞讀取尋常——恰恰就是這次上架意義的全部故事。

晶圓級架構為何改寫速度方程式

Cerebras 能達到這些數字的結構性原因,是晶圓級引擎(Wafer-Scale Engine, WSE):模型權重不再需要在 HBM 記憶體與運算單元之間来回搬運,整個 27B 參數模型直接駐留在晶片上的 SRAM 中。對 GPU 叢集而言每次生成都要跨記憶體頻寬重新載入的權重,在這裡本來就在那裡。對於塞得進 WSE 約 44 GB 片上 SRAM 的模型,主宰 LLM 推論的記憶體頻寬瓶頸實質上消失了——這正是生成速度能比同尺寸模型的 GPU 服務快上一個數量級的原因。

但成就速度的物理,同樣決定了限制。有人在 Hacker News 問:為什麼 Cerebras 只託管小模型,而不上架 Qwen 的 2.4T 參數旗艦?答案一針見血:「晶圓上只有 44 GB SRAM 的空間。一旦外接記憶體,就失去了單晶片方案的加速優勢——那正是 Cerebras 的全部意義。」公開服務層某種意義上就是硬體的廣告:入選的模型,正是塞得進晶片的那批。

改變帳務算式的陷阱

故事到此為止都很美好,問題出在後面。Cerebras 公開服務層設有每分鐘 150,000 tokens 的速率上限——而且關鍵在於,這個上限計入所有輸入 tokens,包括快取命中,並全額計費。官方文件寫得明白:「無論來自快取還是全新處理,輸入 tokens 均按所屬模型的標準輸入費率計費。」

對多數工作負載,這只是個註腳。但對代理式編碼(agentic coding)——正是 Qwen 3.8 27B 明確鎖定的場景(Cerebras 模型頁寫著「代理式編碼、工具使用、研究與長時間工作流」)——這就是全局勝負手。代理工作流的特徵是每一輪都重送一份龐大且大致不變的上下文:系統提示、工具定義、檔案內容、對話歷史。從 OpenAI 到 OpenRouter,推論供應商之所以對快取命中打 75–90% 折扣,正是為了這個模式。沒有快取折扣,重複的上下文每一輪都全額計費,每一輪也都在消耗 150k TPM 的額度。

一位測試者的算術讓效果變得具體:一段帶幾次追問的短程式碼審查——底層對話的快取命中率 91.4%——在 Cerebras 上花了剛超過五分鐘、1.60 美元,而用 OpenRouter 上典型供應商跑同型模型估計只要0.29 美元、約 14 分鐘。Cerebras 快了約 2.8 倍的牆鐘時間,但同一個 session 貴了 5.6 倍。多位開發者回報,在持續的代理式使用中,90 秒到幾分鐘內就撞上 150k TPM 上限。有人算得更狠:以 Cerebras 的速度,輸入端限額相當於「每分鐘只能用 5 秒」。

還有第二個更安靜的限制:託管端點把上下文壓在 128k tokens,而 Qwen 3.8 27B 的開放權重原生支援 262k——透過 YaRN 還可擴展到 1M。單輪或短 session 夠用;但對一個不斷累積檔案內容與工具結果的長時間代理,128k 很快就滿了。

Qwen 3.8 27B 本身行不行?

基礎設施故事底下,是一個真正有料的模型。Qwen 3.8 27B 由阿里巴巴 Qwen 團隊於 2026 年 8 月中以 Apache 2.0 授權開放釋出——27B 參數的稠密多模態模型,原生 262k 上下文、支援圖片輸入、可組態的推理模式,以及扎實的工具呼叫能力。社群反應明顯溫暖:在 r/LocalLLaMA 上它已成了社群最愛的「日常主力」,有使用者回報即使在消費級硬體上也有約每秒 20 tokens——不到 Cerebras 速度零頭,但兩張高階顯卡就能在家跑。

它能登上商業端點本身就是 2026 年大勢的一部分:中國實驗室的開放權重模型,在發布後數週內持續登陸西方託管基礎設施,以積極定價對抗前沿 API。OpenRouter 上 Qwen3.8-27B 的頁面顯示,第三方供應商的價格從每百萬輸入 tokens 0.15 美元起——不到 Cerebras 輸入價的六分之一,速度則是零頭。速度、能力、價格如今是三條獨立的軸線,開發者越來越常分開比價。

誰真的該用這個

撥開數字遊戲,市場區隔其實很清楚:

  • 適合: 短促、延遲敏感的請求——分類呼叫、單次工具往返、每一百毫秒使用者都看得見的互動功能。在這裡,晶圓級速度優勢是差異化的,同價位無人能及。
  • 不適合: 每次工具呼叫都重送大量上下文的長時間代理工作流。全額計費的快取與 TPM 上限會複合放大——你為餵不滿的速度付錢。

對瓶頸在開發者等待時間的人,這筆帳仍算得過來:除錯循環快 2.8 倍的迭代價值,是 per-token 會計看不到的。對瓶頸在規模化 token 支出的團隊,社群的結論很直白——持續的代理式工作大多不划算。

更大的訊號

兩件事讓這次上架值得比「例行模型託管」更多的關注。第一,入門級推論市場正在分化:一邊是速度即產品(Cerebras,以及走類似路線的 Groq LPU 家族);另一邊是價格即產品(跑在商品化 GPU 產能上的開放權重模型,0.15 美元/M 起跳)。中間地带——不快不慢、不貴不便宜的——正是價值死去的地方。

第二,快取爭議是每個供應商困境的預演。提示詞快取折扣之所以存在,是因為代理式工作流天生就是快取形狀的;拒絕它,持續的代理工作就失去經濟性;兌現它,最快的硬體就把大量週期花在不斷重送相同的 tokens 上。兩者之間的摩擦不是 Cerebras 的怪癖——它是為對話設計的基礎設施迎面撞上代理式未來時,尚未解開的經濟學。

Qwen 3.8 27B登上 Cerebras 是罕見的一次上架:限制比規格更有啟發性。速度確實是里程碑。而圍繞它的那些星號,正是推論下一步走向的地圖。