← All posts / Industry

Cerebras CS-4:三片超頻晶圓與重新發明的機架,帶來 30 倍速 AI 推論

Cerebras 發表 CS-4 機架級 AI 加速器,以三顆超頻版 WSE-3 Turbo 晶圓級處理器搭配全新模組化 Nexus 平台,號稱推論速度最快達 GPU 系統的 30 倍、10 兆參數模型可跑出每秒 1,000+ token,並原生支援與 AMD Helios、AWS Trainium 協作的分解式推論架構。

Cerebras CS-4:三片超頻晶圓與重新發明的機架,帶來 30 倍速 AI 推論

在 Nvidia Vera Rubin 機架與 AMD Helios 系統互相較勁一整個夏天之後,Cerebras 祭出了今年推論硬體最嗆的宣言。2026 年 8 月 19 日,這家晶圓級晶片公司發表了第四代系統 CS-4 —— 該公司首款真正的機架級(rack-scale)機器 —— 宣稱 AI 推論速度最快可達 GPU 系統的 30 倍,首批出貨本季展開。

這個頭條數字很容易被當成廠商行銷話術,但底下的架構其實訴說著更有意思的故事:Cerebras 這一代並沒有推出新晶片,而是把晶片「周圍」的一切——供電、封裝、乃至機架本身——全部重新設計,同時把既有晶圓的時脈往上拉。結果是:單晶片效能翻倍、每系統晶片數量增至三倍,並且徹底重新思考了 AI 機架該長什麼樣子。

不是新矽晶圓——同一片 wafer,硬操兩倍功率

CS-4 的核心是新的 WSE-3 Turbo。根據 The Register 的技術深度報導,它根本不是新矽:同樣的台積電 5nm 製程、同樣 46,225 mm² 的晶圓面積、同樣 4 兆顆電晶體、同樣 90 萬個核心,以及與兩年前 WSE-3 相同的 44 GB 晶上 SRAM。

改變的是餵給它的一切。Cerebras 把電源轉換拉近到距離處理器比傳統 GPU 板約 100 倍的位置,幾乎消除了板級供電損耗,得以對晶圓灌入兩倍的功率。The Register 估計,這代表矽晶片時脈從上一代的 1.4 GHz 拉到約 2.8 GHz——對一片晚餐盤大小的晶片來說,這是相當驚人的成就。

翻倍的功率預算直接換成翻倍的規格:

規格WSE-3WSE-3 Turbo
稀疏 FP16125 PFLOPS250 PFLOPS
稠密 FP1612.5 PFLOPS25 PFLOPS
記憶體頻寬21.6 PB/s43.2 PB/s
I/O 頻寬1.2 Tbps2.4 Tbps
TDP(晶圓)15 kW約 33 kW(估計)

一套完整的 CS-4 塞了三顆 WSE-3 Turbo,整個機架擁有 750 PFLOPS 的 AI 算力、7.2 Tbps 的 I/O,以及高達每秒 129.6 PB 的聚合記憶體頻寬,每機架 132 GB SRAM——這樣的容量讓 Cerebras 只需幾十片晶圓就能跑一兆參數級模型,而純 LPU 路線可能需要數千顆晶片。

數字遊戲——請看小字

但有幾點必須留意。The Register 指出,Cerebras 的頭條數字高度依賴稀疏性(sparsity),「而稀疏性一般來說對 LLM 推論沒有幫助」——稠密 FP16 效能其實是每晶圓約 25 PFLOPS,仍然驚人,但不是行銷文案上的那個數字。峰值記憶體頻寬也很可能是理論值;連 WSE-3 在推論時都沒有足夠算力餵飽自己的 SRAM。

「比 GPU 快 30 倍」的說法來自 Artificial Analysis 與內部基準測試(涵蓋一組模型),指的是 token 產生速度——即互動性——而非總吞吐量或每 token 成本。而這個區別,恰好就是 Cerebras 現在的市場定位。

分解式推論:Cerebras 變成解碼引擎

策略上最重大的轉變,是 CS-4 從設計之初就針對分解式推論(disaggregated inference)——把推論的兩個階段拆到互補的硬體上。預填(prefill)引擎(GPU 或 ASIC)先處理輸入提示、準備模型狀態;接著狀態被轉移到 CS-4,由它執行超低延遲的解碼(decode)並串流輸出 token。

Cerebras 明確點名 AMD Helios 與 AWS Trainium 為相容的預填平台。正如 The Register 的觀察,這讓 Cerebras 的晶片「主要成為解碼加速器,類似 Nvidia 在其 LPX 機架系統中使用 Groq LPU 的方式」。憑藉低至 2 微秒的晶圓對晶圓互連延遲,CS-4 宣稱在超過 10 兆參數的模型上可達每秒 1,000 個以上 token,且每瓦吞吐量比 CS-3 高出最多 10 倍。

Nexus:重新發明的機架

CS-4 是第一套建立在 Cerebras 全新 Nexus 平台架構上的系統,將機架拆成運算、供電、I/O 三個模組化子系統。運算部分安裝在後方的「晶圓背包(Wafer-Scale Backpack)」:一個自足的組件,把電源轉換、直接液冷、高速 I/O 與控制電路全部折疊進一個圍繞晶圓打造的三維封裝裡。Cerebras 表示,這個背包比上一代少了 50% 的零件,自動化製造比例提高 60%,部署時間從數天縮短到數小時。

I/O 也重新設計了:可程式化的 Wafer I/O 模組讓頻寬翻倍,同時支援標準化的 RoCE v2 RDMA over Ethernet(用於異質生態系連接)與** Direct Wafer Links**——機架內與跨機架的無交換器直連,用於擴展超大規模 CS-4 叢集。

這套設計借鏡了 Nvidia NVL72 與 AMD Helios 的模組化玩法,但 Cerebras 走得更遠:單一子系統的升級可以獨立出貨,不必等整個機架重新設計。代價是功率——The Register 估計每個背包約 46 kW,整套系統約 120~140 kW。聽起來很嚇人,但跟 AMD 和 Nvidia 今年稍後要推出的 240~250 kW 機架相比,反而顯得保守。

為什麼重要

2026 年 AI 基礎設施競賽的三大趨勢在 CS-4 匯流。第一,互動性正在成為產品本身:當 agent 與推理模型產生的輸出鏈越來越長,token 延遲直接決定使用者體驗,快的 token 就是比慢的 token 值錢。第二,異質推論正在成為主流——「單一加速器家族包辦整條推論管線」的時代正在終結;Trainium/Instinct 做預填、SRAM 豐富的晶圓做解碼,如今是廠商白紙黑字背書的架構。第三,電力才是硬約束:Cerebras 宣稱每瓦吞吐量比 CS-3 高 10 倍,直接打中那些拿不到更多百萬瓦、卻仍需要更多容量的資料中心。

Cerebras 依然面對實際的疑問——公司必須證明 WSE-3T 的高時脈能在量產環境穩定運作,而且 SRAM 容量自五年前的 WSE-2 以來就沒有實質成長,不少分析師原本預期在分解式推論時代會看到容量優先於算力。但作為一份「推論硬體往哪走」的宣言,CS-4 的訊息再明確不過:戰場已經從單晶片的 FLOPS,轉移到整座機架能用多聰明的方式,交付每秒、每瓦、每美元的 token。

CS-4 首批出貨本季展開。