← All posts / Models

Cerebras 發表 CS-4:750 PFLOPs 晶圓級機架,宣稱推論速度最快可達 GPU 系統的 30 倍

Cerebras 新推出的機架級 CS-4 由三片 WSE-3 Turbo 晶圓構成,提供 750 PFLOPs 運算力、129.6 PB/s 記憶體頻寬,在 GPT-OSS-120B 上每秒每用戶可產出超過 4,400 個 token——最快達 GPU 系統的 30 倍,本季開始出貨。

Cerebras 發表 CS-4:750 PFLOPs 晶圓級機架,宣稱推論速度最快可達 GPU 系統的 30 倍

美東時間 2026 年 8 月 18 日晚間 8 點,Cerebras Systems(NASDAQ: CBRS)發表了 CS-4——一款機架級 AI 加速器,公司稱其為業界最快,也是迄今為止對 Nvidia 主導十餘年的 GPU 格局最強硬的一次挑戰。

核心數字相當直白:在 GPT-OSS-120B 上、使用相同提示詞的對比測試中,Cerebras 宣稱 CS-4 每秒每用戶可產出超過 4,400 個 token——最快可達 GPU 方案的 30 倍。整套系統每機架提供 750 PFLOPs 的 AI 運算力、每秒 7.2 TB 的 I/O 頻寬,以及每秒 129.6 PB 的聚合記憶體頻寬。首批出貨將於本季啟動。

三片晶圓,一個機架

CS-4 由三顆新發表的 Wafer Scale Engine 3 Turbo(WSE-3T)處理器構成——每一顆仍是史上最大的 AI 晶片:4 兆電晶體、90 萬個 AI 優化核心,矽片面積達 46,225 平方毫米,並直接在晶圓上整合 44 GB SRAM。

「Turbo」並非行銷話術。與驅動 CS-3 的標準版 WSE-3 相比,WSE-3T 將每片晶圓的 AI 運算力翻倍至 250 PFLOPS,記憶體頻寬也翻倍至每秒 43.2 PB。片上骨幹網路頻寬提升至 53.5 PB/s,片外 I/O 提升至每片 2.4 Tbps,I/O 延遲則從 5 微秒縮短至最低 2 微秒。由於推論速度的真正瓶頸通常是記憶體頻寬而非原始 FLOPs,這個翻倍才是實際推動 token 產出速度的關鍵。

CS-4 也是第一個採用 Cerebras「Nexus 平台架構」的產品——一套模組化機架設計,將系統拆成運算、供電、I/O 三個可獨立擴展的元素。

「晶圓級背包」

最引人注目的工程決策是重新設計的運算子系統:每片晶圓如今安裝在一個後置式「Backpack(背包)」中——這是一個自足的組件,將電源轉換、直接液冷、高速 I/O 與控制電路全部折疊進一個緊貼晶圓的三維封裝裡。

兩個亮點值得注意。第一,部署時間「從數天縮短到數小時」,因為背包垂直掛載於供電陣列,將運算與電源解耦。第二,Backpack 的零件數比上一代系統減少 50%,自動化製造比例提高 60%——這暗示了一個現實:在晶圓級尺度上,可製造性與可維運性和極限規格同樣重要。

供電系統也經過大改。藉由將電源轉換的位置向處理器拉近 100 倍——從傳統 GPU 板上約 50 毫米的距離縮短到約 0.5 毫米——CS-4 幾乎消除了板級電力損耗,並向 WSE-3T 輸送兩倍的功率。這進一步提高了運作時脈與 token 產生速度。Cerebras 並宣稱每瓦吞吐量比 CS-3 提升最多 10 倍——在電力供給(而非晶片供應)成為資料中心擴建瓶頸的這一年,這個數字的重要性不言可喻。

直連晶圓鏈路與 50 兆參數前沿

新的可程式化 I/O 子系統支援兩種連線模式。標準路徑支援 RoCE v2 RDMA over Ethernet,讓 CS-4 機架能直接融入既有基礎設施與異構叢集。更有意思的是 Direct Wafer Links(直連晶圓鏈路):它讓晶圓能在機架內與跨機架之間無需交換器直接互連,晶圓對晶圓延遲最低僅 2 微秒。

這個延遲數字正是 CS-4 最具前瞻性主張的基礎:打造超大叢集、支援參數量超過 50 兆的模型。作為對照,當今最大的前沿模型比這還小一個數量級。Cerebras 明確地將其互連架構定位於一個模型持續變大、跨晶片通訊將率先拖垮 GPU 叢集的未來。

可程式化 I/O 也為異構分解式推論而設計——由專責的 prefill 引擎(例如生態系合作夥伴 AMD Helios 或 AWS Trainium)處理輸入提示詞,再交給 Cerebras 進行超低延遲的解碼。

速度即戰略

「在 AI 世界,速度就是生產力,」Cerebras 共同創辦人暨執行長 Andrew Feldman 說。「過去,快速推論意味著使用更小、更弱的模型。Cerebras CS-4 在最大的前沿模型上 deliver 業界領先的速度,從根本上改變了這個範式。」

技術長 Sean Lie 則把場景講得更具體:「快 30 倍不只是讓回應感覺變快。它讓代理式系統在同樣的牆鐘時間內,有餘裕進行超過一個數量級的推理、驗證或工具呼叫。」

這個論述瞄準的是 AI 中成長最快的工作負載。會循環推理、呼叫工具、自我驗證的 Agent,每項用戶任務可能燒掉數十萬 token。以每秒 4,400 token 的速度,一百萬 token 的推理鏈可在 4 分鐘內完成;在傳統 GPU 服務堆疊上,同樣的推理鏈可能超過一小時。速度論證本質上是「每完成任務成本」的論證——Cerebras 並宣稱 CS-4 的每瓦吞吐提升,能讓資料中心「在既定電力預算內產出更高價值與更多總量的 token」。

SemiAnalysis 創辦人 Dylan Patel 在新聞稿中表示,CS-4 將為「更大模型與龐大用戶量」擴展超快 token 的規模。

脈絡:一家上市公司與 Nvidia 路線圖的競速

這場發表距離 Cerebras 支撐的「Ultrafast」模式讓 OpenAI GPT-5.6 Sol 達到每秒 750 token,恰好一週——那項合作讓 Cerebras 從特立獨行的研究設備商,搖身成為全球使用最廣 AI 產品之一的基礎設施。CS-4 正是為了讓這一等級的效能可在前沿尺度複製而設計的硬體;其前瞻性聲明段落仍將 OpenAI、G42、MBZUAI 與 AWS 列為業務賴以維繫的客戶。

競爭環境毫不留情。Nvidia 的 Rubin 世代預計將大幅提升 GPU 推論吞吐量,Groq、SambaNova 與 AMD 的 Helios 機架也都在追逐同一個低延遲解碼利基市場。Cerebras 的差異化始終是架構層面的:一整片巨大晶圓,避開了 GPU 叢集在數十顆 H100 或 B200 之間做張量平行時付出的跨晶片通訊稅。

「最快 30 倍」能否通過獨立基準測試的檢驗——新聞稿自身的註腳也承認「實際吞吐量會因模型架構、上下文長度、精度與服務組態而異」——將由首批客戶在未來兩季回答。但方向已經明確:推論速度已成為一等一的產品功能,而 Cerebras 剛為 2026 年所有打造「token 工廠」的廠商樹立了新的標竿。