← All posts / Meta

Cerebras CS-4:晶圓級推論正式長成一整個機櫃

Cerebras 發表 CS-4,以三片 WSE-3 Turbo 晶圓打造的機櫃級系統,宣稱推論速度最快可達 GPU 的 30 倍,10 兆參數模型每秒可產出超過 1,000 個 token。

Cerebras CS-4:晶圓級推論正式長成一整個機櫃

過去十年,AI 加速硬體的故事基本上就是 GPU 的故事——更大的叢集、更緊密的網路、更多的百萬瓦。Cerebras 這些年來一直在主張另一條路:把晶片本身做到近乎誇張的大,大到整個神經網路的層可以塞進單一片矽。2026 年 8 月 18 日發表的 CS-4,是這家公司迄今最激進的一次表態——而且第一次,他們賣的不只是一片晶圓,而是一整個機櫃。

Cerebras 發表了什麼

CS-4 是 Cerebras 系統的第四代,也是第一款建立在新機櫃級平台 Nexus 之上的系統。每個機櫃結合三片新發表的 Wafer Scale Engine 3 Turbo(WSE-3T)處理器——這是那片面積 46,225 平方毫米、內含 4 兆電晶體、至今仍是人類打造過最大晶片的超頻版本。Cerebras 表示,整套機櫃提供 750 petaflops 的 AI 運算量,推論速度最快可達 GPU 系統的 30 倍,首批出貨本季展開。

這些頭條數字值得仔細檢視,因為「比 GPU 快 30 倍」這種說法歷來容易引來質疑。這個比較明確指的是「每秒每使用者 token 數」——也就是單一串流的互動體驗——而非每塊錢的總吞吐量。Cerebras 的晶圓級架構向來正是在這一點上最強:模型權重放在片上 SRAM 而非外部 HBM,因此即使上下文與模型規模變大,解碼延遲依然持平。第三方評測也一直把 Cerebras 放在單串流推論速度的最前端。CS-4 的貢獻在於延伸這個優勢的同時,補上讓前幾代產品始終小眾的短板——容量、功率密度與部署性。

10 兆參數、每秒 1,000 個 token

整場發表中技術上最重要的宣稱,與橫向擴展有關。服務一個比任何單一加速器都大的模型,必須把模型切分到多顆處理器上,此時效能就取決於處理器之間的通訊速度。Cerebras 表示已把晶圓對晶圓互連延遲降到最低 2 微秒,這讓 CS-4 叢集可以在超過 10 兆參數的模型上維持每秒 1,000 個以上的 token——這是今天 GPU 部署只能以零頭速度服務的前沿級系統。

互連的改良搭配重新設計的 I/O 子系統。新的可程式化 Wafer I/O Module 讓晶圓邊緣的頻寬加倍,並支援兩種連線模式:基於標準的 RoCE v2 RDMA over Ethernet,用來與既有資料中心網路互通;以及 Direct Wafer Links,用於機櫃內與跨機櫃的無交換器直連。前者對採用至關重要——營運者可以把 CS-4 機櫃塞進自己已經擁有的網路裡;後者則瞄準密集的 Cerebras 叢集,用以前沿級互動推論。

原生支援解耦推論

CS-4 也從設計之初就支援解耦推論(disaggregated inference)——把推論的兩個階段拆到不同硬體上。預填(prefill)引擎負責處理輸入提示並準備模型狀態,Cerebras 預期這部分會跑在 GPU 或 ASIC 上,並點名 AMD Helios 與 AWS Trainium 為相容平台;接著狀態移交給 CS-4,由它執行超低延遲解碼、生成回應。

這是一個值得注意的策略轉向。Cerebras 不再主張晶圓級應該全面取代 GPU,而是把 CS-4 定位成異質管線中的解碼專家——擁有使用者真正感受到的那幾毫秒的元件。這是對 2026 年超大規模推論實際樣貌的務實承認:預填是吞吐導向、可以在便宜矽上充分攤提的工作;解碼是延遲導向、正好獎勵 Cerebras 這種 SRAM 密集、單串流最佳化的設計。至於交接開銷與狀態轉移的工程細節在實際生產環境中是否順暢,將決定理論優勢有多少能在真實部署中存活。

Nexus 機櫃:把無聊的部分做好

發表內容裡最不性感、卻可以說最重要的部分,是機櫃本身。Nexus 把系統重新拆成三個模組——運算、電力與 I/O——核心是後掛式的「Wafer-Scale Backpack」:一個自包含組件,把電源轉換、直接液冷、高速 I/O 與控制電子全部收進一個緊貼晶圓的三維封裝裡。

Cerebras 引用的數字全都是可製造性指標,而非效能跑分:比上一代少 50% 的零件、自動化製造比例提高 60%、部署時間從數天縮短到數小時。供電系統移到比傳統 GPU 板距離處理器近 100 倍的位置,幾乎消除板級損耗,讓 WSE-3 Turbo 能以更高頻率運作——這基本上就是「Turbo」的速度來源。根據 ServeTheHome 與 The Next Platform 的報導,每片晶圓的功耗從 WSE-3 的約 15 kW 上升到 Turbo 版的 27 至 33 kW 附近,這個可觀的增幅正是新供電與散熱架構要吸收的對象。

模組化同時創造了升級路徑:未來的晶圓世代可以直接裝進同一個平台,不必圍繞新晶圓重新設計電力與 I/O。對一家歷來以整機為單位更新的公司來說,這個節奏很重要。

脈絡:推論煉金熱

CS-4 落在一個推論當道的年份正中央。SK 海力士 290 億美元的庫藏股、三星代工漲價、湧入客製矽晶片的資金洪流,全都指向同一個轉變:產業重心從訓練移轉到服務 token。互動式推理模型與代理式工作負載正在把解碼延遲變成產品功能——助理「感覺即時」與「感覺卡住」的差別,現在就用每秒 token 數衡量,而買家願意為每位使用者的速度付錢,不只是為總容量付錢。

Cerebras 的賭注是:這個新局面獎勵架構上的專業化。GPU 仍是訓練與吞吐導向服務的預設選項,NVIDIA 在那裡的地位並不會因為這次發表而受到實質威脅。但在互動推論這一端,晶圓級 SRAM 密度是一項 GPU 難以複製的結構性優勢——HBM 的頻寬與容量正是 GPU 解碼效能的硬限制,而那是物理問題,不是軟體問題。

後續觀察

三個懸而未決的問題將決定 CS-4 是里程碑還是註腳。第一,實際供貨:Cerebras 說本季開始出貨,而這家公司大量準時出貨的歷史紀錄並不完美。第二,「30 倍」宣稱的細節——哪些模型、哪個 GPU 基準、批次大小多少;第三方在使用者實際運行的模型上重現結果,才能一錘定音。第三,解耦推論的合作(AMD、AWS Trainium 負責預填)能否長出整合產品,還是停留在架構投影片上。Cerebras 自己在註腳裡寫的「相較於 GPU 系統的實際推論速度提升可能因工作負載、配置、日期與受測模型而異」,可謂誠實地承擔了這些保留。

沒有疑問的是方向。推論正在變成分層市場——一端是廉價的大量生成,另一端是高價的互動速度——而服務這兩層的硬體正在分道揚鑣。有了 CS-4,Cerebras 打造了迄今最完整的論證:高階互動這一層,屬於晶圓級矽晶片。