← All posts / Industry

Intel Crescent Island:480GB LPDDR5X 與一場「代理式 AI 推論不需要 HBM」的豪賭

在 Hot Chips 2026 上,Intel 詳細揭露 Crescent Island——一張 350W 氣冷 PCIe 卡,搭載最高 480GB LPDDR5X、256 個第三代 XMX 引擎與全速 FP64,以「每瓦 token 數」為核心設計哲學,瞄準代理式 AI 推論市場。

Intel Crescent Island:480GB LPDDR5X 與一場「代理式 AI 推論不需要 HBM」的豪賭

在今年的 Hot Chips 研討會上,Intel 完整揭露了旗下新一代資料中心 GPU Crescent Island 的架構,也順勢提出了這波 AI 熱潮中最反主流的一套硬體論述。當 Nvidia 的 Rubin 與 AMD 的 MI455X 都在追求極致吞吐量——高功率、純液冷封裝、海量 HBM4 記憶體——Crescent Island 卻是一張 350W、氣冷散熱的 PCIe 介面卡,圍繞著多數加速器發表會不會提的指標來設計:每瓦 token 數(tokens per watt),外加足以把整個前沿級開源模型塞進單卡的記憶體容量。

這場深度解析由 Intel 企業 AI 系統首席架構師 Sumit Mohan 與 Intel Fellow Hong Jiang 主講,論述主軸再清楚不過:代理式 AI(agentic AI)工作負載——工具呼叫、長上下文、CPU-GPU 協同運算、KV cache 沉重的併發會話——對平台的壓力模式,與一次性問答的聊天機器人完全不同。Intel 的答案是一顆專為推論打造的引擎,可以直接裝進一般伺服器,不需要特殊的供電與散熱。正式品牌卡出貨時配備 160GB LPDDR5X,參考設計則允許 ODM 夥伴推出最高 480GB 的版本——截至撰稿時,這是所有非 HBM 的 GPU 級 AI 加速器中最大的記憶體容量。

晶片上到底有什麼

Crescent Island 是第一款採用 Xe3P 架構的產品——Intel Celestial 系列 GPU 的最新成員。整顆晶片由四個 Xe3P 切片組成,每片包含 8 個 Xe Core,合計 32 個 Xe Core。每個 Xe Core 配备 8 個 Xe 向量引擎與 8 個 XMX 矩陣加速器,因此整顆 GPU 擁有 256 個向量引擎與 256 個 XMX 引擎,由 32MB 統一 L2 快取餵養,另附 4 個解碼器與 4 個編碼器的媒體引擎。

架構上最大的變化在 XMX 單元。進入第三代後,XMX 採用 16 層深的脈動陣列(systolic array)——是 Xe2 時代 4 層深的四倍——並新增 FP4 精度同發(co-issue)與 FP64 支援。Chips and Cheese 分析已揭露的架構後指出,這些單元比 Xe2/Xe3 的大了約四倍;若以約 2.5GHz 時脈估算,這顆晶片可提供約 2.6 PFLOPS 的 FP4/MXFP4、1.3 PFLOPS 的 FP8、655 TFLOPS 的 FP16/BF16、以及 328 TFLOPS 的 TF32 矩陣運算——比 Nvidia 的 RTX PRO 6000 Blackwell 高出約 30% 的矩陣吞吐量。

還有兩個數字值得注意。每個 Xe3P 核心配備 1MB 通用暫存器檔(較 Xe3 翻倍)與 512KB L1/SLM(由 384KB 提升)——這些是承襲自 Panther Lake 上 Xe3 快取階層改造的改良,目的是減少暫存器溢出、讓更寬的矩陣單元持續有資料可吃。此外,Crescent Island 保留全速 FP64——向量運算約 10 TFLOPS——這在同级產品中幾乎絕無僅有,也悄悄瞄準了長期被忽略的 HPC 社群:他們眼看著消費級衍生的加速器一個個放棄倍精度支援。

LPDDR5X 的豪賭

最大膽的決策在記憶體子系統。流出的 PCB 照片顯示正面 12 顆、背面 8 顆 LPDDR 顆粒;Chips and Cheese 推算, 匯流排寬度唯一合理的選擇是 1280-bit,以 LPDDR5X-9600 速度計算可提供超過 1.5 TB/s 的頻寬——這個數字 Intel 刻意不證實(「我們目前不便揭露該資訊」)。這與 HBM4 對手的頻寬相比只是零頭,而這正是重點:HBM 快但貴得離譜,LPDDR5X 買到的每 GB 記憶體成本,是離散 GPU 世界中其他方案都追不上的。

Intel 自己的投影片把論述講得很具體:對比一張 96GB 的 GPU,160GB 的 Crescent Island 可以把大模型的 FP8 權重加上 KV cache 完整放進單卡,實現更長的上下文、更大的模型、用更少的 GPU 支撐更多併發的代理會話。到了 480GB 的 ODM 版本,單卡就能把 DeepSeek-V4 Flash 這類模型整個裝進本地記憶體——用 Chips and Cheese 的話說,這是其他非 HBM GPU 都做不到的事。對於延遲容忍度以秒計、容量往往比原始頻寬更關鍵的代理式工作負載而言,這個取捨可能恰恰正確。值得留意的是,這與 Apple 統一記憶體的思路如出一轍——而 Intel 明言要搶的就是這塊市場。

像伺服器零件,不像實驗室計畫

另外兩項揭露顯示 Intel 是以基礎設施廠商而非跑分獵人的思維在設計這張卡。第一是功耗管理:Crescent Island 的主動閒置功耗(G0)在 50W 以下、低功耗閒置(G8)約 10W,靠的是可設定的分散式電源域、具激進時脈閘控的封包式 NoC 路由器,以及繪圖與媒體各自獨立的 DVFS 電壓軌——對利用率隨流量劇烈起伏的推論叢集來說意義重大。第二是 RAS(可靠性、可用性、可維護性):關鍵記憶體全面 ECC 與同位檢查、內部匯流排每一跳都有錯誤檢查、動態頁面下線、封裝後硬修復(post-package repair)、以及 PCIe 進階錯誤回報——Intel 稱這能實際降低靜默資料損壞的機率。

軟體方面,Intel 大張旗鼓擁抱開放:支援 vLLM、SGLang、llm-d,甚至 Nvidia 的 Dynamo,讓推論服務堆疊能在異構叢集間路由到 Crescent Island 而無需改程式碼——KV-cache 感知路由與預填充(prefill)最佳化都被列為第一級設計目標。

但別急著下結論

這還不是 Intel 的 Rubicon 時刻。Intel 既沒公布記憶體頻寬,也沒給官方算力數字;上市時程模糊——OCP 2025 的說法是年底送樣,但 Hot Chips 上的保守態度讓外界揣測時程可能已滑向 2027。更別忘了 Intel 資料中心 GPU 的歷史傷疤:Gaudi 的企業端斬獲有限,這隻獵鷹以前摔過。

但戰略意圖再清楚不過。Nvidia 壟斷了訓練前沿,並透過多數企業根本供不起電的機架級系統,把優勢轉化為推論壟斷。Intel 押注的是一個龐大的中間市場——在普通氣冷伺服器上跑代理式工作負載、對記憶體價格敏感、對液冷敬謝不敏的企業——他們寧願買容量而不是頻寬。搭配 Xeon 7 Diamond Rapids 坐鎮頭節點、Crescent Island 插進標準 PCIe Gen5 伺服器,Intel 賣的是整個代理時代的開放平台,而不只是一顆晶片。如果代理式推論市場如產業預期般爆發,這張其貌不揚、裝著半 TB 便宜記憶體的 350W 介面卡,或許會被證明是 Hot Chips 2026 上最有遠見的設計。