Intel Crescent Island:480GB LPDDR5X 與一場「代理式 AI 推論不需要 HBM」的豪賭
在 Hot Chips 2026 上,Intel 詳細揭露 Crescent Island——一張 350W 氣冷 PCIe 卡,搭載最高 480GB LPDDR5X、256 個第三代 XMX 引擎與全速 FP64,以「每瓦 token 數」為核心設計哲學,瞄準代理式 AI 推論市場。
在今年的 Hot Chips 研討會上,Intel 完整揭露了旗下新一代資料中心 GPU Crescent Island 的架構,也順勢提出了這波 AI 熱潮中最反主流的一套硬體論述。當 Nvidia 的 Rubin 與 AMD 的 MI455X 都在追求極致吞吐量——高功率、純液冷封裝、海量 HBM4 記憶體——Crescent Island 卻是一張 350W、氣冷散熱的 PCIe 介面卡,圍繞著多數加速器發表會不會提的指標來設計:每瓦 token 數(tokens per watt),外加足以把整個前沿級開源模型塞進單卡的記憶體容量。
這場深度解析由 Intel 企業 AI 系統首席架構師 Sumit Mohan 與 Intel Fellow Hong Jiang 主講,論述主軸再清楚不過:代理式 AI(agentic AI)工作負載——工具呼叫、長上下文、CPU-GPU 協同運算、KV cache 沉重的併發會話——對平台的壓力模式,與一次性問答的聊天機器人完全不同。Intel 的答案是一顆專為推論打造的引擎,可以直接裝進一般伺服器,不需要特殊的供電與散熱。正式品牌卡出貨時配備 160GB LPDDR5X,參考設計則允許 ODM 夥伴推出最高 480GB 的版本——截至撰稿時,這是所有非 HBM 的 GPU 級 AI 加速器中最大的記憶體容量。
晶片上到底有什麼
Crescent Island 是第一款採用 Xe3P 架構的產品——Intel Celestial 系列 GPU 的最新成員。整顆晶片由四個 Xe3P 切片組成,每片包含 8 個 Xe Core,合計 32 個 Xe Core。每個 Xe Core 配备 8 個 Xe 向量引擎與 8 個 XMX 矩陣加速器,因此整顆 GPU 擁有 256 個向量引擎與 256 個 XMX 引擎,由 32MB 統一 L2 快取餵養,另附 4 個解碼器與 4 個編碼器的媒體引擎。
架構上最大的變化在 XMX 單元。進入第三代後,XMX 採用 16 層深的脈動陣列(systolic array)——是 Xe2 時代 4 層深的四倍——並新增 FP4 精度同發(co-issue)與 FP64 支援。Chips and Cheese 分析已揭露的架構後指出,這些單元比 Xe2/Xe3 的大了約四倍;若以約 2.5GHz 時脈估算,這顆晶片可提供約 2.6 PFLOPS 的 FP4/MXFP4、1.3 PFLOPS 的 FP8、655 TFLOPS 的 FP16/BF16、以及 328 TFLOPS 的 TF32 矩陣運算——比 Nvidia 的 RTX PRO 6000 Blackwell 高出約 30% 的矩陣吞吐量。
還有兩個數字值得注意。每個 Xe3P 核心配備 1MB 通用暫存器檔(較 Xe3 翻倍)與 512KB L1/SLM(由 384KB 提升)——這些是承襲自 Panther Lake 上 Xe3 快取階層改造的改良,目的是減少暫存器溢出、讓更寬的矩陣單元持續有資料可吃。此外,Crescent Island 保留全速 FP64——向量運算約 10 TFLOPS——這在同级產品中幾乎絕無僅有,也悄悄瞄準了長期被忽略的 HPC 社群:他們眼看著消費級衍生的加速器一個個放棄倍精度支援。
LPDDR5X 的豪賭
最大膽的決策在記憶體子系統。流出的 PCB 照片顯示正面 12 顆、背面 8 顆 LPDDR 顆粒;Chips and Cheese 推算, 匯流排寬度唯一合理的選擇是 1280-bit,以 LPDDR5X-9600 速度計算可提供超過 1.5 TB/s 的頻寬——這個數字 Intel 刻意不證實(「我們目前不便揭露該資訊」)。這與 HBM4 對手的頻寬相比只是零頭,而這正是重點:HBM 快但貴得離譜,LPDDR5X 買到的每 GB 記憶體成本,是離散 GPU 世界中其他方案都追不上的。
Intel 自己的投影片把論述講得很具體:對比一張 96GB 的 GPU,160GB 的 Crescent Island 可以把大模型的 FP8 權重加上 KV cache 完整放進單卡,實現更長的上下文、更大的模型、用更少的 GPU 支撐更多併發的代理會話。到了 480GB 的 ODM 版本,單卡就能把 DeepSeek-V4 Flash 這類模型整個裝進本地記憶體——用 Chips and Cheese 的話說,這是其他非 HBM GPU 都做不到的事。對於延遲容忍度以秒計、容量往往比原始頻寬更關鍵的代理式工作負載而言,這個取捨可能恰恰正確。值得留意的是,這與 Apple 統一記憶體的思路如出一轍——而 Intel 明言要搶的就是這塊市場。
像伺服器零件,不像實驗室計畫
另外兩項揭露顯示 Intel 是以基礎設施廠商而非跑分獵人的思維在設計這張卡。第一是功耗管理:Crescent Island 的主動閒置功耗(G0)在 50W 以下、低功耗閒置(G8)約 10W,靠的是可設定的分散式電源域、具激進時脈閘控的封包式 NoC 路由器,以及繪圖與媒體各自獨立的 DVFS 電壓軌——對利用率隨流量劇烈起伏的推論叢集來說意義重大。第二是 RAS(可靠性、可用性、可維護性):關鍵記憶體全面 ECC 與同位檢查、內部匯流排每一跳都有錯誤檢查、動態頁面下線、封裝後硬修復(post-package repair)、以及 PCIe 進階錯誤回報——Intel 稱這能實際降低靜默資料損壞的機率。
軟體方面,Intel 大張旗鼓擁抱開放:支援 vLLM、SGLang、llm-d,甚至 Nvidia 的 Dynamo,讓推論服務堆疊能在異構叢集間路由到 Crescent Island 而無需改程式碼——KV-cache 感知路由與預填充(prefill)最佳化都被列為第一級設計目標。
但別急著下結論
這還不是 Intel 的 Rubicon 時刻。Intel 既沒公布記憶體頻寬,也沒給官方算力數字;上市時程模糊——OCP 2025 的說法是年底送樣,但 Hot Chips 上的保守態度讓外界揣測時程可能已滑向 2027。更別忘了 Intel 資料中心 GPU 的歷史傷疤:Gaudi 的企業端斬獲有限,這隻獵鷹以前摔過。
但戰略意圖再清楚不過。Nvidia 壟斷了訓練前沿,並透過多數企業根本供不起電的機架級系統,把優勢轉化為推論壟斷。Intel 押注的是一個龐大的中間市場——在普通氣冷伺服器上跑代理式工作負載、對記憶體價格敏感、對液冷敬謝不敏的企業——他們寧願買容量而不是頻寬。搭配 Xeon 7 Diamond Rapids 坐鎮頭節點、Crescent Island 插進標準 PCIe Gen5 伺服器,Intel 賣的是整個代理時代的開放平台,而不只是一顆晶片。如果代理式推論市場如產業預期般爆發,這張其貌不揚、裝著半 TB 便宜記憶體的 350W 介面卡,或許會被證明是 Hot Chips 2026 上最有遠見的設計。
Sources
- [1] https://www.tomshardware.com/pc-components/gpus/hot-chips-2026-intel-dives-deep-on-crescent-island-ai-accelerator-larger-caches-and-deeper-xmx-engines-target-maximum-ai-flops-per-watt
- [2] https://www.servethehome.com/intel-crescent-island-160gb-to-480gb-lpddr5x-ai-gpu-at-hot-chips-2026/
- [3] https://chipsandcheese.com/p/hot-chips-2026-intels-crescent-island
- [4] https://wccftech.com/intel-crescent-island-gpus-32-xe3p-cores-for-agentic-ai-low-cost-lpddr5x-up-to-480-gb/
- [5] https://newsroom.intel.com/client-computing/intel-outlines-architectures-for-agentic-ai-at-hot-chips-2026