Intel 揭曉 Xeon 7「Diamond Rapids」:256 核心、1.28 GB 快取,2027 年登場
在 Hot Chips 2026 上,Intel 公開了史上最模組化的 Xeon 伺服器處理器——最多 256 個 P 核心、22 顆晶粒組合、支援 FP8 矩陣運算與 16 通道 DDR5,要用「扇出型架構」正面迎戰 AMD 的小晶片布局。
在本週的 Hot Chips 2026 大會上,Intel 完整揭露了 Xeon 7,代號 Diamond Rapids——這是該公司迄今打造過最複雜的伺服器處理器,也是它希望用來終結 AMD 七年來在資料中心小晶片(chiplet)優勢的武器。最大亮點:旗艦型號的單插座核心數拉高到 256 個 P 核心(比原先規劃的 192 核更多),搭配高達 1.28 GB 的末階快取、16 通道 DDR5,以及全線 PCI Express 6.0。
但有一個老問題:這顆晶片要到 2027 年才會出貨。
從 192 核到 256 核——為什麼?
Diamond Rapids 原定 2026 年推出、最多 192 核心。時程延宕之後,Intel 利用多出來的時間把旗艦規格往上推。根據 ServeTheHome 在 Hot Chips 現場的即時報導,256 核配置似乎是最近才加入藍圖——直接回應 AMD 第六代 EPYC「Venice」,後者同樣以 256 核心(搭配 SMT、共 512 執行緒)為頂規。
產品線本身也因延宕而變窄。Intel 今年稍早已取消八通道的 Diamond Rapids-SP 版本,只保留高階 AP 系列產品。這讓 Xeon 7 成為以 HPC 為核心的高核心數家族,而非通用伺服器平台——戰線縮小,但 Intel 認為在規格上有得一拚。
22 顆晶粒、三種角色
Diamond Rapids 真正有趣的地方在封裝。整顆處理器最多由 22 顆晶粒組成,分為三類:
- 16 顆運算晶粒,採用 Intel 最新的 18A-P 製程——也就是 Panther Lake 率先量產的 2 奈米級製程精煉版。Intel 宣稱 18A-P 可在相同效能下省電 18%,或在相同功耗下提升最高 9% 效能,這還沒計入全新 P 核心的微架構改進。
- 4 顆運算建構模組(CBB)基礎晶粒,採 Intel 3-T 製程,每顆內含 320 MB 末階快取。每個基礎晶粒上以 Foveros 3D 直接混合接合技術堆疊最多四個 16 核心晶粒,並透過 3D 交叉開關連接核心與共享 LLC。
- 2 顆可擴充架構中樞(SFH)晶粒,採 Intel 3 製程,集中記憶體控制器與 I/O——概念上與 AMD 自 2019 年 EPYC Rome 以來的 I/O 晶粒如出一轍。
The Register 的深度分析稱之為 Intel 的「Rome 時刻」:歷經 Sapphire Rapids、Emerald Rapids、Granite Rapids 三個世代的 tile 實驗後,Intel 終於乾淨地把運算與 I/O、記憶體解耦,晶粒可以依 SKU 增減、重用。
扇出型架構與 UMA 的抉擇
技術上最關鍵的決定是連接方式。Intel 捨棄自家的 EMIB 2.5D 矽橋封裝,改用走有機基板、UCIe-S 類似的互連——Intel 稱之為「fan-out-fabric(扇出型架構)」。原因在記憶體拓撲:EMIB 的邊對邊連線會讓運算模組與架構中樞之間多繞幾跳。改用扇出型架構後,每個 CBB 都能直連兩顆 SFH 晶粒,讓 Xeon 7 預設呈現均勻記憶體存取(UMA)——不像 Granite Rapids-AP 預設就切成三個 NUMA 節點,還要軟體自己傷腦筋平衡。
快取一致性也搬上晶片。Intel 以晶片內的偵測過濾器(snoop filter)取代原本放在 DRAM 的目錄,在維持完整 ECC 保護的同時降低延遲、減少一致性流量。每個架構中樞另配 16 MB I/O 快取,CXL 記憶體支援單層或平面雙層模式,具備鏡像與各路徑加密。
規格總覽
旗艦配置的數字如下:
- 最多 256 個 P 核心(完全不支援超執行緒——SMT 整個拿掉,要等下一代 Coral Rapids 才回歸)
- 1.28 GB 末階快取(4 × 320 MB CBB)
- 16 通道 DDR5,速率 8,000 MT/s,搭配 Gen 2 MRDIMM 可達 12,800 MT/s——記憶體頻寬最高 1.6 TB/s
- 128 條 PCIe 6.0 / CXL 3.0 / UPI 3 通道(每個架構中樞四個 ×16 埠),外加 8 條 PCIe 4.0 供周邊使用
- TDP 預估約 600 W,與 AMD Venice 旗艦相當
在指令集方面,Xeon 7 是最早完整支援 AVX 10.2 的處理器之一,更新版 AMX 矩陣延伸指令新增 FP8 支援——代表低精度 AI 推論可以直接在 CPU 上跑,不必掛加速卡。Intel 還新增「spill-and-fill」最佳化指令,把整數暫存器從 16 個擴充到 32 個,引進新的三運算元編碼,既有 x86 軟體重新編譯即可相容。
沒有超執行緒,何時是問題、何時不是?
拿掉 SMT 是這顆晶片最有爭議的取捨。在高執行緒吞吐量的工作負載中,AMD 256 核 / 512 執行緒的 Venice 無論誰的核心更強,都可能保有兩位數百分比的優勢。但 Diamond Rapids 明確定位為 HPC 產品,而許多 HPC 程式——包括用來排名全球超級電腦的 Top500 HPL Linpack——對 SMT 受益有限,甚至不進反退。The Register 也猜測 Intel 可能把它包裝成低延遲的代理式沙盒(agentic sandbox)機型:在容器裡執行、編譯 AI 產生的 Python 程式碼,這種場景講究可預測的單執行緒延遲,勝過邏輯核心數。
競爭格局
規格對規格,Diamond Rapids 與 Venice 可說旗鼓相當:兩者都是 256 核心、16 條速率相同的記憶體通道、1 GB 以上的 L3、相近的 I/O 與約 600 W 的 TDP。AMD 的結構性優勢在於 SMT 與市佔氣勢——Venice 同樣排定 2027 年,但 AMD 在伺服器市佔的攻勢從未間斷,Intel 未來一年得靠 Granite Rapids 與 Clearwater Forest 對抗 AMD 的現役世代。
儘管如此,這套架構本身確實是個轉折點。把一致性機制搬上晶片、3D 堆疊、跨入 18A-P 製程,一一補上了 Intel 自 2019 年以來的效率差距。如果 Intel 能用當年 AMD Rome「每美元更多核心」的方式積極定價,Diamond Rapids 有機會讓 2027 年成為多年來第一次真正有看頭的伺服器 CPU 對決。在 AI 建設主宰資料中心、每一瓦與每一條記憶體通道都要錙銖必較的市場裡,這場競爭來得正是時候。
Sources
- [1] https://www.theregister.com/hpc/2026/08/25/intel-diamond-rapids-xeon-7-cpu-deep-dive/5292427
- [2] https://www.servethehome.com/intel-diamond-rapids-the-2027-intel-xeon-at-hot-chips-2026/
- [3] https://www.tomshardware.com/pc-components/cpus/intel-xeon-7-diamond-rapids-comes-with-up-to-256-p-cores-1-28-gb-of-last-level-cache-next-gen-18a-p-cpu-also-brings-avx-10-2-and-uses-ucie-s-instead-of-emib
- [4] https://wccftech.com/intel-diamond-rapids-xeon-7-cpus-256-p-cores-1-28-gb-of-cache-12800-mtps-memory/
- [5] https://newsroom.intel.com/client-computing/intel-outlines-architectures-for-agentic-ai-at-hot-chips-2026