Intel 256 核心 Xeon 7「Diamond Rapids」:遲到三年的 Rome 時刻,為 AI 時代而生
在 Hot Chips 2026 上,Intel 詳細揭露 Xeon 7「Diamond Rapids」:最多 256 個 P 核心、22 顆晶片堆疊、FP8 矩陣加速、16 通道 DDR5-8000 與 1.28GB L3 快取——史上最先進的 Xeon,但要等到 2027 年才會出貨。
Intel 在 Hot Chips 2026 的簡報裡藏著一種特殊的諷刺。這家曾經嘲笑小晶片(chiplet)是取巧之計、其單晶粒 Xeon 連續七年被 AMD 分離式 Epyc 架構壓著打的公司,終於做出了一顆在封裝層級上看起來酷似 2019 年 Epyc 的伺服器 CPU。但掀開這個熟悉的輪廓,Xeon 7「Diamond Rapids」其實是 Intel 從未出貨過的東西:一顆完全模組化、3D 堆疊、256 核心並內建 AI 矩陣加速的伺服器處理器,採用最先進的 18A-P 製程。而且,一如既往地遲到——原訂 2026 年推出,現在確定延至 2027 年。
Intel 究竟展示了什麼
Diamond Rapids 原本應在今年以最多 192 核心問世。在 Hot Chips 上,Intel 揭曉旗艦型號將直接把 256 個效能核心(P-core)塞進單一插槽,在高階市場追平 AMD 第六代 Venice Epyc。The Register 在深度解析中稱之為 Intel 的「Rome 時刻」——借指 AMD 當年靠 Epyc Rome 終於讓小晶片架構全面成功的那一代產品,只不過 Intel 晚了大約七年才迎來這一刻。
整個封裝確實精巧。最多 22 顆晶片,分為三種角色:
- 16 顆運算晶粒(core compute die),採用 Intel 最先進的 18A-P 製程(Panther Lake 率先導入的改良版 2nm 級節點),每顆最多 16 核心
- 4 顆「運算積木」(CBB)基礎裸晶,採用 Intel 3-T 製程,承載全部 L3 快取——每顆 CBB 有 320MB,頂級型號合計 1.28GB 的最後階層快取
- 2 顆網狀樞紐裸晶(fabric hub),採用 Intel 3 製程,集中管理記憶體控制器與 I/O
運算晶粒透過 Foveros 3D 直接混合鍵合堆疊在基礎裸晶上,而運算模組與網狀樞紐之間則以基板銅線走 UCIe-S 互連——Intel 稱之為「fan-out-fabric」。這個選擇有其深意:若採用 EMIB 矽橋,就必須進行邊對邊連接並增加額外跳躍。扇出式架構讓 Xeon 7 開箱即具備一致性記憶體存取(UMA),修正了 Granite Rapids-AP 預設呈現為三個 NUMA 節點的實際痛點。
不管承不承認,它就是為 AI 而生
與 AI 最相關的一項規格藏在指令集裡:AMX 矩陣延伸新增 FP8 支援,並配備完整的 AVX 10.2 與擴充向量指令。FP8 正是現代 AI 推論的主力數值格式——NVIDIA Rubin GPU 的 MXFP4 與之並行,OpenAI 的 Jalapeño 晶片基準測試也以它計算。一顆能處理 FP8 矩陣運算的通用 CPU,對 AI 服務的「GPU 卸載」層至關重要:tokenization、嵌入、路由、KV-cache 管理,以及永遠不值得動用專用加速器的小批次推論。
平台規格讀起來像是對記憶體饑荒時代的直接回應。兩顆網狀樞紐提供 16 通道 DDR5-8000——搭配 MRDIMM 可達 12,800 MT/s——供應一個設計頻寬高達 1.6 TB/s 的記憶體子系統。I/O 涵蓋 128 條 PCIe 6.0 / CXL 3.0 / UPI 3 通道外加 8 條 PCIe 4.0,CXL 記憶體支援單層或平面雙層模式(含鏡像),記憶體加密引擎同時覆蓋 DDR 與 CXL 路徑。每顆樞紐還配備 16MB I/O 快取與兩組內含 QAT、DSA、IAA 的加速器複合體。
在 DRAM 大缺貨的一年裡——伺服器記憶體合約價飆漲 50-90%,超大規模雲端業者才剛被預告 AI 伺服器將漲價 15% 以上——一顆能 pooling 並加密 CXL 記憶體的 CPU 絕非紙上談兵。它是對資料中心物料成本清單中最昂貴項目的避險。
Intel 還新增了所謂的spill-and-fill 最佳化指令:新增 16 個通用暫存器使整數暫存器總數達 32 個、為 r16 至 r31 引入新編碼、加入三運算元指令,且現有 x86 軟體無需修改原始碼即可重新編譯。快取一致性也移入晶片內——原本存放於 DRAM 的目錄狀態被片上快取過濾器(snoop filter)取代,在維持完整 ECC 保護的同時降低延遲、減少一致性流量。
三個但書
而且個個致命。
沒有超執行緒,沒有主流型號。 Diamond Rapids 完全捨棄 SMT,支援雙插槽的八通道「-SP」版本也在今年稍早被取消,只剩高核心數的 AP 變體。這意味著 DMR 不會在全線市場與 AMD 競爭——只在最頂端的 HPC 區段。經營通用虛擬化機群的企業用戶(Xeon 業務的傳統核心)得等 Coral Rapids,它將找回超執行緒,而且正成形為一個龐大的產品家族。
時程本身就是問題。 2027 年上市意味著 Diamond Rapids 屆時面對的將是 AMD 對 Venice 的下一代回應,而非 Venice 本身——而 AMD 在核心數與能效上已領先多個世代。ServeTheHome 指出,256 核心組態「看起來是最近才加入路線圖的」——這暗示 Intel 是在追趕對手的規格表,而非設定規格表。時脈、全新 P 核心的 IPC 增益、快取階層的多數細節,目前全都未知。
大環境殘酷。 這是一家代工野心正在重組、前幾代旗艦接連延期、工程團隊經歷多輪裁員的公司——The Register 那句「給公司碩果僅存的工程團隊時間打磨」之所以刺耳,是因為它精確。DMR 是 Intel 史上最先進的 Xeon,這是貨真價實的技術成就;但它同時也是對七年 Epyc 壓力最低限度的可信回應。
為什麼它依然重要
放下看好戲的心態,Diamond Rapids 對 AI 基礎設施市場有三個意義。
第一,CPU 正被重新定位為 AI 技術棧的一環,而不只是 GPU 的宿主。FP8 AMX、1.6 TB/s 記憶體頻寬、CXL pooling 與樞紐上的加速器,全都瞄準推論周邊的工作負載。每家廠商都從不同角度收斂到同一個論點——NVIDIA 有 Vera CPU 與 DSX,AMD 有緊密耦合的 GPU-CPU 一致性,現在 Intel 則交出具備矩陣運算能力的通用核心。
第二,18A-P 伺服器級量產是對 Intel 代工故事的公投。如果 18A-P 在伺服器量產規模下兌現宣稱的 18% 功耗降低(或同等功耗下 9% 效能提升),它將實質強化「Intel 製程翻身是真的」這個論述。如果不能,再多小晶片的巧思也救不了路線圖。
第三,在記憶體受限的世界裡,UMA 與 CXL 的價值被放大。當一座機架級 AI 系統搭載超過 20TB 的 HBM、DRAM 價格成為全產業最痛的抱怨時,一個圍繞一致性記憶體存取與彈性 CXL 記憶體層設計的 CPU 架構,處理的正是 2026-2027 年部署的真實瓶頸,而非理論瓶頸。
Diamond Rapids 不會決定 Intel 的命運;任何單一晶片都早已錯過那個能翻轉全局的窗口。但它是最清晰的證據,證明 Intel 已經學會 Epyc 時代的架構課程——模組化、功能分解、3D 封裝、工作負載專屬加速——而且能在最先進製程上執行。市場接下來要花十八個月追問的問題是:當發明這套打法的對手已經演到下一幕時,2027 年才到來的 Rome 時刻,還算不算數?
Sources
- [1] https://www.theregister.com/hpc/2026/08/25/intel-diamond-rapids-xeon-7-cpu-deep-dive/5292427
- [2] https://www.servethehome.com/intel-diamond-rapids-the-2027-intel-xeon-at-hot-chips-2026/
- [3] https://aiweekly.co/alerts/intel-bumps-xeon-7-diamond-rapids-to-256-cores-slips-to-2027
- [4] https://www.igorslab.de/en/intel-diamond-rapids-xeon-7-256-p-cores-128-gb-last-level-cache/