← All posts / Tools

N3P 製程塞進 128 核心、每瓦效能再省 20%:Arm Neoverse CSS N4「Ranger」改寫半客製化伺服器晶片規則

Arm 的 Neoverse CSS N4「Ranger」運算子系統可在台積電 N3P 上實現單晶片 8 至 128 個 N4 核心,支援 LPDDR6、256MB L3 快取與 128 條 PCIe 7 通道,效能較 CSS N3 翻倍;同場 Arm 更宣布 Oracle 與位元組跳動火山引擎加入 AGI CPU 生態系,為代理式 AI 鋪路。

N3P 製程塞進 128 核心、每瓦效能再省 20%:Arm Neoverse CSS N4「Ranger」改寫半客製化伺服器晶片規則

本週 AI 新聞版面大多被模型發布佔據,但 Arm 低調地發表了本月份影響力數一數二的基礎設施公告。9 月 8 日,在中國「Arm Everywhere」活動登場的同時,Arm 正式推出 Neoverse CSS N4,代號 Ranger — 這是該公司迄今可組態性最高的運算子系統(Compute Subsystem),在台積電 N3P 製程上實現單晶片最多 128 個核心。同場公告中,Arm 也確認 Oracle Cloud Infrastructure 與位元組跳動旗下的火山引擎(Volcano Engine),加入 OpenAI、Meta、Cloudflare、SAP 與 Lenovo 的行列,圍繞 AGI CPU 打造方案。

對於關注代理式 AI(agentic AI)時代算力究竟從何而來的人來說,這才是新聞底下的真正故事。

Arm 到底發布了什麼

運算子系統(CSS)並不是一顆你能在市面上買到的晶片。它是 Arm 的半客製化(semi-custom)方案:一套經過驗證、預先整合的平台,包含 CPU 核心、互連架構、快取階層、記憶體控制器與 I/O,合作夥伴可以在投片之前自行組態——核心數量、快取大小、連接性——再疊上自己的專屬設計。今天 Azure、AWS Graviton 與 Google Axion 機群裡跑的 CPU,背後就是同一套機制。

Neoverse CSS N4 是 N 系列(效率優化)產品線對 CSS N2 的接棒之作,規格表讀起來就像直接回應代理式工作負載對資料中心 CPU 的衝擊:

  • 單晶片 8 至 128 個 Neoverse N4 核心(核心代號 Dionysus),時脈最高 3.8 GHz——附帶但書:核心數越多,峰值時脈想必會往下修
  • 每晶片最高 256 MB 共享 L3 快取,相較 CSS N2 的 64 MB 大幅躍進
  • 每核心最高 2 MB L2 快取(是 CSS N2 的兩倍),外加每核心 64 KB L1 指令快取與 64 KB L1 資料快取
  • 支援 DDR5 或 LPDDR6 記憶體——LPDDR6 是該平台首見,對受每瓦吞吐量約束的部署來說是有感的選項
  • 最高 128 條 PCIe 7/6 通道與 CXL 4.0,前一世代為 64 條 PCIe 5
  • 多 chiplet 與多插槽擴充可突破單晶片 128 核上限,支援 UCIe 晶片對晶片互連,以及 Arm 所稱的「合作夥伴專屬 PHY」

對比 CSS N3,Arm 宣稱的數字是:插槽級效能 2 倍、每瓦效能 1.25 倍、記憶體頻寬 1.75 倍。Tom’s Hardware 指出,這些數據是以 128 核心、3 GHz、啟用完整每核心 2 MB L2 的組態量測的。

為什麼 N 系列此刻重要

Arm 的 Neoverse 產品線分為 V 系列(極致效能——Nvidia Grace 與 AWS Graviton 的血統)與 N 系列(每瓦效能)。過去 N 系列核心多半落在基礎設施處理器與效率級雲端實例——想想 Azure Cobalt 100(N2)或 Intel IPU Adapter E2100(N1)——而非旗艦伺服器 CPU。

這個定位正是 CSS N4 有意思的地方。Arm 在公告中的論述是:代理式 AI——會推理、檢索資料、呼叫工具、查詢資料庫、與其他代理溝通的 agent——正把可觀的運算量從加速器移回通用 CPU。橫向擴充的資料平面服務要的是吞吐效率;這正是 N 系列的主場。Arm 宣稱 Arm 架構機架式伺服器已超越 x86,成為加速運算平台的主流,如今提供兩條上路徑:用 CSS N4 自研晶片,或直接採用基於 V3 核心的現成 AGI CPU 晶片。

AGI CPU 那半場公告自帶份量。Arm 揭露 火山引擎——位元組跳動的雲端部門——正在該平台上打造次世代雲服務,並將「首批由 Arm AGI CPU 驅動的代理式沙箱」推向市場;Oracle Cloud Infrastructure 也加入了生態系。加上先前已點名的 OpenAI、Meta、Cloudflare、SAP 與 Lenovo 部署,這個從 IP 授權起家的故事,已經變成一份客戶名單短得驚人、卻涵蓋全球最大運算買家的晶片平台故事。

但書與細節

頭條數字旁邊,有幾個誠實的提醒得放上桌。第一,CSS N4 是發布給「造晶片的人」的公告,不是給買晶片的人——Arm 尚未公布任何 CSS N4 客戶,而 N 系列產品通常在平台發布後一個設計週期才會問世。照慣例,CSS 平台只需要少數幾張大合約就能發揮影響力,但這些合約目前尚未披露。

第二,2 倍/1.25 倍/1.75 倍是廠商對自家前一代的宣稱值,且是在特定組態下量測。第三,效率級產品在代理式服務堆疊中對上 x86 現狀仍需證明自己——在這類工作負載profile 下,記憶體頻寬與 I/O 通道數(兩者在此都翻倍)可能比原始核心數更關鍵。

競爭脈絡也值得一提:Arm 的 2024 路線圖早已預告 CSS V4(代號 Vega)與這次 N4 世代並行,所以 Ranger 是雙管齊下平台更新的一半,而非全貌。

為什麼重要

過去兩年,AI 基礎設施的敘事對 GPU 執迷不悟。更安靜的趨勢是:一旦模型不再是聊天介面、而開始執行動作,加速器底下的 CPU 機群就必須成長——更多協調、更多資料搬移、每機架更多並行程序。如今每一超大規模資料中心業者,不是自研 Arm 客製晶片,就是採購 Arm 架構的量產晶片;Arm 對這股需求的回應,是把兩條路都變便宜——用史上最快 CSS 到投片路徑做客製晶片,以及給其他人現成的 AGI CPU。

對半導體產業來說,CSS N4 也是對製程領先地位的宣示:N3P 上 128 顆效率核心、LPDDR6 與 PCIe 7 的組合,落在合作夥伴晶片問世時大約是 2027 年前後的產品,而它將進入一個「每瓦效能除以每個 agent」開始出現在採購對話裡的市場。

代理式時代,說到底,有一部份是 CPU 銷售故事。Arm 只是把它說白了。