128 核心、3.8 GHz、LPDDR6:Arm Neoverse CSS N4 為 Agentic AI 資料中心獻上半客製化藍圖
Arm 的 Neoverse CSS N4 將單晶片核心數上限翻倍至 128,導入 LPDDR6 與 PCIe Gen 7,並宣稱較 CSS N3 提供最高 2 倍插槽效能與 1.25 倍每瓦效能——一套直接瞄準 Agentic AI 吃重 CPU 工作負載的半客製化捷徑。
2026 年 9 月 8 日,Arm 發表了 Neoverse CSS N4(代號 Ranger)——這是該公司迄今最具彈性的 Compute Subsystem,也是 Arm 迄今對 AI 基礎設施走向最明確的表態:產業正從「單一加速器為中心」的設計思維,轉向由大量半客製化主機 CPU 協同編排的代理式(agentic)架構。
核心規格一目瞭然。CSS N4 可組態範圍從每晶片 8 到 128 個 N4 核心,採 TSMC N3P 製程,時脈最高 3.8 GHz——這是 Arm N 系列子系統的首例。每核心配備 2 MB L2 快取,晶片上共享 L3 最高可達 256 MB。相較前一代 CSS N3,Arm 宣稱插槽層級效能最高 2 倍、每瓦效能 1.25 倍、記憶體頻寬 1.75 倍。
但原始規格只說了一半的故事。真正的策略轉變在於 Arm 選擇連接的東西:LPDDR6 記憶體支援(同樣是 Neoverse CSS 首見)與最高 128 通道的 PCIe Gen 7,外加 CXL 4.0 與快取一致性選項。TechTimes 指出,128 條 PCIe Gen 7 通道足以讓單顆 N4 晶片掛上八條 x16 加速器連結——把主機 CPU 從「餵料給 GPU 的輸送帶」變成真正的密集 AI 叢集協作中樞。
為什麼 Agentic 時代是 CPU 的故事
Arm 這場發表最有趣的部分根本不是晶片,而是工作負載論述。當 AI「從推論走向行動」,代理會推理、檢索資料、呼叫工具、與資料庫及其他代理互動——每一步都產生吃 CPU 的工作:JSON 解析、沙箱執行、鍵值查詢、網路往返、排程器開銷。token 生成的重活仍由 GPU 承擔,但周邊的編排工作全部落在主機 CPU 上。
Arm 的定位反映了業界共同的體認:主機 CPU 層在 AI 伺服器裡長期被視為大宗商品,如今卻成了第一線瓶頸——也是差異化機會。Arm 在共同平台上提供兩條路:CSS N4 給想打造自有差異化晶片的客戶(超大規模資料中心業者、DPU 廠商、網通專家),而 Arm AGI CPU 則給需要回應靈敏的代理式工作負載、直接採用量產晶片的客戶。
AGI CPU 周邊的生態系名單宛如科技業點名簿:OpenAI、Meta、Cloudflare、Oracle、SAP、Lenovo、Supermicro 與 Verda 都被描述為正圍繞它開發解決方案。Google Cloud 正在 Axion 架構的 GKE 上執行代理沙箱;Microsoft Azure 用 Cobalt 200 加速沙箱工具執行;NVIDIA 的 Vera 為代理式工作負載而設計;位元組跳動旗下的火山引擎則正在把首批由 AGI CPU 驅動的代理沙箱推向市場。
半客製化的推銷邏輯
Compute Subsystem 一直是 Arm 對一個難題的答案:自研晶片昂貴又曠日廢時,但現成設計又會浪費效能。CSS 是一套預先整合、預先驗證的平台——核心、互連、記憶體控制器、I/O 一應俱全——合作夥伴可以圍繞自身需求加以組態。Arm 表示 CSS N4 是「迄今最具組態彈性的 CSS」,擁有「從 CSS 到矽晶片的最快路徑」,同時支援單晶片與多 chiplet 設計,鎖定雲端伺服器、網通設備、DPU 與專用加速器。
組態範圍之寬不同尋常:一顆 8 核心的精簡 DPU 晶片和一顆 128 核心的輸送量怪獸,可以共享同一套軟體基礎、IP 驗證與 Total Design 生態系夥伴資源。Arm 還說正在把 Total Design 協作模式——集結 EDA、晶圓代工與設計服務夥伴做早期 IP 驗證——延伸至實體 AI(physical AI),預告機器人與邊緣相關設計即將到來。
脈絡:Arm 在資料中心的動能是真的
Arm 在發表時拋出一個驚人數據:根據 IDC,Arm 架構的機架級伺服器已超越 x86,成為加速運算平台的主流。這個說法值得推敲——「加速運算」是特定市場區隔,x86 在整體裝機量上仍是主流——但它確實反映了一個真實的拐點。AWS Graviton、Google Axion、Microsoft Cobalt 與 NVIDIA Grace/Vera 在短短幾年內,聯手把 Arm 從邊緣選項推向資料中心主流浪潮,而代理式工作負載正是那種突發性強、多行程、I/O 密集的負載型態,Arm 的每瓦效能優勢會在機架規模上複利放大。
競爭背景同樣重要。Intel 與 AMD 並未原地踏步——Granite Rapids 與 Turin 級 x86 處理器持續推高核心數,兩陣營都在講同一套效率敘事。Arm 的賭注是:在代理時代,決勝指標會從「每插槽峰值輸送量」轉向回應靈敏的每瓦效能——主機 CPU 能多快喚醒代理沙箱、服務一次工具呼叫、把資料流給加速器而不讓它停下來。CSS N4 的 3.8 GHz 時脈上限(對 128 核心的效率導向晶片而言相當高)與 LPDDR6 支援,正是衝著這個延遲—頻寬取捨而來。
後續觀察重點
發表之後有三個懸念。其一是落地時程:CSS N4 是設計平台而非量產晶片——客戶晶片通常還要 18 到 30 個月才問世,意味著 N4 架構產品將落在 2028 年區間,屆時要面對 x86 與 RISC-V 陣營的新一代產品。其二是軟體重力:共同的 Neoverse 軟體基礎是 Arm 的護城河,但代理框架每月都在演化,AGI CPU 的「量產就緒」宣稱將受到實際部署多樣性的考驗。其三是功耗天花板:LPDDR6 在記憶體端省電,但 128 核心、3.8 GHz 的 N3P 晶片在密集組態下,封裝與散熱工程將是嚴峻考驗。
目前訊號已經很明確:產業的運算對話正在從「GPU 多大」轉向「整個系統多會編排代理」——而 Arm 剛剛在這個等式的 CPU 側,落下了迄今最激進的一枚棋。
資料來源列於文章metadata。
Sources
- [1] https://newsroom.arm.com/news/arm-agi-cpu-neoverse-css-n4-agentic-ai
- [2] https://www.tomshardware.com/pc-components/cpus/arm-debuts-next-gen-semi-custom-neoverse-css-n4-ranger-platform-compute-subsystem-packs-up-to-128-cores-per-die-on-tsmc-n3p
- [3] https://www.arm.com/products/cloud-datacenter/neoverse-compute-subsystems/css-n4
- [4] https://www.techtimes.com/articles/327003/20260908/arm-neoverse-css-n4-doubles-core-ceiling-adds-lpddr6-pcie-gen-7-ai-servers.htm
- [5] https://aiweekly.co/alerts/arm-debuts-neoverse-css-n4-ranger-with-up-to-128-cores-at-38ghz-on-tsmc-n3p-for