Raptor 住進 AI 工廠:d-Matrix 的 3D DRAM 推論晶片正式插進 NVIDIA 機架
d-Matrix 將透過 NVLink Fusion 把 Raptor XPU 整合進 NVIDIA MGX 機架,與 Vera CPU、Spectrum-X 網路搭配,自 2027 年第四季起提供高階低延遲 token 服務。
七年前,d-Matrix 執行長 Sid Sheth 創立公司時押注的是:推論(inference)而非訓練,將成為 AI 運算的最大成本。2026 年 9 月 10 日,他簽下了讓自家晶片住進昔日對手機房的合約:d-Matrix 宣布與 NVIDIA 展開多年期合作,下一代 Raptor 推論 XPU 將透過 NVLink Fusion 直接整合進 NVIDIA 的 MGX 機架級架構,預計 2027 年第四季初步供貨。
這項經由 PR Newswire 發布、並登上 NVIDIA 官方新聞室的消息,讓一家原本身分是「NVIDIA 挑戰者」的新創,正式成為 NVIDIA AI 工廠生態系的一員——這也是迄今最明確的訊號:AI 推論市場正在走向分層、異質化的架構,而不是一個 GPU 贏者全拿的市場。
官方宣布了什麼
這樁合作的核心,是一套 NVLink Fusion 賦能的機架級系統,讓 AI 實驗室、超大規模雲端業者(hyperscaler)與新興雲(neocloud)能無縫部署所謂的「高階 token 服務」。d-Matrix 不必自建液冷機架、不必獨自在資料中心搶地盤,而是把 Raptor XPU 托盤(tray)直接插入 NVIDIA 已在全球出貨的 NVL144 MGX 機架架構。
整合後的系統簡直是一幅 NVIDIA 全家福:NVIDIA Vera CPU、NVLink 交換器、BlueField-4 DPU、ConnectX-9 SuperNIC 與 Spectrum-X 以太網路,而 d-Matrix Raptor XPU 就安裝在原本屬於 Vera-Rubin GPU 的運算托盤裡。單一機架可容納 144 顆 Raptor XPU。連接方案合作夥伴 Astera Labs——本身就是 NVLink Fusion 生態系的重要玩家——將提供客製化連接晶片,確保 d-Matrix 托盤與機架其餘部分之間的資料流暢通無阻。
對 d-Matrix 而言,加入而非對抗的經濟邏輯再清楚不過。「這次與 NVIDIA 的合作,是我們邁向『人人可用的無限推論』之旅的決定性時刻,」Sheth 在聲明中表示。「透過 NVLink Fusion 整合進 NVIDIA 最新的 MGX 機架級基礎設施,意味著我們的客戶可以在廣泛部署的 NVIDIA AI 工廠平台上,同步部署我們的推論 XPU。」
黃仁勳則把這樁合作定位為平台策略,而非對競爭對手的施捨:「NVLink Fusion 讓合作夥伴能將客製化晶片整合進 NVIDIA 深厚的 NVLink、先進封裝、機架級系統與網路技術生態系。隨著 NVIDIA AI 基礎設施部署於全球雲端與在地資料中心,NVLink Fusion 為像 d-Matrix 這樣的夥伴提供了一條與 NVIDIA 運算平台無縫整合的路徑——為打造下一代 AI 工廠的客戶擴展加速器選擇。」
為什麼是記憶體中心推論晶片?
d-Matrix 成立於 2019 年,「那時沒多少人知道推論是什麼」,Sheth 本週向記者與分析師簡報時如此回憶。公司的核心主張是記憶體中心運算(memory-centric computing):與其在離散 DRAM 和 GPU 運算單元之間來回搬運權重,d-Matrix 把 SRAM 與 3D 堆疊 DRAM 直接與運算融合。該公司宣稱,其成果是推論工作負載最快可達純 GPU 部署的十倍速度,且能耗大幅降低。
這樁合作的時機絕非偶然。過去十二個月,Agentic AI 工具——Anthropic 的 Claude Code、編碼代理、語音助理、即時聊天機器人——把低延遲推論需求推到「爆表」,Sheth 說。每秒每用戶 token 數正在成為產品賣點,而非後端指標。網路安全應用(回應延遲直接等於災害範圍)又添了一波需求。
第一款產品 Corsair 於 2026 年 6 月進入量產,累積資金超過 5 億美元,投資者包括微軟創投 M12。Raptor 是後繼產品,也是這樁 NVIDIA 合作的主角。
Raptor 內部:一顆「兩層樓」的晶片
Raptor 以首創的 3D DRAM 堆疊技術延伸記憶體中心架構:把 DRAM 記憶體晶片與 SRAM 運算晶片疊合成單一「兩層樓」封裝。技術細節已由 IEEE 發表,並由 d-Matrix 共同創辦人暨技術長 Sudeep Bhoja 在 Hot Chips 2026 預先披露:台積電 4 奈米運算裸晶以 36 微米間距熔合在客製 DRAM 裸晶之上,提供每秒 100 TB 的記憶體頻寬——這正是超低延遲解碼得以實現的關鍵規格。
根據 The Next Platform 的報導,一整架 Raptor 晶片每張卡提供 2.3 TB 的 3D 堆疊 DRAM,單機架聚合記憶體頻寬達每秒 7.2 PB,並可作為 NVIDIA Vera-Rubin GPU 機架的配套機架運作。在 Hot Chips 上,d-Matrix 展示了 Z.ai 的 GLM 5.2 達到約每秒 3,000 token(每用戶)、Moonshot AI 的 Kimi K3 達到每秒 1,000 token 的成績,並宣稱可擴展至八個機架。
異質部署中的分工才是真正的產品:GPU 擅長運算密集的預填(prefill)階段,即處理上下文的階段;Raptor 則加速延遲敏感的解碼(decode)階段,即模型輸出回應的階段。採用異質分離(heterogeneous disaggregation)的營運商可以把工作負載在 d-Matrix Raptor XPU 與 NVIDIA Vera Rubin 之間拆分,針對推論的每個階段分別最佳化。
高階 token 經濟崛起
這樁合作背後的商業邏輯,是雙層 token 市場的成形。大宗 token——批次分析、背景處理——哪裡便宜就跑哪裡。互動式 token——即時補全的編碼助理、必須以對話節奏回應的語音代理、每一百毫秒延遲都會被使用者感受到的聊天機器人——則值得溢價。
d-Matrix 與 NVIDIA 聯手鎖定的正是這個高階市場。NVIDIA 的 AI 工廠業務正在快速擴張:財務長 Colette Kress 在 2027 會計年度第二季財報電話會議上表示,每 GW 的營收機會已從 Grace-Hopper 時代(2022 年機架級系統)的約 180 億美元,成長到即將推出的 Vera-Rubin 系統的約 400 億美元。d-Matrix 實際上是在報名,要從這塊不斷變大的餅的內部分一杯羹。
NVIDIA 資料中心 GPU 業務首席產品行銷經理 Jesse Clayton 將這套架構描述為「垂直整合,但水平開放」——合作夥伴可以隨意取用 NVIDIA 技術堆疊的多或少,並透過 NVLink Fusion 介面接入自家晶片。用他的話說,這個平台「完全可替換」(completely fungible)。
分析:合作性競爭成為官方策略
這樁交易最重要的意涵,在於它揭示了 NVIDIA 的策略——以及正面挑戰 NVIDIA 的極限。
對 NVIDIA 而言,每一個 NVLink Fusion 夥伴同時是被化解的競爭者與被強化的護城河。d-Matrix 的 XPU 將在 NVIDIA 設計的機架裡出貨,用 NVIDIA 的互連技術連接,在 NVIDIA 的 AI 工廠軟體中管理,並賣進 NVIDIA 的客戶群。無論哪家的晶片在某個工作負載勝出,NVIDIA 都能收割生態系營收。這與公司在邊緣運算上與聯發科的合作是同一套劇本,也延續了 2026 年 7 月 NVIDIA 與 d-Matrix 的聯合推論系統合作——今天的宣布將其升級為正式的多年期產品路線圖。
對 d-Matrix 而言,這是一場以依賴換取通路的交易。自建機架(透過 4 月收購 GigaIO 的資料中心業務,以及與 Arista、Broadcom、Supermicro 共同打造的 SquadRack 參考設計)始終是選項,Sheth 也承認 Raptor「需要一個容身之所」。但 NVIDIA 的房子已經部署在全球每一座主要資料中心,有成熟的液冷供應鏈和超大規模業者信賴的營運手冊。「我們把 Raptor 托盤插進同樣廣泛部署於眾多資料中心的 NVL144 MGX 機架架構,就能即時取得這些資料中心的入場券,」Sheth 向 The Next Platform 表示。
對整體市場而言,這樁交易正式確認了營運商一年來的訊號:推論正在走向異質化。「機架」比「晶片」更重要,贏家將是能夠依工作負載階段混合運算類型的廠商。至於 Raptor 排到 2027 年第四季的供貨時程——距今還有一年多——屆時會不會落入一個已轉向其他記憶體堆疊方案(Ferrocompute 的鐵電方案、Positron 的記憶體優先加速器、Kepler Computing 的運算記憶體)的市場,仍是未定之數。但憑藉超過 100 項專利、在超大規模業者與前沿實驗室的正積極評估,以及如今 NVIDIA 自家機架架構作為通路,d-Matrix 已為自己買到了一張它原本立志要顛覆的牌桌的座位。
Sources
- [1] https://www.prnewswire.com/news-releases/d-matrix-adopts-nvidia-nvlink-fusion-rackscale-infrastructure-for-ultra-low-latency-ai-inference-302875104.html
- [2] https://www.nextplatform.com/compute/2026/09/10/startup-d-matrix-will-pair-its-raptor-memory-based-xpu-to-nvidia-rackscale-iron/5295601
- [3] https://nvidianews.nvidia.com/news
- [4] https://www.unite.ai/d-matrix-connects-raptor-xpus-to-nvidia-ai-factories-via-nvlink-fusion/