← All posts / Industry

NVIDIA Groq 3 LPX 全面量產:為代理式 AI 時代打造的每秒 3,400 Token 推理機櫃

NVIDIA 源自 200 億美元 Groq 收購的低延遲推理機櫃 Groq 3 LPX 正式進入全面量產,每個機櫃整合 256 顆 LPU 加速器與 128GB 晶片上 SRAM,在 Gemma 4 31B 寫下每秒 3,400 token 的紀錄。Nebius 成為首家採用的 AI 雲,將部署於其 Token Factory 平台。

NVIDIA Groq 3 LPX 全面量產:為代理式 AI 時代打造的每秒 3,400 Token 推理機櫃

本週在帕洛奧圖舉行的 Hot Chips 會議上,NVIDIA 宣布其 Groq 3 LPX——這款源自震驚業界的 200 億美元 Groq 收購案、以機櫃為單位的互動式 AI 推理加速器——已進入全面量產,並由 Nebius 簽下首張 AI 雲客戶合約。這次發表是自 Groq 的 LPU 架構當年以驚人解碼速度打響名號以來,AI 推理市場最重要的一次重塑:這家新創公司強調確定性、以 SRAM 為核心的晶片設計哲學,如今以 NVIDIA Vera Rubin 平台官方擴充元件的身分正式出貨,而 Vera Rubin 正是接替目前驅動多數前沿 AI 工廠的 Blackwell NVL72 世代。

Groq 3 LPX 到底是什麼

Groq 3 LPX 不是另一款 GPU。它是一個專為推理打造的機櫃,設計上與 NVIDIA Vera Rubin NVL72 系統並肩運作,瞄準一個非常明確的瓶頸:token 生成延遲。

代理式 AI(agentic AI)帶來了一個不尋常的運算難題。一個處理複雜任務的代理,可能需要進行數十次甚至數百次連續的模型呼叫——讀檔案、撰寫並測試程式碼、呼叫工具、驗證結果——而每一步都依賴前一步的輸出。延遲不只會在這條鏈上累加,更會直接放大到使用者體驗。一個推理能力頂尖但解碼速度緩慢的模型,只會造就一個反應遲鈍、錯失即時時限的代理。

NVIDIA 的答案是把推理拆成兩個天然的工作分工。Vera Rubin 的 GPU 機櫃負責情境處理(context processing)——吞入長提示詞、大型程式碼庫,以及持續存在的多輪代理狀態。而由 LPU(Language Processing Unit)加速器組成的 LPX 機櫃,則負責解碼階段——也就是 token 逐一生成、原始時脈速度最為關鍵的環節。

機櫃層級的數字相當驚人。每個 Groq 3 LPX 機櫃整合了 256 顆 LP30 加速器,配備總計 128 GB 的晶片上 SRAM——正是當年讓 Groq 原始晶片以低延遲聞名的記憶體技術,因為 SRAM 直接繞過了限制 GPU 解碼效能的 HBM 頻寬天花板。NVIDIA 的規格表列出每機櫃 40 PB/s 的聚合 SRAM 頻寬、640 TB/s 的 scale-up 互連頻寬,全部採用 NVIDIA MGX 機櫃架構與全液冷設計。在單晶片層級,每顆 LP30 加速器內建 500 MB 晶片上 SRAM,頻寬達 150 TB/s。

最關鍵的基準測試:每秒 3,400 token

在 Artificial Analysis 的獨立基準測試中,Groq 3 LPX 執行 Gemma 4 31B(一款開源代理式模型)時,在 100,000 token 的情境長度下,為單一使用者創下每秒 3,400 個輸出 token 的紀錄。NVIDIA 表示這是該模型有史以來最快的紀錄,對延遲敏感的工作負載而言,反應速度比最接近的競爭平台快上約 4 倍。

換個角度理解:前線對話模型串流給人類閱讀的速度通常是每秒 40 到 100 個 token。而自主迭代運作的代理式編碼系統,每秒可消耗數千個 token。在每秒 3,400 token 的速度下,代理可以在幾秒內完成過去需要數分鐘的生成階段——NVIDIA 將此定位為「把數小時的編碼壓縮到數分鐘」。

效率方面的宣稱同樣激進。NVIDIA 預估,在長情境、低延遲配置下運行 2 兆參數模型時,Vera Rubin NVL72 結合 Groq 3 LPX 每兆瓦可提供比 GB200 NVL72 高達 35 倍的推理吞吐量。這項預估值能否在真實工作負載中站得住腳還有待驗證,但方向很明確:AI 工廠現在優化的指標是「每兆瓦每秒 token 數」,而非原始 FLOPS。

Nebius 打頭陣,Groq 自己緊隨在後

從 Yandex 分拆出來的 AI 雲 Nebius,將透過其 Token Factory 推理平台成為首家在正式環境部署 LPX 機櫃的業者。值得注意的是,Nebius 把這次整合定位為對開發者的「非事件」:LPX 加速的模型將在同一個 API 後方運行,提供相同的自動擴展、可觀測性、函式呼叫與結構化輸出——用該公司的說法,這是「換模型的最佳化選項,不是一次遷移」。

「生成是決定 AI 系統反應速度的推理階段,而這正是 NVIDIA Groq 3 LPX 設計來加速的環節,」Nebius 技術長 Danila Shtan 表示。「作為第一家透過 Nebius Token Factory 將其導入正式環境的 AI 雲,我們要讓代理迴圈的每一步都感覺是即時的。」

有個兩年前看似難以置信的轉折:Groq 本身——如今是 NVIDIA 旗下子公司、經營自家推理雲——計畫在 Nebius 之後成為此平台的早期採用者之一。這個曾經的勁敵,同時變成了供應商與客戶。

分析:推理是新的戰場

這裡的策略解讀很直接:NVIDIA 正在代理式工作負載爆發之際,精細切分 AI 工廠市場。過去兩個硬體週期由訓練獨占鰲頭;下一個週期屬於推理,token 經濟學決定誰能獲利。黃仁勳在發布聲明中說得明白:「推理是 AI 的成長引擎……Vera Rubin 以為代理式 AI 時代設計的工作負載最佳化 AI 工廠配置,延伸了這個願景。」

NVIDIA 在 Hot Chips 揭曉的完整 Vera Rubin 平台,是該公司所謂「極致協同設計」(extreme codesign)的展演——7 顆晶片、5 種專屬機櫃,涵蓋負責代理迴圈中編排密集工作的 Vera CPU 機櫃、BlueField-4 DPU、Vera BlueField-4 STX 儲存、Spectrum-6 SPX Ethernet,以及如今的 LPX 推理機櫃。同一場活動還傳出 CoreWeave 已將 Spectrum-X Multiplane 導入正式環境串連 Vera Rubin 機櫃,而 SpaceXAI 將以 Vera CPU 打造下一代代理式 AI 架構——包括規劃中的軌道資料中心。

對買家而言,有一個警訊為這股熱情降溫:這次發表距離 NVIDIA 警告超大規模客戶 2027 年初起 Rubin 與 Blackwell 系統將漲價逾 15% 的報導僅數天,主因是連 75% 的毛利率都無法消化的飆漲記憶體成本。尖端推理吞吐量正在到來——但帳單也在上漲。

接下來的發展值得密切關注。如果 LPX 等級的解碼效能成為代理式服務的預設標準,只依賴 GPU 的推理業者將面臨更沉重的競爭壓力,而「每兆瓦每秒 token 數」可能成為產業的決定性基準——推理時代的等價物,正是定義過去三年 AI 硬體競賽的訓練 FLOPS 之戰。