NVIDIA Groq 3 LPX 進入全面量產:每秒 3,400 Token,AI 推論的解構時代來臨
NVIDIA 在 Hot Chips 2026 宣布 Groq 3 LPX 推論機架進入全面量產,在 Gemma 4 31B、100K 上下文下創下每秒 3,400 個輸出 token 的紀錄——Nebius 成為首個導入的雲端客戶,SpaceXAI 則宣布採用 Vera CPU 打造次世代 AI 架構。
NVIDIA 正式翻開 AI 推論市場的新頁。本週在帕羅奧圖舉行的 Hot Chips 2026 上,這家晶片巨頭確認:源自 200 億美元 Groq 收購案的機架級低延遲推論加速器 Groq 3 LPX 已進入全面量產,並由新創雲(neocloud)業者 Nebius 簽下首張雲端客戶合約。Artificial Analysis 的獨立測試顯示,該系統在 100,000 token 上下文視窗下執行開源模型 Gemma 4 31B 時,達到每秒 3,400 個輸出 token 的紀錄——NVIDIA 表示,這比最接近的競爭平台快上約 4 倍。
對一個經濟重心正從訓練轉向服務的產業來說,這不是一次小小的提速。這是迄今最明確的訊號:推論正在成為一個解構化、專業化的市場——而 NVIDIA 打算吃下每一層。
NVIDIA 到底宣布了什麼
Groq 3 LPX 是 NVIDIA 旗艦 Vera Rubin 資料中心平台的專用擴展。它不是 GPU,而是由 LP30 LPU 加速器組成——承襲 Groq 原始「語言處理單元」設計的確定性、重 SRAM 處理器——每個機架最多搭載 256 顆 LPU,透過超高頻寬晶片互連串聯。
這個架構的決定性特徵是晶片上記憶體。每顆 Groq 3 LPU 內建 500 MB SRAM,整個機架合計 128 GB SRAM、40 PB/s 的聚合晶片內頻寬——相較之下,同級 HBM GPU 系統約僅 1.6 PB/s。一個 70B 參數的 FP8 模型可以完整塞進單一機架的 SRAM 裡,這正是「解碼」(decode,模型逐一生成 token 的推論階段)能跑得這麼快的原因。機架級 AI 推論算力達 315 PFLOPS;NVIDIA 在 GTC 公布的資料則顯示,每顆 LPU 的 8 位元系統級推論算力約 1.2 PFLOPS。
整機由 32 台液冷 1U 運算托盤組成,每台整合八顆 Groq 3 LPU 加速器與宿主 CPU,並直接嵌入 Vera Rubin 平台家族——與負責大規模上下文處理的 Vera Rubin NVL72 機架(Rubin GPU + Vera CPU)搭配運作。
為什麼解碼延遲是新的瓶頸
要理解 NVIDIA 為何在去年 12 月豪擲 200 億美元收購 Groq——並把創辦人 Jonathan Ross 與總裁 Sunny Madra 一併納入麾下——你得先理解代理式 AI 如何改變了推論。
代理(agent)不只是回答問題。它會推理、規劃、撰寫並執行程式碼、檢查系統檔案、在持續循環中呼叫第三方工具,而且常常橫跨數萬 token 的上下文。每一步都以一次一個 token 的方式生成回應。解碼階段的微小延遲會在鏈條的每一步被放大:每步卡個五秒,複雜工作流程就從幾分鐘拖成一小時。NVIDIA 的說法是:過去需要數小時的多步驟代理任務,現在可以幾分鐘內完成。
LPX 的答案是工作負載解構(disaggregation)。Rubin GPU 負責預填(prefill)——接收並處理龐大的上下文視窗——LPX 加速器則承接對延遲敏感的解碼。兩者協同運作為統一的推論引擎,目的正是消除吞吐量與回應速度之間的傳統取捨。
Nebius 打頭陣,SpaceXAI 背書
Nebius 是第一家承諾採用此平台的 AI 雲。它將在自家生產級推論平台 Nebius Token Factory 中部署 Groq 3 LPX,與 Vera CPU、Rubin GPU 並列。
「生成階段決定了 AI 系統實際的回應速度,而這正是 Groq 3 LPX 要加速的對象,」Nebius 技術長 Danila Shtan 說。「作為第一個透過 Nebius Token Factory 將它推向生產環境的 AI 雲,我們要讓代理循環的每一步都感覺是即時的。」
這份背書的分量在於:Nebius 這類把 AI 算力出租給開發者的新創雲,正是靠 token 經濟學生存的客戶。如果 LPX 機架兌現承諾的回應速度,其他以推論為主的雲端業者很快就會跟進。
NVIDIA 同時也拿下另一種旗艦級客戶宣布:SpaceXAI 表示將以 Vera Rubin 平台打造次世代 AI 架構,部署 Vera CPU 來處理代理式 AI 中吃 CPU 的那一側——編排、工具呼叫、程式碼執行、資料處理與模擬——範圍橫跨地面資料中心與軌道衛星。另一方面,CoreWeave 已將 NVIDIA 的 Spectrum-X Multiplane 以太網路架構投入生產,以並行交換路徑串連 Vera Rubin 機架,朝 512,000 GPU 的叢集規模推進。
經濟學:Token 工廠與每百萬 45 美元的問題
NVIDIA 在 Hot Chips 的更大論述是「token 工廠」——以每 token 最低成本將算力轉化為智慧(與營收)的基礎設施。該公司稍早在 GTC 的資料宣稱,Groq 3 LPX 機架搭配 Rubin NVL72 系統,可以在 1 兆參數的 GPT 級模型上以 45 美元生成一百萬個 token。把這件事與本週另一則消息放在一起看——NVIDIA 已警告超大規模客戶,2027 年初起 Rubin 與 Blackwell 系統價格將調漲 15% 以上,原因是 DRAM 成本連 75% 毛利率都吸不住——戰略圖像瞬間清晰:NVIDIA 一邊為解碼工作負載提供差異化矽晶片,一邊對通用艦隊漲價。
這是一套兩面作戰的策略,競爭對手必須接招。Cerebras 正以晶圓級 CS-4 系統推自己的解構式推論;AMD、AWS Trainium 與 Google TPU 都瞄準同樣的推論轉移。NVIDIA 的賭注在於:把算力、網路與推論加速協同設計成一個系統——Spectrum-X 負責資料搬移、Rubin 負責上下文、LPX 負責生成——讓整座工廠、而不只是單顆晶片,都留在自家生態系裡。
後續觀察
三件事將決定 Groq 3 LPX 是重塑市場,還是淪為高階利基。第一,供貨:全面量產已宣布,但透過 Nebius 等新創雲的實際部署時程才是真正的考驗。第二,價格轉嫁:在 2027 年出貨系統面臨 15% 以上漲價的陰影下,LPX 的 token 經濟學能否撐過標價衝擊,將決定採用速度。第三,競爭對手的回應:Cerebras、AMD 與自研晶片陣營現在有了明確的標靶——100K 上下文下每秒 3,400 個 token。
不再有爭議的是方向。推論正裂解為預填與解碼兩塊,而解碼市場屬於能讓代理「感覺即時」的那一方。正如黃仁勳所說:「我們以 LPX 推進效能前沿,實現超快 token 生成。這將改變智慧的生產方式。」
來源
- NVIDIA 部落格 — NVIDIA Advances Vera Rubin Inference With New LPX and CPX Platforms
- SiliconANGLE — Nvidia’s dedicated inference accelerator Groq 3 LPX enters full production
- NVIDIA 開發者部落格 — Inside NVIDIA Groq 3 LPX
- Tom’s Hardware — Nvidia Groq 3 LPU and Groq LPX racks join Rubin platform
- NVIDIA — Groq 3 LPX 產品頁
Sources
- [1] https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/
- [2] https://siliconangle.com/2026/08/24/nvidias-dedicated-inference-accelerator-groq-3-lpx-enters-full-production-to-supercharge-ai-agents/
- [3] https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
- [4] https://www.tomshardware.com/pc-components/gpus/nvidia-groq-3-lpu-and-groq-lpx-racks-join-rubin-platform-at-gtc-sram-packed-accelerator-boosts-every-layer-of-the-ai-model-on-every-token
- [5] https://www.nvidia.com/en-us/data-center/lpx/