← All posts / Models

NVIDIA Groq 3 LPX 進入量產:Agentic AI 時代的 3,400 Tokens/秒推論引擎

NVIDIA 以 200 億美元收購 Groq 團隊後的首款產品 Groq 3 LPX 推論機架正式進入量產,每座機架整合 256 顆 LPU 加速器並與 Vera Rubin NVL72 協同部署,在 Gemma 4 31B 上創下每秒 3,400 輸出 tokens 的紀錄,Nebius 成為首家採用的 AI 雲。

NVIDIA Groq 3 LPX 進入量產:Agentic AI 時代的 3,400 Tokens/秒推論引擎

Rubin 時代最重要的晶片故事,剛從投影片變成實際出貨的硬體。NVIDIA 宣布旗下互動式推論加速器 Groq 3 LPX 正式進入全面量產——這是去年那樁震驚業界的 Groq 收購案之後,NVIDIA 推出的第一款產品。首家客戶是 AI 雲服務商 Nebius(由 Yandex 前基礎設施部門獨立而來),將在旗下 Token Factory 推論平台中部署 LPX 機架,與 Vera CPU 及 Rubin GPU 並列運行。

對所有關注 AI 基礎設施競賽的人而言,這是一個分水嶺時刻:NVIDIA 首次將其機架級 GPU 帝國與 Groq 以 SRAM 為核心的確定性 LPU 架構融合為單一商業平台,也是這樁 200 億美元人才收購(acqui-hire)開始兌現價值的第一份實證。

Groq 3 LPX 究竟是什麼

NVIDIA 將 LPX 定位為 Vera Rubin 平台的「延伸」而非 GPU 的替代品,分工非常清晰:

  • Vera Rubin NVL72 仍是各種 AI 工廠通用的訓練與推論主力。
  • Groq 3 LPX 則專為一件事而生:超高速 token 生成——即輸出 token 串流給單一使用者或 Agent 的速率。

每座 LPX 機架整合 256 顆 LPU 加速器、128 GB 晶片上 SRAM,以及 640 TB/s 的 scale-up 頻寬,採用 NVIDIA MGX 機架架構全液冷設計,可與 Vera CPU 機架、Vera BlueField-4 STX 儲存及 Spectrum-6 SPX Ethernet 交換器無縫搭配。NVIDIA 稱之為「橫跨七款晶片、五種專用機架的極致協同設計」,是其史上最完整的 AI 工廠平台。

背後的物理邏輯不難理解。Agent 系統消耗 token 的模式是不對稱的:輸入端是海量上下文(程式碼庫、工具輸出、多輪對話狀態),輸出端相對少量——但這些輸出 token 必須夠快,因為 Agent 完成一項任務往往需要數十甚至數百次連續的模型呼叫,延遲會在整個工作流中層層疊加。GPU 擅長批次吞吐量,LPU 擅長確定性的低延遲生成。Rubin 加上 LPX,兩端都顧到了。

關鍵數字

在 Artificial Analysis 的基準測試中,Groq 3 LPX 運行開源 Agent 模型 Gemma 4 31B、在 100,000 token 上下文長度下,創下每秒 3,400 輸出 tokens 的紀錄——這是該模型有史以來最快的表現。NVIDIA 的官方宣稱包括:

  • 相較最接近的替代平台,Agent 與延遲敏感工作負載的回應速度提升 4 倍
  • Agent 編碼任務從「小時級」縮短到「分鐘級」
  • 針對 2 兆參數模型在長上下文、低延遲情境下,NVIDIA 自行推估推論吞吐量較 GB200 NVL72 每百萬瓦提升至 35 倍

每百萬瓦那個數字尤其值得注意。在 AI 工廠普遍「先缺電、再缺晶片」的當下——而且 NVIDIA 才剛因 DRAM 成本飆漲,預告 2027 年初起 Rubin 與 Blackwell 系統對超大規模雲端業者漲價 15% 以上——一款倚重晶片上 SRAM 而非 HBM 的推論機架,是戰略上極為優雅的避險布局。

Nebius 打開第一道門

Nebius Token Factory 成為 LPX 的首個量產落地平台,而該公司的說法耐人尋味。Nebius 技術長 Danila Shtan 表示:「生成是推論中真正決定 AI 系統回應速度的環節,而這正是 NVIDIA Groq 3 LPX 加速的目標。作為第一家透過 Nebius Token Factory 將其導入量產的 AI 雲,我們要讓 Agent 迴圈的每一步都感覺是即時的——而且透過開發者已在使用的同一個 API,完全不需要遷移到新技術棧。」

最後那句話是低調的戰略重點。如果為了更快的 token 得把整套技術棧重新架構來適應特殊晶片,那再快也沒有意義——這正是 Groq 新創時期一再踩中的陷阱。在 Token Factory 裡,LPX 被包裝成「換一個模型選項,而非一次遷移」:同一個 API、同樣的自動擴縮與可觀測性、同一套帳務——初期支援部分模型,並保留原生函式呼叫、結構化 JSON 輸出與工具呼叫 Agent 的安全防護機制。

在 Nebius 之後,NVIDIA 表示另有一家專注推論的 AI 雲服務商也計畫成為平台的最早期採用者之一。

為什麼重要

三層意義值得深思。

一、人才收購的論述獲得驗證。 當年 NVIDIA 吸收 Groq——由 Google TPU 架構師創立的 LPU 先驅——不少質疑者問:這個架構在 GPU 巨人內部會存活,還是被冷凍?在 Rubin 時程內進入全面量產給出了明確答案:LPU 以 NVIDIA 一級產品線的身分延續下去,「Groq」名稱與 LPU 商標由 Groq, Inc. 授權使用。

二、推論市場正式一分為二。 黃仁勳稱推論是「AI 的成長引擎」,而 LPX 的問世把市場上早已可見的分化正式定形:大量批次推論(GPU 每瓦吞吐量取勝)對上互動式 Agent 推論(單一流 token 速度取勝)。定價、基準測試與採購談判,都會隨之分歧。

三、速度門檻整個被墊高。 一個能以每秒數千 tokens 速率迭代 coding agent,改變的是「Agent 時間」的成本結構。如果過去需要數小時的任務現在數分鐘完成,多 Agent 管線的經濟學——以及它們燒掉的 token 預算——將再次朝更自主的軟體傾斜。

幾個值得留意的保留條件:目前尚無公開的 API 開放時程;35 倍/百萬瓦是 NVIDIA 針對特定 2 兆參數長上下文情境的推估值,並非第三方獨立測量;LPX 初期僅支援部分模型,而創紀錄的 Gemma 4 31B 究竟是 31B 級模型——前沿規模的 LPX 效能仍有待證明。

即便如此,方向已然清晰。隨著 SpaceX 也揭露將採用 NVIDIA Vera CPU 打造下一代 AI 技術棧——包括軌道資料中心——而超大規模雲端業者正為 2027 年初的 Rubin 出貨做準備,NVIDIA 正有條不紊地補齊 Agentic AI 運算技術棧的每一塊拼圖。Groq 3 LPX 進入全面量產,是那塊沒有人確定能不能存活下來的拼圖——而它剛剛出貨了。