Nvidia 傳以 Groq 授權 LPU 推理晶片重返中國——隨即遭官方否認
The Information 報導 Nvidia 正開發中國專用推理晶片,採用 Groq LPU 技術、年底前小批量出貨;Nvidia 回應「報導有誤」,但聲明措辭留下了日後翻轉的空間。
執行長黃仁勳不久前才說 Nvidia 已「大致上放棄」(largely conceded)中國市場,但這家晶片巨頭據傳正計畫以一條誰都沒料到的路徑重返當地——而且這條路的核心根本不是 GPU。
《The Information》週四報導,Nvidia 計畫在年底前針對中國客戶展開一款全新 AI 晶片的小批量出貨。轉折點在於:根據報導流出的細節,這款晶片採用向 Groq 授權取得的 LPU(Language Processing Unit,語言處理單元)技術,設計上與 Nvidia 的 GPU 協同運作、加速 AI 推論——同時嚴格落在美國出口管制的紅線之內。
Nvidia 隨即出手滅火。該公司向路透社表示:「The Information 關於 Nvidia LPU 的報導並不正確。我們目前在中國市場沒有任何 LPU 銷售,也沒有中國專屬的 LPU 產品。」但正如 Wccftech 在報導中指出,Nvidia 這份聲明的重心幾乎全放在 LPU 計畫的「現況」——這種措辭為未來的操作保留了相當大的空間。對一家曾依序推出中國特規 H800、H20、又眼睜睜看著每一代閹割版逐一被管制的公司來說,把選項藏在口袋裡幾乎是本能反應。
為什麼 LPU 能繞過出口管制的高牆
美國對輸中 AI 加速器的出口管制,主要卡住兩個槓桿:一是晶片搭載多少高頻寬記憶體(HBM),二是能否使用 CoWoS 等先進封裝技術。Nvidia 傳統資料中心 GPU 兩者都用得很重——HBM 堆疊約占旗艦 GPU 一半成本,而 CoWoS 封裝正是把運算裸晶與記憶體融合為一的關鍵。
LPU 架構則完全是另一種生物。Groq 的 LPU 叢集由數百到數千顆專用晶片組成,每顆晶片內建大規模矩陣乘法(MXM)與向量(VXM)運算單元,以及約 230MB 的超高速片上 SRAM。模型權重直接燒錄在 SRAM 中,完全繞過傳統記憶體階層。LPU 沒有分支預測器、也沒有硬體排程器——Groq 編譯器把每一次運算規劃到奈秒級精度,讓資料以確定性、連續排程的節奏從 SRAM 送達運算單元。其成果是每瓦推論吞吐量極為出色的推理引擎,而且完全不需要觸發美國許可門檻的巨型 HBM 配置。
Nvidia 取得這套打法的故事始於 2025 年 12 月:雙方簽署技術授權與資產/人才轉移協議——外界報導規模約 200 億美元,Nvidia 因此取得 Groq 自研 LPU 推理技術的非專屬授權,並接收其晶片與系統團隊。原則上,一款建立在這個基礎上的中國專用推理晶片,可以在 HBM 與先進封裝幾乎歸零的前提下,為中國客戶提供在 2026 年代理式 AI(agentic AI)浪潮中以推論為主的工作負載中極具競爭力的性價比。
Nvidia 面對的殘酷背景
這則報導的時機點,透露的訊息不亞於技術細節。北京正積極勸阻中國企業採購川普政府「特別核准」輸中的 H200 GPU——美國罕見地放行了,中國卻從另一端掐住需求,讓 Nvidia 這款中國合法的旗艦產品在商業上進退不得。出口許可證就擺在那裡,買氣卻被人為斷流。
與此同時,國產替代正在加速疊加。TrendForce 預測,Nvidia 與 AMD 在中國高階 AI 晶片市場的合計市占率將在 2026 年跌到約 10%,其餘約 90% 由中國國產晶片拿下——Nvidia 自身的份額將降至 8% 左右,而一年前還有大約 40%。7 月的另一份調查也發現,中國企業正把國產 AI 晶片的預算占比從 30% 拉高到 46%。
中國進口替代攻勢背後的數字,早已不是紙上談兵:
- 中芯(SMIC)——中國唯一的 7nm 級代工廠——單季營收 30.1 億美元(年增 36.1%)、產能利用率 93.7%,淨利近乎翻三倍至 4.792 億美元。
- 阿里巴巴今年 3 月發表玄鐵 C950:台積電 5nm 製程、64 核 RISC-V 伺服器處理器,內建矩陣與向量加速引擎,可直接原生執行 Qwen 模型、無需 GPU。
- DFSX 走的是另一條路:14nm 的 DF1000 以 3D 晶圓級混合鍵合把記憶體直接疊在運算層上方;預計 2026 年第四季問世的 DF2000「超級節點」進一步以該公司稱為 3.5D Infinity Chiplet 的布局排列多座記憶體—運算塔,宣稱記憶體頻寬可達 Nvidia GB200 NVL72 的兩倍。
- 神秘的上海埃斯格納(Shanghai Aishegna)已切入 DUV 微影設備市場,計畫今年產出 5 台、明年再 20 台,北京同時押注玻璃基板、甚至已有一台 EUV 原型機。
在這個背景下,一款 Groq 血統的推理晶片,是 Nvidia 在「華府管制能賣什麼」與「北京政策不準買什麼」兩面夾殺下,設法留在牌桌上的創意解法。
今天否認,明天上市?
持平看待本週消息:我們手上有一則報導和一份否認,真相大概率落在兩者之間。Nvidia 的聲明——「目前沒有 LPU 銷售、沒有中國專屬 LPU」——並未排除開發中的產品。《The Information》引述兩位內部員工指稱年底小批量出貨,而其戰略邏輯很難反駁:當市調機構預測 Nvidia 中國市占崩向個位數、當推論(而非訓練)成為代理式 AI 時代的主導工作負載,一款能穿過出口管制針眼的 LPU 級加速器,可能是唯一還合法的產品車道。
政治之外也有現實障礙。中國雲端巨頭過去兩年已把軟體棧大幅重構至昇騰(Ascend)與 RISC-V 等國產方案,要再回頭整合一個全新架構談何容易;Groq 這種以 SRAM 為主的設計,等於用晶粒面積換 HBM 成本,直接影響定價;而華府的門檻隨時可能再收緊——BIS 才在 2026 年 1 月修訂輸中半導體許可審查政策,國會也多次提案要徹底封殺中國特規晶片。
儘管如此,這起事件仍標誌著一個鮮明的轉折:定義了 AI 加速器時代的 Nvidia,如今據傳得靠授權對手的架構、才有機會重新叩關曾經的第二大市場——而中國境內的客戶正加速向本土晶片聚攏。無論「中國版 LPU」今年是否真的出貨,更深層的劇本其實已經寫定:全球 AI 晶片市場的 bifurcation(雙軌化)基本完成,兩大陣營的每個玩家,現在都在自己的那一半賽場裡做最佳化。
未來幾個月值得觀察三個訊號:供應鏈上是否出現 LPU 小批量輸中的實證、Nvidia 下次法說會對中國營收的表述,以及北京對「推理級」硬體的國產採購指引會不會在中芯效率還追不上時略微鬆手。
Sources
- [1] https://www.theinformation.com/articles/nvidia-plots-china-comeback-new-ai-chip
- [2] https://www.reuters.com/world/china/nvidia-ship-ai-chip-china-by-year-end-information-reports-2026-08-20/
- [3] https://wccftech.com/nvidia-is-plotting-its-china-comeback-via-a-new-lpu-based-inference-chip-as-smic-rides-us-export-controls-to-a-virtual-china-monopoly/
- [4] https://wccftech.com/nvidia-and-amds-china-market-share-to-drop-to-10-by-2026-as-domestic-chips-seize-90-says-report/
- [5] https://www.trendforce.com/news/2026/07/07/news-chinese-firms-reportedly-raise-domestic-ai-chip-budget-share-from-30-to-46-amid-shift-from-nvidia/