← All posts / Models

每百萬瓦 7 倍:SemiAnalysis 實測揪出 Nvidia 低報 Vera Rubin 真實推論效能

SemiAnalysis 首批經驗證的 Vera Rubin NVL72 AgentX 實測出爐:在 DeepSeek V4 Pro 上,每百萬瓦 token 產量較 Blackwell 高達 7 倍——遠超黃仁勳 GTC 宣稱的 3 倍——換算每吉瓦年利潤約 1,499 億美元。

每百萬瓦 7 倍:SemiAnalysis 實測揪出 Nvidia 低報 Vera Rubin 真實推論效能

Nvidia 每一代產品都有一套儀式:黃仁勳站上 GTC 舞台、秀出一張柱狀圖,然後整個產業花一年時間發現——那張圖其實太保守了。Vera Rubin 的「發現階段」這次提早到來,而宣稱與實測之間的差距,比 SemiAnalysis 實驗室以外任何人預期的都大。

9 月 14 日,這家研究機構發布了 Nvidia 下一代 Vera Rubin NVL72 機架的首批獨立驗證代理式推論(agentic inference)結果,測試基準是其 AgentX——在數千顆晶片組成的機隊上重播真實代理流量的基準測試。頭條結論直白到足以成為產業金句:在 DeepSeek V4 Pro 工作負載(1.6 兆參數的 MoE 模型,作為 O(1–3T) 前沿模型的代理)上,搭載早期預發布軟體的 Vera Rubin NVL72,每百萬瓦 token 吞吐量已是 Blackwell 的 7 倍——而黃仁勳本人在 GTC 2026 給出的數字是 3 倍。

SemiAnalysis 的評語:「黃仁勳必須停止在 GTC 上 sandbagging(藏拙式低報)他的效能宣稱。」

為什麼「sandbagging」是關鍵詞

這不是指控欺騙,而是指控「極度低報」——而且 SemiAnalysis 上一個週期就有前科紀錄。GTC 2024 時,黃仁勳宣稱 GB200 NVL72 將帶來 Hopper 的 30 倍效能;當 SemiAnalysis 後來把硬體推上 InferenceX 實測,量到的是 98 倍。該機構記錄到的模式是:Nvidia 對外公布的世代效能宣稱,系統性地低於出貨平台在軟體堆疊成熟後的實際表現——這意味著,凡是拿 GTC 投影片建立採購模型的買家與競爭對手,他們的起算數字以精確的意義而言「錯了好幾倍」。

能源效率數字值得它獲得的所有關注。在 DeepSeek V4 Pro 代理式工作負載、100 tokens/秒 互動性目標下,Vera Rubin 每百萬瓦約可產出 5,940 萬 total tokens/秒,對比 GB300 Dynamo SGLang(該目標下較強的 GB300 引擎)的 2,850 萬,以及 GB300 Dynamo TRTLLM 的 2,110 萬——對最強 GB300 引擎是 2.09 倍優勢。但曲線隨互動性要求陡升:150 TPS 時,Rubin 每百萬瓦仍有約 3,700 萬 tokens/秒,約為 GB300 SGLang 的 7.2 倍。在剛好 170 TPS 這個點,Rubin 每百萬瓦吞吐量是 GB300 TRTLLM 量測端點的 62.9 倍——不過 SemiAnalysis 特別提醒,引警標籤至關重要:同樣 170 TPS 對上 GB300 SGLang,倍數是 5.56 倍。

對不經營 GPU 機隊的人來說,競爭對手的成績單更殘酷:MI355X SGLang 在 100 TPS 達 201 萬 tokens/秒/百萬瓦(Rubin 領先 29.5 倍)、B200 SGLang 695 萬、B300 vLLM 556 萬、H200 Dynamo SGLang 以 FP8 跑出 226 萬。SemiAnalysis 寫道,在代理式工作負載上,「Vera Rubin 讓 H200 看起來大概跟一台 TI-84 計算機一樣有競爭力」——80 TPS P90 下每美元 token 數是 18 倍,120 TPS 拉大到 39 倍。

經濟學:每吉瓦 1,499 億美元利潤

這一輪週期為什麼「每百萬瓦」數字當家?因為 AI 建設的瓶頸早已不是晶片,而是電力。可供部署的供電機房數量才是限制加速器擴張的硬約束,於是 tokens-per-gigawatt 直接換算成收入與利潤產能——不必再簽新的電力合約。

SemiAnalysis 建了模型:在 75 TPS 互動性、60% 利用率、零授權費(DeepSeek V4 Pro 採 MIT 授權)下,Vera Rubin NVL72 每吉瓦年度營收 1,595 億美元、模擬年利潤 1,499 億美元。最強的 GB300 配置(Dynamo SGLang)分別是 1,149 億與 1,053 億——同樣的電力配置,Rubin 多出約 39% 營收與 42% 利潤,絕對差額約每吉瓦每年 446 億美元的額外模擬利潤。

這份效率也創造了降價空間:在工作負載組成不變下,Rubin 營運商可以對快取輸入、非快取輸入與輸出 token 全面降價約 28%,仍然追平 GB300 Dynamo SGLang 的每吉瓦營收。在 DeepSeek 級開源權重模型早已壓低前沿價格的市場裡,這是戰略武器——效率可以留在口袋裡當毛利,也可以拿出來削對手,取決於需求彈性。

總持有成本(TCO)的故事如出一轍。以「超大規模自建」成本模型、170 TPS、同為 TRTLLM NVFP4 dense 的公平對比,Vera Rubin 每 TCO 美元的總吞吐量是 GB300 Dynamo TRTLLM 的 約 67 倍。在供應商真正會部署這個模型的 60–100 TPS 區間,Rubin 對最新 GB300 TRTLLM 有 1.4 到 3 倍的每美元吞吐優勢。即使走三年租賃經濟學——2026 年 7 月 Rubin 每晶片每小時租金超過 8.5 美元、Blackwell Ultra NVL72 是 5 美元——升級依然划算:80 TPS 下,同樣租賃 TCO Rubin 多產出 62% 的 token,更高互動性區間每租賃美元的 token 數最高可達 16 倍。

共同設計、KV 快取與代理式工作負載

這篇文章的技術核心解釋了差距為何如此巨大:Rubin 是第一個為代理時代、跨六項產品共同設計的平台——Rubin GPU、Vera CPU、NVLink 6 交換器、ConnectX-9、BlueField-4 與 Spectrum-6。AgentX 的工作負載模型反映了代理實際運作的方式:動輒數十到數百次互動的多輪對話、不斷累積的長語境、高前綴重用率(第 n 輪的語境多半直接從 KV 快取服務、無需重算),以及短命子代理爆發造成的高壓 KV 快取流量。聊天機器人時代的基準測試幾乎碰不到這種負載特性。

這一代還多了一個效率槓桿:DSX MaxLPS,第一等的動態電力移轉整合。營運商不再需要按最大 TDP 加 10–20% 超額預留電力,而是可以對推論工作負載做電力剖析、在資料中心內智慧調度電力——因為 GPU 在中高速服務時很少吃滿功耗 envelope,同樣的供電足跡因此塞得下更多 GPU。SemiAnalysis 表示,即將整合進 InferenceX 的 PowerX,會以更細的粒度量測每吉瓦吞吐。

文章裡也有誠實的但書。Rubin 的數字來自早期預發布版 TRTLLM——效能「只會更好」,尤其在延遲—吞吐曲線的兩端。Vera Rubin 的最大 P90 互動性比 GB300 TRTLLM 高約 61%(276 對 171 P90 TPS),不過開源 SGLang 堆疊能縮小這一項差距;而當 GB300 改用 SGLang,部分互動性比較也會收斂。受測機架採用量產 SKU:每運算托盤 2300W TDP、1.5TB CPU LPDDR5X。

意義何在

從數據可以推出三層含義。

對超大規模雲與新創雲,文章的結論毫不模糊:「如果你有錢買或租一台 VR NVL72,就應該買——它會產出比次佳加速器便宜得多的 token,也因此讓你賺更多錢。」買得越多、賺得越多——黃仁勳那句名言——在 SemiAnalysis 的數學裡,如今已在吉瓦規模上可以被量化地證明為真。

對 AMD,這份快照下 29.5 倍的每百萬瓦差距,是在採購會議裡終結對話等級的數字;不過 SemiAnalysis 也指出 AMD 已承諾就 MI455X UALink72 與 InferenceX 合作——這套基準是唯一同時跑 TPU v7、Nvidia、AMD,且即將納入 SambaNova 與 Trainium 的基準。

對所有建模 AI 建設的人,後設教訓是 sandbagging 模式本身。GTC 主題演講的數字是出貨平台在代理式工作負載上的地板,不是天花板。任何用黃仁勳的柱狀圖建立 TCO 模型、競爭分析或主權 AI 採購計畫的人,都該套用一個歷史修正係數——方向是:Nvidia 實際領先得比宣稱的更遠。

發布時點同樣值得注意:這份分析發表的同一週,Nvidia 才剛以 962 億美元季度營收刷新紀錄、Vera Rubin 在 CoreWeave、Azure、Google Cloud 與 Oracle 全面進入量產爬坡;也正是產業注意力被 AI 安全辭職潮與放慢腳步辯論吞噬的一週。本週最安靜的故事,最終可能是:硬體前沿又移動了一次——而且移得比任何人被告知的都遠。

數據與引述來自 SemiAnalysis AgentX/InferenceX 報告《Vera Rubin NVL72 Agentic Inference: 67x better Performance per Dollar》(2026 年 9 月 14 日,部分付費牆)。