基準測試長出牙齒:MLPerf Inference v6.1 發表 Vera Rubin 首批受審數據、史上最大 512 GPU 叢集與首度登場的 Agentic 測試
MLCommons 史上最大規模推理基準測試回合:30 家機構提交 486 項結果、單加速器效能一年提升 5.7 倍、NVIDIA Vera Rubin NVL72 首批受同儕審查數據最高達 GB300 的 3.7 倍,並新增 End-to-End RAG 與 Edge Agentic 兩項新測試。
AI 推理的產業標準量尺,剛迎來了史上最熱鬧的一個回合。2026 年 9 月 16 日,MLCommons 發布了 MLPerf Inference v6.1 的完整結果,數字背後是一個快速複利成長的生態系:創紀錄的 30 家提交機構、486 項資料中心與邊緣運算結果、測試史上最大規模的系統,以及首度納入標準化測試的 RAG(檢索增強生成)管線與邊緣 Agentic 工作負載。
對於採購、部署或只是追蹤 AI 基礎設施的人來說,這是唯一一份廠商無法單憑自家說詞宣稱優勽的資料集。這裡的每個數字都經過同儕審查、可重現、且與架構中立。而這一回合所記錄的進步速度相當驚人:最佳的單加速器 DeepSeek-R1 伺服器場景結果,一年內提升了 5.7 倍(相較 v5.1 回合);最佳的視覺語言模型結果,僅六個月就提升了 2.99 倍。
Vera Rubin 的首批受審數據
全場最受矚目的項目來自 NVIDIA。Vera Rubin NVL72 機架——現今前沿推理部署主力 Blackwell GB300 NVL72 的後繼者——以預覽(preview)類別首次登上 MLPerf 舞台,提交者包括 NVIDIA 自身,以及在其 VR200 NVL72 系統上運行的雲端業者 Nebius。
Closed 組別(所有提交者必須使用相同參考模型,確保不同硬體平台能公平比較)的頭條數字如下:
- 在 Qwen3-VL 上最高達 GB300 NVL72 的 3.7 倍吞吐量——這是該套件中最吃重的視覺語言基準,在離線、伺服器與互動三種場景皆達成,採用 vLLM 搭配 NVIDIA 開源 Dynamo 推理框架。
- 在 DeepSeek-R1 上最高達 2.5 倍吞吐量,使用 TensorRT-LLM 函式庫。
NVIDIA 將這些成果歸功於全端軟硬體共同設計:強化的 Tensor Core 與新版 Transformer Engine 同時加速 prefill 與 decode 兩個階段;NVFP4 精度縮減了模型權重、注意力與 KV cache 的記憶體佔用;再加上分離式服務(disaggregated serving)與針對 DeepSeek-R1、Qwen3-VL 這類混合專家(MoE)模型的大規模專家平行。NVL72 的第六代 NVLink 縱向擴充域提供比市售乙太網路高 10 倍的封包速率與低 3 倍的延遲,這正是機架級專家平行得以成立的基础。
「預覽」這個類別認定值得注意:它意味著該平台必須在下一個提交回合前達到商用可供貨狀態。這些並非實驗室裡的樣品,而是客戶幾個月內就能買到的矽晶片數據。NVIDIA 另外揭露,在 SemiAnalysis AgentX 代理式基準的預覽測試中,Vera Rubin NVL72 達到 GB300 NVL72 的 30 倍效能——此數字雖不在 MLPerf 審查範圍內,但暗示了 Agentic 工作負載對新架構低延遲特性的回報有多麼劇烈。
MLPerf 史上最大系統——而且是 AMD 的
AMD 也不遑多讓。AMD 與首次提交的 Crusoe 合作,送測了 MLPerf Inference 史上最大的系統:以標準 RoCE 乙太網路 fabric 串連 64 節點、共 512 顆 Instinct MI355X GPU,運行 gpt-oss-120b 與 DeepSeek-R1。
該叢集在 gpt-oss-120b 上繳出離線 575 萬 tokens/秒、伺服器場景 539 萬 tokens/秒的成績;在 DeepSeek-R1 上則為離線 290 萬、伺服器 241 萬 tokens/秒——AMD 稱之為 MLPerf 史上最高的總吞吐量,且從 1 到 64 節點呈現近線性擴展。gpt-oss 的運行以原生 MXFP4 將模型拆成 512 個獨立的單 GPU 副本;DeepSeek-R1 則使用 SGLang、每節點一個八 GPU 副本。
AMD 同場發表了 Instinct MI350P——一張將 CDNA 4 矽晶片裝進標準企業機殼的雙槽 PCIe 5.0 卡:128 個運算單元、144 GB HBM3E、4 TB/s 頻寬、最高 4.6 PFLOPS 的 MXFP4/MXFP6 算力——約當旗艦 MI355X 平台基準效能的 80%,供電力與散熱預算吃緊的部署環境使用。
兩項新測試,為真實世界的 AI 而生
更深遠的消息或許是基準套件本身的演進。v6.1 新增了兩項比純吞吐量更貼近實際部署型態的測試:
End-to-End RAG 是 MLPerf 首個多元件推理基準,為整條問答管線評分:嵌入模型將查詢向量化、檢索器從向量資料庫撈取候選段落、重排序器精煉清單、再由 LLM 對證據進行推理。參考實作串接了 gpt-oss-120B(查詢分解與答案生成)、gpt-oss-20B(文件評分)、e5-base-v2(嵌入)與 ColBERTv2(重排序),語料庫包含 107,484 個段落與來自 Google FRAMES 資料集的 824 道多跳問題——並由 Llama 3.1-8B 擔任裁判,強制 97% 的準確率門檻。
Edge Agentic Inference 則瞄準已經跑在工作站與桌機 AI 主機上的程式編碼助理使用型態。它重播 20 條取自 SWE-bench Verified 的代理式編碼軌跡——共 1,007 個回合——透過 Q4_K_M 量化、以 llama.cpp 運行的 Qwen3.6-27B,單流、同時只有一個請求在途,就像開發者在筆電上真正使用 agent 的方式。評比指標為每回合平均延遲,並以 BFCL v4 作為準確率門檻。首次提交的 Atlas Inference 便藉此比較了 NVIDIA DGX Spark(20.1 tokens/秒,1,007 回合在 64 分鐘內全數完成)與 AMD Strix Halo 桌機(19.63 tokens/秒)——這正是該基準設計目的所在的那種同引擎、受控的對照。
異構、跨太平洋、與軟體定義的勝利
本回合有兩個系統打破了 MLPerf 的傳統框架。Cisco 提交了該基準首個跨廠商異構系統:透過 Silicon One G200 fabric,將 8 顆 NVIDIA H200 與 8 顆 AMD Instinct MI350X 池化為單一推理資源池——正是 Cisco 透過 Secure AI Factory 銷售的混合加速器架構。MangoBoost 則攜手 Dell、TensorWave 與 Microsoft Azure,完成首個地理分散式提交:韓國的 16 顆 MI300X 與美國的 16 顆 MI355X 跨越太平洋組成單一 GPT-OSS-120B 服務端點,報告的擴展效率達 97%。
同時,這個回合也是軟體實力的低調展示。Intel 報告 gpt-oss-120B 在相同的 Arc Pro B70 硬體上提升 36%,Xeon 6980P 上的 Llama 3.1-8B 更靠純軟體獲得 2.4 倍提升。AMD 的 ROCm 7 讓未更動的 MI355X 矽晶片上的 GPT-OSS-120B 吞吐量提升 28-38%——72 顆 GPU 的叢集如今勝過上一回合 94 顆 GPU 的配置。NVIDIA 的 GB300 NVL72 僅靠降低 KV cache 精度、核心融合與分離式服務,就在 Qwen3-VL 上提升至 1.6 倍。
MLPerf Inference 作為品牌的終章
最具前瞻性的細節或許是:30 家提交者中已有 16 家改用 MLPerf 全新的 API 中心化測試框架(harness),以真正的 client/server 架構、透過標準 API 驅動受測系統——這正是當代推理服務被消費的方式。該框架是 MLPerf Endpoints 的基石,後者將於 2026 年 10 月開放滾動式提交,並在 2027 年取代 MLPerf Inference 成為資料中心基準,計畫納入正規化結果與更多 Agentic 工作負載。
對買家而言,v6.1 的結果是一份難得的禮物:橫跨五款新加速器、四個世代矽晶片的機架級系統,有了可信且可比較的數據;而且首度有了對真正構成生產環境 AI 的 RAG 管線與 Agentic 迴圈的有效測量。這個基準測試在這一回合長出了牙齒。下一回合,它打算把自己的前身整個吞掉。
Sources
- [1] https://mlcommons.org/benchmarks/inference-datacenter/
- [2] https://www.globenewswire.com/news-release/2026/09/16/3363348/0/en/mlcommons-sets-participation-record-with-new-mlperf-inference-v6-1-benchmark-results.html
- [3] https://www.unite.ai/nvidia-vera-rubin-nvl72-posts-first-mlperf-inference-preview-results/
- [4] https://www.storagereview.com/news/mlperf-inference-v6-1-5-7x-per-accelerator-gains-a-512-gpu-run-and-vera-rubins-first-peer-reviewed-numbers
- [5] https://www.nvidia.com/en-us/data-center/resources/mlperf-benchmarks/
- [6] https://www.amd.com/en/blogs/2026/amd-delivers-its-broadest-mlperf-inference-6-1-submission.html