上線首日 4.8 倍吞吐量:CoreWeave 攜 Cognition 將 Nvidia Vera Rubin NVL72 推入量產
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 正式上線,Cognition 成為全球首個在該系統上跑量產負載的客戶——Devin 的訓練、強化學習與推論全面遷移,SWE-2 推論吞吐量較 GB200 NVL72 提升最高 4.8 倍。
誰能率先把 Nvidia 下一代 Vera Rubin 機架交到付費客戶手上?答案揭曉,贏家不是任何一家超大規模雲端業者。9 月 30 日,CoreWeave 在舊金山舉行的 Fully Connected 大會上宣布:NVIDIA Vera Rubin NVL72 正式於 CoreWeave Cloud 上線,而開發 Devin AI 軟體工程師的新創 Cognition,成為全球第一家在這套系統上執行量產負載的客戶。
事件重點
CoreWeave 在 9 月初收到首批 Vera Rubin NVL72 量產機架。短短幾天——而不是幾個月——Cognition 的工程師就建好了叢集,並完成史上第一個由客戶端執行的 Vera Rubin 推論基準測試,對照基線為 GB200 NVL72。公布的數字相當驚人:SWE-2 推論負載的總 token 吞吐量提升最高 4.8 倍,強化學習負載的輸出 token 吞吐量提升 3.8 倍。
這項宣布伴隨 Fully Connected 大會上的一系列發布,現場聚集了超過 4,500 位客戶、合作夥伴與開發者。CoreWeave 同時宣布將供應 NVIDIA Vera——首款專為 AI agent 打造的 CPU——並推出 CoreWeave Forge,一個整合 Weights & Biases、OpenPipe 後訓練技術與開源專案 marimo 筆記本的連續模型改良環境。
為什麼 Agent 負載讓機架級系統變得關鍵
「Agentic coding 是一種毫不留情的負載:超長上下文、高併發、快速推理,」Cognition 研究高級副總裁暨共同創辦團隊成員 Silas Alberti 表示。「在 CoreWeave 部署 NVIDIA Vera Rubin NVL72 之後,我們的工程師看到 SWE-2 推論負載的總 token 吞吐量提升最高 4.8 倍。對於每一步都在等上一步完成的 agent 負載來說,這會複合成 Devin 真正多做出來的工作。」
這個複合效應正是整個故事的核心。一個解決軟體工程任務的 agent,會執行數十個連續的模型呼叫——規劃、讀程式碼、編輯、跑測試、診斷、再重來。當每一步都依賴前一步,生成速度的改進會在整條軌跡上相乘。對 Cognition 而言,吞吐量的提升意味著每顆 GPU 能容納更多並發的 Devin 工作階段、大幅加速的研究迭代,以及更低的單位成本——而且公司強調,生成速度毫無損失。
Cognition 用來做基準測試的負載本身也很講究:工程師從 FrontierCode 抽樣任務子集,再部署 AI agent 去解題——這是真實世界的軟體工程評測,而非合成的延遲測試。這是全球第一個公開發布、由客戶執行的 Vera Rubin 推論基準。
Vera Rubin NVL72 快速導覽
Vera Rubin NVL72 是 Nvidia 繼 GB200/GB300 NVL72 Blackwell 世代之後的機架級後繼者,將新款 Vera CPU 與 Rubin GPU 結合,組成以 NVLink 互連的 72 顆 GPU 機架,CoreWeave 的部署再搭配 Spectrum-X 102.4T 乙太網路作為橫向擴展骨幹。
CoreWeave 還發布了業界第一份在該平台上實測的晶片效能數據:在 DeepSeek R1 推理模型、相同互動性條件下,每百萬瓦(MW)token 吞吐量是 GB200 NVL72 的 10 倍。在電力而非晶片日益成為 AI 擴建瓶頸的市場裡,「每瓦吞吐量」可能才是決定哪朵雲贏得 agent 時代的指標。
Vera CPU 端則瞄準另一個瓶頸:沙盒(sandbox)。Agentic AI 從兩個方向擠壓基礎設施——服務 agent 需要大規模低延遲運算,而透過 RL 改良 agent 則需要數千個隔離環境同時運行。單一 Vera 機架容納 128 顆 CPU、11,264 個核心,足以支撐超過 11,000 個各佔一核的並發環境,透過 CoreWeave Sandboxes 做硬體隔離,並由 Spectrum-X 乙太網路交換器與 BlueField-4 DPU 處理安全的 agent 通訊。CoreWeave 實測 Vera CPU 上的 agent 沙盒啟動速度加快超過 3 倍,在 Terminal-Bench 所有通過任務上則有 1.7 倍的效能增益。
護城河其實是營運模式
這次發布中更低調但更具戰略意義的一點是「延續性」。客戶可以用與現有 GB200 NVL72、GB300 NVL72 機群完全相同的營運模式和工具鏈來跑 Vera Rubin——CoreWeave Kubernetes Service、SUNK、Mission Control、Sandboxes、無伺服器推論——再加上 CoreWeave 的效能工程團隊從旁支援。
「這麼快就讓 Vera Rubin NVL72 上線,而且客戶幾天內就看到效能增益,這是多年來跨 GPU 世代工程化平台的成果,」CoreWeave 產品與工程執行副總裁 Chen Goldberg 說。「我們的工作是讓運算、網路和軟體像單一系統一樣運作,讓客戶能建造越來越複雜的 agent,而不必自己扛下基礎設施的複雜度。」
CoreWeave 與 Nvidia 的合作關係可追溯到 2017 年的 Volta 世代——據報那些 V100 GPU 至今仍在跑客戶負載,已近十年。Nvidia 超大規模與高效能運算副總裁 Ian Buck 把耐用性包裝成平台的核心賣點:「能持續創造價值多年的基礎設施,以及把對的 GPU 放到對的負載上的彈性。」CoreWeave 攜手 Dell Technologies,是最早部署搭載 GB200 與 GB300 NVL72 的 Dell PowerRack 系統的雲端業者之一,如今也是最早部署 Vera Rubin 的業者之一。
分析:新晶片首發的先行者經濟學
對 CoreWeave 而言,每個 Nvidia 世代都搶先進入量產,就是它的商業模式。這家公司以破紀錄的 MLPerf 成績、以及唯一連續三次獲得 SemiAnalysis 最高 Platinum ClusterMAX 評級的 AI 雲端著稱。優先取得新晶片,讓它能網羅吞吐量需求最飢渴的客戶——而現在,那就是 Cognition 這類 agentic AI 公司:它在不到九個月內,從過渡性產能擴張到數千顆 GPU 用於訓練與推論。
對 Cognition 來說,這是純粹的產能與成本故事:Devin 的經濟學在吞吐量軸線上改善近五倍,而吃掉大量隔離沙盒與輸出 token 的 RL 研究循環加速近 4 倍。在 Devin 據報已跨過 10 億美元年化營收的市場裡,每個工作階段的成本,就是毛利與燃燒之間的分界線。
更宏觀的訊號,是 agentic AI 技術堆疊的演進方向。當運算的基本單位從「一次對話補全」變成「數千條並發的多步驟 agent 軌跡」,整個平台——GPU 織網、沙盒用的 CPU 核心、網路、編排——都成為產品本身。Nvidia 正據此設計(專為 agent 打造的 CPU、以每百萬瓦 token 吞吐量為目標的機架),而與它最早共同工程化的雲端業者,正是搶下 agent 負載的那一批。
Vera Rubin NVL72 現已於 CoreWeave Cloud 上向早期體驗客戶開放。
Sources
- [1] https://www.coreweave.com/news/coreweave-delivers-nvidia-vera-rubin-nvl72-performance-at-production-scale-starting-with-cognition
- [2] https://blogs.nvidia.com/blog/coreweave-agentic-ai-vera-rubin/
- [3] https://www.datacenterdynamics.com/en/news/coreweave-makes-nvidia-vera-rubin-nvl72-available-cognition-is-early-customer/
- [4] https://www.coreweave.com/blog/cognition-becomes-first-customer-for-nvidia-vera-rubin-nvl72-on-coreweave-cloud