AMD 發布 ROCm 10:代理式 AI 工具鏈與 3.3 倍推論提升,十年來最大軟體更新
AMD 以 ROCm 10 歡慶開源運算堆疊十週年,主打 ROCm.AI 代理式開發體驗——整合 ROCm CLI、支援 Claude/Cursor/Codex 的 AMD Skills 與自動最佳化工具 Hyperloom——並宣稱推論效能較 ROCm 7 提升 3.3 倍、訓練提升 2.4 倍。
2026 年 8 月 27 日,AMD 發布了 ROCm 10,時機點頗具深意:第一版 ROCm 1.0 於 2016 年 4 月問世,這個版本幾乎正好落在 AMD 開源運算實驗的第十年。但「十週年」的包裝其實低估了實質內容。ROCm 10 與其說是函式庫更新,不如說是一次重新定位——從「這裡有更好的基礎元件」,轉向「這裡有一套完整、AI 原生的流程,讓模型在 Instinct GPU 上落地量產」,並把 AI 代理直接嵌進開發者體驗裡。
對一個仍高度錨定在 NVIDIA CUDA 上的產業來說,這個重新定位比任何單一跑分數字都重要。評估過 AMD Instinct 硬體卻又卻步的客戶,最常引用的護城河不是矽晶片本身,而是軟體鎖定:工具鏈、文件、營運知識、經過驗證的堆疊。ROCm 10 是 AMD 至今縮小這道鴻溝最激進的一次嘗試。
ROCm 10 實際上裝了什麼
這次發布圍繞三大支柱:更一致的軟體基礎、經過驗證的量產路徑,以及名為 ROCm.AI 的 AI 原生開發體驗。
基礎工程扎實但不炫。全新的 ROCm Core SDK 讓堆疊走向模組化——團隊只安裝工作負載所需的元件,不必部署整個開發環境,既縮小軟體足跡,也讓平台團隊對驗證與生命週期管理有更細緻的控制。所有套件都透過 AMD 的多架構建置系統 TheRock 打造,目的在消除評估、開發與量產環境之間的細微差異。同時,ROCm 10 與 Core SDK 10.0 的支援範圍涵蓋完整 GPU 產品線——Instinct 加速器、Radeon 顯示卡與 Ryzen 整合式顯示,Windows 與 Linux 雙平台皆支援。
在量產這一側,AMD 開始提供經過驗證的 vLLM 與 SGLang 容器、Python wheels 與模組化套件,推論團隊因此有了經測試的優先模型部署路徑,不必再從原始碼自行組裝推論環境。訓練方面,新的整合環境 AMD Primus 涵蓋實驗配置、基礎架構驗證、預訓練、監控與最佳化——包括記憶體效率配置的探索,以及大規模訓練前的叢集驗證,目的是在工作負載從單機擴展到多節點叢集時減少試錯。在叢集規模上,RCCL(AMD 的集體通訊函式庫)則獲得大規模初始化、容錯、GPU 發起網路、對稱記憶體與多節點集體運算的強化。
ROCm.AI:代理式開發層
頭號功能是 ROCm.AI,它由三個部件組成,把「手動駕駛 AMD 堆疊」變成更接近「委派給代理」的工作模式。
ROCm CLI 把過去散落各處的腳本整併成單一命令列工具,負責安裝、驗證、部署、更新與診斷 AI 工作負載。rocm serve <model> 一行指令就能在 PyTorch 上啟動推論;rocm examine 則用來診斷環境與驅動問題。它以技術預覽形式推出,值得注意的是它支援離線(air-gapped)部署——相依套件可打包成自足式套件,這顯然是衝著主權與安全敏感客戶而來。
AMD Skills 或許是文化意義上最重要的一步。它透過 Agent Skills 格式,把 AMD 驗證過的 ROCm 工作流程直接送進開發者已在使用的 AI 編碼助理——Claude、Cursor 與 Codex。技能目錄以聯邦式收藏的形式放在公開的 amd/skills GitHub 儲存庫,與這些工具既有的標準技能目錄(~/.claude/skills/、~/.cursor/skills/)相容,並附帶一個市集,讓 AMD 團隊打造的技能可以一鍵安裝。工作流程反轉了慣例:開發者不再翻文件找指令,而是直接說出目標——「安裝並驗證我的 ROCm 環境」「部署這個模型」「診斷這個系統」——助理便執行 AMD 驗證過的步驟。配套的 ROCm Console 則提供本機的遙測、日誌與執行狀態可視性。
Hyperloom 走得最遠。它是一套新的開源代理式系統,將推論最佳化端到端自動化:剖析工作負載、分析主機端程式碼與 GPU kernel 的瓶頸、規劃變更、套用、跑基準測試、驗證正確性——循環反覆,不需要工程師逐步盯場。AMD 宣稱它能把過去需時數週的人工最佳化壓縮到數小時,同時探索的解空間遠超人類在時間壓力下會嘗試的範圍。再結合執行緒追蹤即時掛載(不重啟工作負載即可剖析)與本機 hipBLASLt GEMM 調校(模型資產不出客戶環境),主題一以貫之:過去需要稀缺專家效能調校的工作,變成可重複、可自動化的流程。
3.3 倍這個數字,以及它的但書
最受矚目的效能宣稱:配置 ROCm.AI 的系統,推論吞吐量平均提升 3.3 倍、訓練吞吐量平均提升 2.4 倍(相較 ROCm 7.0)。
依 AMD 效能實驗室 2026 年 7 月 7 日的測試配置:8 張 AMD Instinct MI355X GPU 平台,ROCm 7.0 對上基於 ROCm 7.2.2、加入最佳化 kernel、平行化與排程的 ROCm.AI 預覽版。推論模型為 GLM-5、Kimi-K2.5 與 DeepSeek-R1-0528,以每秒 token 數計量;訓練模型為 DeepSeek-V2-Lite、DeepSeek-V3-16B 與 Qwen3-30B-A3B,搭配 Megatron-LM。
值得肯定的是,AMD 官方部落格對範圍的說明異常謹慎:「這些結果取決於特定工作負載與配置……不應被呈現為 ROCm 10 的普遍效能提升。」這個但書下得對,因為增益的大宗來自協同式最佳化——推論軟體、通訊、記憶體管理、kernel——疊在較舊的基線之上,而非來自單一硬體或編譯器變更。HPCwire 先前對 ROCm.AI 的報導也提到區塊縮放融合 kernel 與快速快取量化等技術在 DeepSeek 模型上帶來 3.3 倍加速,與這幅圖像一致。不過,對手上已裝著 ROCm 7.x 的 MI355X 容量的客戶而言,實際的訊息很簡單:一次軟體更新,可能就值得你目前吞吐量的好幾倍。
為什麼重要:直接攻擊護城河的本體
AMD 的難題從來不是 Instinct 硬體規格缺乏競爭力,而是 CUDA 二十年的領先——工具、文件、營運知識、驗證過的堆疊——讓切換的總成本感覺高於矽晶片的折扣。ROCm 10 同時從三個方向進攻這道等式:經驗證的容器與模組化交付降低整合成本;Primus 與 RCCL 的改進降低大規模營運風險;ROCm.AI 則把專業門檻整個搬走——把 AMD 的機構知識放進開發者已經付費使用的代理裡。
代理式這個角度,也是對「開發者」樣貌已經改變的低調承認。2016 年,ROCm 的受眾是讀手冊的 HPC 程式設計師;2026 年,受眾愈來愈是那個需要可信、機器可讀程序指引的 AI 編碼代理——AMD 把技能目錄以標準格式放上 GitHub,等於押注「助理」而非「人類」才是開發者文件的主要消費者。NVIDIA 有自己龐大的生態系;AMD 賭的是,代理拉平這個戰場的速度,會遠快於人類。
但書依然真實:ROCm CLI 還在預覽階段,Hyperloom 的自主性需要在 AMD 實驗室之外接受獨立驗證,3.3 倍也只是單一配置對單一基線的數字。但作為戰略宣言,ROCm 10 毫不含糊——十年之後,AMD 不再逐項功能地追趕 CUDA,而是開始設法讓「選哪家的硬體」這件事變得不那麼重要。如果 Hyperloom 與 AMD Skills 如這次發布所預期地成熟,下一個評估 Instinct 機架的買家,可能一行 ROCm 專屬程式碼都不用寫。
Sources
- [1] https://www.amd.com/en/blogs/2026/amd-rocm-10-a-simpler-path-to-production-ai-on-amd.html
- [2] https://wccftech.com/amd-rocm-10-big-ai-updates-performance-gains/
- [3] https://www.hpcwire.com/aiwire/2026/07/29/can-amd-lower-cudas-moat-with-rocm-ai/
- [4] https://rocm.blogs.amd.com/ecosystems-and-partners/rocm-x-blog/README.html