← All posts / Industry

正式開賣:華為 Ascend 950 叢集商用上線,中國的 Nvidia 替代方案進入主打時刻

華為雲的 Ascend 950 靈衢叢集服務——以 UnifiedBus 超級節點串連 1,024 顆 NPU、提供 1 EFLOPS FP8 運算力與 256 TB 統一記憶體——已於 9 月 30 日在中國正式商用,11 月 30 日推向全球。

正式開賣:華為 Ascend 950 叢集商用上線,中國的 Nvidia 替代方案進入主打時刻

過去兩年,中國 AI 晶片的故事幾乎等於「發表會的故事」:路線圖、主題演講、規格表,加上精心安排的洩漏跑分。9 月 30 日,這個故事出現了第一個真正的商業里程碑——華為雲的 Ascend 950 靈衢智算叢集服務在中國正式商用,完全按照兩週前上海 HUAWEI CONNECT 2026 承諾的時間表兌現。這件事的意義,遠超過單一產品上線。

靈衢(Lingqu)服務把華為新一代「超級節點」架構包裝成開箱即用的雲端服務。核心是一套以華為自研 UnifiedBus 互連技術打造的 1,024 卡 Ascend 950 運算叢集,可輸出 1 EFLOPS 的 FP8 算力(FP4 為 2 EFLOPS),並具備 256 TB 全域統一記憶體定址空間。華為表示,這套系統可以端到端管理數千億參數級別的超大規模模型訓練,無需額外的叢集架構切分或適配。中國以外的客戶,則要等到 11 月 30 日。

到底上線了什麼

從 HUAWEI CONNECT 2026 上華為雲執行長周躍峰承諾時程時披露的細節,可以拼出全貌:

  • 架構。Ascend 950 超級節點透過 UnifiedBus——華為自研的高速互連協定,具備跨實體節點的統一記憶體定址——把多顆 NPU 耦合為一台邏輯上的單一電腦。這是華為基礎設施戰略的核心豪賭:不與 Nvidia 在單晶片層級硬碰硬(出口管制與中芯製程限制在此最痛),而是在系統層級取勝,用互連、記憶體池化與叢集軟體補足單顆晶片的劣勢。
  • 上線順序。中國區 9 月 30 日率先商用,全球版 11 月 30 日跟進。華為把雲端服務定位為「開箱即用的 AI 叢集」,為無法(或不願)自建 Ascend 機房的企業大幅降低採用門檻。
  • 穩定性訴求。華為稱靈衢服務可支撐長達 40 天的穩定雲端訓練,故障恢復在 10 分鐘內完成——這組數字直接瞄準在整合度不足的叢集上跑長週期訓練任務的營運痛點。
  • 需求背景。同場活動中,華為高層表示 AI 晶片需求持續大於供給,公司資料也證實 Ascend 950 系統已進入商用。路透社報導,CANN 軟體棧的月活躍開發者超過 5,200 人。

系統層級的豪賭,量化來看

這次商用上線,只是華為輪值董事長胡厚崑(David Wang)在 CONNECT 主題演講中那套架構論述浮上水面的部分。如今 10 萬卡叢集已是訓練 SOTA 模型的基本門檻,但傳統伺服器架構下,叢集內部通訊會吃掉超過 40% 的總訓練時間,嚴重壓低 Model FLOPs Utilization(MFU)。華為馬可夫實驗室的模擬顯示,用 4 千卡超級節點組成的 10 萬卡叢集,MFU 比用 8 卡伺服器堆出來的叢集高出 2.75 倍。

這個框架決定了該如何解讀靈衢上線。華從並沒有宣稱 Ascend 905 晶片在單晶片層級擊敗 Nvidia 旗艦——畢竟在中國以外,很少人會接受這種說法。華為的主張是:一個緊密耦合、擁有 256 TB 池化記憶體的 1,024 卡超級節點,是比一整排鬆散伺服器更好的運算單元;而且對多數中國企業來說,真正會消費前線級訓練算力的方式,就是按小時租用這種託管服務。

主題演講的其餘部分,則勾勒了超級節點概念的下一步:Atlas 960E SuperPoD 是業界首款量產的 NPO(近封裝光學)系統,可擴展至 4,096 顆 NPU、8 EFLOPS FP8 與最高 1 PB 的 HBM;升級版 TaiShan 950 通用超級節點與 OceanStor M900 KV 快取儲存叢集,把這套架構延伸到沙盒密集的 Agent 工作負載;而 Agent 超級叢集可互連最多 512,000 顆 NPU,搭配多軌拓撲可達一百萬顆。晶片節奏也在加速:Ascend 960DT 提前到 2027 年第一季(比原路線圖早三季),970 與 980 分別排在 2028、2029 年。

為什麼軟體故事現在更重要

硬體搶頭條,但靈衢上線同時也是華為生態系數學的一次期中考核。CANN(神經網路運算架構)是 Ascend 的根基,如今已轉入持續的社群驅動開源開發——外部開發者佔比首次過半(61%),Ascend 也成為 PyTorch 官方支援的加速器後端,是第一個登上 PyTorch 官網的中國運算平台。已有超過 40 個模型在這套棧上完成原生預訓練,華為稱之為唯一經過驗證的國產預訓練路徑。

這是商用叢集服務能否成立的隱形前提。雲端超級節點要賣得動,客戶既有的訓練程式碼——PyTorch、vLLM、Triton、veRL——必須免改寫就能跑。CANN 每賺到一分開源公信力,都會直接轉換為靈衢的可服務市場。

脈絡與但書

有三個現實為這次上線降溫。第一,11 月 30 日的全球版將直接撞上制裁地理:華為雲的國際據點在許多市場依法不能提供含美國技術的 AI 算力,這項服務的現實版圖是親中市場與全球南方。第二,記憶體仍是整個產業的硬約束——同一週,華為消費者業務負責人余承東表示 AI 帶動的記憶體漲價,已讓華為每支手機的平均成本增加約 200 美元;HBM 供給限制華為的叢集野心,一如它限制所有玩家。第三,「正式商用」是鳴槍起跑,不是抵達終點:靈衢訓練任務的實際使用率、指標級客戶名單與獨立跑分,都還有待揭曉。

無可爭辯的是方向。DeepSeek 規劃中的內蒙古 16 萬卡全 Ascend 叢集、已部署超過 1,000 套的 Atlas 900 A3 超級節點,加上如今開放一般租用的 1 EFLOPS 超級節點服務——中國的國產 AI 算力棧,已經從「可信的路線圖」變成「可下單的庫存」。對於追蹤出口管制能否拖住中國前線 AI 發展的人來說,該看的已經不是晶片,而是訂單簿。