六個開源儲存庫對決 CUDA:DeepSeek 與華為開源 Ascend 軟體堆疊
DeepSeek 開源了完整 Ascend 軟體堆疊——TileLang、DeepGEMM、DeepEP、FlashMLA、TileKernels 與 DeepSelect——為華為晶片提供 CUDA 之外的完整工具鏈,且已在 DeepSeek V4 訓練中承擔多數算子。
二十年來,加速運算最深的護城河從來不是晶片本身,而是 CUDA。Nvidia 的 GPU 規格表可以被追平,但圍繞它的程式設計環境——函式庫、編譯器、十多年累積的算子程式碼——讓開發者難以離開。9 月 30 日,DeepSeek 對這條護城河發起了至今最直接的一擊:該實驗室與華為聯合開發、並正式開源了一套針對華為 Ascend AI 晶片的六模組程式設計工具包,內容完全對應 DeepSeek 目前在 Nvidia 硬體上生產使用的基礎設施。
這次開源了什麼
這次發布(透過 DeepSeek 官方微信帳號宣布,並由路透社確認)涵蓋了 Ascend 上 AI 訓練堆疊的整個底層:
- TileLang——高階核心程式語言與編譯器工具鏈,原生支援 Ascend 950,包含程式碼生成、自動排程與同步
- DeepGEMM-Ascend——矩陣乘法函式庫,支援 BF16、FP8 與 FP4,API 與 DeepSeek 既有 CUDA 版 DeepGEMM 完全相容
- DeepEP-Ascend——通訊函式庫,負責在混合專家(MoE)模型中把資料路由到各專家並彙整輸出,訓練與推理皆適用
- FlashMLA——稀疏注意力算子,提升長上下文處理效率
- TileKernels——常用向量運算與記憶體存取算子,用於資料處理
- DeepSelect——高效率資料選擇
每個元件都在 DeepSeek 先前為 Nvidia 平台開源的套件中有直接對應版本。這種對稱性正是重點:針對 DeepSeek Nvidia 工具鏈開發的人,可以轉移到 Ascend 而保留熟悉的 API——無需重寫程式碼。
TileLang 才是真正的故事
戰略分量最重的一塊是 TileLang。DeepSeek 形容它提供比 CUDA「更簡潔的程式設計模型」,能「顯著提升開發效率、簡化程式碼邏輯」——同時仍能把硬體效能推到極限,而非像其他高階語言那樣用效能換便利。
實驗室提出的佐證就是自己的訓練流程:DeepSeek V4 系列模型訓練所用的大部分算子,如今都以 TileLang 實作;而 DeepSeek 訓練中使用的每一個 TileLang 算子,現在在 Ascend 上都有對應的高效能實作。Ascend 版本封裝了華為底層的 Ascend C 指令,透過同一套高階介面暴露出來——也就是說,DeepSeek 為自家模型打造的抽象層,原則上已經可以同時坐在任一家廠商的硬體之上。
這是一個低調但激進的架構。如果核心層可攜,Nvidia 與華為之間的轉換成本就從「移植整個程式碼庫」崩解為「切換硬體目標」。這在軟體層面做的事,正是華為在超級節點層面做的事。
在 128 卡超級節點上打造
這些工程並非閉門造車。DeepSeek 表示華為團隊「深度參與」了整個開發過程,雙方並在一套以 128 顆 Ascend 950 晶片構成的超級節點上,共同對運算與晶片間通訊做了深度最佳化。這一點至關重要:分散式訓練的成敗取決於問題的後半段——讓數千顆加速器持續有資料可算、沒有一顆在閒置。DeepEP-Ascend 這個 MoE 路由層,恰恰是決定一套超級節點究竟是真正的訓練機器、還是一堆昂貴且利用不足的零件的元件。
DeepSeek 宣稱,在多個關鍵測試案例中,這些元件的運算與通訊效能「已接近底層硬體的極限」——意味著在 Ascend 上,軟體已不再是瓶頸,瓶頸是晶片本身。
不過有一點值得保留:這個宣稱是以 Ascend 的天花板為基準,而不是以 CUDA 上同等工作負載為基準。一個核心跑在某平台硬體極限、與一份工作量成本不高于 CUDA 的 workload,是兩種不同的主張;目前也沒有公開數字為完整的生產級移植定價——包括工程時間、效能差距、以及是否需要重新訓練。
脈絡:生態系缺口才是真正的出口管制
這次發布落在華為公布新一代 AI 處理器與超級節點系統(含 Ascend 950 叢集商用化)兩週之後,也延續了雙方在 DeepSeek V4 上的合作——V4 已於四月帶著 Ascend 支援推出。華為曾表示,預期其系統將在 2027 年廣泛用於模型訓練。
未言明的推手當然是美國出口管制。中國實驗室越來越容易取得峰值規格可信的國產加速器——但如果榨出這些效能需要對抗不成熟的工具鏈,硬體平價就毫無意義。Nvidia 的長期優勢從來不是原始 FLOPS,而是圍繞晶片二十年的軟體重力。DeepSeek 開源的,正是一個前沿實驗室訓練自家模型所用的那套基礎設施——他們試圖由上而下把這股重力建立起來:不是先打造通用生態系、再祈禱前沿工作負載到來,而是直接交出前沿工作負載的地基,向所有人敞開。
開源同時讓整套堆疊可稽核、可分支。任何中國新創——或任何面臨晶片取得限制的組織——都可以檢視、擴充這些元件,或把它們移植到其他加速器上。DeepSeek 明確將 TileLang 定位為「為更廣泛 AI 晶片打造高可用軟體生態系的有用參考」,這句話讀起來,邀請對象遠不止華為。
意義何在
對 Nvidia 而言,這是分析師警告多年的侵蝕情境,只是從意料之外的方向到來。沒有人正面超越 CUDA;而是一個模型實驗室在它上面蓋了一層可攜抽象,然後把移植版開源。TileLang 仍然支援 Nvidia GPU——它最初就是在 Nvidia 上驗證的——所以這個語言本身並不敵視 Nvidia。這正是它危險的地方:開發者因為它更簡潔而採用,之後才發現自己的程式碼已經不在乎底下跑的是誰的晶片。
對華為而言,這次發布把 Ascend 從「規格強大但有軟體問題的硬體」變成擁有前沿實驗室認證工具鏈的平台——免費取得、並已在 128 卡系統上以硬體極限為基準做過驗證。2027 年的訓練承諾,底下現在看得見軟體了。
對整個產業而言,這再添一個訊號:AI 基礎設施堆疊正沿著地緣政治路線碎裂——不是在模型層(中美系統至今互通),而是在基底層。Nvidia 用軟體築起的護城河,正被一個一個儲存庫、公開地填平。
全部六個專案現已可用:TileLang 與 TileLang-Ascend 位於 GitHub 的 tile-ai 組織;DeepGEMM-Ascend、DeepEP-Ascend、TileKernels、FlashMLA 與 DeepSelect 位於 deepseek-ai。
Sources
- [1] https://www.tomshardware.com/tech-industry/artificial-intelligence/deepseek-and-huawei-release-open-source-ascend-ai-programming-tools-to-reduce-reliance-on-nvidia-ecosystem-tools-include-compute-and-communication-libraries-as-well-as-ascend-support-for-tilelang
- [2] https://www.geopolitechs.org/p/deepseek-builds-for-huawei-ascend
- [3] https://github.com/tile-ai/tilelang-ascend
- [4] https://pandaily.com/deepseek-ascend-infra-oss-tilelang-deepgemm-deepep-superpod-flex
- [5] https://www.techtimes.com/articles/328396/20261002/deepseek-huawei-open-source-toolkit-lets-developers-ditch-cuda-without-rewriting-code.htm