CUDA 殺手免費開放:DeepSeek 開源整套華為 Ascend 工具鏈
DeepSeek 公開釋出 TileLang、DeepGEMM、DeepEP 與整套華為 Ascend 軟體棧——這是迄今為止最直接的一次嘗試,要抹掉十年來把 AI 產業鎖在 Nvidia CUDA 上的轉換成本。
十多年來,Nvidia 的護城河從來不主要在晶片本身,而在 CUDA——這套專有程式設計層,幾乎所有重要的 AI 框架、核心運算子和訓練腳本都是針對它打造的。想離開 Nvidia GPU,過去意味著數個月的程式碼重寫、除錯,以及效能損失的漫長恢復期。2026 年 9 月 30 日,DeepSeek 對這條護城河發動了迄今最直接的一擊:正式公開、免費下載它與華為共同打造、用於程式設計 Ascend AI 加速器的整套軟體工具鏈。
實際釋出了什麼
核心是 TileLang——DeepSeek 稱之為 CUDA 替代品的領域特定程式語言。它絕非玩具:TileLang 最早是在 Nvidia 硬體上測試並驗證的,DeepSeek 曾用它撰寫高效能核心,包括 FlashMLA 等級的注意力機制實作,程式碼量卻只有傳統 CUDA 的一小部分。大約 80 行 TileLang 的 Python 程式碼,就能在某些運算子上達到手調核心約 95% 的效能,而且它如今同時支援 CPU、GPU 與 NPU,包括華為的 Ascend 950。
在 TileLang 之外,DeepSeek 一併釋出其自建基礎設施棧的其餘部分,全部為華為晶片從零重寫:
- DeepGEMM——供大型模型推理與訓練使用的矩陣乘法核心
- DeepEP——供大規模分散式訓練使用的高速晶片間通訊
- TileKernels——標準向量運算原始件
- FlashMLA——DeepSeek 為其 Multi-head Latent Attention 架構著名開源的長上下文注意力實作
- DeepSelect——訓練資料管線的資料過濾
合起來,這套工具鏈完整鏡射了 DeepSeek 已為自家 Nvidia GPU 叢集打造的一切——而「鏡射」正是重點。任何想離開 Nvidia 的中國實驗室,現在都有一條免費、經過實測、由前沿模型實驗室維護的軟體路徑通往 Ascend 硬體。
技術布局今年以來逐步成形
這次釋出並非憑空出現。地基在過去幾個月早已清晰可見:
- 根據 Tom’s Hardware 報導的 DeepSeek 自家研究,Ascend 910C 已達到 H100 約 60% 的推理效能,手動優化 CUNN 核心後還能進一步推高。
- DeepSeek 的 PyTorch 函式庫如今能把 CUDA 程式碼轉換為 CUNN(華為的對等框架)——正是這種摩擦力的消除,讓遷移從理論變成可行。
- DeepSeek 與華為持續共同開發串連 128 顆 Ascend 950 的超級節點(supernode)設計,工程投入放在處理器之間如何溝通的比重,不亞於原始算力本身。
- TileLang 方法已支援 DeepSeek V4 系列訓練所用的大部分運算子——V4 是該公司於 2026 年 4 月釋出的 1.6 兆參數旗艦模型,在主要基準上與 GPT-5、Claude Opus 打平。
V4 這個細節比表面看來更重要。DeepSeek 發布 V4 時,將效能實測的優先存取權給了中國晶片廠——而不是 Nvidia 或 AMD。在前沿模型被證明能在國產晶片上良好運作後,字節跳動、騰訊與阿里巴巴隨即搶下 Ascend 950 訂單。開源這套工具鏈是同一盤棋的下半手:先證明前沿模型能在華為晶片上跑,再把軟體交到其他所有中國實驗室手上。
為什麼這比晶片禁令更難反制
Nvidia 的中國業務在 H20 限制之後本已萎縮——這款為符合美國出口管制而閹割的晶片,自己也遭遇了牌照問題。Bloomberg Intelligence 目前估計,華為 Ascend 系列已把 Nvidia 在中國的市占率推向個位數,即使中國科技股整體仍落後於美國 AI 同業。
戰略邏輯比市占率更深。美國出口管制的假設是:只要拒絕供貨晶片,中國實驗室就會持續依賴美國供應商。結果恰恰相反——每一項新限制都強化了打造完全主權棧的誘因:晶片、互連,如今再加上軟體。DeepSeek 一邊把最新基礎設施跑在國產加速器上,一邊成為 OpenRouter 上排名第一的模型供應商。
對華府而言,不舒服的事實在於不對稱性:你可以用許可證管制一顆晶片,但你無法管制一份任何人都能下載、fork、改進的開源程式碼。DeepSeek 剛剛把「讓 Nvidia 難以離開」的那層軟體免費送了出去。一個能用的 CUDA 替代品,背後是一家擁有前沿模型、且有硬體夥伴正在大規模出貨 950 系列的實驗室,這比任何單一出口禁令都是更緩慢、卻更結構性的威脅。
採用率才是真正的問題
這一切並不會自動發生。鏡像他人晶片棧的開發者工具,價值完全取決於外部工程師的採用規模。CUDA 的優勢透過十年累積的 Stack Overflow 問答、大學課程、框架預設值與預訓練核心而複利成長。TileLang 與其夥伴在 DeepSeek 和華為之外從零開始——不過,由中國最受矚目的 AI 實驗室親自開源,本身就是最強的種子。
接下來的關鍵,在於阿里巴巴、字節跳動、騰訊以及下一梯隊的中國 AI 新創,是否會在這套棧上標準化——還是把它 fork 成互不相容的分支。但方向已然明確:中國的 AI 基礎設施自主,不再止步於晶片。從今天起,它包含了驅動晶片的軟體。
Sources
- [1] https://www.bloomberg.com/news/articles/2026-09-30/deepseek-unveils-huawei-ai-chip-tools-that-may-replace-nvidia-s
- [2] https://www.reuters.com/world/asia-pacific/deepseek-partners-with-huawei-develop-chip-programming-tools-reducing-reliance-2026-09-30/
- [3] https://startupfortune.com/deepseek-open-sources-chip-tools-that-could-let-huawei-replace-nvidia-in-china/
- [4] https://www.digitimes.com/news/a20260930VL214/deepseek-ascend-software-huawei-nvidia.html
- [5] https://github.com/tile-ai/tilelang