從輝達到昇騰:DeepSeek 創辦人把「用華為晶片訓練模型」變成一場戰略豪賭
The Information 報導,DeepSeek 創辦人梁文鋒向投資人表示,改用華為晶片訓練模型是公司最大的戰略押注之一,華為最快將於 2026 年第四季開始交付訓練晶片——對一個此前完全建立在輝達硬體之上的實驗室而言,這是一次決定性的轉向。
2026 年 9 月 21 日週日,The Information 刊出一篇獨家報導,把過去一年 AI 硬體世界持續加速的一場轉向講得再清楚不過:DeepSeek 創辦人梁文鋒已向投資人表示,用華為晶片訓練模型是公司最大的戰略押注之一,而且他預期華為最快將於今年第四季開始向 DeepSeek 交付 AI 訓練晶片——消息來源為兩位知情人士。
這篇由 Juro Osawa 與 Qianer Liu 撰寫的報導,還揭露了一個讓這場豪賭更有份量的細節:DeepSeek 目前正在訓練一個 2 兆參數的模型,並計畫推出 8 兆參數的後繼者。如果華為的時程兌現,這家以效率聞名全球的 AI 實驗室,將在中國國產晶片上——而非輝達的 GPU 上——嘗試它迄今最龐大的訓練工程。
為什麼「訓練」才是真正的分水嶺
DeepSeek 與華為硬體的淵源並不新鮮,但在此之前,這始終是一個「推論」(inference)的故事。
2026 年 4 月,路透社引述 The Information 報導,DeepSeek 的 V4 模型將原生運行於華為最新晶片,成為第一個直接跑在昇騰(Ascend)矽晶片上的中國前沿模型。7 月,路透社又報導 DeepSeek 正在自研 AI 晶片。9 月 4 日,Bloomberg 報導 DeepSeek 計畫在內蒙古興建中的 GW 級資料中心,部署至少 16 萬顆華為 Ascend 950DT 加速器——這個叢集可望成為已知最大規模的昇騰晶片集中部署。
但無論規模多大,上述報導描述的都是「把模型提供給使用者」。訓練是另一個難度層級的問題,而 DeepSeek 的華為故事,恰恰就是在這裡摔過跤。
2025 年 8 月,英國《金融時報》報導,DeepSeek 曾嘗試在華為昇騰晶片上訓練 R2 模型但宣告失敗——長時間的多 GPU 訓練出現不穩定效能,最終退回輝達硬體並推遲了模型發表。這次失敗從此成為質疑中國 AI 算力自主論者的經典引證:華為可以架起叢集,但前沿訓練需要的是軟體成熟度、互連可靠性與生態系深度——而這些,只有輝達的 CUDA 生態用十五年以上的時間打磨過。
這正是梁文鋒對投資人的表態之所以重要的原因。這不是一紙採購公告——這是那個曾經失敗過的實驗室創辦人,告訴出資者:下一次嘗試不是實驗,而是戰略。根據 The Information 的摘要,「用更多國產晶片訓練模型」是公司的重大優先事項,且華為預期「最快今年第四季開始向 DeepSeek 交付訓練晶片」。
2 兆參數的背景板
模型規模讓賭注進一步放大。
DeepSeek 的名聲,建立在「從受限硬體中榨出前沿等級效能」之上——V3 僅用 278.8 萬 GPU 小時的輝達 H800 完成訓練,只是西方實驗室開銷的零頭。但 2 兆參數的模型、乃至計畫中的 8 兆參數模型,是完全不同量級的工程。這種規模的訓練會考驗技術棧的每一層:記憶體頻寬、互連拓撲、橫跨數萬顆加速器的容錯能力,以及軟體能否讓利用率連續數週維持高檔。
在昇騰上做這件事,意味著 DeepSeek 的工程師必須在華為的 CANN 軟體生態上解決上述所有問題——而 CANN 缺乏 CUDA 十多年累積的工具鏈、文件與社群慣例。2025 年 R2 的失敗精準示範了缺口所在:長時間多 GPU 訓練的效能不穩,是系統軟體層的症狀,不是算力(FLOPS)的問題。
反方論點則是:DeepSeek 是全世界最有資格填平這道缺口的公司。這是一個以「硬體受限下的軟體工程」為核心能力的實驗室——V3 時代的雙流注意力機制與 FP8 訓練優化,正是同一類工作。如果有人能吸收掉不成熟軟體棧的摩擦,那就是這個曾把出口管制硬體變成全球效率基準的團隊。
三條時間線正在交會
第四季交付窗口並非孤立事件。有三個時鐘同時在倒數。
華為的路線圖時鐘。 在 2026 年 9 月 17 日的華為全聯接大會(Huawei Connect)上,華為把下一代 Ascend 960DT 晶片的發表提前到 2027 年第一季——比原定的 2027 年第三季提前了整整兩季——並揭露 Ascend 960PR 的 FP4 吞吐量目標翻倍。一家晶片商把旗艦產品加速六個月,同時其最大客戶公開承諾在國產晶片上做訓練,這不是巧合,而是生態系的協同推進。華為目前的高階晶片 Ascend 950DT,在中國市場的價格已突破每顆 25 萬人民幣——在 HBM 記憶體短缺推動中國 AI 晶片整體漲價 20% 至 50% 的背景下。
地緣政治的時鐘。 這篇報導落在 9 月 24 日華府川習會前三天,也是美國財政部長 Bessent 確認美中同意成立 AI 對話工作小組(含國安事件通報機制)的一週後。美國出口管制已一步步把輝達最先進的資料中心 GPU 擋在中國市場之外——而這正是華為昇騰系列被打造來填補的真空。與此同時,眾議院中國委員會主席 Moolenaar 正公開敦促行政部門進一步收緊管制、堵住讓中國實驗室蒸餾美國模型的「雲端服務漏洞」。螺絲每轉緊一圈,DeepSeek 的國產押注就從「選項」更接近「生存必需」。
產業的時鐘。 與 The Information 報導同一週,美國超大尺度雲端業者正執行一場平行的「去輝達化」:微軟正洽談超過 30 萬顆自研 Maia 300 加速器明年的交付;Meta 的 Iris 晶片本月進入量產;OpenAI 與 Broadcom 共同設計的「Jalapeño」處理器已擴大生產策略;亞馬遜則與高通簽下多代客製晶片協議。地理不同,邏輯相同——最大的 AI 買家們都在判斷:即使自研晶片效能仍遜於輝達,「完全依賴單一供應商」才是更大的風險。
後續觀察指標
如果華為真的在 2026 年第四季開始交付訓練晶片,第一個可觀察的訊號不會是新聞稿,而是一種「缺席」:退回輝達的缺席。2025 年的 R2 循環展示了失敗的樣貌——延遲、悄悄退回輝達、發表延期。一個 2 兆參數模型在昇騰硬體上完整訓練到底,且利用率沒有撐破 DeepSeek 賴以立身的效率敘事,將是迄今最強的證據,證明 CUDA 護城河在前沿規模上是跨得過去的。
第二個訊號是 8 兆參數計畫的命運。那個模型的訓練期,將正好落在華為 960 世代晶片的時代——換言之,DeepSeek 的路線圖與華為的路線圖,如今在功能上已合而為一。以 DeepSeek 的規模,把前沿野心與單一國內供應商的執行力綁死,要嘛是中國 AI 史上最大膽的基礎設施押注,要嘛是其最集中的風險曝險。
第三個訊號是競爭面。The Information 為這篇報導下的關鍵字裡包含了 Moonshot AI——提醒我們 Kimi 的開發者與所有中國前沿實驗室,面對的是同一道出口管制高牆,且都在觀望昇騰訓練究竟行不行。如果 DeepSeek 成功,華為得到的不只是一張訂單,而是一個重塑整個中國 AI 產業採購決策的實證案例。如果再次失敗,2025 年那些後備選項,已經比當時更稀薄。
把這場豪賭說白
撥開參數數字與外交辭令,梁文鋒對投資人傳達的訊息可以濃縮成一句話:那個造就了 DeepSeek 的限制——算力太少、管制太緊——已經變成必須馴服被管制剩下來的算力的理由。這個證明了「更少輝達能做更多事」的實驗室,現在要證明的是:完全不用輝達,照樣抵達前沿。
2026 年第四季,就是這個命題的第一場實戰測驗。
Sources
- [1] https://www.theinformation.com/articles/deepseek-bets-big-huawei-chips-bypass-u-s-export-controls
- [2] https://www.bloomberg.com/news/articles/2026-09-04/deepseek-plans-big-huawei-ai-chip-order-to-power-new-data-center
- [3] https://www.reuters.com/world/china/deepseeks-v4-model-will-run-huawei-chips-information-reports-2026-04-03/
- [4] https://www.reuters.com/world/china/chinas-deepseek-developing-its-own-ai-chip-sources-say-2026-07-07/