← All posts / Meta

16 萬顆 Ascend 晶片、零 Nvidia:拆解 DeepSeek 內蒙古超級集群

Bloomberg 報導 DeepSeek 將在內蒙古 1 GW 資料中心部署至少 16 萬顆華為 Ascend 950DT 加速器——這是已知最大規模的全國產 AI 集群,也是中國「去 Nvidia 化」路線圖最嚴苛的一次壓力測試。

16 萬顆 Ascend 晶片、零 Nvidia:拆解 DeepSeek 內蒙古超級集群

過去兩年,「中國 AI 集群」這個詞後面總跟著一個但書:機架上也許貼著華為的標籤,但供應鏈某個環節多半還藏著 Nvidia——可能是走私、囤貨,或經由人頭公司洗進來的貨。Bloomberg 於 9 月 4 日的報導,或許標誌著這個但書正式畫上句點。開啟開源權重重革命的杭州實驗室 DeepSeek,計劃在內蒙古一座興建中的大型資料中心,部署至少 16 萬顆華為次世代 Ascend 950DT 加速器——據知情人士說法,這將是已知規模最大、內部幾乎不含任何美國矽片的 AI 集群之一。

這個專案同時在三個層面上表態:技術、產業與地緣政治。而它的成敗,將直接告訴我們中國過去兩年狂奔的算力自主路線,究竟是真跑了起來,還是只是原地踩油門。

我們目前知道什麼

整個集群以 Ascend 950DT 為核心——這是華為於 2025 年 9 月 HC 大會發表的旗艦級機架加速器。每顆晶片搭載華為自研的 HiZQ 2.0 高頻寬記憶體(單顆 144 GB、頻寬 4 TB/s),並透過 UnifiedBus 2.0 互連架構,把數千顆晶片綁成一台邏輯上的單機。在華為自己的超級節點(supernode)拓撲中,8,192 顆 Ascend 950DT 占用約 160 個機櫃,可輸出約 8 EFLOPS 的 AI 算力;而 Atlas 950 SuperCluster 再將 64 個超級節點串成超過 52 萬顆晶片的系統。

以 16 萬顆晶片計,DeepSeek 這次擴建相當於約 20 個 Atlas 950 超級節點的矽量——帳面算力足以在不使用任何一顆 H 系列 GPU 的情況下訓練前沿模型。報導指出,園區電力規模約 1 GW(百萬瓩),躋身全球最大單一租戶 AI 園區之列,與 xAI 的 Colossus、Meta 的俄亥俄集群屬於同一量級。

選在內蒙古並非偶然。這個地區花了十年把自己經營成中國的資料中心前沿:乾冷氣候提供天然冷卻,煤電網之外疊加全國數一數二的風光綠電,再加上地方政府急於釋出的土地。DeepSeek 早已在烏蘭察布一帶與字節跳動、阿里巴巴共用算力走廊。這座新超級集群,等於把當地的定位從「便宜的機房租借處」升級成「GW 級主權 AI 基礎設施」。

為什麼重要:真正的難關是軟體

直覺上這像一則硬體新聞——晶片數量很驚人、Nvidia 又丟了訂單。但它不是。中國國產 AI 算力的瓶頸從來不是 FLOPS,而是軟體棧。華為的 Cann 工具鏈、MindSpore 框架與 Ascend 相容的 PyTorch 分支,無論在成熟度、開發者生態還是大規模分散式訓練的實際吞吐上,長期落後 CUDA 一大截。

而這正是 DeepSeek 成為這場實驗最佳租戶的原因。這個實驗室的整個招牌,就是「軟體極限主義」——從受限硬體裡榨出前沿能力。DeepSeek 的 V 系列與 R 系列已經證明,審慎的架構選擇(多頭潛在注意力、稀疏 MoE 路由、蒸餾管線)能用美國對手零頭的訓練預算,做出逼近前沿的模型。工程團隊還把每個細節全部開源——這也是為什麼「DeepSeek 技巧」如今出現在大洋兩岸各家實驗室的訓練配方裡。

把這套打法搬到 Ascend 矽片上,是另一個數量級的挑戰——從核心層級的算子庫,到無法依賴 InfiniBand 或 Nvidia NCCL 的容錯通訊,整個技術棧都得重新打造。但如果有一個實驗室把「CUDA 護城河不可逾越」視為可解的工程問題而非自然定律,那就是 DeepSeek。中國媒體數月來持續報導 DeepSeek 大舉招募晶片軟體人才;內蒙古這座集群,就是這批人才兌現與否的考場。

供給端的疑問

就算軟體問題解了,16 萬顆加速器對華為的晶圓處境仍是天文數字。Ascend 950 系列由中芯國際以 N+2 製程生產,無法使用 EUV 微影。業界普遍理解其良率遠低於台積電,華為被迫把產能分散到多座晶圓廠與封測線。Bloomberg 措辭裡的「至少」兩個字承擔了全部重量:DeepSeek 能否如期收到全部 16 萬顆、其中多少是完整規格的 950DT 而非降規版,取決於中芯能否在 2026 到 2027 年間持續爬良率曲線。

這是喧鬧賽局之下那場安靜的賽局。美國出口管制設計的理論基礎,是「箝制微影技術,就能隨時間箝制模型能力」。內蒙古集群是這套理論迄今最直接的測試:如果華為交得出貨、DeepSeek 馴得了軟體,中美前沿實驗室之間的算力差距,就會從「存亡等級」縮小到單純的「昂貴」。

脈絡:資金早已就位

這座集群並非活在金融真空裡。DeepSeek 已於 2026 年 6 月完成首輪外部融資——超過 500 億人民幣(約 74 億美元),估值突破 500 億美元,投資方以國家隊為主,特殊交易結構確保創辦人梁文鋒緊握控制權。此後屢有報導指出,DeepSeek 最快今年就會遞交科創板(STAR Market)IPO 申請,討論估值落在 710 至 740 億美元區間。一座 GW 級、全國產的算力基地,正是這個故事最需要的資產:它把 DeepSeek 從「才華洋溢但依賴外部基礎設施」改寫成「才華洋溢且主權自立」——這對北京的優先序重要,對記得晶片制裁如何重創前幾代中國 AI 冠軍的公開市場投資人,更重要。

而且效應會複利滾動。DeepSeek 對 Ascend 軟體棧的每一項改進——每個算子核心、每個通訊優化、每條容錯路徑——都會外溢給整個華為生態系,降低後續每一家中國實驗室的進入門檻。這是一座單一租戶的建設案,它的外部性卻是全國性的。

後續觀察指標

  • 部署節奏。 留意殼公司採購紀錄與華為供應鏈揭露,看晶片出貨是否跟得上 16 萬顆的目標,還是不斷順延。
  • 訓練訊號。 如果 DeepSeek 下一個旗艦模型的技術報告出現「Ascend 原生訓練」的紀錄——哪怕是部分訓練——「CUDA 護城河永存」的論點就大勢已去。
  • 中芯良率。 任何關於 N+2 良率改善的公開數據,都會近乎線性地轉換成這座集群(及其後繼者)填滿機櫃的速度。
  • Nvidia 的對照組。 黃仁勳本週才剛以 Blackwell 需求為本宣告「AGI 已經到來」。內蒙古這座集群是那句話的另一半——一個不打算買任何一顆他的晶片、卻想抵達同一終點的算力集團,正在成形。

結論

新聞標題上的數字是 16 萬顆晶片。真正該盯的數字更小、也更難看見:一年後,DeepSeek 前沿訓練算力中運行在國產矽片上的比例。如果那個比例夠高,2026 年 9 月被歷史記住的方式,將不是「某座大集群動工的一個月」,而是「全球 AI 基礎設施正式分裂,從政策預言變成蒙古草原上物理事實」的那一個月。