← All posts / Models

290 億參數、40 億激活、零 NVIDIA:中國電信開源 Xing4.0,首款全程用昇騰訓練的智能體模型

中國電信旗下星辰大模型 Xing4.0-29B-A4B 是首個完全在華為昇騰 910C 與 MindSpore 上訓練的同級開源模型,智能體編碼基準擊敗 Gemma4 與 Qwen3.6。

290 億參數、40 億激活、零 NVIDIA:中國電信開源 Xing4.0,首款全程用昇騰訓練的智能體模型

2026 年 9 月 17 日,中電信人工智能科技有限公司低調地把一批模型權重上傳到 Hugging Face、ModelScope 與 Modelers。沒有主題演講,沒有直播。但這個作品本身分量十足:Xing4.0-29B-A4B,一個總參數 290 億、每 token 僅激活 40 億參數的混合專家(MoE)語言模型——而真正讓它超越基準表格意義的是:這是首個完全在華為昇騰 NPU 平台上、以 MindSpore 框架從頭訓練至此規模的模型,而非依賴 NVIDIA GPU 與 CUDA 軟體生態。

對於追蹤美中 AI 技術棧緩慢脫鉤的人來說,這次發布值得細讀。它不是前沿實驗室展示算力巨獸,而是一家國有電信營運商,用國產晶片打造出一個中等規模、徹底開源的智能體模型,而且基準成績在同級中真正具有競爭力。

實際開源了什麼

星辰(Xing)系列是中國電信 TeleChat 血統的最新一代——TeleChat 今年 1 月才以「首個完全用國產晶片訓練的 MoE 模型」寫下歷史。Xing4.0-29B-A4B 於 9 月 17 日同步釋出三個版本:

  • Xing4.0-29B-A4B — Apache 2.0 授權的完整權重(約 58.1 GB safetensors,最大分片 4.1 GB)
  • Xing4.0-29B-A4B-FP8 — 量化訓練/推論版本
  • Xing4.0-29B-A4B-GGUF — 本地部署格式;Q8_0 版本約 12 GB,單張高階消費級顯卡即可跑動

架構採用 2026 年高效智能體模型的標準配方:40 層、隱藏維度 3,584、MLA(Multi-head Latent Attention)、64 個路由專家(每 token 激活 4 個)外加 1 個共享專家。上下文長度在這個量級相當激進:原生 256K token,可擴展至 512K——因為智能體工作負載(整庫級編碼、長工具呼叫鏈、文件接地)的成敗就取決於上下文。

為智能體而非聊天機器人而生的架構

模型卡中有兩個設計亮點。第一,團隊描述了「mHC + MLA + MTP」技術棧:MLA 提供便宜的長上下文 KV 快取,MTP(Multi-Token Prediction)用於服務端的投機解碼,而 mHC——一種混合注意力變體——是團隊用華為原生核語言 Ascend C 手寫的融合算子實作。這個細節最容易被人略過,卻正是整個發布的核心:在 CUDA 世界裡現成可用的功能,在昇騰軟體棧上並不存在。中國電信的工程師必須自己打造、跨框架做數值對齊、再手工融合。

第二,模型明確針對「複雜工程任務」調優——多步規劃、工具呼叫、長推理鏈執行——並對 OpenCode、Claude Code、OpenClaw、Hermes 等智能體框架做了格式級適配。換言之,它的目標場景不是聊天視窗,而是在現有框架中運行的自主編碼或維運智能體。

效能數字:同級之中真的能打

中國電信把 Xing4.0-29B-A4B 拿去跟高效 MoE 級別兩個最直接的開源對手——Google 的 Gemma4-26B-A4B 與阿里巴巴的 Qwen3.6-35B-A3B——對比。智能體相關的結果最值得看:

基準Xing4.0-29B-A4BGemma4-26B-A4BQwen3.6-35B-A3B
SWE-bench Verified75.053.076.0
SWE-bench Multilingual66.051.067.2
Terminal-Bench 2.157.530.051.5
Claw-Eval76.5571.4974.54
DeepresearchBII60.839.359.7
Tau3-Bench64.6358.967.2
AIME202690.088.392.7
IFBench69.6772.6765.5

模式很一致:在智能體編碼與工具使用評測——Terminal-Bench、Claw-Eval、DeepresearchBII——Xing4.0 全面領先;SWE-bench Verified 上以一分之差緊咬 Qwen3.6,同時領先 Gemma4 達 22 分。Gemma4 在 IFBench(指令遵循)的領先是唯一明顯短板。沒有人會說這是前沿級模型,但「一個 Apache-2.0 的 29B MoE 能在 SWE-bench 上跟 Qwen3.6 拉鋸」在 2026 年是貨真價實的強勢發布——而它全程未動用一張 NVIDIA GPU 的事實,則是讓它具有地緣政治意義的註腳。

96% 這個數字:協同設計真正的價值

發布中技術上最耐人尋味的,是訓練效率的數據。團隊透過多層級協同最佳化——細粒度 MoE 通訊優化、選擇性重計算、「DVM」自動圖算子融合,以及前述手寫的 Ascend C mHC 融合核——讓整體訓練吞吐量比昇騰開箱即用表現提升約 96%。換句話說:接近翻倍的吞吐,不是來自更好的晶片,而是來自軟體協同設計。

這點之所以重要,是因為外界對非 NVIDIA 訓練棧的標準批評是:原始峰值算力會低估真實差距——核心成熟度、集體通訊調優、框架開銷都會把差距拉大。在昇騰 910C 叢集上做到接近 2 倍的純軟體端增益,正是國產算力棧從下方縮小「可用性差距」的埋頭苦幹證據。它與科大訊飛星火 X2-Flash、以及 2026 年稍早 DeepSeek 在昇騰上續訓練的工作互相呼應——不同團隊,同一課題:協同設計可以部分替代矽晶優勢。

生態系打法:處處提 PR,不築高牆

這次發布也展現了更成熟的開源策略。Xing4.0 的支援已提交(發布時待合併)到 SGLang(#39793)、vLLM(#57135)、TensorRT-LLM(#19283)、llama.cpp(#29012)與 KTransformers(#2168),並附上可直接複製的服務指令,包含 OpenAI 相容 API、MTP/EAGLE 投機解碼、以及 xing4 推理/工具呼叫解析器。微調路徑同時支援 LLaMA-Factory(全球主流)與 MindFormers(昇騰原生路徑),跨晶片部署則透過 BAAI FlagOS 一鍵完成。甚至還有 KTransformers 配方,在 GPU/CPU 異構環境下只留 24 個專家在 GPU 上就能跑。

對於承受「去 NVIDIA 化」採購壓力的中國企業,這就是推銷話術:一家電信級公司背書的 Apache-2.0 模型,從晶片、框架、算子到權重的完整血統都是國產的,可以部署在國家雲的昇騰叢集上,或任何能在最新出口管制震盪中倖存的硬體上。

為什麼重要

剝掉民族主義色彩,這個工程故事依然亮眼:小型總參數+小型激活+長上下文的高效開源模型前沿,多了一個按參數量計算能贏下真實智能體基準的新玩家。把地緣政治加回來,這次發布就成了一個標記:「完全用國產算力訓練」的宣示,已經從兆級參數的面子工程,下放到 300 億參數的務實主力級——也就是銀行、電信、政府系統整合商真正會大量部署的那一級。

真正的懸念是迭代速度。NVIDIA 的護城河從來不是單次訓練,而是數千個驗證過的核心、工具鏈與使用者習慣的複利。一個優秀的昇騰 29B 模型證明的是可行性;按時推出 Xing4.1、Xing5 並維持這種基準紀律,證明的才是一套生態系。而中國電信比多數公司都更懂網路效應的價值。