290 億參數、40 億激活、零 NVIDIA:中國電信開源 Xing4.0,首款全程用昇騰訓練的智能體模型
中國電信旗下星辰大模型 Xing4.0-29B-A4B 是首個完全在華為昇騰 910C 與 MindSpore 上訓練的同級開源模型,智能體編碼基準擊敗 Gemma4 與 Qwen3.6。
2026 年 9 月 17 日,中電信人工智能科技有限公司低調地把一批模型權重上傳到 Hugging Face、ModelScope 與 Modelers。沒有主題演講,沒有直播。但這個作品本身分量十足:Xing4.0-29B-A4B,一個總參數 290 億、每 token 僅激活 40 億參數的混合專家(MoE)語言模型——而真正讓它超越基準表格意義的是:這是首個完全在華為昇騰 NPU 平台上、以 MindSpore 框架從頭訓練至此規模的模型,而非依賴 NVIDIA GPU 與 CUDA 軟體生態。
對於追蹤美中 AI 技術棧緩慢脫鉤的人來說,這次發布值得細讀。它不是前沿實驗室展示算力巨獸,而是一家國有電信營運商,用國產晶片打造出一個中等規模、徹底開源的智能體模型,而且基準成績在同級中真正具有競爭力。
實際開源了什麼
星辰(Xing)系列是中國電信 TeleChat 血統的最新一代——TeleChat 今年 1 月才以「首個完全用國產晶片訓練的 MoE 模型」寫下歷史。Xing4.0-29B-A4B 於 9 月 17 日同步釋出三個版本:
- Xing4.0-29B-A4B — Apache 2.0 授權的完整權重(約 58.1 GB safetensors,最大分片 4.1 GB)
- Xing4.0-29B-A4B-FP8 — 量化訓練/推論版本
- Xing4.0-29B-A4B-GGUF — 本地部署格式;Q8_0 版本約 12 GB,單張高階消費級顯卡即可跑動
架構採用 2026 年高效智能體模型的標準配方:40 層、隱藏維度 3,584、MLA(Multi-head Latent Attention)、64 個路由專家(每 token 激活 4 個)外加 1 個共享專家。上下文長度在這個量級相當激進:原生 256K token,可擴展至 512K——因為智能體工作負載(整庫級編碼、長工具呼叫鏈、文件接地)的成敗就取決於上下文。
為智能體而非聊天機器人而生的架構
模型卡中有兩個設計亮點。第一,團隊描述了「mHC + MLA + MTP」技術棧:MLA 提供便宜的長上下文 KV 快取,MTP(Multi-Token Prediction)用於服務端的投機解碼,而 mHC——一種混合注意力變體——是團隊用華為原生核語言 Ascend C 手寫的融合算子實作。這個細節最容易被人略過,卻正是整個發布的核心:在 CUDA 世界裡現成可用的功能,在昇騰軟體棧上並不存在。中國電信的工程師必須自己打造、跨框架做數值對齊、再手工融合。
第二,模型明確針對「複雜工程任務」調優——多步規劃、工具呼叫、長推理鏈執行——並對 OpenCode、Claude Code、OpenClaw、Hermes 等智能體框架做了格式級適配。換言之,它的目標場景不是聊天視窗,而是在現有框架中運行的自主編碼或維運智能體。
效能數字:同級之中真的能打
中國電信把 Xing4.0-29B-A4B 拿去跟高效 MoE 級別兩個最直接的開源對手——Google 的 Gemma4-26B-A4B 與阿里巴巴的 Qwen3.6-35B-A3B——對比。智能體相關的結果最值得看:
| 基準 | Xing4.0-29B-A4B | Gemma4-26B-A4B | Qwen3.6-35B-A3B |
|---|---|---|---|
| SWE-bench Verified | 75.0 | 53.0 | 76.0 |
| SWE-bench Multilingual | 66.0 | 51.0 | 67.2 |
| Terminal-Bench 2.1 | 57.5 | 30.0 | 51.5 |
| Claw-Eval | 76.55 | 71.49 | 74.54 |
| DeepresearchBII | 60.8 | 39.3 | 59.7 |
| Tau3-Bench | 64.63 | 58.9 | 67.2 |
| AIME2026 | 90.0 | 88.3 | 92.7 |
| IFBench | 69.67 | 72.67 | 65.5 |
模式很一致:在智能體編碼與工具使用評測——Terminal-Bench、Claw-Eval、DeepresearchBII——Xing4.0 全面領先;SWE-bench Verified 上以一分之差緊咬 Qwen3.6,同時領先 Gemma4 達 22 分。Gemma4 在 IFBench(指令遵循)的領先是唯一明顯短板。沒有人會說這是前沿級模型,但「一個 Apache-2.0 的 29B MoE 能在 SWE-bench 上跟 Qwen3.6 拉鋸」在 2026 年是貨真價實的強勢發布——而它全程未動用一張 NVIDIA GPU 的事實,則是讓它具有地緣政治意義的註腳。
96% 這個數字:協同設計真正的價值
發布中技術上最耐人尋味的,是訓練效率的數據。團隊透過多層級協同最佳化——細粒度 MoE 通訊優化、選擇性重計算、「DVM」自動圖算子融合,以及前述手寫的 Ascend C mHC 融合核——讓整體訓練吞吐量比昇騰開箱即用表現提升約 96%。換句話說:接近翻倍的吞吐,不是來自更好的晶片,而是來自軟體協同設計。
這點之所以重要,是因為外界對非 NVIDIA 訓練棧的標準批評是:原始峰值算力會低估真實差距——核心成熟度、集體通訊調優、框架開銷都會把差距拉大。在昇騰 910C 叢集上做到接近 2 倍的純軟體端增益,正是國產算力棧從下方縮小「可用性差距」的埋頭苦幹證據。它與科大訊飛星火 X2-Flash、以及 2026 年稍早 DeepSeek 在昇騰上續訓練的工作互相呼應——不同團隊,同一課題:協同設計可以部分替代矽晶優勢。
生態系打法:處處提 PR,不築高牆
這次發布也展現了更成熟的開源策略。Xing4.0 的支援已提交(發布時待合併)到 SGLang(#39793)、vLLM(#57135)、TensorRT-LLM(#19283)、llama.cpp(#29012)與 KTransformers(#2168),並附上可直接複製的服務指令,包含 OpenAI 相容 API、MTP/EAGLE 投機解碼、以及 xing4 推理/工具呼叫解析器。微調路徑同時支援 LLaMA-Factory(全球主流)與 MindFormers(昇騰原生路徑),跨晶片部署則透過 BAAI FlagOS 一鍵完成。甚至還有 KTransformers 配方,在 GPU/CPU 異構環境下只留 24 個專家在 GPU 上就能跑。
對於承受「去 NVIDIA 化」採購壓力的中國企業,這就是推銷話術:一家電信級公司背書的 Apache-2.0 模型,從晶片、框架、算子到權重的完整血統都是國產的,可以部署在國家雲的昇騰叢集上,或任何能在最新出口管制震盪中倖存的硬體上。
為什麼重要
剝掉民族主義色彩,這個工程故事依然亮眼:小型總參數+小型激活+長上下文的高效開源模型前沿,多了一個按參數量計算能贏下真實智能體基準的新玩家。把地緣政治加回來,這次發布就成了一個標記:「完全用國產算力訓練」的宣示,已經從兆級參數的面子工程,下放到 300 億參數的務實主力級——也就是銀行、電信、政府系統整合商真正會大量部署的那一級。
真正的懸念是迭代速度。NVIDIA 的護城河從來不是單次訓練,而是數千個驗證過的核心、工具鏈與使用者習慣的複利。一個優秀的昇騰 29B 模型證明的是可行性;按時推出 Xing4.1、Xing5 並維持這種基準紀律,證明的才是一套生態系。而中國電信比多數公司都更懂網路效應的價值。
Sources
- [1] https://github.com/XingChen-AGI/Xing4.0-29B-A4B
- [2] https://huggingface.co/XingChen-AGI/Xing4.0-29B-A4B
- [3] https://www.chinatelecom.com.cn/ct/news/jtxw/168741.html
- [4] http://jjckb.xinhuanet.com/20260917/9f95e731e7f6467f84e321a71f9784bb/c.html
- [5] https://www.mindstudio.ai/blog/xing4-0-29b-a4b-model-release