← All posts / Models

Qwen3.8-Flash-Next:阿里巴巴提前揭開 Qwen4 架構的面紗

阿里巴巴 Qwen 團隊發布 125B 參數的開放權重模型,預覽 Qwen4 架構:混合線性注意力、51B 參數的 n-gram 嵌入層,以及每 token 僅 6B 活躍參數。

Qwen3.8-Flash-Next:阿里巴巴提前揭開 Qwen4 架構的面紗

大多數模型發布都是漸進式迭代:更大的叢集、更多訓練 token、更高的跑分。但阿里巴巴 Qwen 團隊在 2026 年 8 月 26 日發布的東西,在性質上截然不同。Qwen3.8-Flash-Next 是一個開放權重(open-weight)的多模態 Mixture-of-Experts 模型——而且它是第一個採用 Qwen4 架構的公開成果。可以把它理解為一個「附帶可下載權重的研究預覽版」:125B 總參數、每 token 僅 6B 活躍參數、一個 51B 參數的 n-gram 嵌入層,以及一套在大部分深度上捨棄全域注意力的混合式設計。

對於追蹤前沿模型設計走向的人來說,這是今年資訊密度最高的發布之一。以下拆解它實際上裝了什麼。

核心規格

根據 Hugging Face 上的官方模型卡,Qwen3.8-Flash-Next 是一個因果式視覺語言模型,結構如下:

  • 總參數量: 125B,每 token 僅 6B 活躍——外加 51B n-gram 嵌入與 4B 多 token 預測(MTP)層
  • 上下文長度: 原生 262,144 token,可擴展至 1,000,000 token
  • 層數: 48 層,重複布局為 12 ×(3 ×(Gated DeltaNet → MoE)→ 1 ×(Qwen Sparse Attention → MoE))
  • 專家數: 共 512 個,每 token 啟用 10 個路由專家 + 1 個共享專家
  • 隱藏維度: 2560;token 詞嵌入 248,320(填充後)
  • N-gram 嵌入表: 第 2 層收錄 20,000,000 個 bigram/trigram
  • 授權: Qwen Community 1.0(社群授權,非 Apache 2.0)

最引人注目的是啟動比例。125B 總參數中只有 6B 活躍,約 4.8% 的啟動率——遠低於一般開放權重 MoE 模型,這也是它能在 Qwen Cloud 上採取激進定價的原因:生產版 Qwen3.8-Flash 每百萬輸入 token 僅 0.16 美元、每百萬輸出 token 0.47 美元,且預設開啟 1M 上下文。

四項架構賭注

模型卡將 Flash-Next 定位為對「現代大型語言模型核心元件如何在規模上互動」的根本性重新思考。支撐這個說法的是四個想法。

一、混合注意力與 Qwen Sparse Attention(QSA)。 團隊沒有沿用早期 Qwen 世代的 Gated DeltaNet + Gated Attention 組合,而是將 Gated DeltaNet(線性注意力家族)與新的稀疏注意力機制配對——後者在微區塊(micro-block)層級運作,而非挑選個別 token。QSA 配置使用 24 個 query head 與 2 個 KV head(head 維度 256)、一個具 4 個 query head 與 1 個共享 key head 的 MQA 索引器,預算為 512 個區塊或 2048 個 token。官方宣稱的效益:大幅降低長上下文延遲——這對反覆消化數十萬 token 上下文的代理式(agentic)工作負載最為關鍵。

二、Gated Residual。 帶正規化的殘差流是深層訓練得以成立的基礎。Flash-Next 加入了一個逐元素、依賴資料的讀取閘門與每分支的純量寫入閘門(4 個分支、瓶頸秩 320),用來調製流經加寬殘差流的資訊——在不破壞訓練穩定性、幾乎不增加推論開銷的前提下,提高每一層的表達能力。

三、N-gram 嵌入。 這是最不循常規的部分。這個 51B 的 n-gram 嵌入表——在第 2 層以短 bigram/trigram 索引——提供了一條幾乎不需要計算、且比 MoE 專家更適合卸載(offload)的參數擴展軸。換句話說:你可以便宜地「儲存」這些參數,卻不必在每次前向傳播中為它們付費。它本質上是一張巨大的、學習出來的 token 二元組與三元組統計查找表,供注意力層取用。r/LocalLLaMA 上的社群記憶體估算顯示,理想 4-bit 量化後約需 82 GB(約 58 GB 主權重 + 約 24 GB n-gram 表)——體積不小,但已在單台高記憶體工作站的可及範圍內,而 n-gram 部分因為存取稀疏,恰好適合快取與卸載。

四、量身打造的訓練配方。 團隊對不同類別的權重分別使用 Muon 與 AdamW 優化器,重新擬合 scaling law 以完全消除 batch size 熱身(訓練直接從目標 batch size 開始),並以更少的總優化器步數支撐更大的學習率。這是 2026 年的低調趨勢:優化器的選擇不再是超參數層面的後見之明,而是架構層級的決策。

跑分表現

在官方評測表中,Flash-Next 的比較對象包括 Qwen3.8-27B、Qwen3.7-Plus(397B 總參數/17B 活躍)、DeepSeek-V4-Flash-0731(284B/13B)與 Claude Opus 4.6(Max)。重點成績(最佳成績由 Qwen 加粗標示):

  • 代理式編程(DeepSWE 1.1): 58.7——領先 DeepSeek-V4-Flash 的 54.4,遠超 Qwen3.7-Plus 的 16.5
  • SWE-bench Pro: 62.5,對比 Claude Opus 4.6 的 53.4
  • SWE-bench Multilingual: 81.0,對比 Claude 的 77.5
  • 長時程辦公任務(CoWorkBench): 73.9,對比 Claude 的 68.2
  • 專業職能任務(JobBench): 55.7——比 Qwen3.8-27B 的 33.4 高出 22 分
  • 前沿代理任務(Agents’ Last Exam): Pass@1 24.3、分數 51.2
  • GPQA Diamond: 91.7;LiveCodeBench v6: 91.9;IFBench: 81.3

視覺語言成績對一個「實驗性預覽」而言同樣亮眼:AndroidWorld(手機代理)84.5、OSWorld 2.0(電腦操作)二元 19.4/部分 52.3、LVBench(長影片理解)76.6、RealWorldQA 88.5。

不過有兩個誠實的警告必須並列。第一,大部分基準模型的成績是由 Qwen 團隊在修正後的基準版本上重新評測的——廠商自跑的比較需要獨立重現,而且 8 月初 Qwen3.8-Max 發布時就曾在 r/singularity 上被批評「benchmaxxed」,獨立數字出爐後實際表現較接近 GLM-5.2 等級。第二,HLE(Humanity’s Last Exam)依然令所有模型謙遜:Flash-Next 為 35.9,Claude Opus 4.6 為 40.0。

為什麼重要

戰略層面的解讀與規格同樣重要。Flash-Next 實質上是 Qwen 團隊打算帶入 Qwen4 的想法的公開壓力測試:區塊級稀疏注意力、透過 n-gram 嵌入獲得的「零計算」參數容量、閘控殘差,以及混合優化器。公開權重(Hugging Face 與 ModelScope 提供 bf16,社群 GGUF 量化在數小時內跟進,Unsloth 也發布了本地部署文件)讓整個生態系在旗艦出貨前就能找出失敗模式——量化行為、推理框架相容性、長上下文衰減。

這也延續了中國團隊在效率端市場的開放權重攻勢。一個 6B 活躍參數、256K 上下文、每百萬輸入 token 0.16 美元的多模態模型,瞄準的正是那些由推論成本(而非峰值智能)決定採購的高量級代理工作負載。背景是:阿里巴巴自研的 T-Head 晶片據報導已有超過 60% 的供應能力分配給外部客戶,而該公司能在國產晶片上完成模型開發的能力,越來越被視為對沖美國出口管制的籌碼。

對開發者而言,實際結論很簡單:如果你在打造會讀取大型程式碼庫、或需要長時程記憶的代理,Flash-Next 值得本週就跑一次評測。推理支援包含 SGLang、vLLM 與 TokenSpeed,思考模式預設開啟(reasoning_effort 可從 xhigh 調到 low),而生產級的 Qwen3.8-Flash API 定價比多數閉源替代方案低一個數量級。

如此透明的架構預覽並不多見。無論 Qwen4 最終是什麼模樣,它的承重構件現在已經公開、可下載,而且正在被網路上的陌生人拿去做量化——這正是驗證一組想法是否真正可行的最佳方式。