← All posts / Models

阿里巴巴提前公開 Qwen4 架構:Qwen3.8-Flash-Next 開放權重 8 月 26 日登場

在權重上架前的幾小時,阿里巴巴將下一代 Qwen4 架構——GDN 混合注意力加上 Qwen Sparse Attention——包進開放權重的多模態 MoE 模型 Qwen3.8-Flash-Next 釋出,傳聞總參數 125B、激活參數 6B。

阿里巴巴提前公開 Qwen4 架構:Qwen3.8-Flash-Next 開放權重 8 月 26 日登場

2026 年 8 月 26 日北京時間 23:00,阿里通義千問(Qwen)團隊將做一件即使在 2026 年這個瘋狂節奏下都顯得不尋常的事:在下一代模型還沒有名字之前,先公開它的架構。Qwen3.8-Flash-Next——一個開放權重、多模態的混合專家(MoE)模型,建構在阿里巴巴明確稱為「將驅動即將到來的 Qwen4 系列」的下一代架構之上——預定於 ModelScope 與 Hugging Face 上線,而本地 AI 社群已經為它倒數了一整週。

訊號透過這類發布慣用的管道傳出。8 月 25 日,ModelScope 上出現一個帶有「Upcoming Open-Release」徽章的預告頁面,標語寫著「Onward to the Next-Gen — Lightning-Fast」,並附上指向 2026-08-26 23:00(UTC+8)的釋出倒數計時器。Qwen 團隊同日在 X 上發文強調:「下一波 Qwen 即將到來。」該頁面曾短暫下架——這是阿里巴巴處理保密發布時用過的手法——但截圖與社群鏡像保存了一切,倒數仍在進行。

已確認的資訊

剝掉傳聞的雜訊之後,已確認的輪廓本身就相當驚人:

  • 開放權重、多模態、MoE。 Qwen3.8-Flash-Next 是開放權重的多模態混合專家模型——不是純 API 服務,也不是稠密模型。
  • 兩項招牌架構變革。 根據 Qwen 團隊自己的聲明,此模型引入了 GDN 混合架構與 Qwen Sparse Attention(QSA,千問稀疏注意力)。這是被定位為定義 Qwen4 世代的兩大機制。
  • 它明確不是 Qwen4。 阿里巴巴將這次釋出定位為技術預覽(technology preview):在 Qwen4 系列到來之前,先把架構變革交到社群手中——推理引擎、量化核心、應用程式——讓生態系在第一天就準備就緒。
  • 時間點。 8 月 26 日北京時間 23:00,於 ModelScope 上線。

尚未確認的:參數量、授權條款、上下文長度、API 定價,以及所有基準測試分數。截至撰稿時權重尚未公開,因此不存在任何獨立評測。

傳聞的規格:總參數 125B、激活 6B

社群對已下架 ModelScope 頁面的分析——包括 @aijoey 在 X 上廣泛流傳的貼文——指向 125B 總參數 / 6B 激活的 MoE 配置,外加一個約 51B 的大型 n-gram 嵌入查詢表。如果屬實,Flash-Next 的每 token 激活計算量大約是廣受歡迎的 Qwen3.6-35B-A3B(約 3B 激活)的兩倍,同時保有高記憶體工作站真正跑得動的檢查點大小。

這個傳聞規格解釋了社群的反應分歧。圍繞洩漏形成的 Hacker News 討論串——正是 8 月初把 Qwen3.8-27B 推上 893 分榜首的同一批人——想要一個 MoE 兄弟型號,而 Flash-Next 回應了這個需求。但許多 RTX 5090 擁有者原本期盼的是能量化塞進 32GB VRAM 的 35B-A3B 直接後繼者。125B-A6B 是另一回事:

  • 128GB Mac Studio / MacBook Pro——搭配 Q4–Q8 的 MLX 版本應可勝任;統一記憶體是這裡的優勢。
  • RTX 5090(32GB)——部分可行:需要積極的 FP8/NVFP4 量化加上駐留 CPU 的專家,即 FreeToken 式的專家拆分——熱門專家快取在 GPU、冷門專家由主機記憶體服務。
  • Strix Halo / 大統一記憶體 APU——記憶體配置得當的話可行。
  • 單張 24GB 顯卡——不用神級的卸載技巧就別想了。這一層正是呼喊 35B-A3B 的族群。

本地 AI 評論者 Eric Boehs 在 Hacker News 上主張,訓練良好的 125B-A6B 可以達到接近 27B 稠密模型的效能,同時保有 MoE 的吞吐量優勢——而且在代理式編程(agentic coding)上能與 Claude Sonnet/Opus 級模型一較高下。這是社群期望的上限,不是基準測試表格;在 SWE-bench Pro 與 Terminal-Bench 的獨立評測數字出爐前,請把它當作 Flash-Next 即將被檢驗的假說。

真正的重點:GDN 混合架構 + Qwen Sparse Attention

猜參數量的遊戲很有趣,但這個架構才是本次發布對本地 AI 圈以外也重要的原因。

GDN(Gated Delta Network,閘控 Delta 網路)是阿里巴巴的線性注意力層。 標準 Transformer 會維護一個隨序列長度增長的 KV 快取,而 GDN 層保持一個固定大小的遞迴狀態,以學習到的閘控規則更新;其技術脈絡可上溯至 DeltaNet 與 Mamba-2。好處是:長上下文的成本不再隨長度膨脹,因為狀態不會增長,同時保留少數全注意力層來處理線性注意力不擅長的精確檢索。社群對開放權重的 Qwen3.8-2.4T-A95B 檢查點分析後統計出 69 個 GDN 層對 23 個全注意力層——大約三比一。Flash-Next 被描述為正是這個譜系上的「GDN 混合架構」。

QSA——Qwen Sparse Attention——則是真正的新東西。 目前沒有公開的技術說明:只有名字,以及它作為本次預覽兩大招牌變革之一的定位。這種資訊稀缺本身就是模式的一部分——2025 年底 Qwen3-Next 預覽 Gated DeltaNet 時文件同樣稀少,直到 Qwen3.5 系列大規模採用後架構才獲得完整規格。架構金絲雀先出現;文件與量產模型隨後跟上。

而這個模式正是這次的劇本。Qwen3-Next 於 2025 年底預覽 GDN;Qwen3.5 全面採用;Qwen3.8——包括以 Qwen3.8-2.4T-A95B 之名開源的 2.4 兆參數旗艦——在整個現世代延續了混合架構。如果歷史間隔可循,完整的 Qwen4 系列應在这次預覽的數個月之後而非數天之後到來。阿里巴巴正在賭:下一代架構值得在旗艦之前先送出去。

沒有其他實驗室跟得上的發布節奏

把視野拉遠,這一個月本身就是新聞。2.4 兆參數旗艦 Qwen3.8-Max 於 8 月 3 日發布;開放權重於 8 月 12–13 日跟進;免費 Apache-2.0 授權的 Qwen3.8-27B 數天後登場並攻佔 Hacker News 榜首;現在,8 月還沒結束,下一代的架構就以開放權重形式預覽。一個月內四場重大發布,從 2.4T 旗艦到架構預覽——無論開源或閉源,目前沒有其他實驗室以這種節奏迭代。

真正決定 Flash-Next 實際影響力的未決問題是授權。阿里巴巴近期的 Qwen 發布橫跨光譜兩端:Qwen3.8-27B 以無限制的 Apache-2.0 釋出,而 Qwen3.8-Max 的開放權重版本帶有營收門檻條款。Flash-Next 落在光譜哪個位置,決定了它會成為下一季本地代理式編程的預設模型,還是研究上的好奇標本。

上架當下還值得關注的:Unsloth 等量化團隊是否推出 day-zero GGUF 版本(他們已公開為此日期預做準備)、MLX 移植是否像 Qwen3.8-27B 那樣在數小時內出現、以及首批獨立代理式基準測試是否重現原廠的長時程任務宣稱。要擊敗的基準線並不貴:Qwen3.8-Max 目前以每百萬 token 2.00/6.00 美元的價格提供 1M token 上下文——這是下一代必須壓低的成本。

對開發者而言,實際建議是為架構做準備,而不只是為模型。Flash-Next 第一天就是個未經驗證的預覽——把工作負載的低風險副本導向它、與現有模型比較,讓生態系把核心打磨好之後,再讓關鍵任務依賴它。權重今晚釋出。Qwen4 系列則在阿里巴巴認為社群準備好的時候到來——而按照它自己的設計,這件事現在有一部分掌握在社群手中。