← All posts / Models

Qwen3.8-Flash-Next:阿里巴巴開源 Qwen4 架構的首波預覽

阿里巴巴 Qwen 團隊開源一款 125B 參數的 MoE 模型,每 token 僅啟動 6B,兼顧百萬級上下文與 GDN + QSA 混合注意力,在代理式編程基準上超越 Claude Opus 4.6 Max。

Qwen3.8-Flash-Next:阿里巴巴開源 Qwen4 架構的首波預覽

2026 年 8 月 26 日,阿里巴巴 Qwen 團隊低調釋出了今年最具份量的開源權重模型之一:Qwen3.8-Flash-Next——一個總參數量 1250 億、每 token 僅啟動約 60 億參數的多模態混合專家(MoE)模型。「Next」這個後綴並非行銷話術:官方明確將它定位為 Qwen4 架構的早期預覽,使其成為阿里巴巴下一代模型設計的第一個公開實體。對於關注開源模型走向的人而言,這次發布与其說是產品上市,不如說是一份關於「極致性價比」的研究宣言。

架構新在哪裡

Qwen3.8-Flash-Next 從四個層面系統性升級——注意力、殘差連接、嵌入與最佳化——其中注意力機制的重新設計是核心。團隊打造了一套混合注意力架構,在模型的 48 層中交錯使用兩種截然不同的機制:

  • Gated DeltaNet(GDN):佔 48 層中的 36 層。GDN 是線性注意力的變體,其鍵值(K/V)狀態隨上下文增長僅近乎恆定,這正是讓百萬 token 推理在經濟上變得可行的關鍵。GDN 與全注意力層 3:1 的比例,本身就是一個結構性押注:絕大多數 token 走便宜的路徑。
  • QSA(區塊級稀疏查詢注意力):佔其餘 12 層。與 GDN 不同,QSA 層的 K/V 狀態會隨上下文增長,但 QSA 是在微區塊(micro-block)層級運作,而非對整個序列做注意力——線性注意力頭數為 value 48、query 16——藉此大幅降低長上下文延遲,同時保留精確檢索能力。

其設計哲學相當務實:純線性注意力在需要精確長程回憶的任務上會退化,而純全注意力在百萬 token 規模下成本難以承受。Qwen 的解法是把「全精度注意力」當成稀缺資源——只留 12 層——其餘運算預算全部投入恆定記憶體的近似機制。值得一提的是,Qwen3-Coder-Next 今年稍早已採用類似的混合思路,但 Flash-Next 將稀疏度與上下文企圖心又推了一大步。

模型原生支援 262K 上下文,並可透過 YaRN 擴展至 100 萬 token,且是完全多模態——文字與視覺共用同一組權重,沒有額外的視覺適配層。

基準測試:小啟動量,代理式編程大戰力

最引人注目的數字來自代理式編程(agentic coding),顯然是模型的重點最佳化方向。Qwen 公佈的成績包括:

  • SWE-bench Pro 62.5 分——在同一評測框架下超越 Claude Opus 4.6 Max 的 53.4 分
  • DeepSWE 1.1 拿到 58.7 分,這是一項考驗長時程軟體工程能力的評測
  • CoWorkBench 73+ 分,屬於辦公工作流代理基準家族
  • SWE-bench(verified)81.0 分

必須坦白說明的但書:這些是 Qwen 自家框架下的數字,而且團隊註明有問題的任務已被修正、所有基線模型都在改良後的基準上重新評測——雖然有揭露,但這仍意味著比較基礎是 Qwen 的重跑結果,而非中立第三方。不過跨所有已公佈評測的型態相當一致:一個每 token 僅啟動 6B 參數的模型,在先前由更稠密的前沿系統盤據的領域——尤其是代理與編程任務而非純知識回憶——站穩了腳跟。

經濟學故事

發布部落格的標題是「A New Architecture, Towards Ultimate Cost-Efficiency」(新架構,邁向極致成本效率),而定價確實支撐了這個論述。在 QwenCloud 上,正式 API 版本 qwen3.8-flash 定價約為每百萬輸入 token 0.16 美元、每百萬輸出 token 0.47 美元。路透社報導指出,該模型在編程與辦公任務上表現更強,同時相較前一代 Flash 大幅削減訓練成本。當一個 6B 啟動量的 MoE 模型摸到前沿級的代理式編程基準,每解決一項任務的成本就下降一個數量級——這正是足以撼動工作負載遷移的那種變化。

社群很快點出一個細節:Qwen3.8-Flash-Next 是開源權重版,而 Qwen3.8-Flash 才是內建百萬上下文與工具支援的正式 API 版本。Hugging Face 上的開源權重與 API 版本的參數計算方式略有出入(HF 模型卡在某些檢視下列出約 180B 總量的基礎配置,125B/A6B 則是常被引用的後訓練數字),部署者務必確認自己拉取的具體檢查點。

取得方式

權重已以 Apache 2.0 授權上架 Hugging Face(Qwen/Qwen3.8-Flash-Next),並已登陸 Ollama——包括 Apple Silicon 的 MLX 版本(125b-a6b-mlx-bf16 標籤),這意味著一台配置足夠的 Mac Studio 就能在本地跑起 Qwen4 架構預覽。Ollama 函式庫頁面形容它為「第一個採用 Qwen4 架構的開源權重模型」,與 Qwen 官方說法一致。r/LocalLLaMA 社群反應熱烈,發布當天的討論串中已有使用者在 DGX Spark 等單 GPU 環境上實測。

為什麼重要

對關注開源模型生態系的人,有三個重點:

  1. 架構成為新的擴展槓桿。 在訓練運算成本承壓的時代,Qwen 選擇在推論經濟學上競爭,而非堆疊原始參數量。3:1 的 GDN 對 QSA 混合比例加上百萬上下文,是一個具體、可複製的設計參考點,而 Apache 2.0 授權意味著從新創到對手實驗室都能深入研究。
  2. 代理式編程前沿如今有開源權重參戰。 在 SWE-bench Pro 上超越 Claude Opus 4.6 Max——即使是在自家框架上——十二個月前對開源模型而言仍難以想像。這顯示 Anthropic 最強的商業護城河正面臨實質的邊際壓力。
  3. Qwen4 的輪廓已經公開。 透過開源架構預覽,阿里巴巴一方面在下代旗艦發布前搶佔聲量,另一方面形同把驗證工作眾包出去:每一次社群部署 Flash-Next,都是對 Qwen4 地基的免費壓力測試。

反方觀點在於穩健性。混合線性注意力模型過往在某些長上下文回憶任務上曾出現品質斷崖,早期單機報告也提到部分查詢情境下表現退化。12 層 QSA 是否足以在百萬 token 規模下擋住這些斷崖,正是未來幾週社群評測要回答的問題——而對阿里巴巴來說恰好順水推舟:這些評測對象,正是他們下代旗艦的架構,而且完全免費。