阿里巴巴 Qwen3.8-Max:2.4 兆參數開源權重模型直追前沿
阿里巴巴的 Qwen3.8-Max 以 2.4 兆參數 MoE 架構,在代理電腦操作基準測試中超越 GPT-5.6 Sol Max 與 Claude Fable 5,成為開源權重模型的新標竿。
開源權重領域的新巨人
2026 年 8 月 2 日,阿里巴巴 Qwen 團隊正式發布了 Qwen3.8-Max——Qwen 家族迄今為止最強大的模型,也是該團隊首次以「Max 規模」推出的開源權重模型。這個模型擁有 2.4 兆參數,每次推理啟動 950 億活躍參數,採用混合專家(MoE)架構,目標是與 OpenAI 和 Anthropic 最強的閉源模型正面交鋒——而且從多項指標來看,它做到了。
這次發布是 AI 產業長期辯論中的一個關鍵時刻:開源權重模型能否真正匹敵專有前沿模型?僅僅一年前,Meta 的 Llama 和阿里巴巴早期的 Qwen 版本在基準測試中還大幅落後於 GPT 和 Claude。如今 Qwen3.8-Max 帶著在多個排行榜上名列前茅的成績問世,尤其是在「代理電腦操作」——當今 AI 系統最具挑戰性的能力領域之一。
代理任務基準測試的全面領先
核心數據令人矚目。根據阿里巴巴自家基準測試表(並由 BenchLM 獨立驗證),Qwen3.8-Max 在 OSWorld-Verified 達到 86.1 分——這項基準測試衡量 AI 代理自主操作作業系統、點擊應用程式、完成多步驟電腦任務的能力。這個分數超越了 OpenAI 的 GPT-5.6 Sol Max(83.2)和 Anthropic 的 Claude Fable 5(85.0),後兩者是 2026 年 8 月公認的閉源前沿模型。
除了 OSWorld 之外,Qwen3.8-Max 在 PaperBench 以 93.0 分領先,這是一項評估 AI 端到端復現科學論文能力的研究自動化基準測試。它還在 Terminal Bench 取得 86.6 分,測試命令列操作的熟練度。根據 Neowin 的分析,Qwen3.8-Max 在涵蓋程式編寫、代理和綜合能力的七個不同評估類別中擊敗了 Fable 5 和 GPT-5.6 Sol。
在 BenchLM 公開排行榜上,Qwen3.8-Max 以 79.6 分(滿分 100) 的綜合得分排名 217 個模型中的第 6 名,是 2026 年 8 月發布的所有模型中排名最高的。其資料頁顯示了 52 行經過來源驗證的基準測試數據,是今年紀錄最完整的模型發布之一。
架構與技術規格
Qwen3.8-Max 建立在混合專家(MoE)架構之上,這是 2026 年前沿開源模型的主流範式。擁有 2.4 兆總參數和 950 億活躍參數,它在每次推理時僅啟動約 4% 的總參數——這正是 MoE 設計的標誌性效率優勢,使模型能夠在保持推理成本可控的情況下達到前沿級別的品質。
主要規格包括:
- 總參數量: 2.4 兆
- 活躍參數量: 每 token 950 億
- 上下文視窗: 最高 100 萬 tokens(約 75 萬字)
- 模態: 原生多模態——可處理文字、圖片、影片和文件
- 定價: 每百萬輸入 tokens 2 美元,每百萬輸出 tokens 6 美元(透過阿里雲 API)
100 萬 token 的上下文視窗尤其值得注意。它使模型能夠在一次推理中處理整個程式碼庫、冗長的研究論文或多小時的影片內容——這項能力直到 2026 年中還只有少數頂級閉源模型具備。
Qwen 團隊強調,Qwen3.8-Max「在數十項內部和公開工作基準測試中展現了穩定、一致的進步,因為 RL 訓練持續擴大規模」,這意味著即使在發布之後,模型仍可能透過持續的強化學習進一步提升。
開源權重的承諾
Qwen3.8-Max 最具意義的面向,或許是阿里巴巴對開源模型權重的承諾。Qwen 團隊宣布,Qwen3.8-Max 和較小的 Qwen3.8-27B 變體都將作為開源權重模型在 Hugging Face 和 ModelScope 上發布。在 8 月 2 日 API 上線時,團隊表示開源權重將在「下週」推出。
這是一件大事。如果兌現承諾,Qwen3.8-Max 將成為有史以來發布的最大開源權重模型,在總參數量和活躍參數量上都超越 Meta 的 Muse-Glimmer 30B 和 MiniMax 的 M3。這對開源 AI 社群的意義非常深遠:研究人員、新創公司和企業將能夠使用一個真正的前沿級別模型——可以自行部署、微調和修改,而不需要依賴 API 或支付每 token 的費用。
Qwen 家族在開源社群中已有龐大的影響力。截至 2026 年初,Qwen 模型在 Hugging Face 上已累計超過 10 億次下載,是全球最受廣泛採用的開源 AI 模型家族之一。發布 Max 規模的權重將進一步鞏固阿里巴巴作為開源前沿模型領導者的地位。
競爭格局:2026 年 8 月的模型版圖
Qwen3.8-Max 進入了一個競爭激烈的領域。2026 年 8 月的開源權重排行榜競爭白熱化:
| 模型 | BenchLM 分數 | 核心優勢 |
|---|---|---|
| Qwen3.8 Max | 79.6 | 代理電腦操作、多模態 |
| MiniMax M3 | 68.8 | 程式編寫、100 萬上下文、成本效率 |
| Grok 4.5 | 75.4 | 最佳近前沿性價比(91% 的頂尖分數,成本降低 88%) |
| Nemotron 3 Ultra | ~72 | 長上下文任務、NVIDIA 優化 |
| GLM-5.2 | ~70 | 中文語境優化、代理能力 |
Qwen3.8-Max 脫穎而出的關鍵在於它在代理基準測試中的主導地位——這個類別最直接地衡量 AI 在真實數位環境中自主行動的能力。雖然程式編寫基準測試如 SWE-bench 在全行業都取得了戲劇性的進步(斯坦福 2026 AI 指數報告指出,一年內效能從 60% 提升到接近 100%),但代理電腦操作仍然是一個連頂級閉源模型都感到棘手的前沿領域。Qwen3.8-Max 在這裡稱霸,是一個有意義的信號。
更大的圖景:中國 AI 的崛起
Qwen3.8-Max 也是一個更大的地緣政治故事中的數據點。斯坦福今年發布的 2026 AI 指數報告得出結論:「中美 AI 模型效能差距已經實質消除。」 過去美國機構生產了絕大多數重要的 AI 模型,如今阿里巴巴的 Qwen 團隊、DeepSeek、MiniMax 和月之暗面(Kimi)等中國實驗室定期推出在公開基準測試上匹敵甚至超越西方對手的模型。
阿里巴巴的策略與眾不同:該公司不僅依賴 API 營收競爭,而是利用開源權重發布來建立生態系統鎖定效應。每一位下載 Qwen 權重、進行微調並在生產環境中部署的開發者,都成為 Qwen 生態系統的一部分。透過 Qwen3.8-Max,阿里巴巴押注於「免費提供前沿級別模型」將創造遠比將其鎖在付費牆後更大的長期價值——這種理念與 OpenAI 和 Anthropic 的封閉做法形成鮮明對比。
接下來值得關注
現在的關鍵問題是阿里巴巴是否會兌現開源權重的承諾。截至 8 月 13 日,權重尚未出現在 Hugging Face 上,Reddit r/LocalLLM 社群的一些成員對時間表表示了懷疑。如果權重如期發布,它將在一夜之間重塑開源 AI 的格局。如果延遲或縮減規模,則會抑制市場熱情。
無論如何,Qwen3.8-Max 都代表了開源權重 AI 的新高水位線:一個 2.4 兆參數的模型,不僅與閉源前沿競爭——在幾個重要類別中,它定義了前沿。
Sources
- [1] https://qwen.ai/blog?id=qwen3.8
- [2] https://venturebeat.com/technology/qwen3-8-max-arrives-with-a-bold-claim-it-outperforms-gpt-5-6-sol-max-and-fable-5-on-agentic-computer-use
- [3] https://www.neowin.net/news/alibaba-releases-qwen38-max-challenging-gpt-56-sol-and-claude-fable-5-on-ai-benchmarks/
- [4] https://benchlm.ai/models/qwen3-8-max
- [5] https://www.mindstudio.ai/blog/qwen-3-8-max-benchmarks-features
- [6] https://www.scmp.com/tech/article/3362738/alibabas-ai-model-qwen38-max-made-widely-accessible-ahead-open-weights-release