Qwen3.8 開放權重登場:阿里巴巴一次釋出 2.4 兆參數 MoE 旗艦與可在地端跑的 27B 多模態模型
阿里巴巴兌現承諾:Max 級的 2.4 兆參數 Qwen3.8-2.4T-A95B 與多模態 Qwen3.8-27B 本週以 Apache 2.0 授權登上 Hugging Face。
當阿里巴巴的 Qwen 團隊在七月預覽 Qwen3.8-Max 時,聲明中附帶了一個不尋常的承諾:開放權重(open weights)也會一併釋出。社群對此多半抱持禮貌性的懷疑——過去 Max 級的 Qwen 模型一向是純 API 產品,只有較小的等級才會開放。而這個星期(2026 年 8 月 13 日至 14 日),阿里巴巴說到做到:兩個模型檔案以 Apache 2.0 授權登上 Hugging Face 與 ModelScope——旗艦模型的完整開放權重版 Qwen3.8-2.4T-A95B,以及專為在地端硬體打造的多模態伴隨模型 Qwen3.8-27B。這兩者合計,是今年規模最大的開放權重發布,也是迄今最強的訊號:AI 領域中「開放 vs. 封閉」的前沿界線,確實已經移動了。
實際釋出了什麼
主角是 Qwen3.8-2.4T-A95B。名稱本身就是架構說明:這是一個稀疏混合專家(Mixture-of-Experts)模型,總參數量 2.4 兆,每個 token 約啟用 950 億參數。正是這種稀疏設計,讓這個規模的模型有實用可能——稠密的 2.4 兆模型根本無法部署,但每個 token 只路由到一小部分專家,使推理成本維持在中型模型的水準,同時保有巨型模型的知識容量。檔案以 Hugging Face Transformers 格式發布,相容 vLLM 等主流推理引擎,而社群的量化版本在數小時內就跟上了——包括透過 FlagOS 軟體棧發布的 INT8 版本,以及 Unsloth 等團隊 inevitable 的 GGUF 轉換潮。
第二個發布的 Qwen3.8-27B,影響力可能更即時。這是一個原生多模態模型,具備視覺與推理能力、256K token 的上下文視窗,硬體需求讓認真等級的消費者設定也負擔得起:Unsloth 的文件指出,量化後可在 17 GB 的 RAM/VRAM 環境於本地運行;全精度部署則需要 24 GB 級的 GPU。如 Hugging Face 模型卡所言,這是「廣受喜愛的 Qwen 模型之續作,帶來無與倫比的智慧密度」——一個瞄準單 GPU 開發者、本地部署與離線工作流程的稠密模型,而這些族群是前沿 API 模型從未服務過的。
效能表現如何
根據阿里巴巴的發布資料,Qwen3.8-Max 為 Qwen 家族的編碼與協作任務設下新標竿,發布文章特別強調其整合式代理架構——將 issue 狀態機、派送器、監控器與看門狗組合成單一執行迴圈,用於 GitHub 驅動的開發工作流程。第三方評價較為保留但仍屬正面。在 Hacker News 上,早期的基準測試討論將 2.4T 版本形容為「與 Opus 4.8 和 Sol 互有勝負,整體落後 Fable 約 10 到 20 分」——也就是說,在許多面向上與目前這一代的西方前沿模型具競爭力,即使不是穩居榜首。在社群評測排行榜上,該模型在共享結果中已名列第二,對開放權重系統而言是相當強勢的初次登場。
27B 模型也獲得了自己的掌聲。本月稍早,針對 Qwen3.8-Max 視覺能力的獨立測試已將這個家族推上 Roboflow VLM 物件偵測基準的榜首,而 27B 更把多模態能力帶進一個還很少見視覺支援的尺寸級距。以「很難被取悅」聞名的 Reddit r/LocalLLM 社群,對 27B 的釋出展現了真正的熱情——這是本地模型命中目標的可靠指標。
當然並非一切完美。部分 Hugging Face 討論串對初始版本缺少某些社群期待的能力表達失望——尤其是 2.4T 檔案缺乏視覺支援,相較於 Kimi 等競爭對手的發布特別被點名。阿里巴巴回應表示後續版本將補上額外能力,但對今天就在評估這個檔案的採購者而言,缺口是真實存在的。
旗艦模型開放權重為何重要
其戰略意義說來簡單,卻值得深入思考。這是 Qwen 有史以來第一次開放 Max 級模型。過去阿里巴巴的模式與業界如出一轍:中階模型公開發布,旗艦模型則透過阿里雲、Qoder 與 Token Plan 的 API 存取來變現。打破這個模式,讓 Qwen3.8 在開放陣營直接與全封閉的前沿競爭——也對所有「較小模型、即將推出」的西方實驗室形成壓力。
這也延續了 2026 年的定義性趨勢之一:開放權重 AI 的重心已決定性地移向中國。Qwen3.8 抵達的時間點,就在 Moonshot 的 Kimi K3 開放權重發布之後沒幾天,而中國 AI 公司之間打造更大、更強基礎模型的競賽正日趨白熱化。以 Apache 2.0 釋出 2.4 兆參數,阿里巴巴等於把一個前沿等級的基礎模型捐給了全世界——任何公司、實驗室或政府都可以自行架設、微調、修改,並在其上打造產品,無需談判授權,也不必按 token 付費。
對企業而言,決策計算以具體的方式改變了。社群已記錄的 INT8 部署路徑,讓 2.4T 模型在一座規劃良好的推理叢集內就能運行,而不需要超大規模資料中心。對受管制的產業、資料主權部署與成本敏感的高流量工作負載來說,「接近前沿、完全開放、可自行架設」是一個真正有吸引力的定位——而這是封閉 API 在結構上無法提供的。
但也要留意
兩個但書讓慶祝保持清醒。第一,就算有啟用參數的效率優勢,2.4 兆總參數仍意味可觀的儲存與記憶體佔用,實際的服務配置需要細緻的工程;社群上關於實戰 vLLM 設定的早期討論,就挖出了不少令人意外的細節。第二,旗艦檔案缺少視覺能力,意味這次發布還不是開放權重需求的完整解答,而競爭對手的開放模型今天確實填補了其中一些空缺。
但這些都只是一等公民的挑剔。一年前,問題還是「會不會有任何開放模型接近前沿」。這個星期,問題已經變成「要下載哪一個前沿模型」——而這本身就是一個非凡的局勢。