← All posts / Models

Qwen3.8-27B 開源登場:原生視覺、262K 上下文、Apache 2.0 授權

阿里巴巴以 27B 精巧開源模型內建視覺編碼器與 262K 原生上下文,Agentic 編碼分數讓兩倍大的模型顏面無光。

Qwen3.8-27B 開源登場:原生視覺、262K 上下文、Apache 2.0 授權

阿里 Qwen 團隊又出手了。繼八月初發布 2.4 兆參數的旗艦 Qwen3.8-Max 之後,公司於 8 月 14 日在 Hugging Face 上架了 Qwen3.8-27B —— Qwen3.8 家族中開放權重、易於部署的成員,採用 Apache 2.0 授權。一天之內,Hacker News 討論串就衝上 1,090 點。這個反應並非盲目追捧:這是一個 270 億參數的稠密模型,原生支援圖片與影片理解、預設開啟思考模式,繳出的 Agentic 編碼成績讓不少前沿級閉源模型都相形失色。

Qwen3.8-27B 特別在哪裡

在每週都有新模型問世的年代,這次發布有三個真正與眾不同之處。

第一,視覺是內建的,不是外掛。 Qwen3.8-27B 是原生視覺語言模型 —— 一個整合視覺編碼器的因果語言模型,能處理圖片與影片,從 STEM 圖表、掃描文件到一小時長度的影片都行。不需要另外接一條視覺管線,多模態請求也沒有額外的 API 溢價。對自架推論的團隊來說,把兩套部署堆疊收合成一套,可以說是這一代最實質的改變。

第二,這個量級的上下文視窗大得驚人。 模型原生支援 262,144 tokens 上下文,可擴充至 1,000,000 tokens —— 即將上線的 Qwen Cloud 官方託管版預設就會啟用百萬等級。27B 參數配上 25 萬 tokens,代表整個程式碼庫、完整開發歷史、或數小時影片,都能塞進一台放得進書桌下的硬體的工作記憶體裡。

第三,架構是真正的混合式。 64 層結構採用 16 個重複區塊,每個區塊由三層 Gated DeltaNet(線性注意力)搭配一層 Gated Attention 組成 —— DeltaNet 側有 48 個 V 線性注意力頭與 16 個 QK 頭,注意力側則是 24 個查詢頭、4 個 KV 頭、頭維度 256。這種分工讓便宜的線性注意力層處理絕大多數 token,把完整注意力留給最關鍵的位置,這正是 262K 原生上下文不會讓注意力成本爆炸的原因。模型還以多 token 預測(MTP)訓練,隱藏維度 5120,詞表填充至 248,320 tokens。

跑分:小模型,前沿級表現

模型卡上的數字,讓這次發布從「漸進改良」變成「世代跳躍」。所有編碼評測皆以 Claude Code harness、256K 上下文、temperature 1.0 執行。

在 SWE-bench Pro 上,Qwen3.8-27B 拿下 61.7 —— 高於 Qwen3.6-27B 的 53.5,也領先 Qwen3.7-Plus(57.6),甚至超過 Claude Opus 4.6 Max 官方回報的 53.4。在 Terminal-Bench 2.1(Terminus) 拿到 73.0,同樣超越 Qwen3.7-Plus 與 Meta 的 Muse Glimmer-30B,僅落後 Opus 4.6 Max 的 78.2。最戲劇性的躍升是 DeepSWE 1.1:42.2 分,相較 Qwen3.6-27B 的 13.3 與 Qwen3.7-Plus 的 14.2 —— 一個世代就讓深度 Agentic 編碼能力翻了三倍。自家 QwenSWEBench 說的是同一個故事:79.0 對上一代的 49.3。

多模態表格同樣強悍。OSWorld-Verified —— Agent 操作真實桌面的電腦使用評測 —— 拿到 84.3,不只贏過上一代 Qwen(63.9),也贏過 Opus 4.6 Max(72.7)。WebArena-Verified 為 64.8,AndroidWorld 為 81.9,新發布的多模態工具使用評測 ClawEval-MM 則為 Pass@3 57.4。通用推理也不含糊:GPQA Diamond 89.2、LiveCodeBench v6 90.3、指令遵循 IFBench 79.5。

當然要潑點冷水:它並非全面稱王。Humanity’s Last Exam 上 30.8 對 Opus 4.6 Max 的 40.0;在長程前沿 Agent 任務(Agents’ Last Exam)上也落後 Qwen3.7-Plus。最前沿的深度推理仍是大模型的戰場。但對多數開發者與企業實際要自動化的工作 —— 終端驅動編碼、倉庫級修復、文件處理、電腦操作 —— 差距已經實質消失。

彈性思考模式與熟悉的工具鏈

Qwen3.8-27B 預設以思考模式運作,會先輸出明確的推理段落再給最終答案。關鍵在於這可依請求動態調整:reasoning_effort 參數(xhigh、medium、low)讓你逐次呼叫在深度與延遲之間取捨,思考模式可整個關閉,而 preserve_thinking 能在多輪 Agent 對話中保留歷史訊息的推理上下文。任何看過 Agent 浪費 token 重新推導它早就知道的脈絡的人,都會感激最後這項功能。

下游相容性開箱即用。權重支援 Hugging Face Transformers、vLLM、SGLang 與 TokenSpeed,團隊並建議正式環境使用專用推論引擎。BF16 原版之外同步提供官方 FP8 量化版 —— 55.6 GB 的 BF16 下載量在 FP8 下約砍半,社群 Q4 量化版本可望讓 24 GB 消費級顯示卡在中等上下文下跑得動。不過 Hacker News 早期回報指出,長上下文的 KV 快取記憶體不如部分對手精省,16 GB 顯卡的買家對 256K 上下文要有心理準備。

為什麼重要

時空背景值得注意。就在 Hugging Face 統計顯示 Qwen 家族六個月內突破 30 億次下載 —— 超過 Google 與 Meta 開源模型總和 —— 之後幾天,這個模型問世;這也是輝黃仁勳與多位業界人士連署呼籲華府勿限制開源模型出口後,第一個重量級開放權重發布。一個 Apache 2.0 授權、原生視覺、前沿級 Agentic 編碼、又有百萬 token 路線圖的 27B 模型,既是送給開發者的禮物,也是地緣政治宣言:AI 堆疊的開放權重層,如今制定節奏的不只是舊金山,還有杭州。

對工程團隊來說,實際結論很簡單。如果你正在評估自架模型做編碼 Agent、文件智慧或桌面自動化,Qwen3.8-27B 剛剛重新定義了單卡部署的天花板。去下載它,用你自己的程式碼庫跑 SWE-bench Pro harness,在你簽下一份推論合約之前,先把電腦使用評測數據對照你的實際工作流程。權重現在就在 Hugging Face 與 ModelScope 上 —— 而且不像多數只在 Hacker News 紅一天的東西,這次的你真的可以留著。