Qwen3.8-Max-0902 空降 Code Arena WebDev 榜首:阿里「編碼與協作」強化版以 1,691 分擊退 Claude Opus 5
阿里巴巴針對 Coding & Cowork 後訓練的 Qwen3.8-Max-0902,在 Code Arena WebDev 榜單從 1,669 躍升至 1,691 分奪冠,超越 Claude Opus 5(Max)與 Kimi K3 Max,混合單價僅約每百萬 token 5 美元。
阿里巴巴發布 2.4 兆參數旗艦 Qwen3.8-Max 還不滿一個月,Qwen 團隊就推出了定向強化版本。9 月 1 日,阿里雲將模型升級為 Qwen3.8-Max-0902——一個針對「Coding & Cowork(編碼與協作)」資料追加後訓練的版本。幾小時內,Arena 團隊就確認了結果:新檢查點以 1,691 分空降 Code Arena: WebDev 總榜第一,超越 Anthropic 的 Claude Opus 5(Max,1,687 分)與 Moonshot 的 Kimi K3 Max(1,674 分)——而且混合單價只有每百萬 token 約 5 美元。
這次到底更新了什麼
剝掉版本號後綴,故事其實很明確:這不是新的基礎模型。Qwen3.8-Max-0902 沿用了 8 月旗艦的完整架構——總參數 2.4 兆、每 token 激活約 950 億的混合專家(MoE)系統,以及 100 萬 token 上下文視窗(預覽版 API 後設資料列出可用上下文 983,616 token、最大輸出 131,072 token)。真正改變的是後訓練配方:阿里追加了新一輪強化學習與監督微調,聚焦點直指編碼與「協作」——也就是企業真正願意付費的那種多步驟、呼叫工具的辦公室任務。
命名方式延續了 Qwen 既有慣例(也是 DeepSeek 帶起的帶日期點版本風格):同家族、同權重骨架,日期後綴標記一次後訓練檢查點。r/LocalLLaMA 社群的反應相當即時——有人直呼這是「DeepSeek 式更新」,意指中國實驗室越來越把旗艦模型當成持續迭代的活系統,而非一年一換的世代跳躍。
可用性則是熟悉的兩段式節奏。截至發布當下,Qwen3.8-Max-0902 僅透過 QwenCloud(阿里 DashScope 生態系)API 提供,以相同價格取代 qwen3.8-max:多數地區輸入每百萬 token 2 美元、輸出 6 美元,部分區域標價 $1.65/$4.95。-0902 檢查點的權重尚未釋出。對照母版本的節奏——8 月 2 日 API 先行、8 月 13 日前後以 Qwen3.8-2.4T-A95B 之名在 Hugging Face 開源權重——多數觀察者預期這次強化最終會下放到開源權重線,但阿里尚未承諾時間表。
榜單數學
Arena 的結果是頭條,數字值得細看。前一版 Qwen3.8-Max 在 WebDev 榜上是 1,669 分。-0902 檢查點大漲 22 分來到 1,691,初步信心區間為 +19/-19——也就是說對 Claude Opus 5(Max)的領先仍在統計噪音範圍內,但趨勢毫無懸念。Arena 官方聲明特別點出模型在多步推理與工具呼叫上的突出表現,而這正是 WebDev 偏好式評測最獎勵的能力畫像:使用者給兩個匿名模型同一個網頁應用開發題,對產出投票選出自己想留下的版本。
同樣值得注意的是新模型在分數對價格的帕累托前沿(Pareto frontier)上的位置。Arena 指出 Qwen3.8-Max-0902 占據了該前沿上得分最高的位置——壓過 HY4 Preview(1,629 分、混合單價 $2.08/百萬 token)與 Qwen 自家的 Qwen3.8-Flash-Next(1,620 分、$0.39/百萬 token)。換句話說:比它便宜的都打不過它,跟它分數接近的都貴得多。Claude Opus 5(Max)的定價是 Qwen 這個檢查點 5 美元混合單價的數倍,這正是此類榜單成為 API 營收兵家必爭之地的原因。
為什麼「編碼與協作」重要
這次強化策略呼應了前沿實驗室優化目標的更大轉向。8 月的 Qwen3.8-Max 原版發表本身就是一場代理式編碼展示:阿里官方部落格描述該模型在一次自主運行中寫下約 7,600 行程式碼、執行超過 1,100 個動作、跑完 33 輪 GPU 訓練,全程由一套結合 issue 狀態機、分派器、監視器與看門狗、接上 GitHub Issues 的執行迴圈調度。
-0902 版本把這套論述推得更深。「Coding & Cowork」後訓練意味著模型不只針對一次性程式碼生成調校,而是針對真實工作中最混亂的中段:跨長對話維持上下文、按正確順序呼叫工具、從失敗的建置中復原,並產出辦公室使用者可以直接交接的成果——試算表、文件、儀表板。這正是 Anthropic、OpenAI、Google 在各自代理平台上纏鬥的同一塊疆域,也是中國實驗室迭代最凶狠的主戰場。
競爭格局解讀
三個觀察值得記下。第一,API 旗艦之間的差距現在是用個位數 Arena 積分衡量的,榜首每週易主——Claude Opus 5(Max)、Kimi K3 Max、Qwen3.8-Max-0902 之間的差距小於榜單自身的信心區間。第二,性價比才是可持續的護城河主張:每百萬 token 2/6 美元的定價,賭的是「與領先者統計平價、成本卻只有零頭」能拿下企業合約。第三,帶日期檢查點的節奏——8 月的 Qwen3.8-Max、8 月 28 日的 Flash-Next、9 月 1 日的 -0902——說明阿里把旗艦當成持續部署的產品在經營,背後是相當的工程成熟度。
對開發者的實際建議很簡單:如果你正在 QwenCloud 上打造網頁應用生成或通用編碼代理,把整合指向新檢查點——升級價格與前版完全相同,沒有理由留在 8 月的版本上。如果你在等開源權重,Qwen3.8-2.4T-A95B 倉庫仍是此一規模最後一個完全開放的檢查點,而歷史經驗顯示這次強化遲早會進到那裡。
WebDev 王座或許幾天內就會再度易手——±19 的初步分數向來如此。但作為 2026 年 9 月前沿競爭的快照,訊息很清楚:編碼模型榜首是橫跨三國的三方賽局,而那張桌子最便宜的席位,現在屬於杭州。
Sources
- [1] https://arena.ai/leaderboard/code/webdev
- [2] https://x.com/arena/status/2094974637704913198
- [3] https://www.linkedin.com/posts/qwen_qwen38-max-just-got-upgraded-meet-qwen38-activity-7500738758955126785-BqyO
- [4] https://cellcog.ai/blog/qwen3-8-max-0902/
- [5] https://aireiter.com/blog/qwen3-8-max-0902-api
- [6] https://qwen.ai/blog?id=qwen3.8
- [7] https://www.reddit.com/r/LocalLLaMA/comments/1w4x5uu/qwen38max0902_released/