九天五款開源權重模型:能力溢價正在崩塌
8 月 21 日至 29 日,五家中國 AI 實驗室接連推出具備百萬 token 上下文的開源權重模型,價格卻壓在低價帶——OpenAI 的回應是降價 20%。前沿模型市場正式進入價格戰。
2026 年 8 月底這一週,將被記住為「能力溢價」死亡的一週。8 月 21 日至 29 日之間,五家 AI 實驗室——智譜 Z.ai、阿里巴巴、騰訊、MiniMax 與 DeepSeek——接連釋出開源權重模型,而且幾乎每一款都配備百萬 token 上下文視窗,價格卻壓在業界過去所謂的「低價帶」。沒有任何一家單獨宣稱對閉源前沿取得壓倒性領先;但五家加在一起,徹底摧毀了「前沿級能力必須搭配前沿級價格」這個假設。
這波浪潮的規模,從社群討論熱度就能看出。某個社群監測語料庫顯示,模型發布相關討論量從 8 月 15 至 21 日當週的 506 則,暴增至 8 月 22 至 28 日當週的 978 則——1.93 倍的成長反映的是真實的出貨速度,而非媒體炒作。九天內五款開源權重模型,即使以 2026 年的狂飆標準來看,也是史無前例。
實際上線了什麼
GLM-5.3-Flash(Z.ai,8 月 26 日):320B 總參數的混合專家模型(MoE),每 token 啟用 18B 參數,原生多模態,具備百萬 token 上下文,以寬鬆的 MIT 授權釋出。定價為每百萬輸入 token 0.15 美元、輸出 0.50 美元——而且 Z.ai 宣稱它在所有基準測試上都擊敗了自家前代旗艦 GLM-5.2,儘管體積不到一半。有趣的是,這款模型在正式亮相前,曾以匿名代號「Ox Alpha」在 OpenRouter 上低調運行了六天,在沒人知道它來自誰的情況下衝上排行榜前列。Flash 版發布兩天後,Z.ai 也兌現承諾,公開了完整的 GLM-5.3 旗艦權重。
Qwen3.8-Flash(阿里巴巴,8 月 26 日):多模態 MoE,同時是 Qwen4 架構的早期預覽:125B 參數加上 51B 的 N-gram 元件,開源權重,定價每百萬 token 0.16/0.47 美元。阿里巴巴示範了這款模型僅用 75GB 記憶體就能本地運行,並獲得 Unsloth 第一時間支援——這是一個明確訊號:Qwen 是為自架族群打造的,而不只服務 API 用戶。百萬上下文版本隨 OpenCode Go 出貨。
Hy4 Preview(騰訊,8 月 28 日):本批次的重量級選手:770B 總參數、49B 啟用,百萬 token 上下文,Apache 2.0 授權。代理工具廠商 Cline 回報 Hy4 在 SWE-bench Pro 上領先,並稱之為他們迄今測得最大的一次世代躍進。騰訊最有趣的宣稱帶有架構層面的意味:Hy4 能並行協調多個 Codex 工作階段並評估其結果——它是個指揮者,而不只是執行者。
MiniMax M3 與 M2.7(8 月 24 日):M3 是 428B 開源權重 MoE,具備百萬 token 上下文,並原生支援文字、影像與影片輸入。MiniMax 讓這兩款模型在 GMI Cloud 上免費使用十四天,可透過供應商 API 或閘道器存取。
DeepSeek V4-Flash-Vision-Exp(8 月 21 日):實驗性多模態模型,文字能力與 V4-Flash 持平,但在多模態代理基準上大幅躍進——據報在視覺代理任務上接近甚至超越 Anthropic 的 Opus 4.8。
閉源陣營在價格上讓步了
開源閘門大開的同時,閉源前沿也沒有閒著——但很說明的是,他們的動作集中在價格而非能力。8 月 21 日,OpenAI 將 GPT-5.6 Sol 的 API 定價調降超過 20%,為期三個月,輸入成本降至每百萬 token 4 美元、輸出 20 美元。路透社的報導一語道破:對手持續以低於 OpenAI 公開價格的費率搶市。聚合平台數據顯示折扣更深——某大型路由平台上 Sol 打五折、Terra 八折、Luna 兩折——使得 Sol 在某些平台上比 Anthropic 的 Fable 便宜超過三倍。
與此同時,Anthropic 在正式發布前就開始將用戶導向 Fable 5.1,Google 推出了 Gemini Omni 1.1 Flash,xAI 則把 Grok 4.6 上了 Vertex AI。沒有人以能力炸彈領銜。差異化戰場轉移到了帳單上。
三項從溢價功能變成標配的東西
讓這波浪潮成為結構性轉變而非一次性事件的原因在於:十八個月前還能收取溢價的三項功能,現在在低價帶已是標準配備:
- 百萬 token 上下文:GLM-5.3-Flash、Qwen3.8-Flash、Hy4 Preview、MiniMax M3 全部內建。百萬上下文不再是加價理由——它是入場券。
- 原生多模態:不是外掛視覺編碼器——GLM-5.3-Flash 是 GLM-5 系列第一款原生多模態模型,M3 還能處理影片。
- 寬鬆的開源權重:320B 模型採 MIT 授權,徹底改變了採購對話。企業的開源權重採用已從研究問題變成供應商核可清單上的一個核取方塊。
陷阱:每 token 便宜,不等於每任務便宜
「模型已商品化,別再糾結」這個誘人結論只對了一半,而錯的那一半會讓你燒錢。同一週的實戰報告說明了原因:一位開發者把 Opus 和 Sonnet 換成 GLM 和 DeepSeek,儲值 10 美元,結果全燒在簡單任務上;另一位發現透過編碼代理框架跑名義上便宜的模型,每個任務成本竟達數美元。這兩個都不是模型問題。真正的成本驅動因素在模型周邊:推理力度預設值(某廠商測得同一模型在中力度下以每任務 4.31 美元排在編碼榜第二名,但在最大力度下以 9.14 美元跌到第十六名)、快取行為(同一模型在某平台快取命中率高達 96%,另一平台卻只有 19%——相同工作的有效輸入成本相差五倍),以及供應商差異(同一款開源權重模型,最便宜與最貴的託管商之間存在 11 倍價差)。
因此,對 8 月底的正確解讀不是「模型不再重要」,而是:模型現在是便宜的部分,而圍繞模型的一切——路由、快取、力度調校、可觀測性——才是部署成敗與財務失血的關鍵。
接下來會怎樣
從數據形狀可以推出兩個預測。第一,開源權重模型將持續以 flash 級價格、前沿級宣稱的組合出貨,發布節奏將維持在兩週以內——閘道器營運商已回報市場沒有穩定的第一名模型,供給端增加模型的速度快到沒人來得及評測。第二,差異化將果斷地離開模型本身。當五家實驗室都能以每百萬 token 0.15 美元提供百萬上下文多模態開源權重時,決定部署優劣的,是 API 呼叫周圍的工程紀律。
能力溢價在九天內崩塌了。營運溢價的競賽,才剛要開始。
Sources
- [1] https://www.requesty.ai/blog/open-weight-frontier-august-2026-glm-qwen-hy4
- [2] https://huggingface.co/tencent/Hy4-preview
- [3] https://huggingface.co/Qwen/Qwen3.8-Flash-Next
- [4] https://www.reuters.com/technology/openai-cuts-developer-pricing-frontier-gpt-56-sol-model-by-more-than-20-2026-08-21/
- [5] https://huggingface.co/MiniMaxAI/MiniMax-M3