← All posts / Models

吞噬旗艦的 Flash:DeepSeek V4.1 Flash 正式登場——並讓 V4 Pro 退役

DeepSeek 這款 552B 參數、原生多模態的新 MoE 模型在 agent 基準測試上擊敗自家旗艦——公司因此宣布 9 月 14 日起所有 V4 Pro 流量改由它承接,並以 Flash 價格計費。

吞噬旗艦的 Flash:DeepSeek V4.1 Flash 正式登場——並讓 V4 Pro 退役

模型發布通常有一套固定劇本:更大的旗艦登場,去年的模型降價、被禮貌性地邊緣化。DeepSeek 這次直接撕掉了劇本。2026 年 9 月 10 日,該公司正式發布 DeepSeek-V4.1-Flash——新架構家族中最小的模型,具備原生多模態視覺理解能力——並在同一份公告中宣布:自家旗艦 V4 Pro 將停止服務自己的流量。自 9 月 14 日北京時間中午 12 點(UTC 04:00)起,所有打向 deepseek-v4-pro 的請求都會被路由到 V4.1 Flash,並按 Flash 價格計費,直到未來的 V4.1 Pro 推出為止。

對於建立在 Pro 端點上的開發者來說,這不是一紙例行的棄用通知,而是一次強制遷移——遷往一個更便宜、更快的模型,而且 DeepSeek 用自家基準測試數據主張:它已在效能、成本、速度與總任務完成時間上全面超越旗艦。

V4.1 Flash 究竟是什麼

核心數字描述了一個 5,520 億參數的混合專家(MoE)骨幹——幾乎是前代 V4 Flash 284B 的兩倍——但真正讓它跑得動的是活化參數的設計:讀取輸入時僅活化 8B 參數,生成輸出時活化 16B,低於 V4 Flash 全程 13B 的水準。架構形態也變了。V4.1 Flash 捨棄純 MoE 解碼器,改用因果編碼器—解碼器(Causal Encoder-Decoder)設計,包含 20 層編碼器與 20 層解碼器,並搭配一個獨立於骨幹之外、參數量 196B 的「Engram」條件記憶模組。

另有兩個亮點值得注意。其一,視覺能力不再是外掛的實驗性兄弟模型(已退役的 V4-Flash-Vision-Exp):V4.1 Flash 從預訓練階段就原生支援影像理解。其二,本次發布採 MIT 授權,延續 DeepSeek 开放前沿級權重的慣例——模型權重已上架 Hugging Face。

效率工程是這次發布的隱藏主角。壓縮稀疏注意力第二代(Compressed Sparse Attention 2)與 FP4 KV 快取,把全域 KV cache 壓到每 token 890 位元組——約為 V4 Flash 的四分之一,官方數據稱比 DeepSeek-V1 減少 437 倍。在 100 萬 token 的上下文視窗裡,這是「記憶體預算塞得進一個機櫃」與「塞不進」的差別。

基準測試面貌——及其但書

DeepSeek 的更新日誌列出了一份異常寬廣的評測成績單:GPQA Diamond 90.9、HLE 36.8(純文字子集 39.1)、Codeforces 評分 3471、MathArena Apex 65.6、Terminal-Bench 2.1 達 90.6、DeepSWE v1.1 達 74.2、CyberGym 88.1、搭配工具的 HLE 則為 63.9。

與即將退役旗艦的對比才是耐人尋味之處。在 agent 工作上,Flash 全面獲勝:Terminal-Bench 2.1 以 90.6 對 87.9,DeepSWE v1.1 以 74.2 對 62.7——在現今最艱難的軟體工程 agent 基準之一上領先 11.5 分。但在無輔助的知識與推理方面,旗艦仍守得住:V4 Pro GA 版在基礎模型比較中拿下 GPQA Diamond 92.4、SimpleQA-Verified 55.2,Flash 則為 90.9 與 42.3。換句話說,新模型是更好的 agent,卻是稍差的百科全書。

DeepSeek 還做了一件模型卡上罕見的誠實之事:公布同一個模型在八種不同 agent 腳手架下的分數。僅因工具鏈差異,DeepSWE 的分數波動就達 8.7 分——比任何已發布比較中前三名模型之間的差距都大。凡是把單一數字的基準表格當成真理的人,都應該咀嚼一下這個數字。

定價、遷移與意義

V4.1 Flash 的價格為尖峰時段每百萬輸入 token 0.30 美元、每百萬輸出 token 1.20 美元,離峰時段半價。對從 V4 Pro 遷移過來的流量而言,這相當於 cache-miss 輸入成本約降 77%、輸出成本約降 70%。在 API 上,模型以 deepseek-flash 名稱提供服務;已退役的 deepseek-v4-flash 與 deepseek-v4-flash-vision-exp 名稱暫時路由到新模型,確保既有程式碼持續運作。

這次發布延續了 DeepSeek 一貫的壓縮時程。9 月 9 日先出現限時 beta,模型名稱直接把到期日寫在臉上——deepseek-v4.1-flash-expires-on-0910——beta 定價比照 V4 Flash,每帳號限 20 個並發請求。一天之後正式版落地,連同 V4 Pro 的路由決定一起宣布。同日,DeepSeek 的 Harness 工具鏈更新至 0.1.5,加入 V4.1 Flash 支援、檔案上傳與側邊欄預覽。

更大的訊號在架構層面。DeepSeek 明言新設計的目標是「更高的能力上限、更快的推理、更高的吞吐,並可擴展至更大的模型」——這讀起來像是為同一套因果編碼器—解碼器加 Engram 骨架上的 V4.1 Pro 進行預演。當一個新家族中最小的模型,已經能在 agent 工作上以幾分之一的成本取代上代旗艦時,這個家族的天花板就移到了某個有趣的位置。開源社群拿到了 MIT 授權的權重,而所有 API 客戶拿到了一個四天倒數:評估自己依賴 Pro 的管線是否準備好了。

對一家兩年來不斷重新定義「前沿級能力應該值多少錢」的公司而言,用路由把自家旗艦送去給便宜模型接班,是最 DeepSeek 式的操作。