每 token 僅啟動 8B 參數、KV 快取壓到 890 位元組:DeepSeek V4.1-Flash 全面超越自家旗艦——然後把它淘汰
DeepSeek 新發布的 552B 參數 MoE 模型,每個輸入 token 僅啟動 8B 參數,KV 快取壓縮至每 token 890 位元組,在 Terminal-Bench 2.1 與 DeepSWE 上擊敗 V4-Pro——並將於 9 月 14 日承接旗艦模型的 API 流量。
每 token 僅啟動 8B 參數、KV 快取壓到 890 位元組:DeepSeek V4.1-Flash 全面超越自家旗艦——然後把它淘汰
2026 年 9 月 10 日,DeepSeek 發布了 DeepSeek-V4.1-Flash,而這場發布會讀起來不像產品上市,更像對自家旗艦的一場精密拆除。DeepSeek 寫道:在「多方測試」中,這個新架構家族中最小的模型,在效能、成本、速度與總執行時間上全面勝過 DeepSeek-V4-Pro。結論呢?V4-Pro 逐步退場。自 2026 年 9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 的 API 請求都將改路由至 V4.1-Flash,並按 Flash 費率計費,直到未來的 V4.1-Pro 問世。(在用戶要求下,V4-Pro 端點後來獲准續命、計費方式不變——但方向已經再明確不過。)
這次發布是 DeepSeek 核心論述迄今最鋒利的一次表達:決定代理(agent)時代勝負的不是原始參數量,而是推理經濟學。而支撐這套論述的數字值得細看——因為它們描述的是一個為單一工作負載(長時間運行的 AI 代理)以近乎偏執的精度打造的架構。
因果編碼器—解碼器(CED):刻意的不對稱
V4.1-Flash 是一個擁有 552B 主幹參數的多模態混合專家(MoE)模型,採用 40 層 Transformer,拆成 Causal Encoder-Decoder(CED) 結構:20 層因果編碼器接 20 層解碼器。真正的關鍵在解碼器如何處理 KV 快取:不是由每個解碼層從自身隱藏狀態推導 KV,而是從編碼器最終隱藏狀態投影而來。
回報是精準對應代理工作負載特性的不對稱。在 prefill 階段——消化冗長提示、整個程式碼庫、完整對話歷史時——每個 token 僅啟動 8B 參數;在解碼階段——實際生成回應時——啟動 16B。代理工作負載天然是輸入沉重的:一個編碼代理可能讀完一百萬 token 的上下文,只為寫出幾千 token 的修補程式。一個在輸入端只花 8B 參數的模型,在結構上(而非折扣上)就低於輸入輸出兩端都燒完整參數預算的模型。
作為對比:DeepSeek-V4-Flash 從 284B 主幹中每 token 啟動 13B 參數;V4-Pro 從 1.6T 主幹中啟動 49B。V4.1-Flash 同時做到了總容量更大(552B 對 284B)、每個輸入 token 更便宜(8B 對 13B 啟動)。
KV 快取壓縮至每 token 890 位元組
工程上的頭號成就,是 KV 快取壓縮。對長上下文代理而言,KV 快取——模型對已讀內容的全部記憶——是主導成本:運行時吃 HBM,步驟之間常溢出到 SSD,而快取命中的輸入費用往往是代理 API 帳單裡最大的一條。
V4.1-Flash 用一套技術組合正面進攻,技術報告的描述精度罕見地高:
- 壓縮稀疏注意力 2(CSA2) 為每個注意力層指定三種靜態模式之一——Full、Reindex 或 Reuse——跨層共享主 KV 與索引器鍵,並重用 Top-K 稀疏注意力索引。解碼器中,分層稀疏索引器(Hierarchical Sparse Indexer)將較後面的索引層限制在第一個 Full 模式層構建的候選池內,使深層索引成本與上下文長度脫鉤。
- FP4 主 KV 快取 採 E2M1 格式、每 16 通道一組 E4M3 縮放因子,把儲存壓到接近四位元精度的體積。
- SWA Bounded Replay 只重放最近的
n_win個 token 來重建缺失的滑動視窗 KV 狀態——完全免除將 SWA KV 持久化到 SSD 的需要。
綜合結果:全域 KV 快取足跡為每 token 890 位元組——約為 DeepSeek-V4-Flash 的四分之一,且(依模型卡圖 1)相對 DeepSeek-V1 約有 437 倍的縮減。換算成公告中的絕對承諾:KV 快取所需 HBM 為前代的 1/4,SSD 儲存為 1/8。
上下文長度為 1M token:稀疏注意力先以 64K 序列長度訓練,在 45T token 的多模態預訓練語料推進到 34T token 時延伸至 1M。模型原生多模態:從零訓練的 DeepSeek-ViT 視覺編碼器(採 2D-RoPE 與 3×3 pixel-unshuffle 降採樣)加上兩層 MLP 投影器,從預訓練第一天起就將視覺嵌入餵給語言模型。
其他元件補全了設計:Single-Pass mHC(改版殘差流混合,配高效 Mega-mHC 核心)、196B 參數、以 token 查找稀疏存取的 Engram 條件記憶模組,以及採半自回歸草稿生成與信心排程驗證的 DSpark 投機解碼。MoE 路由為每層 1 個共享專家加 384 個路由專家,每 token 啟動 6 個路由專家。
基準測試:小模型,前沿成績
在基礎模型的知識與推理上,V4.1-Flash 與 1.6T 參數的 V4-Pro 互有勝負——MMLU-Pro 贏(74.1 對 73.5)、BigCodeBench 贏(60.6 對 59.2),SimpleQA-Verified 與 SuperGPQA 讓分。但真正讓競爭對手坐立難安的是指令模型的成績。在最大推理努力設定下,DeepSeek 報告:
- Terminal-Bench 2.1:90.6——高於 Opus-5.0(89.1)、GPT-5.6 Sol(88.8)與 Kimi K3(88.3)
- DeepSWE v1.1:74.2——與 Opus-5.0(74.0)持平,高於 GPT-5.6 Sol(73.0)
- CyberGym:88.1——領先 GPT-5.6 Sol(84.5)與 GLM-5.3(84.5)
- Codeforces 評分:3471——遠高於 V4-Pro 的 3348
- Agent’s Last Exam:31.8、AutomationBench:54.8——在表中皆居首位
- HLE with tools:63.9——高於 Opus-5.0 的 63.6
在部分更難的代理評測上差距則反轉——Terminal-Bench 3.0(30.0 對 Opus-5.0 的 43.3)、Terminal-Bench 4.0(31.2 對 51.8)、ProgramBench、ExploitGym——這讓前沿的全貌保持誠實:這是一個以性價比取勝的 Flash 級模型,並非對絕對技術頂點的全面橫掃。
模型還提供 1 到 100 連續可調的推理努力(reasoning effort)——用整數旋鈕在推理成本與準確率之間取捨,比其他實驗室的離散思考模式更細緻。
定價:快取命中便宜 50 倍以上
新定價於 9 月 10 日 04:00 UTC 生效,deepseek-flash 端點:
- 輸入(快取命中):尖峰每 1M token $0.006,離峰 $0.003
- 輸入(快取未命中):尖峰每 1M $0.30,離峰 $0.15
- 輸出:尖峰每 1M $1.20,離峰 $0.60
尖峰時段為工作日(UTC)01:00–04:00 與 06:00–10:00,其餘時段離峰半價。上下文至 1M token、最大輸出 384K,並發上限 2,500——對這個模型顯然為之而生的「代理艦隊」場景來說,每個數字都有意義。
對照西方前沿定價——V4 上市時 GPT-5.5 約為每 1M 輸入 $5,Opus 級模型遠高於此——$0.006 的快取命中價,對主導代理帳單的輸入沉重流量而言,便宜了將近兩個數量級。而快取命中費用恰恰是 890-byte-per-token 架構所瞄準的成本項:定價與工程,是同一個賭注的兩個面。
開放權重,與一份部署邀請
一如以往,DeepSeek 以 MIT 授權在 Hugging Face 與 ModelScope 開源了模型,頭幾天下載量已突破 75,000 次。值得注意的是,這次沒有附 Jinja 聊天模板,而是提供獨立的 Python 參考實作,外加 deepseek-recipe——一組帶 Python 綁定的 Rust 程式庫,涵蓋 Messages、Chat Completions 與 Responses API 的提示編碼、工具呼叫、思考模式與串流。
公告裡還有一句少見的話:「計畫以 2,000 顆 GPU 加儲存叢集做大規模部署?來談談。」DeepSeek 明確在爭取大型自托管用戶,而對 KV 快取 SSD 足跡的強調,暗示公司預期這個模型將運行在儲存(而非算力)成為瓶頸的組態中。
意義何在
三個訊號值得帶走。
第一,「旗艦」作為穩定類別的時代,正在 DeepSeek 終結。 當一個 552B、prefill 僅啟動 8B 參數的模型,在代理開發者最在乎的基準上擊敗 1.6T 旗艦,而公司的回應是把旗艦流量導向小模型,「Pro」的含義就從「最強」變成了「每單位能力的最貴」。DeepSeek 實質上從上方重新定價了前沿。
第二,代理成本戰爭的主戰場在 KV 快取。 ChatGPT 時代的經濟學是每生成一個 token 的成本;代理時代的經濟學是每「重讀」一個 token 的成本——而 V4.1-Flash 的 4 倍 HBM 縮減、8 倍 SSD 縮減與近乎免費的快取命中,瞄準的正是這一條帳。快取命中定價高出 DeepSeek 數百倍的競爭對手,將在企業標案中直接感受到壓力。
第三,開放權重如今是架構優勢的交付管道,而不只是姿態。 MIT 授權保證 vLLM、SGLang 等推理生態會競相支援 CSA2 與 CED——而它們落地的每一項優化,都讓 DeepSeek 的架構在所有地方(包括 DeepSeek 自己不擁有的叢集)變得更便宜。
提醒依然真實:自報基準、發布太新尚待獨立驗證、最難的 Terminal-Bench 層級仍有明顯落後。但這個模式如今已不陌生——每隔幾個月,世界上最便宜的高能力模型就會再大幅降價一次。而這一次,它連同前代旗艦的退休通知一起送達。
Sources
- [1] https://www.deepseek.com/en/news/deepseek-v4-1-flash/
- [2] https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- [3] https://api-docs.deepseek.com/quick_start/pricing
- [4] https://www.reuters.com/world/asia-pacific/chinas-deepseek-launches-v41-flash-model-2026-09-10/
- [5] https://www.geopolitechs.org/p/deepseek-v41-flash-stronger-faster