每 token 僅 890 位元組:DeepSeek-V4.1-Flash 如何把 KV 快取成本壓到極限,還讓自家旗艦提前退役
DeepSeek 新推出的 552B 參數開放權重模型採用因果編碼器—解碼器架構,將 KV 快取壓到每 token 890 位元組(僅前代的 1/4),同時在 Agent 基準上超越 V4-Pro,促使 DeepSeek 親手淘汰自家旗艦。
2026 年 9 月最有趣的模型發布,不是最大的那一個,而是服務成本最便宜的那一個。9 月 10 日,DeepSeek 發布了 DeepSeek-V4.1-Flash:一個 552B 參數的多模態混合專家(MoE)模型,採 MIT 授權開放權重,支援百萬 token 上下文,技術報告的副標題直接點明這家公司的優化方向——將 KV 快取壓縮推向極限。
四天後,DeepSeek 做了一件在這個通常把旗艦模型變現好幾年的產業裡幾乎前所未見的事:自 9 月 14 日 04:00 UTC 起,所有打到 deepseek-v4-pro——該公司 1.6T 參數旗艦——的 API 請求,一律改路由到 V4.1-Flash,並按 V4.1-Flash 的價格計費。DeepSeek 正在淘汰自家旗艦,改用一個骨幹參數量只有三分之一的模型,因為在效能、成本、速度與總執行時間上,小模型全面勝出。
問題所在:快取正在吃掉 Agent 工作負載
要理解這次發布為何重要,得先知道現代 AI 推理的錢都花在哪裡。聊天場景中,貴的是生成 token;但在 Agent 工作負載——寫程式的 agent、瀏覽網頁的 agent、呼叫工具的迴圈——貴的是「讀」。Agent 每走一步都要把整段對話歷史重新餵進模型,意味著同一段 prompt 前綴會反覆撞進服務端數百次。供應商對這種快取命中提供大幅折扣,但就算打折,快取命中費用通常仍是 Agent 帳單的最大宗。
這筆帳的規模由 KV 快取決定:模型為了讓注意力層能回看先前的 token,必須為每個 token 維護的記憶體佔用。KV 快取越大,每個併發用戶燒掉的 HBM 越多、每張 GPU 能塞的用戶越少、為了重複使用前綴而持久化到 SSD 的儲存量也越大。
V4.1-Flash 直接攻擊這個數字。模型的全球 KV 快取佔用為每 token 890 位元組——約為 DeepSeek-V4-Flash(3,514 位元組)的四分之一,而根據技術報告自己的比較,相對 DeepSeek-V1 約有 437 倍的縮減。以每 token 890 位元組計算,完整的百萬 token 上下文只需要約 0.9 GB 的 KV 快取。為了前綴重用而保存在 SSD 或主機記憶體的持久化快取,佔用更降到前代的約八分之一。
手法:因果編碼器—解碼器與三種注意力模式
最核心的架構變革,是 DeepSeek 稱之為因果編碼器—解碼器(Causal Encoder-Decoder, CED)的設計:一個 40 層的 Transformer,由 20 層因果編碼器加上 20 層解碼器組成。訣竅在於解碼器的全域 KV 快取是從編碼器最終隱藏狀態投影而來,而不是由每個解碼器層自己的隱藏狀態推導。結果是一個真正非對稱的模型:prefill(輸入密集階段)每 token 只啟動 8B 參數,decode(輸出階段)啟動 16B。輸入密集的 Agent 工作負載——正是那些快取成本壓得人喘不過氣的場景——拿到了便宜的那條路。
在 CED 之上還有兩層壓縮機制:
- 壓縮稀疏注意力 2(CSA2)為每個注意力層指定三種靜態模式之一——Full、Reindex 或 Reuse——跨層共享主 KV 與索引器 K,並重用 Top-K 稀疏注意力索引。解碼器中的分層稀疏索引器進一步把後續索引層限制在第一個 Full 模式層建構的候選池內,讓深層索引器的成本與上下文長度脫鉤。
- FP4 主 KV 快取將快取量化為 E2M1 格式,每 16 個通道共用一個 E4M3 縮放係數。
- SWA Bounded Replay 只重放最近的 n_win 個 token 來重建缺失的滑動窗口注意力 KV 狀態,因此 SWA KV 完全不需要持久化到 SSD。
其餘的技術堆疊簡直像 DeepSeek 研究執念的目錄:196B 參數、透過 token 查找稀疏存取的 Engram 條件記憶(使總參數量達約 763B);搭配自製 Mega-mHC 核心的 Single-Pass mHC 殘差流混合;以及採信心調度驗證的 DSpark 投機解碼。MoE 層使用 1 個共享專家與 384 個路由專家,每 token 啟動 6 個。
視覺能力是原生而非外掛:從零訓練、具備 2D-RoPE 與 3×3 pixel-unshuffle 降採樣的 DeepSeek-ViT 編碼器,接上兩層 MLP 投影器,而且視覺嵌入從預訓練一開始就與文字聯合處理——45 兆 token 的多模態語料,稀疏注意力在 64K 序列長度訓練,並在 34T token 處將上下文擴展到百萬。
讓旗艦提前退役的數字
DeepSeek 自己的基準表格說明了為什麼敢淘汰 V4-Pro。基礎模型評測上,V4.1-Flash-Base 在 MMLU-Pro(74.1 對 73.5)、BigCodeBench(60.6 對 59.2)、HumanEval(79.4 對 76.8)、GSM8K(93.0 對 92.6)擊敗了 V4-Pro-Base(1.6T 參數、49B 啟動)——但在知識密集測試上落後,如 SimpleQA-Verified(42.3 對 55.2)與 SuperGPQA(53.1 對 53.9),這對參數量只有三分之一的模型來說是可預期的取捨。
Agent 成績才是最驚人的地方。在最大推理努力下,V4.1-Flash 在 Terminal-Bench 2.1 拿到 90.6——超過 Claude Opus 5.0(89.1)與 GPT-5.6 Sol(88.8)——加上 DeepSWE v1.1 的 74.2(Opus 5.0 為 74.0)、CyberGym 的 88.1(全表最佳,高於 GPT-5.6 Sol 的 84.5)、AutomationBench 的 54.8,以及 Agent’s Last Exam 的 31.8,後兩項領先表列所有前沿競爭者。它還以 3471 的評分稱霸 Codeforces。模型在最困難的長時程終端任務上仍明顯落後 Opus 5.0(Terminal-Bench 3.0:30.0 對 43.3;Terminal-Bench 4.0:31.2 對 51.8)——前沿沒有移動,但中前沿剛剛變得便宜得多。
一個真正新穎的服務功能:推理努力可以在 1 到 100 之間連續調控(整數,而非低/中/高三段開關),讓開發者能按請求權衡推理成本與準確率。
像挑釁一樣的定價
API 定價讓成本故事變得具體。V4.1-Flash 在 DeepSeek 自家 API 的定價為尖峰每百萬輸入 token 0.30 美元,離峰為尖峰的五折——快取輸入依供應商不同約為每百萬 0.006–0.007 美元。第三方供應商甚至更便宜:Fireworks 掛出輸入 $0.22/M、快取輸入 $0.007/M、輸出 $0.66/M,並完整開放 1M 上下文。上下文快取正是架構發揮作用之處——0.9 GB 的完整上下文快取佔用,讓官方平台能提供 2,500 併發用戶的容量。
模型以 deepseek-flash 名稱在 DeepSeek API 上線,原生支援多模態。V4-Flash 與 V4-Flash-Vision-Exp 已退役,模型名稱暫時路由到 V4.1-Flash 以保持相容。官方合作夥伴 WorkBuddy(含 CodeBuddy)與 OpenCode 已全面支援。而在一句明顯針對超大規模部署者的話裡,DeepSeek 邀請任何「規劃 2,000 張 GPU 以上加儲存叢集的大規模部署」來談——釋放出該公司期待效率紅利轉化為自建部署、而不只是 API 流量的訊號。
更大的圖像
2026 年下半年 AI 經濟學的兩股潮流在這次發布中交匯。第一,Agent 工作負載已經顛倒了推論成本模型:如今主導帳單的是輸入處理而非輸出生成,因此快取壓縮成了整個技術堆疊中槓桿最大的優化。第二是開放權重的壓力攻勢:一個 MIT 授權、在 Terminal-Bench 2.1、DeepSWE、CyberGym、AutomationBench 與 Agent’s Last Exam 上擊敗封閉前沿模型——而且輸入只要每百萬 token 0.22–0.30 美元——的模型,是對每一家封閉實驗室定價權的直接攻擊。
還有一個給產業的低調訊號:DeepSeek 示範了一個執行得當的較小架構,可以在同一產品家族內、在旗艦出貨五個季度後就讓旗艦過時。在每家實驗室都競相放大的市場裡,DeepSeek 剛提出了反面論證——下一個競爭前線不是每個模型的參數量,而是每個位元組快取的效率。等到 V4.1-Pro 最終問世,它將建立在這套壓縮快取的基礎之上,而旗艦層級將不得不重新證明自己。
Sources
- [1] https://api-docs.deepseek.com/news/news260910/
- [2] https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- [3] https://llm-stats.com/models/deepseek-v4.1-flash
- [4] https://venturebeat.com/technology/deepseek-v4-1-flash-debuts-with-0-003-1m-off-peak-cached-input-rate-and-benchmarks-eclipsing-gpt-5-6-sol-claude-opus-5