一場沒有發生的日落:DeepSeek V4.1-Flash 以百萬級上下文與 0.003 美元快取讀取登場,V4 Pro 獲得緩刑
DeepSeek 這款 552B 參數的開放權重新模型以極低的推理價格挑戰對手,同時公司收回於 9 月 14 日關閉 V4 Pro API 的計畫。
2026 年 9 月 10 日 04:00 UTC,DeepSeek 悄悄改寫了前沿模型市場的價格底線。該公司發布了 DeepSeek-V4.1-Flash——一款多模態、開放權重的混合專家(MoE)模型,其基準測試成績與價格高出許多的閉源模型處於同一水準,而它的定價卻低得像是一個打錯的數字。兩天後,它又做了一件更罕見的事:承認自己判斷失誤。原定於 9 月 14 日 04:00 UTC 生效的熱門 V4 Pro API 停服計畫,在用戶反彈之後被取消了。
9 月 10 日到底發布了什麼
根據 Hugging Face 上的官方模型卡,DeepSeek-V4.1-Flash 是一款擁有 5,520 億主幹參數的多模態混合專家模型,支援最高一百萬 token 的上下文長度。模型權重採用 MIT 授權條款釋出——這是現存最寬鬆的授權之一——意味著任何人都可以執行、微調、蒸餾這個模型,並將其整合進商業產品,幾乎沒有任何附加條件。
架構設計才是真正有趣的地方。第三方技術深度解析描述了一種因果編碼器—解碼器(CED)設計,配備雙注意力模式(稱為 CSA2)與改良式殘差連接,但最核心的規格是不對稱啟動:每個輸入 token 僅啟動約 80 億參數,生成輸出時上升到約 160 億。這個落差至關重要,因為它把「讀取上下文的成本」與「生成答案的成本」脫鉤了。對於那些把大量系統提示詞與檢索文件塞進上下文、卻只生成簡短工具呼叫的 Agent 管線來說,這種經濟學遠優於同等能力的對稱式模型。
獨立追蹤平台還指出,該模型的訓練資料量約為 45 兆 token,並且原生支援影像輸入——視覺能力直接內建於基礎模型,而非透過獨立的編碼器產品外掛。不過也有一個插曲在開源社群引發熱議:有人審查了釋出的 safetensors 檔案後主張,實際儲存的參數量接近 7,500 億,因為模型大部分以 4 位元精度儲存,不同的計數慣例會得出不同的總數。DeepSeek 官方文件堅持 552B 主幹的數字,但這個爭議已在 r/LocalLLaMA 上成為熱門討論串——這恰好說明了在 2026 年,「參數量」作為模型比較指標依然多麼模糊。
讓所有人多看兩眼的定價
新定價於 9 月 10 日 04:00 UTC 生效,圍繞一個簡單的原則設計:離峰費率正好是尖峰的 50%。每百萬 token 的價格如下:
- 輸入(快取未命中): 尖峰 $0.30 / 離峰 $0.15
- 輸入(快取命中): 尖峰 $0.006 / 離峰 $0.003
- 輸出: 尖峰 $1.20 / 離峰 $0.60
正是那個 $0.003 的快取輸入費率在開發者社群瘋傳,VentureBeat 的報導也以它為核心。快取輸入——也就是 Agent 框架每次呼叫都會重複發送的系統提示詞與靜態上下文——是讓天真的 RAG 部署燒錢燒到破產的隱形凶手,而 DeepSeek 現在把它定價到:每天重複發送一個 10 萬 token 的提示詞一千次,大約只要新台幣十元上下。早期的基準報告宣稱,該模型的 Agent 能力分數超越 V4-Pro-Preview 等級,並在編碼與工具使用評測上與 GPT-5.6 Sol、Claude Opus 5 等閉源旗艦競爭,而每 token 成本僅是對方的一小部分。對供應商相關的基準宣稱當然要保持一貫的懷疑,但獨立排行榜的報導與 DeepSeek 自家數據大體一致。
一場沒有發生的退場
原始計畫非常「矽谷」地冷酷。V4.1-Flash 上線時,舊款 V4 Flash 立即退役,DeepSeek 並宣布北京時間 9 月 14 日 12:00(UTC 04:00)之後,發往高階 V4 Pro 的流量將被轉路由至 V4.1-Flash。紙面上這很合理——新模型在多數公開基準上勝過舊模型——但 V4 Pro 早已成為生產環境的主力,企業花了好幾個月針對它的邊角案例行為做校準。一場只給四天緩衝的強制切換,正是那種會以隱微方式弄壞 Agent 管線的變更:工具呼叫格式略有不同、拒絕邊界略有不同、數學運算略有不同。
用戶的抱怨來得又快又具體。9 月 12 日,DeepSeek 的 API 更新日誌出現了一句讓習慣了美國雲端供應商「愛用不用」式棄用通知的人為之側目的話:「應用戶需求,我們決定在 2026 年 9 月 14 日之後繼續提供 DeepSeek V4 Pro 的 API 服務,計費方式維持不變。」日落變成了選修題。截至撰寫本文時,距離原定的 9 月 14 日切換期限只剩幾個小時,而什麼都沒改的 V4 Pro 用戶將照常運作。
為什麼這件事的意義超越單一模型
有兩件事值得記住。
第一,這套定價結構是戰略武器,不是促銷。DeepSeek 一直在利用離峰折扣平滑自身的推理負載,而「離峰即尖峰五折」的規則把這套紀律延伸給了客戶。當一款接近前沿水準的開放權重模型對每百萬輸出 token 只收 $0.60 的離峰價,每一家閉源供應商的價目表都變成了一場等待發生的談判。中國實驗室之間的效率競賽——比的是每 FLOP 擠出的能力,而不是炫耀總算力——早已不是茶餘飯後的趣聞,而是整個市場被拿來衡量的參考曲線。
第二,這次緩刑是一個小而真實的證據,說明開放權重經濟如何約束供應商行為。DeepSeek 無法完全鎖定客戶,因為舊模型的權重早已公開流通;真被逼急的人可以自行部署。這個事實讓純強制性的遷移更難推行,也讓傾聽用戶不只是禮貌,而是生意。閉源供應商的棄用通知是既成事實;開放權重實驗室的棄用通知,只是一個起手出價。
對開發者而言,實務建議很直接:V4.1-Flash 現在是新專案的預設推薦——MIT 授權權重、百萬 token 上下文、原生視覺能力、近乎免費的快取讀取,這個組合對 Agent 工作負載幾乎無懈可擊。V4 Pro 用戶得到了緩刑,但方向早已明朗,聰明的做法是現在就開始按照自己的時程測試遷移,而不是等下一次日落日期被公布。
模型權重在 Hugging Face 上,新價格已經生效,而這週佔據開發者論壇的期限最終證明是可以彎曲的。在一個由節節高升的能力宣稱所定義的市場裡,DeepSeek 本週發布最具顛覆性的東西,也許是一句簡簡單單寫著「我們聽見你了」的更新日誌。
Sources
- [1] https://www.deepseek.com/en/news/deepseek-v4-1-flash/
- [2] https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- [3] https://api-docs.deepseek.com/updates/
- [4] https://venturebeat.com/technology/deepseek-v4-1-flash-debuts-with-0-003-1m-off-peak-cached-input-rate-and-benchmarks-eclipsing-gpt-5-6-sol-claude-opus-5
- [5] https://apidog.com/blog/deepseek-v4-pro-retirement-migration-guide/
- [6] https://www.datacamp.com/blog/deepseek-v4-1-flash
- [7] https://llm-stats.com/models/deepseek-v4.1-flash