← All posts / Models

用 Flash 退役 Pro:DeepSeek V4.1 Flash 限時 48 小時公開測試全解析

DeepSeek 低調開放 V4.1 Flash 兩天限時測試——全新架構、原生多模態,宣稱以 Flash 價格超越 V4 Pro,輸出速度實測最高達每秒 507 tokens。

用 Flash 退役 Pro:DeepSeek V4.1 Flash 限時 48 小時公開測試全解析

DeepSeek 再次用最低調的方式發出最響亮的訊號。9 月 8 日下午,這家中國 AI 實驗室悄悄開放了中繼模型 V4.1 Flash 的限量測試——而且直接把失效日期寫進模型 ID 裡:deepseek-v4.1-flash-expires-on-0910。9 月 10 日一到,端點自動關閉。想在 DeepSeek 下一波產品決策中留下意見的開發者,只有整整兩天時間,用一次次 API 呼叫來投票。

這次測試版到底是什麼

表面上,接入方式簡單到近乎敷衍:base_url 不動,把模型名稱換成那串自帶「保存期限」的識別碼,就能開始呼叫。定價與正式版 V4 Flash 完全相同——沒有測試版溢價——但每個帳號僅限 20 個並發請求。

這個並發上限洩露了真正的意圖。正式版 V4 Flash 每帳號允許 2,500 個並發請求,V4 Pro 也有 500 個;20 個並發只夠做功能驗證與實際評測,離承載生產流量差了兩個數量級。DeepSeek 並不是在軟性試營運一款產品,而是在自己的開發者社群身上跑一場結構化實驗——配套的匿名問卷更說明了一切:其中一整個模組,專門用來評估「取代 V4 Pro 的可行性」。

換句話說,DeepSeek 真正想問的不是「這個模型好不好」,而是「你願不願意讓我們的旗艦下台一鞠躬?」

是新架構,不是調參數

官方文件中最關鍵、卻最容易被略過的一句話是:V4.1 Flash 採用全新模型架構,且多模態能力為原生支援。文字、影像與音訊輸入在統一的管線中處理,不像現行 V4 Flash 得靠外掛的 Vision 擴充包處理圖文輸入。

在 DeepSeek 的技術脈絡裡,這個區別很有分量。V4 系列今年 4 月 24 日預覽發表時(同時推出 Pro 與 Flash 兩個變體),就已經歷過一次注意力機制大改——token 級壓縮結合 DSA 稀疏注意力,用算力和記憶體換取長上下文吞吐,並在 MIT 開源授權下讓 100 萬 token 上下文成為全系標配。V4.1 Flash 則是在這個基礎上又進行了一次架構級重構。DeepSeek 稱之為「中繼版本」,但「中繼」指的是發布狀態而非野心:官方社群公告宣稱,V4.1 Flash 在效能、成本與速度上同時超越 V4 Pro。

至少速度這一項,已經可以被第三方驗證。開放首日,多位開發者在 X 上分享吞吐實測,最高輸出速度來到每秒 507 tokens。有開發者讓模型生成一段「騎腳踏車的鵜鶘」SVG 動畫(這種惡搞壓力測試已自成一個流派),期間錄得 328 tokens/s;整體輸出速度普遍在每秒 300 tokens 以上。對於使用者盯著串流輸出看的延遲敏感型 Agent 產品而言,這個等級的吞吐量,會直接改變哪些互動模式在商業上可行。

讓旗艦退休的經濟學

價目表解釋了 DeepSeek 為何如此在意「Pro 取代」這個問題:V4 Pro 的輸出定價約為 Flash 的三倍,並發上限卻只有五分之一。對流量密集的消費級應用來說,這個倒掛是決定性的——能不能把工作負載從 Pro 搬到 Flash,直接決定單位成本結構。

分析機構 AGI Zhilu 把這次測試想縫補的缺口講得很清楚:V4 Pro 推理能力強,但成本不適合高流量場景;舊版 Flash 便宜又快,卻在複雜推理與原生多模態上有所欠缺。如果正式版 V4.1 Flash 真能以 Flash 價格提供接近 Pro 的能力,一大票消費端應用與 Agent 產品就可以徹底遷離旗艦模型——包括 DeepSeek 自己的路由。該公司已表明,過渡期間所有 V4 Pro 請求都將被導向 V4.1 Flash,這是罕見的「Flash 用來退役 Pro」而非互補並存的案例。

離峰時段輸入價格為每百萬 tokens 快取命中 $0.007、快取未命中 $0.22,輸出 $0.66;尖峰時段全面加倍。DeepSeek 對「尖峰」的定義是北京時間的平日上班時段——這意味著美國團隊在自己正常的白天打 API 就是半價,而台灣與日本的團隊得把批次任務排到深夜或週末才能拿到同樣價格。對長時間運行的 Agent 工作負載來說,這不是價目表上的脚注,而是值得納入排程設計的工程參數。

密集的更新節奏,與一扇對某些人關上的門

這次測試為一段不可思議的密集期畫下(暫時的)句點:不到 40 天內四五個大動作,包括 V4 預覽與開源、V4 Flash 正式版 API(版本號 DeepSeek-V4-Flash-0731)、V4 Pro 正式版同步開源 Harness v0.1,以及如今的 V4.1 Flash。這大概率是一個新更新週期的起點,而非終點。

還有一個結構性但常被忽略的限制值得點出:V4 系列權重在 Hugging Face 上以 MIT 授權公開,因此有資料居留限制的機構理論上仍可自行部署或使用第三方推理服務。但 V4.1 Flash 只存在於 DeepSeek 官方 API 上——權重並未釋出。對 2025 年 2 月起就限制 DeepSeek 的台灣、日本與美國公部門而言,這扇 48 小時的窗無論意願如何都是關著的。台灣行政院的禁令範圍最廣,明確涵蓋本地部署;日本數位廳採專案逐一審核制;美國多個聯邦機構與州政府則禁止在公務設備上使用。

為什麼重要

這次測試的設計本身,就說明了 DeepSeek 從兩年開源權重競爭中學到的事:大規模社群評測比任何內部評測套件都更便宜、也更誠實;而硬性截止日能把好奇心轉化為急迫感。把下線日期直接寫進模型名稱,DeepSeek 把基礎設施衛生變成了行銷。

更宏觀地看,一款原生多模態、每秒 300+ tokens、輸出價格僅前代旗艦三分之一的模型,正是會壓縮整個市場時間表的那種發布。前沿實驗室靠能力差距支撐溢價定價;DeepSeek 的策略則是在公開場合、以 Flash 價格關閉這些差距,然後賭開發者會注意到。48 小時窗口 9 月 10 日關閉。真正重要的結論——Flash 能否吸收 Pro 的工作負載——將由每一位願意改一行設定檔的人共同寫下。