DeepSeek V4-Flash-Vision-Exp 在高難度視覺基準測試中擊敗 Claude Opus 4.8
DeepSeek 的實驗性多模態模型以 Flash 級價格加入影像理解能力,在兩項高難度視覺基準測試中擊敗 Claude Opus 4.8,且價格便宜得多。
DeepSeek 低調地推出了今夏最有趣的模型發布之一。2026 年 8 月 21 日,這家中國 AI 實驗室在其 API 平台上線了 DeepSeek-V4-Flash-Vision-Exp——一款實驗性多模態模型,在廣受歡迎的 V4-Flash 文字模型基礎上加入影像理解能力,不僅沒有犧牲任何文字能力,也沒有調漲價格。
核心宣稱相當大膽:在兩項真正困難的視覺基準測試上,這款實驗模型擊敗了 Anthropic 的 Claude Opus 4.8——一款每 token 成本高出許多倍的前沿級模型。在 ALE(一個包含超過 1,000 項多步驟應用程式建構任務的基準測試)和 ZeroBench(由 100 道異常困難的影像分析謎題組成)上,V4-Flash-Vision-Exp 的得分比它所基於的純文字版 V4-Flash 高出 10 分以上,並且在兩項測試中都小幅超越了 Opus 4.8。
實際上線了什麼
V4-Flash-Vision-Exp 是一個總參數量 2,840 億的混合專家(MoE)系統,每個提示只啟動 130 億參數。這種稀疏設計正是其經濟效益的秘訣:模型總量很大,但單一請求只會觸及其中一小部分,讓推理保持快速且便宜。
根據 DeepSeek 官方發布說明,這款模型在文字能力上與 V4-Flash 持平——包括代理(agent)、推理和世界知識——同時在多模態代理基準測試上「大幅躍進」,將效能拉近至 Opus-4.8 的水準。在七項文字基準測試中,它有六項擊敗了先前的純文字版 V4-Flash。
API 的細節務實且對開發者友善:
- 每張圖片最多計費 384 tokens,按標準 V4-Flash 價格計算
- 支援 Chat Completions、Anthropic Messages 與 Responses 三種 API 格式
- 圖片可以透過 base64、外部 URL 或新的 Files API 傳入
- 單一請求最多可包含 600 張圖片,最長邊上限 8,192 像素(含 15 張以上圖片的請求降為 4,096 像素)
- 可選的
detail欄位可將圖片降解析度至 512×512,在不需要精細細節時節省 tokens - 支援 JPEG、PNG、GIF 與 WebP——依檔案內容而非副檔名偵測格式
與模型同步推出的還有 Harness 代理框架的 0.1.1 版(開箱即用支援新模型),以及免費的 Files API,讓開發者上傳圖片一次後即可在多個請求中以 file_id 重複引用。
價格差距為何重要
成本結構正是這次發布最具戰略意義的部分。V4-Flash 一直位於 API 價格表的最底端,約為每百萬輸入 tokens 0.14 美元、每百萬輸出 tokens 0.28 美元——相較之下,Claude Opus 級模型的價格是它的許多倍。(注意:DeepSeek 已於 8 月 16 日調漲部分 V4-Flash 費率,輸出價格依級別調整為 0.66 至 1.10 美元,請以官方定價頁為準——但這款模型仍與 Opus 處於完全不同的價格帶。)
底層的效率來自 V4 架構的注意力機制創新。DeepSeek 先前的 V4 技術工作引入了兩種壓縮技術——壓縮稀疏注意力(CSA)與高度壓縮注意力(HCA)——該公司表示,相較於 V3.2,這些技術讓每 token 推理運算量減少 73%,KV 快取記憶體負擔降低 90%。正是這套機制,讓一個 2,840 億參數的模型能以 Flash 級價格提供視覺工作負載。
對開發者來說,實際的數學很簡單:在 V4-Flash-Vision-Exp 上為應用加入視覺功能,不會讓每月的 AI 帳單爆炸;而在前沿級多模態 API 上做同樣的事,帳單可能會。
先別急著切換——注意這些但書
適度的懷疑是必要的。首先,這是一款實驗性版本,不是永久旗艦——名稱中的「-Exp」後綴是誠實的標示。其次,DeepSeek 的基準測試數字大多是自行呈報的;獨立測試機構如 Artificial Analysis 和 LMArena 通常會在這類發布後的幾天內跑出自己的數字,那才是任何結論定案前的正常程序。
第三點也最重要:在兩項特定基準上擊敗 Opus 4.8,不代表全面超越 Opus 4.8。Anthropic 更新的模型——Claude Fable 5、Claude Opus 5 以及受限發布的 Claude Mythos 5——並未列入這次比較。Opus 4.8 已不是 Anthropic 的天花板;例如在 Terminal-Bench 2.1 上,V4-Flash-Vision-Exp 得分 83.9,低於 Opus 4.8 的 85.0,在 NL2Repo 上的差距更大。在混合文字與視覺的代理基準上,這款 DeepSeek 模型接近但並未一致超越 Anthropic 的基準線。
此外,視覺堆疊究竟如何整合進模型,目前還沒有完整的技術報告,自架者和研究者只能從 API 行為推敲,而非架構文件。
大局:平民價格的多模態代理
拋開基準測試的軍備競賽,更深層的訊號在於產業的走向。DeepSeek 明確將這款模型定位於代理式應用——模型需要看懂螢幕截圖、讀取圖表、理解示意圖,然後搭配工具採取行動的工作流程。這正是推動下一波 AI 產品的核心場景,從瀏覽器自動化到 QA 測試再到資料萃取。
過去一年,視覺代理工作流程大多鎖定在前沿級價格的 API。一款每次請求能處理 600 張圖片、價格低於每百萬 tokens 一美元的 130 億啟動參數 MoE 模型,改變了「什麼產品在經濟上可行」的計算方式。每天跑數千個截圖分析任務的新創公司,會直接感受到差異。
這也呼應了我們整個夏天追蹤的趨勢:能力沿著價格曲線下滲的速度,遠比任何人預測的快。智譜的 GLM-5.3 透過後訓練從相同的 7,430 億參數架構中榨出更多效能;阿里巴巴以 270 億參數開源了 Max 級品質的模型;現在 DeepSeek 又以 Flash 價格提供接近前沿的多模態代理效能。前沿實驗室依然握有絕對領先——但「前沿」與「負擔得起」之間的距離正在不斷縮小。
V4-Flash-Vision-Exp 能否從實驗性版本轉正為旗艦,以及獨立基準測試是否會證實 DeepSeek 的宣稱,將是未來幾週值得關注的焦點。無論如何,多模態 AI 的價格效能邊界又一次被推動了。
Sources
- [1] https://api-docs.deepseek.com/news/news260821/
- [2] https://the-decoder.com/deepseek-releases-experimental-flash-vision-model-that-rivals-opus-4-8-on-agent-benchmarks/
- [3] https://unrot.co/blogs/today-top-ai-news-august-24-2026
- [4] https://www.reddit.com/r/LocalLLaMA/comments/1vubb20/deepseekv4flashvisionexp/