← All posts / Models

DeepSeek 給最便宜的王牌裝上眼睛:V4-Flash-Vision-Exp 逼近 Opus-4.8

DeepSeek 的實驗性多模態模型以 V4-Flash 的價格為 284B 參數 MoE 架構加入影像理解,在十一項代理基準中三項擊敗 Anthropic 的 Opus-4.8,其餘多項僅以些微差距落後。

DeepSeek 給最便宜的王牌裝上眼睛:V4-Flash-Vision-Exp 逼近 Opus-4.8

過去兩年,多模態一直是個昂貴的社區。Anthropic、OpenAI 與 Google 的視覺代理穩坐定價階梯的頂端,而最便宜的能力模型清一色只能讀文字。2026 年 8 月 21 日,DeepSeek 悄悄打破了這個格局:這家杭州實驗室發布了 DeepSeek-V4-Flash-Vision-Exp,在平價的 V4-Flash 骨幹上嫁接影像理解能力——並隨即公布了一張基準成績表,顯示它與 Anthropic 的 Opus-4.8 打得有來有回。

模型現已上線 DeepSeek API 平台,名稱為 deepseek-v4-flash-vision-exp,同時發布的還有內建支援的 DeepSeek Harness 0.1.1 版。這是一個實驗性版本——“Exp” 後綴名符其實——但這些數字值得細讀,因為它們說明的不只是單一模型,而是整個代理市場的走向。

這次發布了什麼

V4-Flash-Vision-Exp 以純文字的 V4-Flash 為基礎——一個總參數量 2840 億、每個 prompt 僅啟動約 130 億參數的混合專家(MoE)模型——加入讀取圖片與螢幕截圖、並根據所見內容採取行動的能力。DeepSeek 對文字能力的措辭相當保守:公司表示這個實驗模型「在文字能力上與 DeepSeek-V4-Flash 持平,包括代理、推理與世界知識」,同時在多模態代理基準上「較 V4-Flash 有重大躍進,將多模態代理性能拉近至 Opus-4.8 的水準」。

API 整合對開發者相當友善。圖片以計費 token 計價,每張最多 384 個 token,價格與 V4-Flash 完全相同。模型支援 Chat Completions、Messages 與 Responses API,接受文字與圖片混合輸入,圖片可以 base64、外部 URL 或 Files API 三種方式提供——Files API 也隨本次發布上線,免費使用,開發者上傳一張圖片後即可在多個請求中以 file_id 重複引用,無須重複上傳。

數字實際上說了什麼

DeepSeek 公布了對陣 Opus-4.8 的十一項基準結果。視覺模型贏了三項:DeepSWE 領先 1.3 分、Agents’ Last Exam 領先 1.6 分、ZeroBench 領先 1.0 分。其餘八項落後,但差距分布很有意思:有的極為接近——Toolathlon-Verified 是 75.9 對 76.2,Chartography 是 64.3 對 65.0,Terminal Bench 2.1 是 83.9 對 85.0;有的差距明顯——NL2Repo 上 DeepSeek 拿 57.7 對 69.7,落後 12 分,DSBench-Hard 是 63.6 對 71.7。

那個多模態「躍進」帶著一個 DeepSeek 自己附上的星號。在 ApexBench 上,新模型拿 36.5 分,V4-Flash 只有 26.2 分;Agents’ Last Exam 上是 27.3 對 25.2。但該公司自己的註腳指出,在這兩項評測中,純文字的 V4-Flash「會忽略其中包含的多模態元素」——舊模型是在它看不見的圖片測題上被打分。躍進是真的,但有一部分量測的是「給盲人模型做視力測驗」會發生什麼。值得肯定的是,這項揭露就寫在成績表裡而非埋在角落,這比多數實驗室誠實。

最有意思的一行數字,反而是 DeepSeek 低調處理的那個。公司說視覺模型在文字上「持平」V4-Flash;但按照自家數據,它在七項文字基準中贏了六項。Toolathlon-Verified 進步 5.6 分,DeepSWE 進步 4.9 分,DSBench-Hard 進步 4.0 分。唯一例外是 Cybergym——加入視覺後在這項資安基準上掉了 1.4 分。這些數據全部來自 DeepSeek 自評:公司用自己的 harness、在溫度 1.0、top_p 0.95 的設定下測自己的模型。設定有揭露,但終究是廠商自己控制的。

有一個數字屬於整個領域而非這場對決:AutomationBench 上,三個模型全部擠在二十多分——25.7、25.1、27.2。無論今天的代理擅長什麼,端到端自動化顯然還不在其中。

為什麼這場比較在商業上重要

這次發布之所以有分量,關鍵在價格。本月研究發現 V4-Flash 是已知模型中最便宜的:每百萬輸入字約 0.87 美元,相較 Anthropic Opus 級別約 50 美元——超過 50 倍的價差,企業買家早已注意到。在這個價差面前,Toolathlon 輸一兩分是商業論述而非敗局;但 NL2Repo 輸 12 分是另一回事——倉庫規模的程式碼工作,正是企業購買代理要做的事。

誠實的但書仍然存在。Opus-4.8 是五月發布的模型;Anthropic 之後已推出 Claude Opus 5,而無論 DeepSeek 還是其他人,都還沒有公布包含 Opus 5 的對比表。DeepSeek 本週也證實 V4-Pro 正式版(GA)已出貨,具備大幅增強的代理能力、Responses API 支援與 Codex 整合——而那個模型同樣不在這張表上。這次發布真正建立的,是一條價格效能底線:每百萬 token 只花幾分錢,開發者就能拿到一個看得懂螢幕截圖、會解析圖表、能在終端機作業、且在多數代理任務上距離前沿模型只剩一兩分的代理人。

這正是 DeepSeek 自 V3 與 R1 以來反覆重演的模式:把前沿實驗室定為高級品的能力,以極低成本推出一個夠接近的版本,然後讓市場完成剩下的工作。V4-Flash-Vision-Exp 把這個模式延伸到了多模態代理。如果歷史押韻,「實驗性」標籤會在一季內悄悄消失——而視覺代理的溢價,將不得不再次證明自己的存在價值。

來源