← All posts / Models

DeepSeek V4-Flash-Vision-Exp:追趕 Opus 4.8 的實驗性多模態模型

DeepSeek 的實驗性視覺版 V4-Flash 在多模態代理基準上逼近 Anthropic Opus 4.8,價格卻只有零頭。

DeepSeek V4-Flash-Vision-Exp:追趕 Opus 4.8 的實驗性多模態模型

DeepSeek 今夏又丟出了一個相當有意思的模型。2026 年 8 月 21 日,這家位於杭州的實驗室發布了 DeepSeek-V4-Flash-Vision-Exp——旗艦純文字模型 V4-Flash 的實驗性多模態版本。新模型能夠讀取圖片與螢幕截圖,並根據所見內容採取行動,這個組合讓它直接在多模態代理基準上與 Anthropic 的 Opus 4.8 正面交鋒。

模型現已在 DeepSeek API 平台上線,模型 ID 為 deepseek-v4-flash-vision-exp,同時發布的還有該公司代理框架 DeepSeek Harness 的 0.1.1 版,開箱即支援新模型。

DeepSeek 實際上發布了什麼

V4-Flash-Vision-Exp 的基礎是純文字的 V4-Flash——一個總參數量 284B、每 token 約激活 13B 參數的混合專家(MoE)模型,具備一百萬 token 的上下文視窗——再原生加入影像理解能力。根據 DeepSeek 的發布說明,這個實驗模型「在文字能力上與 DeepSeek-V4-Flash 持平,包括代理、推理與世界知識」,同時在多模態代理基準上「較 V4-Flash 大幅躍進」,將效能「帶到接近 Opus-4.8 的水準」。

對開發者而言,實際細節更重要:

  • 圖片計費:圖片以 token 計費,每張最多 384 tokens,按標準 V4-Flash 價格收費。
  • API 介面:支援 Chat Completions、Messages 與 Responses API。
  • 輸入格式:支援文字加圖片混合輸入,圖片可透過 base64 編碼、外部 URL 或 Files API 提供。
  • Files API:DeepSeek 同步推出了 Files API——免費使用,開發者上傳圖片一次後即可在多個請求中以 file_id 重複引用。

最後一點容易被忽略,但商業意義不小。對於需要反覆檢視同一批截圖或圖表的代理工作流程來說,以引用方式重用圖片而非重複上傳,能大幅降低請求頻寬——而這正是此模型鎖定的使用場景。

誠實解讀基準測試表格

DeepSeek 公布了十一項基準結果,將新模型與 Opus 4.8 以及自家純文字版 V4-Flash 對比。重點結論:V4-Flash-Vision-Exp 在十一項基準中的三項擊敗 Opus 4.8——DeepSWE 領先 1.3 分、Agents’ Last Exam 領先 1.6 分、ZeroBench 領先 1.0 分。其餘八項落後,但差距往往很小:Toolathlon-Verified 為 75.9 對 76.2,Chartography 為 64.3 對 65.0,Terminal Bench 2.1 則是 83.9 對 85.0。

有兩項差距較大。在倉庫規模編碼任務 NL2Repo 上,DeepSeek 拿到 57.7 分,Opus 4.8 為 69.7 分——落後十二分。DSBench-Hard 則是 63.6 對 71.7。這些正是企業購買代理去執行的困難長程任務,差距是真實存在的。

還有一個值得細讀的註腳。DeepSeek 自己在多模態躍進的說明中承認:在 ApexBench 與 Agents’ Last Exam 上,純文字版 V4-Flash 是在被評測於含有它結構上無法看見的圖片的測試上——它「忽略了其中包含的多模態元素」。ApexBench 上從 26.2 跳到 36.5 的進步,有一部分是在測量「給盲人模型做視力測驗」會發生什麼。值得稱許的是,DeepSeek 把這點直接寫在表格註腳裡,而不是等別人發現——這比多數實驗室來得透明。

或許最有意思的發現,是 DeepSeek 自己低調以對的那一項。該公司說視覺模型在文字上「持平」於 V4-Flash,但按其自家的數據,視覺版在七項文字基準中的六項擊敗了純文字版:Toolathlon-Verified 進步 5.6 分、DeepSWE 進步 4.9 分、DSBench-Hard 進步 4.0 分。唯一的例外是資安基準 CyberGym,加上視力反而少了 1.4 分(75.3 對 76.7)。換句話說,多模態訓練對文字能力似乎產生了正向轉移,而非造成退化。

有一項基準值得為整個產業記上一筆:在 AutomationBench 上,三個模型的得分都落在二十多分——25.7、25.1 與 27.2。無論今日的代理擅長什麼,那項任務肯定不在其中。

比的是哪個 Opus?為何這個對比比看起來更窄

框架上有一個關鍵細節:Anthropic 已於 2026 年 7 月 24 日發布 Claude Opus 5。五月推出的 Opus 4.8 在 Anthropic 的除役頁面上仍列為 Active(完全支援並推薦使用,最早 2027 年 5 月才會退役),所以 DeepSeek 選的是一個現行、受支援的對手,而非已被淘汰的舊模型。目前同時有多個 Opus 模型保有 Active 狀態。

但 DeepSeek 的表格裡沒有 Opus 5 的欄位,也沒有任何第三方公布過這個對比。V4-Flash-Vision-Exp 與 Anthropic 最新旗艦模型的優劣,目前就是未知數。DeepSeek 的說法也沒有越界——它說的是「接近 Opus-4.8」,而在多項基準上確實接近。它沒有說「接近 Anthropic 最新模型」。

此外,所有數據都來自 DeepSeek 自家,使用自家 harness 以 minimal 模式評測,溫度 1.0、top_p 0.95。設定皆有揭露——廠商自測是業界常態——但終究是廠商的數據。

商業上的論述

儘管多數項目落後,這次發布依然掀起波瀾,原因在於價格。八月稍早的研究發現,V4-Flash 是知名模型中運行成本最低的:DeepSeek 每百萬字約 0.87 美元,Anthropic 約 50 美元——這個差距企業買家早已注意到了。在這樣的價差之下,多數基準落後一兩分是商業論述,而非敗北。但 NL2Repo 落後十二分就是另一回事了。

DeepSeek 另外也證實,V4-Pro 正式版已於 8 月 13 日 GA 上線,具備大幅增強的代理能力、Responses API 支援與 Codex 整合——那才是多數企業買家實際會權衡的模型,而它並沒有出現在這次的比較表格中。

為什麼重要

這裡的模式如今已很熟悉:一家中國實驗室以大宗商品級的價格推出性能優異的開放生態系模型,拿一個稍舊但仍受支援的美國旗艦做基準對比,然後讓價差自己說話。V4-Flash-Vision-Exp 是實驗性的——「Exp」後綴明明白白地告訴你這點——但它證明 DeepSeek 的多模態代理進展迅速,而且「每美元智慧」的前沿持續由杭州推進。真正能一錘定音的測試——V4-Flash-Vision-Exp 對上 Opus 5、在中立 harness 上進行——目前有名無實。在此之前,一個實驗性多模態模型在多數基準上與受支援的美國前沿模型相差幾分、成本卻只有零頭,這本身就是一個真正的市場事件。