← All posts / Models

DeepSeek V4-Flash-Vision-Exp:每張圖 384 Token 的視覺賭注,正在改寫 Agent 經濟學

DeepSeek 的實驗性多模態模型以與 V4-Flash 完全相同的價格提供視覺能力,每張圖片固定計費 384 token,多模態 Agent 基準逼近 Opus-4.8——上線三天就被編碼代理燒掉 250 億 token。

DeepSeek V4-Flash-Vision-Exp:每張圖 384 Token 的視覺賭注,正在改寫 Agent 經濟學

2026 年 8 月 21 日,DeepSeek 低調推出了 V4-Flash 模型一直在「假裝」具備的能力:視覺。這個新的實驗版本 deepseek-v4-flash-vision-exp 在該公司 API 平台上線,官方公告短得可以塞進一則推文——但藏在價目表裡的一個設計決策,比任何基準測試圖表都更能說明 Agent 經濟學的走向。

賣點很簡單:視覺版在文字能力上(Agent、推理、世界知識)與 DeepSeek-V4-Flash 持平,同時能在同一個請求中理解圖片。DeepSeek 宣稱,在需要視覺理解的多模態 Agent 基準上,它較純文字的 V4-Flash 有「重大躍進」,多模態 Agent 能力「逼近 Opus-4.8」——Anthropic 的前沿模型。價格完全不變:與 V4-Flash 相同,圖片以一般輸入 token 計費。

但真正有趣的部分,是公告沒有放在最前面的那些。

384 Token 上限就是整個設計

在推理之前,DeepSeek 會先重新調整每張傳入圖片的尺寸。小於約 384×384 像素的圖會被放大(保持長寬比);更大的圖則被縮小——同樣保持長寬比——直到總像素數約等於一張 800×800 圖片的水準。結果是一個硬性上限:每張圖片固定 384 token,與原始解析度無關。一張 2000×2000 的截圖和一張 5000×5000 的照片,成本完全一樣——因為縮放之後,它們根本就是同一個東西。

隨之而來的算術很驚人。以 V4-Flash 離峰時段每百萬 token 0.22 美元的輸入費率計算,一張圖約花 0.00008 美元——大約一美元可以看 2,500 張圖。在 Hacker News 上剖析這次發布的討論串裡,有留言者算出了同樣的數字:「如果沒算錯,每張圖 400 token,等於一美元 2,500 張圖。」

這種固定計費不是慷慨,而是把解析度上限直接寫進價目表。這個模型便宜,是因為它看得不那麼仔細。正如一位留言者直白地說:「唉,800×800 殺掉了一大堆應用場景。」

社群的替代方案很快定調:給 Agent 一個裁切放大(crop-and-zoom)工具,讓它能針對高解析度圖片的某個子區域以原生細節請求重看,讀一個 600×600 的裁切,而不是整張糊掉的圖。多位開發者回報這招有效。也有人點出明顯的極限——把九個裁切縫合回單一的空間理解本身就是難題,而計數物件或追溯圖表中的關聯,正是這套方法崩潰的地方。兩派都對,只是針對不同工作負載。檢查按鈕有沒有渲染在正確位置,縮到 800×800 撐得住;讀收據上的 8 級小字,撐不住。

detail 參數存在,但值得了解的主要是它「做不到」的事:low 會縮到 512×512,而 high、original、auto 目前全都是同一件事——照樣套用標準縮放。沒有任何高解析度模式可以選。

基準測試表低估了文字端

DeepSeek 的發布說明用一個詞描述視覺版的文字效能:與 V4-Flash「持平」。但同時發布的基準測試表可不是這麼說的。在七項純文字 Agent 基準中,視覺版贏了六項:

文字 Agent 基準Vision-ExpV4-Flash-0731Opus-4.8
Terminal Bench 2.183.982.785.0
NL2Repo57.754.269.7
Cybergym75.376.778.3
DeepSWE59.354.458.0
Toolathlon-Verified75.970.376.2
DSBench-Hard63.659.671.7
AutomationBench(公開版)25.725.127.2

DeepSWE 提升 4.9 分、Toolathlon-Verified 提升 5.6 分——這不是誤差範圍。在 DeepSWE 上,視覺版還以 59.3 比 58.0 險勝 Opus-4.8。「文字持平」大幅低估了 DeepSeek 自家測試框架量測出來的結果;任何依這些數據挑選編碼或工具使用模型的人,就算一張圖都不傳,也該選視覺版。

多模態的成績則需要更仔細解讀:

多模態基準Vision-ExpV4-Flash-0731Opus-4.8
ApexBench(Pass@1)36.526.2*39.4
Agents’ Last Exam27.325.2*25.7
Chartography64.3–65.0
ZeroBench(Pass@5)35.0–34.0

星號是 DeepSeek 自己加的註腳:在 ApexBench 和 Agents’ Last Exam 上,純文字的 V4-Flash 會忽略題目中的多模態元素。所以對 V4-Flash 的「重大躍進」,有一部分只是在量測一個模型看得見、另一個看不見——這是事實,但不等於能力增益。誠實的比較要看 Opus-4.8 那一欄:DeepSeek 在 ApexBench 落後 2.9 分、Chartography 落後 0.7 分,但在 Agents’ Last Exam 和 ZeroBench 反超。「逼近 Opus-4.8」是公允的說法——而以 Anthropic API 定價的一小部分做到這點,才是真正的大標題。

慣例的但書依然適用:所有 DeepSeek 系列的數據都來自 DeepSeek Harness Minimal Mode(top_p=0.95、temperature=1.0)——廠商自家的測試框架——而且這些是發布日的數字,未經獨立複驗。

一週真實流量顯示了什麼

廠商基準是一回事,OpenRouter 路由層在模型上線頭三天的遙測數據是另一回事:

  • P50 吞吐量 每秒 85 token,P50 延遲 1.11 秒
  • 工具呼叫錯誤率 1.27%——對一個以 Agent 為核心賣點的模型來說,及格
  • 單一供應商提供 100% 上線時間、99.93% 可用率(沒有備援可切換)
  • 90.4% 快取命中率,把實際輸入成本壓到牌價的約七分之一(實付約 0.03 美元對牌價 0.22 美元)
  • P99 延遲 18.34 秒、P99 端對端 99.94 秒——批次任務可接受,但對任何有人在螢幕前等待的場景相當煎熬

流量結構最能說明一切。最大使用者全是編碼代理框架:Claude Code 用了 95.8 億 token、pi 用了 45.6 億、Hermes Agent 用了 33 億,再加上 DeepSeek 自家多模態橋接框架的 31.2 億。沒有人把它當聊天模型用——使用者把它指向程式碼庫和螢幕,這與純文字基準七戰六勝的成績整整齊齊地對上。三天內,這個模型燒掉了 250 億 prompt token、6,960 萬 completion token,以及 1.39 億推理 token。推理量大約是完成量的兩倍,思考模式預設開啟,而推理 token 以輸出費率計費。如果你的成本模型把輸出當成「答案的長度」,你會差上大約三倍。

還有一段背景解釋了為什麼一個便宜的視覺模型會造成這麼大的轟動:純文字版 V4-Flash 顯然已經假裝自己看得見好幾個月了。「它在我三個專案上試著靠分析像素來重建視覺,」一位 Hacker News 留言者回報。以那個基準點來看,一個真正會看圖的模型是實實在在的升級——哪怕看得模糊。

你放棄了什麼

兩個遺漏,都不在公告的條列重點裡。不支援 FIM(fill-in-the-middle)補全——純 V4-Flash 和 V4-Pro 在非思考模式下都提供 FIM,但價目頁在此標註不支援,對行內程式碼補全的場景是硬性阻礙。而且模型字串沒有建置日期:純文字版是 V4-Flash-0731、Pro 是 V4-Pro-0813,這個卻只是 Vision-Exp。有日期的版本是你能據以推理的版本;沒有戳記的 exp 標籤是個移動靶。一位留言者如此解讀路線圖:先出預覽版收集訓練資料,再做後訓練,幾週或一個月後放出表現更好的開放權重。如果是這樣,本週跑的評測都有保存期限。

其他限制多半寬鬆:每個請求最多 600 張圖、請求本體 48 MiB、透過新的 Files API(免費,上傳一次、以 file_id 重複引用)單張可達 64 MiB、最大邊長 8192 像素——但一旦請求帶十五張以上圖片就悄悄砍半到 4096,這正是批次文件處理任務的形狀。外部圖片 URL 的 60 秒下載逾時,測試時好好的,指向慢速客戶 CDN 時就開始间歇性失敗。如果圖片對你的管線很重要,Files API 是更安全的預設選擇,而不是之後再做的小優化。

戰略解讀

DeepSeek 在 2026 年以機械般的精準度重複執行同一套劇本:先上實驗性 API 版本、收割真實流量、精煉,然後放出躍升超越預覽版的開放權重。V4-Flash-Vision-Exp 讀起來就是第一步。激進的圖片 token 化——固定 384 token、沒有高解析模式——是一場豪賭:賭大多數 Agent 工作負載需要的不是精細的視覺細節,而是以可忽略的成本取得任何視覺錨定。OpenRouter 的流量顯示這場賭注正在落地:三天 250 億 token,絕大多數來自編碼與螢幕驅動的 Agent。

未決的問題是 Anthropic 如何回應。Opus-4.8 在最難的多模態推理上仍領先(NL2Repo:69.7 對 57.7;DSBench-Hard:71.7 對 63.6),而 Anthropic 的定價傘讓它有降價空間。但 DeepSeek 再次證明:「以幾分之一的價格逼近前沿」本身就是一個具有巨大拉力的產品類別。等到權重釋出——很可能在幾週內——每一個自架的 Agent 堆疊都將免費獲得視覺。

就目前而言,建議很直接:如果你在螢幕和程式碼庫上跑 Agent 迴圈、且不依賴 FIM,現在就能用——光文字基準就值得你換模型字串,視覺是額外賺的。如果你需要釘選的版本、FIM 支援或精細視覺細節(類比錶盤、密集電路圖、收據上的小字),就再等等。而且不管把它指向哪裡,都要記住這個設計:它便宜,是因為它看得不那麼仔細。價格與解析度是同一個決策,不是兩個。