← All posts / Models

DeepSeek 開源首款多模態代理模型:V4-Flash-Vision-Exp 權重以 MIT 授權公開

DeepSeek 將完整的 305B 參數 DeepSeek-V4-Flash-Vision-Exp 檢查點以 MIT 授權上傳至 Hugging Face——原生 FP8 權重、百萬 token 上下文、DSpark 投機解碼,並在半數多模態代理基準上追平甚至超越 Opus-4.8。

DeepSeek 開源首款多模態代理模型:V4-Flash-Vision-Exp 權重以 MIT 授權公開

在以一款便宜的實驗性多模態模型震撼市場十天之後,DeepSeek 做了真正改變格局的那一步:把權重直接公開。8 月 31 日,這家杭州實驗室將完整的 DeepSeek-V4-Flash-Vision-Exp 檢查點以 MIT 授權上傳至 Hugging Face——這是 DeepSeek-V4 家族首款開放權重的多模態模型,也是全球極少數能「看懂螢幕截圖、然後操作電腦」的開源模型之一。

到 9 月 1 日早上,這個儲存庫已累積約 18,000 次下載、420 多個讚。對一個需要多 GPU 節點才能跑動的 3,050 億參數巨獸來說,這個數字相當驚人——也清楚說明開源生態對強力視覺語言代理的飢渴程度。

這次到底釋出了什麼

這個儲存庫不只是一堆 safetensors 檔案。DeepSeek 給了整套可運行的工具:

  • 完整檢查點——總計 3,046 億參數,以原生 FP8 格式儲存(路由專家權重採 4-bit FP4,注意力與共享元件則為 FP8/BF16),附帶 config.json、分詞器檔案與 safetensors 索引。
  • 最小化 PyTorch 推理實作——涵蓋視覺編碼器與對齊器、DFlash 注意力核心路徑、MoE 路由、Hyper-Connections,以及 DSpark 前向傳遞。
  • 不依賴 PyTorch 的提示詞編碼參考實作——OpenAI 風格的 JSON 內容區塊與緊湊的 <image>path</image> 文字標記,兩種格式會編碼出完全相同的提示詞與 token ID。
  • vLLM 與 SGLang 的第一手部署食譜——包括在單一 4×GB300 節點上一行 Docker 指令起服務。

根據公開的 config.json,架構為 43 層混合專家模型:256 個路由專家(每 token 激活 6 個外加 1 個共享專家)、64 個注意力頭搭配單一 KV 頭(極為激進的多查詢注意力)、秩 1024 的 MLA 式低秩 Q/K 投影、1,048,576 的最大位置嵌入(透過 YaRN 從 64K 基礎擴展至百萬 token 上下文),以及 3 層 DSpark 投機解碼頭——與 DeepSeek 在 V4 文字模型上首創的「單一檢查點同時做草稿與驗證」技巧相同,讓 vLLM 能以 3 個投機 token 與自適應驗證來服務它。

授權條款才是許多讀者眼中的頭條。MIT 是最寬鬆的授權之一:商用、再散布、微調、蒸餾,全部放行。DeepSeek 大可選擇僅限研究或社群授權——近期不少中國開源模型正是這麼做的。但它沒有。

基準成績表,以及為什麼它重要

模型卡附上了與純文字兄弟版(DeepSeek-V4-Flash-0731)及 Anthropic Opus-4.8 的對比,數字值得細讀。

在文字代理基準上——Terminal Bench 2.1、NL2Repo、Cybergym、DeepSWE、Toolathlon-Verified、DSBench-Hard、AutomationBench——Vision-Exp 穩住了相對七月文字模型的水準,並與 Opus-4.8 保持咬合:它在 DeepSWE 上擊敗 Opus(59.3 對 58.0),在 Toolathlon-Verified 上幾乎打平(75.9 對 76.2)。裝上眼睛,並沒有讓它的打字變差。

多模態代理基準才是這次發布的真正賣點。ApexBench Pass@1 從 26.2(純文字模型、忽略圖片)躍升至 36.5,大幅拉近與 Opus-4.8 的 39.4 之間的差距。在 Agents’ Last Exam 上,Vision-Exp 拿下 27.3——領先 Opus-4.8 的 25.7。ZeroBench(Pass@5)以 35.0 對 34.0 領先 Opus,Chartography 則以 64.3 對 65.0 近乎平手。

換句話說:一個開放權重、MIT 授權的模型,如今在已公布的多模態代理基準中有一半達到甚至超越閉源前沿水準,其餘項目差距也在兩分以內。一年前,開源多模態大致等同於「OCR 加圖說」的品質;這在當時是不可想像的。

實際跑起來需要什麼

問題來了,而且是真的。3,046 億參數的檢查點,即便是原生 FP8,也不是筆電能負荷的工作量。DeepSeek 自家的 vLLM 食譜瞄準4×GB300 節點;SGLang 食譜的旗艦配置跑在 B200 GPU 上、採 FP4 量化。粗略估算:FP8 檢查點中光是專家權重就佔約 2,960 億參數,下載量在你能配置任何 KV cache 之前就以數百 GB 起跳(官方食譜以 FP8 KV cache 與區塊大小 256 稍作緩解)。

社群的動作一如既往地快。Unsloth 在一天內就上架了 Vision-Exp 的 GGUF 量化版,延續其在純文字 V4-Flash 上的模式——當時 Q8「無損」量化為 162GB,3–4 bit 版本可在 110–168GB 統一記憶體的 Mac 上運行。但即使經過壓縮,也別指望它在遊戲電腦上跑。現實的部署場景是:租用多 GPU 節點、自建 DGX 級主機,或透過推理服務商——OpenRouter 已上架此模型——給那些想要資料自主權但不擁有矽晶片的團隊。

而這正是此發布所服務的受眾:需要可以自行部署、檢視、微調、離線隔離的頂級視覺語言代理的企業與研究單位。MIT 授權讓這四件事在法律上都毫無懸念。

為什麼這次比 API 上線更具衝擊力

8 月 21 日 Vision-Exp 出現在 DeepSeek API 上時,故事是「Opus 級多模態代理的低價挑戰者」。不錯,但 API 是租賃關係——定價、可用性、日誌全都由 DeepSeek 說了算。權重改變了這層關係:

  1. 價格下限從此有了結構性支撐。 任何服務商都能供應這個模型,競爭會把利潤壓向硬體成本。在每一場採購談判中,Anthropic 與 OpenAI 的視覺代理定價背後都多了一個開源替代品在喘氣。
  2. MIT 之下蒸餾合法且容易。 預期下一季會出現一批以 Vision-Exp 輸出訓練的較小多模態代理模型,如同 2025 年 V3/R1 孕育出的生態系。
  3. 代理堆疊一併附贈。 附 DSpark 投機解碼、工具呼叫解析器與推理設定的部署食譜,意味著這個開源模型不是研究樣品——第一天起就是可部署的基礎設施。
  4. 開放權重軍備竽賽繼續升溫。 GLM-5.3-Flash 於 8 月 26 日出貨、騰訊 8 月 28 日開源 770B 的 Hy4 預覽版,如今 DeepSeek 以 V4 家族首款開源多模態模型回應。中國實驗室正以每週一次的節奏推出旗艦級開源模型,每一次都在重新定義「開放」的標準。

但要注意

它叫 Exp 其來有自。模型卡明言這是實驗性檢查點——是在 V4-Flash 上的延續訓練,而非從零打造的多模態版本。相對 0731 純文字模型,部分文字代理項目略微退步(Cybergym 75.3 對 76.7;NL2Repo 的 57.7 仍遠落後 Opus 的 69.7)。而「在兩項多模態基準上擊敗 Opus-4.8」也不等於「作為產品與 Opus-4.8 相當」——Anthropic 的模型受益於打磨過的框架、工具生態與可靠性工程,這些都不是原始檢查點自帶的東西。

但這些都無損核心事實:自 8 月 31 日起,任何有硬體的人都能免費、無附帶條件地下載、檢視並部署全球較強的電腦操作視覺代理之一。開源多模態代理的前沿,剛剛移動到幾個月前閉源前沿所在的位置。這才是重點,而且是大新聞。