視覺是回饋迴路,而不只是輸入:螞蟻集團以 MIT 授權開源 124B 的 Ling-3.0-flash-VL
螞蟻集團旗下 inclusionAI 開源 Ling-3.0-flash-VL:124B 參數的多模態 MoE 模型,每 token 僅啟動 5.5B 參數,支援影像與影片輸入、256K 上下文,提供 BF16 與 FP8 權重,並採用寬鬆的 MIT 授權。
螞蟻集團的開源模型實驗室 inclusionAI(外界多稱 AntLing)悄悄完成了三部曲。繼九月初發布純文字的 Ling-3.0-flash、數天後推出金融微調版 Ling-3.0-flash-Fin 之後,團隊現在開源了補齊整條產品線的關鍵一塊:Ling-3.0-flash-VL——一個原生多模態模型,它把視覺當成推理過程的第一等公民參與者,而不是外掛的輸入通道。
單看規格表,這個模型容易被低估——它是「flash 級」產品,而非前沿旗艦。但細節值得深究:124B 總參數的稀疏 MoE 架構,每 token 僅啟動 5.5B 參數;原生支援影像與影片理解;256K token 上下文視窗;首日即提供完整部署方案;FP8 權重;以及對這個規模的模型而言最不尋常的一點——寬鬆的 MIT 授權。
核心規格
| 項目 | 數值 |
|---|---|
| 總參數量 | 124B(稀疏 MoE) |
| 每 token 啟動參數 | 5.5B(約 4.4% 容量) |
| 上下文視窗 | 256K token |
| 模態 | 文字、影像、影片 |
| 權重格式 | BF16 + FP8(分片 safetensors) |
| 授權 | MIT |
| 推理框架 | SGLang(首日 Docker 映像檔)、vLLM(專屬倉庫) |
BF16 檢查點分片後總計約 250 GB,官方建議的 SGLang 配置是在四張 141 GB 級 GPU(H200 或 H20-3e)或四卡 Blackwell 節點(B300/GB300)上,透過 YaRN 提供完整 256K 上下文服務。換言之:它不是能跑在筆電上的模型,但它是單一高階節點就能承載的模型——而這正是讓開源多模態權重真正可部署的關鍵區間。
架構:為長多模態代理歷史而生
從模型卡可以看出三個突出的設計選擇。
第一,混合骨幹。 42 層 transformer 以 5:1 的比例交錯使用 KDA(Kolmogorov–Arnold 式注意力)層與 Gated 多頭潛在注意力(MLA)層。明確的目標是:在文字、影像、影片,以及——特別值得注意的是——「延長的代理任務歷史」之間實現高效率的長上下文處理。這套架構從設計之初就考量了代理式工作負載,而不是事後改裝。
第二,VideoRoPE 時序編碼。 它不把影片當成一堆影格的集合,而是讓旋轉位置編碼同時承載空間位置與時間順序。模型卡明列支援的任務包括事件定位、長影片問答與影片片段剪輯——這些能力通常存在於專用影片模型,而非通用開源權重。
第三,視覺管線。 ViT 編碼器從影像與影片抽取特徵;兩層 MLP 投影器將這些特徵對齊到文字表徵,實現統一的多模態理解。這在 2026 年已是標準做法——但圍繞它的論述不是。
理解、推理、行動——以及驗證
這次發布最有意思的主張不在基準分數,而在架構哲學。Ling-3.0-flash-VL 被描述為將視覺整合進「理解、推理、規劃、行動與驗證的完整流程」。團隊將能力分為三個維度:
- 理解(Understand)——讀懂複雜視覺資訊:物件計數、複雜版面、圖表與文件內容。
- 推理(Reason)——以視覺證據進行推理:運用所見資訊做計算、多步推理與外部資訊查證。
- 行動(Act)——與介面互動:讀懂網頁與軟體 UI,並將視覺資訊轉譯為一連串動作。
第三個維度是最大的線索。GUI 代理已成為 AI 商業競爭最激烈的類別之一,而一個能閉環的視覺模型——感知畫面、對其推理、採取行動、再用視覺驗證結果——正是這個類別需要的基礎設施。中文圈對這次發布的報導,將此描述為強化網頁生成與 GUI 任務執行的「視覺回饋迴路」。思考模式預設開啟(temperature 0.6、top-p 0.95),與一個意在行動前深思的模型定位一致。
基準分數說了什麼——沒說什麼
模型卡報告在 Artificial Analysis Intelligence Index v4.1.1 上獲得 42 分,較 Ling-3.0-flash 的 38 分進步 4 分——這是個值得注意的結果,因為它代表加入視覺提升了模型的整體智慧分數,而非稀釋它;多模態融合稀釋原始能力,歷來是常見的失敗模式。Artificial Analysis 本身在發布當週以當時的指標版本給出 25 分;模型卡上的 v4.1.1 數字反映的是新版方法論。Terminal-Bench 2.1 則是在 Artificial Analysis 協議下、使用 Terminus 2 harness、統一 2 小時逾時、每任務跑三次的設定完成評測。
獨立評論的態度審慎而非狂熱——這可以說是恰當的。Orcas Router 拿它與純文字的 Ling-3.0-flash 做比較時提出了一個中肯觀點:兩者是互補而非競爭關係。如果你的工作負載從不碰像素,足跡更小的基底模型仍是理性選擇;VL 的價值恰恰在感知進入迴路的那一刻出現。
MIT 授權:故事中的故事
在授權條款成為開源權重 AI 最受爭議變數的此時,一個 124B 多模態模型採用 MIT 授權本身就是一種宣示。它對商業使用、修改與再散布幾乎不加任何限制——對照今年許多名義上「開放」的前沿模型所附帶的自訂社群授權條款。再加上 FP8 權重(相較 BF16 約可減半服務記憶體),以及 OpenRouter 上的免費層與 DeepInfra、Novita 等供應商的付費 API,無論自行部署還是呼叫 API,嘗試 Ling-3.0-flash-VL 的門檻都趨近於零。
脈絡:中國效率浪潮的又一個註腳
本博客持續追蹤所謂的中國開源模型效率論——DeepSeek 以 KV-cache 創新帶來 1M 上下文的 V4.1-Flash、Qwen 的密集發布節奏,以及螞蟻自家的 Ling 系列。Ling-3.0-flash-VL 是這個論述又一個乾淨而具體的數據點:設計上不追逐絕對前沿,而是押注一個紀律嚴明的架構——4.4% 啟動率的 MoE——能以遠低於前沿的服務成本,交付多數真正有用的能力(在此即多模態代理感知),並透過寬鬆授權的開放性,讓生態系採用進一步放大優勢。
這場豪賭是否成立,答案不會出現在排行榜上,而是出現在部署現場:如果 Ling-3.0-flash-VL 開始出現在 GUI 代理堆疊、以及那些跑 GPT 級與 Gemini 級模型成本過高的文件解析管線裡,flash 級產品就算完成了它的使命。
此刻,權重已在 Hugging Face 與 ModelScope 上,SGLang 與 vLLM 的部署文件齊備,OpenRouter 上可免費試用。以任何標準衡量,這都是一次真正的開放發布。
Sources
- [1] https://huggingface.co/inclusionAI/Ling-3.0-flash-VL
- [2] https://openrouter.ai/inclusionai/ling-3.0-flash-vl:free
- [3] https://www.247wallst.com/cards/xpost-01m292qhpmct3wmpcr611yzsvd
- [4] https://www.orcarouter.ai/blog/ling-3-0-flash-vl-vs-ling-3-0-flash
- [5] https://x.com/ArtificialAnlys/status/2098502360800850280