看得少、懂更多:Qwen3.8-Omni-Flash 重寫影音 AI 的經濟學
阿里巴巴 Qwen 團隊推出 1M 上下文全模態模型,像代理人一樣跳著看影片,token 用量砍 45.7%、29 項基準全面超越前代,每百萬輸入 token 只要 0.15 美元。
多模態 AI 最燒錢的習慣,就是像人類一樣從第一格看到最後一格地「看完」一支影片。2026 年 9 月 18 日,阿里巴巴 Qwen 團隊發布了 Qwen3.8-Omni-Flash,一個拒絕這麼做的全模態模型。它不線性吞下兩小時的錄影,而是從問題出發,自己決定哪些片段值得看、值得聽,再透過多輪「由粗到細」的檢索收集證據。Qwen 團隊表示,這讓長影片理解在 OmniVideoBench 上的準確率從 63.4 提升到 67.8,同時 token 消耗減少約 45.7%——同樣的任務,從 145,736 個 token 降到 79,117 個。
「準確率更高、成本更低」這組合正是本次發布的核心命題,而它出現的時間點,正是音訊與影片成為現實世界代理人(agents)主要媒介的時刻。
Qwen3.8-Omni-Flash 是什麼
模型建構在 Qwen3.8-Flash-Next 架構上——這個基座模型已在 2026 年 8 月以開放權重形式釋出。Qwen3.8-Omni-Flash 本身首發僅提供 API,未宣布開放權重,目前已上線 QwenCloud、阿里雲 Model Studio 與 Qwen Studio。
輸入面是真正的全模態:文字、影像、音訊、影片進去,文字出來。需要語音合成?文件請開發者改用 Qwen3.5-Omni。核心規格如下:
- 1M token 上下文視窗(QwenCloud 標示最大輸入 991K、最大輸出 131K,最大推理長度 262K token)
- 思考模式預設開啟,
reasoning_effort為xhigh,設成none可關閉 - 同時支援 DashScope 與 OpenAI 兩種協議——Chat Completions 與 Responses API
- 支援函式呼叫、網頁搜尋、結構化輸出、上下文快取與批次呼叫
- 影片檔最長 2 小時 / 2 GB(透過 URL);音訊最長 3 小時
- 音訊輸入支援 113 種語言與方言;影片取樣至 15 fps 仍維持穩定結果
- 多聲道音訊:透過
use_multichannel支援雙聲道立體聲與四聲道 FOA 空間音訊 - 在 6 個區域可用:北京、新加坡、香港、東京、法蘭克福、維吉尼亞
如果這些能力讀起來像語音代理人的檢查清單,那正是刻意設計。模型宣告的工作流程——理解內容、規劃任務、用工具執行、交付結果——是代理人迴圈,不是聊天迴圈。
代理式感知的賭注
技術上最有意思的部分,是 Qwen 團隊所稱的代理式感知(agentic perception)。長影片理解傳統上是暴力問題:全部編碼,然後祈禱關鍵的三分鐘能在上下文壓縮中倖存。Qwen3.8-Omni-Flash 把它倒過來:代理人從問題起點出發,只把算力與 token 分配給重要的片段,並在多輪迭代中逐步聚焦。
Qwen 自家在 29 項評測上對比 Qwen3.5-Omni-Plus 的數字:
- 整套評測平均分數提升超過 25%
- WildClawBench-MM:+36.5 分
- AgenticVBench:+22.3 分
- UniClawBench:69.6
- LongAudioSpan:+8.3 分
- OmniVideoBench:+9.6 分(原始分數 63.4 → 67.8)
- OmniCap-IF:CSR +8.5、ISR +14.1 分
- 代理能力概括為 WildClawBench-MM 與 UniClawBench 平均 +19.5 分
對上 Google,Qwen 聲稱視聽表現「接近 Gemini 3.8 Flash」,而整體音訊表現超越它——直接挑戰這家搜尋巨頭剛上線的即時對話模型。發布當時尚無獨立評測結果,跨實驗室比較暫時請視為廠商自述。
掀桌級定價
這是這次發布讓競爭對手最不舒服的地方。QwenCloud 定價為每百萬輸入 token 0.15 美元、每百萬輸出 token 0.47 美元,隱式快取命中每百萬 0.016 美元。對比 Gemini 3.8 Live 公開的費率——輸入 0.75 美元、輸出 4.50 美元——Qwen 把音訊理解的輸入成本壓到約五分之一,輸出成本約十分之一。
對自家前代的降幅更猛:音訊輸入每小時成本下降超過 98%,視聽輸入下降超過 93%,X 上的官方公告把影片輸入降幅定在約 89%。在這個價位,一整類工作負載——會議轉寫與摘要、客服中心分析、監控影像審閱、課程索引、媒體資產庫——從「昂貴的試點專案」變成「例行預算項目」。
開源安慰獎:Qwen-MM-Plugins
由於模型只輸出文字,媒體工作由工具來做——Qwen 為此開源了兩個專案。Qwen-MM-Plugins 以 Apache-2.0 釋出,口號是「讓任何代理人框架成為多模態原生」。每項能力以 Skill 加上可選的 MCP server 形式安裝,引導式安裝器支援 Claude Code、CodeBuddy、Codex、Qoder、OpenClaw、Qwen Code 與 Gemini CLI。omni 系列插件對應發布示範:
omni-memory——為長影片建立視聽記憶omni-video2note——把教學影片轉成圖文並茂的 PDFomni-chatcut——音樂 MV、電影解說、保留說話者聲音的影片翻譯
README 坦承一個現況缺口:多數框架還無法把音訊原生餵給主模型,音訊暫時得走 API。與插件並行的還有 Qwen-Live Harness,瞄準即時互動的視聽應用。
大脈絡:全模態價格戰
這次發布落在九月中的一波語音模型潮中間——Google 的 Gemini 3.8 Live 與 Live Extended Thinking 於 9 月 15 日上線,xAI 的 Grok Voice Transcribe 2.0 在 9 月 18 日推出,阿里巴巴自己也剛發布 Qwen3.8-LiveTranslate,一個把 60 種語言即時口譯平均延遲壓到 2.3 秒的模型。Qwen3.8-Omni-Flash 是這個技術棧中「理解」的那一半:LiveTranslate 負責即時跨語言搬運語音,Omni-Flash 負責消化數小時的多媒體並回答問題。
策略訊號也藏在「沒有發布什麼」裡。基座 Qwen3.8-Flash-Next 帶開放權重,其上的全模態模型卻沒有。阿里巴巴的押注是:可防禦的利潤不在基座 LLM,而在代理式全模態能力——同時又用插件與框架把自家 API 嵌進每一個主流代理人生態系。
後續觀察
三個問題將決定這次發布能否超越榜單意義。第一,token 效率增益在混亂的真實影片——監控畫面、多說話者會議、壓縮過的直播流——上是否成立,還是只在精心策劃的評測集上漂亮?第二,與 Gemini 的對比能否撐過獨立測試,尤其兩家公司現在都以週為單位出貨?第三,封閉 API 的決定會不會守得住,還是等插件生態成熟後就跟進開放權重?
對開發者而言,算盤已經很好打:1M token 上下文、函式呼叫、預設開啟的推理、六個區域可用,加上讓兩小時影片分析變成零頭的價格——Qwen3.8-Omni-Flash 是第一個讓有趣問題從「它看不看得懂影片?」變成「它能用多低的成本忽略不重要的部分?」的全模態模型。