← All posts / Models

一個模型聽懂一切:Qwen3.8-Omni-Flash 砍掉 98% 音訊成本,用 Agent 方式讀兩小時影片

阿里巴巴 Qwen 團隊發布原生全模態模型:百萬 token 上下文、支援 74 種語言語音辨識、每小時音訊輸入成本大降 98%,agentic 影片模式可跳過 45% 的影格處理,分數反而更高。

一個模型聽懂一切:Qwen3.8-Omni-Flash 砍掉 98% 音訊成本,用 Agent 方式讀兩小時影片

2026 年 9 月 18 日,阿里巴巴 Qwen 團隊發布 Qwen3.8-Omni-Flash,這是 Qwen 全模態(omnimodal)家族的最新成員,也可能是迄今最積極的一次嘗試——要讓音訊與影片成為 Agent 經濟的一等公民。它的主張說來簡單、做來極難:一個原生端到端模型,能在單一請求中同時接受文字、影像、音訊與影片輸入,具備 100 萬 token 上下文視窗,而且每小時「聆聽」成本低到讓獨立的語音轉文字管線失去經濟意義。

時機點很重要。過去兩年,「多模態」多半意味著「一個還能看圖的語言模型」。而真正主宰會議、通話、媒體與實體世界的音訊和影片,始終昂貴、有損耗、在架構上矮人一截:轉錄服務把文字餵給聊天機器人,過程中剝掉了語氣、重疊的說話者,以及畫面上的一切。Qwen3.8-Omni-Flash 傳達的最新訊號是:這個時代正在結束,戰場正從「感知」轉向 agentic delivery——模型不再只是描述兩小時的錄音,而是決定要對其中哪些部分採取行動。

這次發布了什麼

來自 Qwen 官方發布文章的重點數字:

  • 原生全模態架構 —— 文字、影像、音訊、影片輸入,文字輸出,全部在一個端到端模型內完成,而非多個專家元件的串接。最大輸出 131,072 token。
  • 100 萬 token 上下文 —— 每個檔案約可容納兩小時的原始音訊或影片,在阿里雲 Model Studio 上單一請求最多 64 個檔案。
  • 74 種語言的語音辨識,從阿拉伯語、粵語到維吾爾語、越南語;29 種語言的語音生成。
  • 橫跨音訊、視聽與 Agent 共 29 項基準測試,平均分數比上一代 Qwen3.5-Omni-Plus 高出 25% 以上。
  • 每小時音訊輸入的 API 成本降低超過 98%,視聽混合輸入降低超過 93%——依 Qwen 自家的估算方法與 Qwen3.5-Omni-Plus 比較。

最後一項主張值得細讀,而 Qwen 願意公布估算方法也值得肯定。98% 這個數字是與自家上一代全模態模型的可比比較,以兩分鐘素材輸入成本的 30 倍估算——並不是與 OpenAI 或 Google 比較。但從阿里雲公布的定價反推,量級就很清楚:Model Studio 對音訊按 每秒 7 個 token 計費,國際版定價為 每百萬輸入 token 0.15 美元。一小時音訊等於 25,200 token,換算下來每小時音訊輸入成本約 0.0038 美元——遠低於一美分(輸出費用另計)。720p、每秒 1 幀的視聽輸入在同一基礎上降低超過 93%。

Agentic 影片模式

這次發布在技術上最有意思的不是基準分數,而是一種搜尋策略。以傳統方式分析長錄影時,即使答案只藏在其中三分鐘,整個檔案都會被處理。Qwen3.8-Omni-Flash 的 agentic 模式把這件事倒了過來:模型從問題出發,自行決定要看、要聽哪些片段,並以多趟由粗到細的方式蒐集證據,因此大多數影格根本不會被處理。

Qwen 公布的數字相當驚人。在 OmniVideoBench 上,靜態模式準確率 63.4,agent 模式上升到 67.8,同時每次查詢的 token 數從 145,736 降到 79,117——減少約 45.7%。更少的 token,更好的答案。但要注意:agent 模式是在 Qwen 自家的 Qwen Code 編碼代理框架內執行,而 Gemini 3.8 Flash 在同一框架下的 agent 模式得分 70.1,高於 Qwen 的 67.8;Qwen 則在長影片的 LVOmniBench 以 73.6 對 70.7 領先。不過這個模式可以推廣到任何長媒體產品:讓模型先索引、再選擇性閱讀,帳單下降而準確率維持。

基準成績的誠實解讀

Qwen 的比較表混雜了兩個對手——與自家上一代相比差距戲劇性,與 Gemini 3.8 Flash 相比則互有勝負:

基準測試Qwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM(多模態工具使用)71.034.558.9
AgenticVBench(多模態工具使用)36.814.545.0
UniClawBench(多模態工具使用)69.667.169.0
OmniVideoBench(視聽推理)63.453.865.2
LongAudioSpan(長音訊準確率)82.774.479.3
AliMeeting(說話者錯誤率 / 字錯誤率,越低越好)3.4 / 17.288.1 / 89.672.6 / 53.1
FLEURS-ASR(60 語言字錯誤率,越低越好)9.37.27.9
VoiceBench(音訊互動)91.692.992.3

最突出的一行是多說話者會議。Qwen 表示上一代模型在 AliMeeting 轉錄測試上幾乎完全失敗(說話者錯誤率 88.1),新模型降到 3.4、字錯誤率 17.2——這正是會議紀錄使用場景背後的關鍵能力。同樣值得注意的是,新模型輸給自家前代的兩個項目(多語言轉錄 9.3 對 7.2、VoiceBench 91.6 對 92.9)是白紙黑字印出來,而不是藏起來。另外,Agent 基準中有兩項在 Claude Code 框架內執行、一項在 OpenClaw 內執行,所以那些分數衡量的是「模型加框架」——這個區別足以讓結果大幅變動。

Qwen 自己的總結算是公允:視聽工作上接近 Gemini 3.8 Flash,音訊整體則領先。在 AliMeeting 上則完全不接近——那是世代級的差距。

解釋設計理念的那個 Demo

發布文章裡藏著一段比任何圖表都更有解釋力的軼事:Qwen 給自己的模型一項任務——在 12 小時內改善 Qwen2.5-Omni-3B 的四川話語音辨識,並交付一個可用的模型。全模態模型不是實驗的對象,而是研究員本身。它閱讀程式碼庫、為一種漢語方言規劃資料策略、執行訓練、完成交付——音訊理解不再是自主機器學習工程的產出,而是投入。

「Omni Senses. Agentic Delivery.」這句標語正是這次發布的真正命題:音訊與影片正從感知輸入,演化為 Agent 用來理解環境、執行任務的核心媒介。為了支撐這個主張,Qwen 同時擴充了 Qwen-MM-Plugins——一套開源技能與工具伺服器,讓 Claude Code、Codex、Qwen Code 等編碼代理能讀取影像、影片與音訊——並開源了 Qwen-Live Harness,一個基於 Flash-Realtime API 的即時全模態執行環境(截至撰稿時,其 GitHub 頁面仍回傳 404)。

但沒有開源權重

對一個以開源權重建立聲譽的實驗室來說,這次發布沒說出口的部分才是重點:截至 9 月 18 日,沒有開源權重的公告,Hugging Face 上也沒有模型卡。在 Qwen 另行說明之前,Qwen3.8-Omni-Flash 是純 API 模型,透過阿里雲 Model Studio 與千問平台提供。它也與本月稍早發布的文字與視覺旗艦 Qwen3.8-Max 不同——Omni 才是那個「會聽」的模型。

這個定位說明了競爭前沿現在的位置。多模態中廉價、商品化的部分——先轉錄再對話——正被壓低到每小時幾分錢的量級。而有差異化的部分是 agentic:選擇性搜尋長媒體、在串流中呼叫工具、在工作時把兩小時錄影握在上下文裡的模型。Qwen3.8-Omni-Flash 是對這個前沿的一次有力宣示,而它的價格讓人很難不去為它打造產品。

後續觀察

對於打造會議紀錄、通話審查、字幕、配音或長影片搜尋產品的團隊而言,這次發布改變的決策是:還要不要保留獨立的語音轉文字步驟。合理的測試方式很樸素:把同樣十份錄音分別跑過現有管線和這個模型,以每小時成本與錯誤數評分。但更大的競賽也值得關注:如果 Gemini 3.8 Flash 在 OmniVideoBench 的 agent 模式領先能在獨立評測中成立,Google 仍保有視聽推理的王冠;而如果 Qwen 的會議轉錄差距與降價迫使對手回應,那麼「聆聽的邊際成本趨近於零」的 omni-agent 市場,將對所有人敞開。