← All posts / Models

AI 語音大降價 95%:阿里巴巴 Qwen-Audio 3.1 五模型齊發,掀起語音市場價格戰

阿里巴巴 Qwen 團隊一次推出五款音訊模型——ASR、ASR-Next、TTS、TTS-Next 與 262K 上下文的 Realtime 即時對話模型——同時大砍 API 價格最高達 95%,一夜之間改變語音 Agent 的成本結構。

AI 語音大降價 95%:阿里巴巴 Qwen-Audio 3.1 五模型齊發,掀起語音市場價格戰

本週最響亮的 AI 新聞不是又一個前哨聊天機器人,而是一場價格戰的槍聲。阿里巴巴的 Qwen 團隊發布了 Qwen-Audio 3.1——一次涵蓋語音辨識、語音合成與即時對話的五模型陣容,伴隨而來的 API 降價幅度狠到很难不作別的解讀:文字轉語音(TTS)降價約 70%、即時對話(Realtime)約 85%、自動語音辨識(ASR)最高降 95%。

對一個正急著把 AI Agent 推上電話、耳機與客服系統的產業來說,音訊原本正悄悄成為主要的成本項目。阿里巴巴一夜之間把它變得近乎免費——而這個舉動本身,說明了語音 Agent 市場的走向。

這次發布了什麼:五個模型,一套完整語音堆疊

Qwen-Audio 3.1 不是單一模型,而是一套涵蓋完整語音迴路的協同陣容:

  • ASR——主力轉錄模型。支援多語言與方言辨識,並新增「潤飾」處理,能自動移除逐字稿中的贅詞與重複字句。
  • ASR-Next——音訊「理解」模型,可以說是五者中最有趣的一個。它支援說話者分離(diarization,把語音段落分配給不同說話者)、產生時間戳、偵測情緒、辨識環境音與機械噪音,還支援聲音描述(sound captioning),甚至能直接回答關於音訊內容的問題。
  • TTS——語音生成模型,具備多語言合成、跨語言音色轉移,以及用指令控制情緒、語速、口音與演繹風格的能力。你可以用平白的文字下指令:「用犀利、有威嚴、令人肅然起敬的語氣唸這段。」
  • TTS-Next——統合式音訊生成系統,結合語言模型與擴散方法,在單次生成中同時產出語音、音效與背景音。阿里雲文件將它定位為「AudioGen」模型,瞄準podcast、電影級音景與遊戲音效,而非單純旁白。
  • Realtime——即時對話模型,可同時說與聽(全雙工)、即時處理插話,而且——這個細節很能說明語音體驗的未來方向——當偵測到使用者語氣低落時,會放慢回應速度、更有同理心。

旗艦版 Realtime Plus 將上下文視窗擴大到 262,144 個 token,支援函式呼叫、網路搜尋與聲音複製(voice cloning),透過持久的即時連線串流輸出語音與文字。

技術亮點:更少的 token,更快的訓練

隨附的技術論文最清楚揭示了 TTS 模型的成本邏輯。低幀率tokenizer以每秒僅 12.5 幀表示語音,大幅減少自迴歸語言模型需要預測的單位數;再由 flow-matching 元件生成最終聲波所需的聲學細節。

訓練分五個階段:預訓練語言模型、預訓練 flow-matching 模型、聯合訓練兩者並逐步聚焦於高品質資料,之後依序對兩個元件施加強化學習。阿里巴巴表示,強化學習階段具體改善了韻律(prosody)、音色相似度,以及對困難參考錄音的適應力——正是讓合成語音「像人」而非「勉強聽得懂」的特質。

模型接受自由格式的指令來控制角色、情緒、語速、音色、風格與口音,並支援 86 個行內標籤來表達笑聲、呼吸、咳嗽、嘆氣等非語言事件。語言涵蓋 16 種語言與 20 個中文方言區,單次可合成最長三分鐘的音訊(依阿里雲文件,TTS-Next 在 podcast 場景可達四分鐘),且能容忍含噪音、迴音或發音不清的參考語音。

價格的故事:要跟 DeepSeek 一起讀

降價是頭條,但把它跟本週另一個數字並排看更有意思:DeepSeek 在把 API 價格調漲 2.3 到 4.5 倍之後,年營收達到 10 億美元。兩個舉動方向相反,意義相同——中國 AI 生態已經分化成兩種路線:能對前哨推理能力收取溢價的實驗室,以及把音訊(和其他商品化模態)當成交量生意、由最便宜能用的供應商通吃的市場。

Qwen 的信心其來有自。2026 年 7 月,前代的 Qwen-Audio 3.0 TTS Plus 在 Artificial Analysis 文字轉語音競技場以 1,237 的品質 Elo 分排名第一,領先 Google 的 Gemini 3.1 Flash TTS、MiniMax Speech 2.8 HD 與 ElevenLabs Eleven v3——而牌價僅每百萬字元 27.60 美元,約為比較中 ElevenLabs 與 MiniMax 等級的三分之一。(但要注意:該模型每秒僅生成約 16 個字元,最快的對手可達 120;且它與第二名差距落在信賴區間重疊範圍內,統計上是並列第一。)

新的 3.1 端點仍需獨立的品質與延遲測試。但如果 3.1 陣容在新價位下保有多少類似的性價比,每一家獨立語音 AI 供應商的毛利結構都將面臨壓力測試。

為什麼全雙工比跑分更重要

陣容中影響最深遠的,可能是最不炫的 Realtime。傳統語音 Agent 串接一條管線——語音 → ASR → 文字 → 語言模型 → 文字 → TTS → 語音——每一次交接都增加延遲與故障面,尤其當使用者中途插話時更是如此。整合式模型把語音理解、推理與生成摺進單一服務,簡化了插話處理並降低端到端延遲。

阿里巴巴指出,基於 Qwen-Audio 3.0 Realtime Plus 的應用可沿用相同的整合協議,遷移程式碼有限。但生產團隊仍需對輪流發言(turn-taking)、插話時的工具呼叫準確度與錯誤處理做回歸測試——而且 262K 上下文視窗是連線上限而非記憶策略;即時音訊、工具結果與對話狀態都會消耗它,有狀態的 Agent 仍需要摘要與截斷政策。

開源、託管與尚缺之處

許多報導略過的細節:各模型的可用性並不均勻。ASR 檔案轉錄端點與 Realtime Plus 目前已在阿里雲 Model Studio 上線。開源權重的 Qwen3-TTS 儲存庫仍以 Apache 2.0 授權提供——但它與託管版 Qwen-Audio 3.x 服務分屬不同譜系,想自架的開發者應先驗證功能與 API 的一致性。ASR-Next 與 TTS-Next 則尚無上線日期,屬「已發表、未開放」。TTS-Next 的價格已公布(北京區每百萬輸入 token 6 人民幣、輸出 12 人民幣,不含促銷),但每秒 3 次請求的速率限制,透露出早期產能的保守。

結語

Qwen-Audio 3.1 是一種安靜的重要。這裡沒有單一模型改寫前哨——但一套五模型陣容,配上競技場領先的 TTS 品質、262K 上下文的全雙工即時對話、具備說話者感知的音訊理解,以及 70% 到 95% 的降價,改變了所有語音產品開發者的算術。當轉錄一分鐘或合成一段落的邊際成本趨近於零,差異化就移往別處:延遲、可靠度、插話下的工具使用,以及調教出一副人們真正想聽的聲音的品味。

這個月的能力新聞很吵。價格新聞說的更多:語音正在變成基礎設施,而基礎設施的宿命,就是很快變便宜。