← All posts / Models

五個模型、砍價 95%:阿里 Qwen-Audio-3.1 重寫語音 AI 的成本底線

阿里巴巴 Qwen 團隊一次推出五模型語音矩陣——升級版 ASR、TTS、Realtime 加上新成員 TTS-Next 與 ASR-Next——同時將 ASR 價格砍最多 95%、TTS 約 70%、Realtime 約 85%。

五個模型、砍價 95%:阿里 Qwen-Audio-3.1 重寫語音 AI 的成本底線

阿里巴巴的 Qwen 團隊從不畏懼價格戰,但這次的發布依然像一記震撼彈。9 月 23 日,團隊推出 Qwen-Audio-3.1,一次性升級整套語音矩陣:五個模型涵蓋語音辨識、語音合成與即時對話,伴隨最高 95% 的 API 降價。在 OpenAI、ElevenLabs、Deepgram 仍以高價銷售音訊智慧的市場裡,阿里巴巴直接重設了整個轉錄與語音品類必須遵守的成本底線。

這次發布了什麼

這不是單一模型,而是一整套協同作戰的產品線。三個既有模型——ASR(自動語音辨識)、TTS(文字轉語音)與 Realtime——完成全面升級,另外新增兩個成員:

  • ASR(升級)——主力轉錄模型現在會「自動清理贅詞與重複語句」,不需後處理就能產出乾淨的逐字稿,多語言與方言辨識能力同步提升。
  • ASR-Next(新)——理解層。在轉錄之上疊加多說話者身分辨識與個別時間戳、情緒偵測、環境音與機械噪音偵測。換句話說,它告訴你的不只是「說了什麼」,還有「誰說的、何時說、帶著什麼情緒、在什麼背景音之下」。
  • TTS(升級)——多語言合成支援「自然的跨語言音色轉換」,情緒、語速與風格透過純文字提示控制,不必再摸索黑盒參數。
  • TTS-Next(新)——整個矩陣中架構上最有意思的模型。阿里雲文件將它定位為「AudioGen」模型,能在單次生成中同時產出語音、音效與背景音」,把過去需要串接三套推論系統的工作流程,收攏成一次模型呼叫。
  • Realtime(升級)——支援同時說與聽,具備「即時打斷」處理,這種全雙工能力正是對話式語音代理與步行對講機式助理的分水嶺。

阿里雲百鍊(Model Studio)的技術文件進一步揭露 TTS-Next 的企圖心:它接受文字、時間戳與最多三段參考音訊(每段 30 秒)輸入,輸出 WAV/MP3/PCM 格式,支援的任務橫跨多語言 TTS、多說話者對話、播客、電影級聲景、環境音與音效。單次請求的輸出時長在播客場景可達 240 秒,其他場景 120 秒。牌價為輸入每百萬 token 6 元人民幣、輸出每百萬 token 12 元人民幣(未含促銷)。

降價本身就是新聞

模型發布是日常,這種定價不是。根據 The Decoder 的報導,降幅如下:

API降價幅度
ASR最高 95%
TTS約 70%
Realtime約 85%

砍 95% 不是促銷,而是對整個品類的戰略性重新定價。AI Weekly 的分析一針見血:這次降價「重設了整個轉錄供應商品類必須達到的成本基準,無論你過去的毛利結構建立在什麼之上」。Deepgram、ElevenLabs 與 OpenAI 的音訊 API 如今面對一個不舒服的選擇:跟進新底線並摧毀自己的毛利結構,或者死守價格、把每一個對成本敏感的場景——客服中心、會議轉錄、媒體監測、大規模語音代理——拱手讓給阿里巴巴。

有幾點必須誠實以對。阿里巴巴並未公布優惠價的生效日期,也未說明該價格屬承諾容量還是即時容量。激進的牌價也僅適用於 Model Studio——阿里雲自家的推論平台,這代表完整折扣只落在願意建構在中國雲端基礎設施上的客戶,對受監管的西方企業而言是實際的考量。但對全球大多數開發者來說,訊號再明確不過:語音 AI 正走向「轉錄近乎免費」的時代。

為什麼 TTS-Next 在架構上重要

拋開價格,TTS-Next 指出了音訊生成的下一步。今天要產出一段精緻的播客或影片配樂,得串接一條編排管線:一個模型負責旁白、第二個負責音效、第三個負責環境音鋪底,再手動混音。TTS-Next 單次生成語音、音效與背景音,直接壓垮這條管線——就像多模態 LLM 曾對「文字加圖片」工作流程做過的架構整併一樣。

透過時間戳輸入的「靈活時序控制」同樣實用:創作者可以把旁白釘在特定時間點,不必反覆重新生成。加上長輸出下的一致音色與多說話者對話支援,這個模型瞄準的是專業製作場景——短影音、播客、影視與遊戲音訊——而非展示用的玩具。

另一方面,升級後的 Realtime Plus 搭載 262K token 的上下文視窗,足以讓語音代理帶著完整對話歷史、工具呼叫結果與應用狀態走完整場會話。這讓阿里巴巴的競爭面從轉錄供應商延伸到即時代理編排——正是 OpenAI Realtime API 與一群語音代理新創激烈爭奪的地盤。

脈絡:語音大戰正在升溫

Qwen-Audio-3.1 並非憑空出現。同一週,Nvidia 釋出 Nemotron 3 Diarization,一個免費的 1 億參數模型,可即時辨識最多八位說話者,目前以 14.7% 的錯誤率領先 VoiceArena 說話者分離基準。OpenAI 推出三項 ChatGPT 語音升級,包含外掛支援與可自選的後端模型。根據 AI Weekly 的追蹤,Google 也有自家語音發布正在路上。

讓阿里巴巴這次與眾不同的是「組合拳」:逼近前沿的能力加上激進的價格傘。Nvidia 的分離模型免費但功能單一;OpenAI 的語音升級精緻但走高價路線。Qwen-Audio-3.1 押注的是:在語音領域(比文字領域更甚),價格彈性主導一切,而代理工作量的爆發將流向任何把音訊智慧做到近乎免費的廠商。

對正在打造語音代理、會議機器人或媒體管線的企業,實際建議很直接:現在就拿 Qwen-Audio-3.1 與你現有的技術棧做基準測試。即使資料居留或法規限制讓你留在西方供應商,這條新的價格底線也該寫進每一次的合約談判裡。對產業其他人而言,這次發布再次提醒我們:在當前的 AI 週期中,最具破壞力的產品功能,往往就是帳單上的數字。