← All posts / Tools

語音戰爭的第二戰線:微軟 MAI-Voice-2.1 正面踏入 ElevenLabs 的市場

微軟宣稱新的 MAI-Voice-2.1 語音模型在成本與品質上都勝過 ElevenLabs、Google 與 xAI,而且手裡還握有 Teams 和 Dragon Copilot 這兩台配送卡車。

語音戰爭的第二戰線:微軟 MAI-Voice-2.1 正面踏入 ElevenLabs 的市場

十月第一週最重要的 AI 發布,不是什麼前沿推理模型——而是兩個「聲音」。2026 年 10 月 1 日,Microsoft AI 低調推出了 MAI-Voice-2.1 與 MAI-Voice-2.1-Flash 兩個文字轉語音(TTS)模型,並明確宣稱它們在成本與準確度上都優於 ElevenLabs、Google 與 xAI 的競品。一天後,The Information 用更直白的方式定了調:微軟推出語音 AI,就是「要與 ElevenLabs 競爭」——句點。

這個定調很重要,因為語音一直是生成式 AI 浪潮中,極少數由新創公司跑贏所有超大雲廠商的領域。ElevenLabs 據報導估值已逼近 220 億美元,年化營收約 5 億美元,並在 9 月 28 日推出 Eleven v4 與 v4 Turbo——支援 90 多種語言、表情控制、更低延遲的語音代理。四天後,微軟帶著 Azure 的通路引擎走進同一個市場。這是不是巧合,時間線自己會說話。

微軟實際上發布了什麼

MAI-Voice-2.1 家族鎖定兩種不同的工作負載:

MAI-Voice-2.1 是品質旗艦。根據微軟的 Azure 文件,它能「從文字或一小段參考音檔生成自然、有表現力的語音」,並內建防護機制,確保只有經過授權、取得同意的聲音才能被複製。它能在長篇內容(有聲書、播客、課程演講)中維持說話者一致性,支援 23 種語言、26 種地區設定,並可透過 SSML(mstts:express-as 樣式,如喜悅、興奮、同理)做細粒度的情緒控制。模型推論延遲約 550 毫秒,定價為每百萬字元 22 美元。

MAI-Voice-2.1-Flash 則是走量版本。它能生成最長 45 秒的音訊,端對端延遲僅 150 毫秒;微軟表示它的模型推論速度快 55%,成本比同級模型便宜約 60%。定價為每百萬字元 15 美元。訴求非常明確:即時語音代理、客服中心 IVR 流程、以及每一毫秒和每一分錢都會複利累積的多語言互動場景。

技術上更有意思的能力之一是「跨語言說話者身分」:同一個聲音可以用 23 種支援語言、以原生口音發聲,切換語言時保持相同的聲音身分。微軟舉的例子是家教 App 可以在課程中途切換語言而不必換「老師」,多語言助理則能用對方使用的語言回覆,聽起來仍然是同一個人。兩個模型都支援用幾秒鐘的參考音檔即時複製聲音,但必須通過同意驗證的閘門。

微軟也對「擬真」提出了數據:在一場結合兩個新模型、共 4,000 名聽者的圖靈測試中,50.3% 的聽者認為 MAI-Voice 與真人錄音同等或更加擬真。換句話說,聽者無法以高於隨機猜測的機率分辨合成語音與真實人聲。

數字遊戲

微軟的定價宣稱值得細看,因為「更便宜」完全取決於分母怎麼算。以字元計價,旗艦版每百萬字元 22 美元、Flash 版 15 美元,直接與 ElevenLabs 的 API 定價對撞——而且遠低於幫助 ElevenLabs 建立約 5 億美元年化營收的高階方案。微軟也宣稱品質領先,但正如 Value Add Pulse 指出的,微軟的優越性宣稱是「自行發布,未經報導中引用的任何獨立基準測試檢驗」。語音品質的比較極度依賴基準設定,而且具體比較對象(哪個 ElevenLabs 模型、什麼參數設定)並未揭露。

不過在轉錄那一側就不是自說自話了:與語音模型同場發布的 MAI-Transcribe-2-Streaming,在 Artificial Analysis 的串流排行榜上,無論最終稿或部分稿都排名第一——最終詞錯率 2.5%,首個部分稿在收到音訊後約 100 毫秒內產出,最終稿 0.13 秒完成,而該指數是以 AgentTalk、VoxPopuli 與 Earnings22 共約八小時音檔組成。微軟把轉錄與語音模型配對,把整個語音代理迴圈——聽、理解、決策、開口——壓縮到對話節奏以內。

通路才是武器

故事到這裡就不再是模型之爭,而是採購之爭。微軟並不是把 MAI-Voice 當成純 API 來賣(雖然它已可透過 OpenRouter、Microsoft Foundry、MAI Playground、Vercel 與 Azure Voice Live 使用,LiveKit「即將上線」)。根據 The Information 的報導,這些模型首先瞄準的是微軟自家產品的功能:在 Teams 裡轉錄會議通話,以及在 Dragon Copilot——它的醫療臨床 AI 產品——裡轉錄醫病對話。

Teams 有約 3.2 億月活用戶;Dragon Copilot 已嵌入數千家醫療體系的臨床工作流程。ElevenLabs 儘管估值與營收亮眼,每一張企業語音合約都得逐一去贏。正如 Trace Cohen 在創投解讀中所說:語音新創現在的盡職調查問題是,你的企業客戶到底需要「業界最好」的品質,還是「夠用而且已經內建在 Teams 裡」——因為微軟剛剛讓第二個選項對許多 E5 客戶而言,在邊際上等於免費。

這與微軟當年對 GitHub Copilot 和 Office Copilot 的算計如出一轍:掌握介面,出一個夠好的模型,讓通路完成剩下的工作。這也呼應了幾天前阿里巴巴用 Qwen-Audio-3.1 砍價 95% 的操作——語音 AI 市場正進入一個由綁售與單位成本戰爭、而非單純品質決定誰贏得哪一層市場的階段。

專家能守住嗎?

ElevenLabs 的多頭論點是:超大廠的 AI 功能在品質上紀錄參差,需要量產級聲音複製的企業可能會繼續選擇專家。OpenAI 的語音模式兩年來並沒有在高階應用中取代 ElevenLabs,顯示專家護城河就算面對免費綁售的替代品也守得住。v4 模型在微軟發布前四天推出,加入表情控制與 90 多種語言——這是一家看見對手要來、提前卡位的公司會做的事,趕在綁售版「夠好」之前把開發者鎖進自家 API。

空頭論點則是採購重力。一旦企業可以在本來就在付的微軟合約裡勾一個語音選項,不管品質差距多大,訂價制的語音 API 都會面臨壓力。獨立廠商——Cartesia、Play.ht、Resemble AI、Deepgram——今年都為了同一波企業語音代理浪潮募了創投輪,而沒有一家的估值接近 ElevenLabs 報導中的 220 億美元。微軟自建替代品,改變了其中每一家的算盤。

最可能的結局不是贏家通吃。語音 AI 正在裂解成兩個世界:垂直綁售的在位者(微軟之於 Teams 與醫療、Google 之於 Workspace 與 Android、xAI 之於 Grok 的多模態堆疊),以及以品質、語言覆蓋與開發者體驗取勝的水平 API 玩家(ElevenLabs、Cartesia,以及越來越以低價進場的阿里巴巴 Qwen-Audio)。微軟的進場是迄今最清晰的訊號:這個品類的經濟學將沿著這條線分裂——而這場仗,通路與模型品質各占一半。

三款新的 MAI 音訊模型現已可在 Microsoft Foundry 正式使用。如果過去一週有任何預示,語音戰爭的第二戰線已經開打,而且這一次,微軟帶著 Azure 的支票簿和 Teams 的裝機量上陣。