← All posts / Models

100 毫秒給出第一個猜測:微軟 MAI-Transcribe-2-Streaming 首發即奪冠,同步推出兩款新語音模型

Microsoft AI 推出首款串流轉錄模型,WER 2.5%、支援 60 種語言、每小時音訊僅 0.54 美元,搭配 MAI-Voice-2.1 與延遲 150ms 的 Flash 版本,全面進軍語音代理市場。

100 毫秒給出第一個猜測:微軟 MAI-Transcribe-2-Streaming 首發即奪冠,同步推出兩款新語音模型

語音競賽有了新的排行榜冠軍。2026 年 10 月 1 日,Microsoft AI 一次推出三款語音模型:公司首款串流轉錄模型 MAI-Transcribe-2-Streaming,加上兩個文字轉語音新成員 MAI-Voice-2.1 與 MAI-Voice-2.1-Flash。三者合起來,構成一條完整的管線,瞄準的正是當前應用 AI 競爭最激烈的戰場——能在人類還覺得「這是一場對話」的時間窗內,完成傾聽、理解、決策與開口回應的即時語音代理。

一個不等你說完的轉錄模型

核心宣示相當直白:MAI-Transcribe-2-Streaming 在 Artificial Analysis 排行榜上,最終稿與部分稿(partial transcripts)的準確度雙雙拿下第一名。引用 2026 年 9 月 28 日版本的串流排行榜,該模型的最終字錯率(WER)為 2.5%、首個部分稿錯誤率 2.8%、產出最終轉錄僅需 0.13 秒。微軟還強調模型位於該基準「準確度對延遲」評估的 Pareto 前沿——言下之意,那套「要準就要慢」的老規則在這裡不成立。

機制比名次更值得注意。傳統語音轉文字會等一句話說完才回傳結果;MAI-Transcribe-2-Streaming 則在收到音訊後短短 100 毫秒左右就先給出第一批猜測(術語叫 partials),隨著上下文累積持續修正,最後很快鎖定穩定的逐字稿。這改變了應用能做的事:語音代理可以在使用者話還沒說完時就開始推理或呼叫工具,即時字幕能邊說邊上,而非慢半拍。

模型支援 60 種語言,並具備自動、連續的語言偵測——講者中途切換語言也不必重啟 session,這是多數以單一語言訓練的 ASR 系統直接崩潰的情境。微軟宣稱在內部評測中,即時聽打與字幕場景的文字出現速度,是最接近對手的兩倍。

基準本身量測什麼也值得一提。Artificial Analysis 的 AA-WER 串流指標評估的是音訊逐塊串入的模型,資料取自約八小時音訊、三個資料集——AA-AgentTalk(50%)、VoxPopuli(25%)與 Earnings22(25%)——刻意混合了多元口音、領域術語與惡劣聲學條件。時間指標則以 SileroVAD 語音活動偵測判定的發言結束點起算。

兩款語音模型

MAI-Voice-2.1 是微軟迄今最強的多語 TTS,涵蓋 23 種語言、26 種地區設定。它的招牌能力是跨語言的說話者一致性:同一個「聲音」能用所有支援語言開口,而且每種語言都是道地口音,不是把一種口音硬套到所有語言上。微軟舉的例子是教學 App 能在課程中途切換語言而不必換老師,品牌聲音全球一致。定價為每 100 萬字元 22 美元。

MAI-Voice-2.1-Flash 針對高流量、延遲敏感的工作負載。它能生成最長 45 秒的音訊,端到端延遲僅 150 毫秒,推理速度加快 55%,價格約比同級模型便宜 60%,來到每 100 萬字元 15 美元。微軟明確把 Flash 定位為 MAI-Transcribe-2-Streaming 的天然搭檔——兩者一前一後包住語音代理迴路,在「聽」與「說」兩端同時買回延遲。

兩款語音模型都支援用幾秒鐘的參考音訊、跨所有支援語言進行聲音複製,並內建同意(consent)防護機制防止濫用——在聲音複製濫用已經引來多國監管關注的這一年,這是必要的設計。

還有一個驚人的數據:在一場 4,000 人參與的圖靈測試中,50.3% 的聽者認為 MAI-Voice 與真人錄音一樣、甚至更有人味。在與真實語音的強制比較中越過 50% 這條線,正是 TTS 從「令人驚豔的 demo」邁向「部署預設選項」的那種里程碑。

脈絡:MAI 語音產品線快速成熟

這次發表延續了一條已有動能的產品線。先前的非串流辨識模型 MAI-Transcribe-2 推出時,微軟就稱其為全球最快、最準、最便宜。新的串流版本補上了即時代理唯一缺的那一塊。更宏觀地看,MAI 模型家族——負責推理的 Thinking-1、寫程式的 Code-1.1-Flash、生成影像的 Image-2.6——顯示微軟正在打造一條全端、自家的模型陣容,減少對合作夥伴模型的依賴。

發布管道的策略同樣值得注意。三款模型都可透過 Microsoft Foundry、MAI Playground、Vercel 與 Azure Voice Live 使用,語音模型另上架 OpenRouter,LiveKit 標示即將支援。微軟還同步推出 Chatter——MAI Playground 裡的即時 demo,讓使用者直接與由新轉錄與語音模型驅動的助理對話。

為什麼重要

語音是 AI 延遲預算最嚴苛的場景。文字代理回覆慢三秒沒人介意;語音代理慢三秒就覺得壞掉了。經濟帳同樣清楚:轉錄每小時音訊 0.54 美元(年底前的優惠價)、語音每 100 萬字元 15 美元,微軟把「聽懂再開口」的完整迴路,定價到消費級應用都負擔得起,而不只是企業試驗專案。

競爭格局的解讀:Google 幾週前才以 Gemini 3.5 Transcribe 推進轉錄市場,OpenAI、ElevenLabs 與 Decagon 的 Chord 也都在搶同一塊語音代理大餅。微軟的賭注是:在中立第三方基準上奪冠,搭配激進定價與廣泛的發布管道,是成為語音代理浪潮預設管線最快的方式。第一名寶座每個月都會被挑戰,但「100 毫秒內給出第一個猜測」的串流設計,才是對手真正得跟上的一部分。