每小時十美分:微軟 MAI-Transcribe-2 把語音辨識變成公共事業
微軟 MAI-Transcribe-2 以 5.2% 詞錯率稱霸 60 種語言的 FLEURS 基準,並以每小時 0.10 美元定價重擊 OpenAI、Google 與 ElevenLabs——五個月內價格砍了 72%。
語音轉文字正在變成一種大宗物資,而握著定價槍的是微軟。本週,Microsoft AI 團隊發布了 MAI-Transcribe-2,一款自研語音辨識模型,官方直接稱之為「世界上最快速、最準確、最便宜的語音辨識模型」。最搶眼的數字是:每音訊小時 0.10 美元的促銷價,效期到 2026 年底。
這不是小幅降價。2026 年 4 月第一代 MAI-Transcribe 上線時,價格是每小時 0.36 美元。五個月後,接班機型把自己的前代砍掉了約 72%——同時還增加了語言支援、功能與基準測試戰績。在客服中心平台、媒體公司與會議記錄新創動輒處理六位數小時音訊的市場裡,十萬小時音訊的成本從 36,000 美元降到 10,000 美元,足以讓每個採購部門重新招標。
模型實際做了什麼
MAI-Transcribe-2 支援 60 種語言,比六月 1.5 版的 43 種大幅增加。在跨語言語音辨識的標準考場 FLEURS 基準上,微軟表示此模型在全部 60 種語言中排名第一,平均詞錯率(WER)僅 5.2%,擊敗 Gemini 3.5 Transcribe、OpenAI 的 GPT-Transcribe、Whisper V3-Large 與 ElevenLabs Scribe v2。
速度是第二條攻擊軸線。根據微軟引用的 Artificial Analysis 實測,MAI-Transcribe-2 的推理速度是 GPT-Transcribe 的 10 倍、ElevenLabs Scribe v2 的 7 倍、Gemini 3.5 Transcribe 的 5 倍,同時在「準確度對延遲」的帕累托前沿(Pareto Frontier)上居於領先——沒有任何競品能同時比它更快又更準。它在 Artificial Analysis 的詞錯率總榜上排名第二,微軟將此描述為歷代版本持續「攻頂」的延續。
功能清單則像極了企業買家過去兩年來的許願池:
- 說話者分離(diarization)——錄音依說話者切分並正確歸屬,每段附帶偏移量與時長詮釋資料。
- 詞級時間戳——每個字都帶精確時間,支援字幕對齊、逐字搜尋與音訊導航。
- 關鍵詞偏置(keyword biasing)——提供產品名、縮寫或領域術語清單,辨識會向其傾斜(是提示而非強制輸出)。
- 可設定風格——
verbatim模式保留贅詞、改口與自我修正,供合規與品管使用;clean模式移除贅詞,產出可讀性高的筆記與字幕。 - 語碼轉換(code switching)——像 Hinglish(印地英語混合)與 Spanglish(西英混合)這類混語對話,可以在一句話中間自然切換,不必強制全檔單一語言。
- 自動語言識別,並對背景噪音、多人重疊發話與參差不齊的麥克風品質保持強健。
API 的技術細節
技術上,MAI-Transcribe-2 目前透過 Azure 語音服務的 Fast Transcription API 提供公開預覽。開發者在 speechtotext/transcriptions:transcribe REST 端點(api-version 2025-10-15)上把 enhancedMode.enabled 設為 true、enhancedMode.model 設為 "MAI-Transcribe-2" 即可啟用。輸入為 300 MB 以下的 WAV、MP3 或 FLAC 音訊檔——這意味著它目前瞄準的是批次型工作負載,如字幕製作、臨床筆記、客服記錄與內容創作,而非即時串流。除了 Azure,微軟也把模型推上 Foundry、MAI Playground,以及格外值得注意的 OpenRouter——讓自家的 MAI 系列與它同時在 Azure 裡轉售的 OpenAI 模型正面對決。
預覽版的但書很重要:目前沒有 SLA,微軟明確建議在正式版之前不要用於生產環境。但定價訊號已經打出去了,競爭對手現在就得回應。
為什麼「價格崩跌」才是真正的新聞
語音辨識在 AI 技術堆疊中占據一個特殊位置:它是少數買家能把價格、延遲、語言覆蓋與準確度攤在試算表上逐項比較的市場。這裡沒有靠感覺評分的空間,也不像影像生成或寫作那樣存在主觀品味問題。當一家廠商同時公布基準測試冠軍和 3–10 倍的價格優勢,理性的回應就是換供應商。
這種透明度正是微軟選定這個戰場的原因。MAI 系列——Transcribe、Voice、Image,以及持續登上 Foundry 的推理模型——是微軟擺脫「OpenAI 分銷通路」形象、以第一方模型開發者身分立足的賭注。每有一個工作負載從 GPT-Transcribe 轉向 MAI-Transcribe-2,兩者的關係就再微幅重新平衡一次。
更深層的影響在於商品化對新創生態的擠壓。每小時十美分的 Whisper 級品質,讓「我們轉寫得更準」這個推銷詞徹底失效。能存活下來的是工作流(編輯整合、合規留存、領域微調)、法規定位(醫療與法律認證)與專屬領域資料。原始轉寫品質不再是護城河——它變成由超大雲廠以公共事業價格供應的基本盤。
還有一個訓練資料飛輪的論點。客服中心、會議錄音與字幕管線每天產生數十億小時的音訊。定價低到足以承接這股流量的廠商,將取得地球上最大的真實世界語音語料庫——充滿噪音、多語混合、語碼轉換的音訊,那是乾淨的學術基準永遠測不到的。微軟的激進定價不只是市占策略;它是資料取得策略,而且會複利滾動。
競爭對手的帳本
對 OpenAI 而言,GPT-Transcribe 現在貴了約一個數量級,而第三方實測速度慢十倍——在試算表決勝負的市場裡,這是站不住腳的位置。對 Google 而言,Gemini 3.5 Transcribe 還保有一定的品質口碑,卻面臨 5 倍的延遲差距。對 ElevenLabs 而言——Scribe v2 曾是新創圈的準確度標竿——超大雲廠以更低價格提供相等甚至更好的詞錯率,是最典型的上下夾殺:他們的出路在語音生成與代理式語音產品,而不是單靠轉寫。
微軟自身的經濟學也吃到了甜頭:推理跑在完全自有的基礎設施上——全球 Azure 區域、自有晶片策略,以及一個存在了十年的語音服務。只有當你需要租別人的 GPU 來交付時,每小時十美分才是毀滅性定價。
這一步也落在本週更廣的格局裡:當前沿對話模型忙著搶 AGI 頭條,最激烈的競爭已悄悄移往無聊、高量、按表計費的工作負載——轉寫、翻譯、字幕——因為買家在這裡是真的會拿尺出來量的。誰贏得這些公共事業級的底層軌道,誰就掌握了未來每個代理、機器人與會議助理都得開口說話的預設管線。
MAI-Transcribe-2 現已在 Azure Speech、Foundry 與 OpenRouter 上公開預覽,0.10 美元/小時的促銷價持續到 2026 年底。從 0.36 到 0.10 美元的五個月旅程,告訴你這條曲線的下一站:快速趨近於零。
Sources
- [1] https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/
- [2] https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe
- [3] https://venturebeat.com/infrastructure/microsoft-ais-mai-transcribe-2-undercuts-openai-google-and-elevenlabs-on-price-and-speed
- [4] https://www.unite.ai/mai-transcribe-2-tops-fleurs-benchmark-across-60-languages-microsoft-says/
- [5] https://techstartups.com/2026/09/04/top-tech-news-today-september-4-2026-amazon-google-microsoft-nvidia-openai-tesla-more/