← All posts / Models

每分鐘兩美分:xAI 發布 Grok Voice Transcribe 2.0,準確率翻倍、價格不變

xAI 全新語音轉文字模型在 Artificial Analysis 榜單上排名第一(32 個串流模型),電話語音與多語系音訊的字錯誤率減半,批次轉錄維持每小時 0.10 美元——而且已經在為 Atlassian Loom 與 Tesla 車內 Grok 助理服務。

每分鐘兩美分:xAI 發布 Grok Voice Transcribe 2.0,準確率翻倍、價格不變

語音轉文字正悄悄成為 AI 技術堆疊中競爭最激烈的一層。光是過去一個月,Google 推出了內建口語修正與函式呼叫的 Gemini 3.5 Transcribe,微軟的 MAI-Transcribe-2 則以每小時 0.10 美元的價格自稱「全球最便宜的語音辨識模型」。9 月 18 日,xAI 也加入了戰局:Grok Voice Transcribe 2.0——一個官方宣稱準確率是前代兩倍的語音轉文字模型,而價格完全不變。

這次發布的重要性來自它的出身。Grok Voice Transcribe 2.0 建構在驅動 Grok Voice 的同一個音訊基礎模型之上,而那個模型早已在生產環境中每天處理數萬通客服電話、轉錄數百萬小時的影片旁白,並驅動 Tesla 車內的 Grok 語音助理。換句話說,這不是一個為了刷排行榜而生的實驗室模型——它是把真實、嘈雜、多語系的生產環境工作負載,透過後訓練精煉出來的獨立轉錄產品。

真正關鍵的數字

在公開的 Artificial Analysis 排行榜上,Grok Voice Transcribe 2.0 在 32 個串流模型中準確率排名第一,對手包括 OpenAI、Google、ElevenLabs 與 Deepgram 的產品。內部評測在四個來自生產流量的測試集上也說了一致的故事:

  • 電話語音(8 kHz 客服通話): 改善幅度最大的類別。8 kHz 電話音訊對於用乾淨錄音室語料訓練的模型向來是重災區,xAI 表示在這個測試集上它領先所有受測模型。
  • 對話音訊: 與 Grok 的英文對話。
  • 憑證資訊: 口述的電話號碼、電子郵件地址、帳號——幻覺出一個錯誤數字就會造成實際傷害的地方。
  • 短語指令: 涵蓋 19 種語言的車用語音指令,字錯誤率從 20.6% 降到 6.8%。

最後這個數字值得特別強調。短語音幾乎不給模型任何推斷語言或意圖的上下文,這正是多語系系統歷來最容易崩潰的場景。在這個測試集上把 WER 砍掉約三分之二,最清楚地證明:變強的不只是轉錄頭,而是底層的音訊基礎模型本身。

發布時公布的特定音訊類別也呈現同一模式:對話音訊的字錯誤率從 8.7% 降至 3.3%,短語從 20.6% 降至 6.8%(相對前一代)。

定價:兩美分的每一分鐘

Grok Voice Transcribe 2.0 的價格與 1.0 版完全相同:批次轉錄每小時 0.10 美元,串流每小時 0.20 美元——換算下來約每分鐘兩美分、串流每分鐘四美分。說話者分離(diarization)、詞級時間戳與關鍵詞偏置全部免費內建。

這個價位讓 xAI 直接撞上微軟——後者才剛把 MAI-Transcribe-2 的促銷價定在每小時 0.10 美元(到 2026 年底)。差別在定位:微軟把轉錄當成 Azure 的公共事業來賣;xAI 賣的則是一個早已在 Tesla 規模上運轉的語音代理堆疊的副產品。當你的訓練資料就是即時客服流量與車內指令時,額外推出一個轉錄 API 的邊際成本,幾乎就只是服務它的成本。

為代理而生,而不只是為了檔案

功能清單讀起來像是一份寫給語音代理開發者的檢核表,而非檔案處理工具:

  • 批次與串流——轉錄錄音檔與 URL,或即時串流轉錄。
  • 詞級時間戳與信心分數,每一個詞都有。
  • 免費內建說話者分離——在多數供應商那裡這本是另外收費的項目。
  • 多聲道轉錄,最多 8 個獨立聲道。
  • 關鍵詞偏置,每個請求最多 100 個領域詞彙——產品名稱、醫學術語、內部行話。
  • 文字格式化——數字、日期、貨幣、電話號碼與電子郵件都以書面形式輸出。
  • 填充詞移除(「嗯」、「呃」)與智慧斷句偵測,判斷說話者何時講完。

智慧斷句偵測是低調但對代理最關鍵的一項:語音代理的延遲主要取決於能否判斷使用者真的說完了,插話(barge-in)行為也依賴它。把它包進轉錄層而非另一個端點,對任何建構在 xAI 堆疊上的開發者來說都省掉了半條管線。

Loom 合作案:從語境到程式碼

整份聲明中策略上最耐人尋味的細節是客戶案例:Atlassian 正在用 Grok Voice Transcribe 2.0 驅動 Loom——它的螢幕錄影產品——因為發現它比原本的方案更準確。Atlassian 團隊協作產品線資深副總裁 Sanchan Saxena 明確描繪了這個工作流:在 Loom 裡錄下行動計畫,把逐字稿丟進 Cursor,程式碼就自己改好了。

這是一個在兩個戰線上都令人矚目的結盟。第一,它把一個 xAI 模型放進了 Atlassian 的產品介面——一塊大家原本以為 OpenAI 與微軟早已鎖死的企業腹地。第二,它描述了一個具體的「語境到程式碼」迴路:說出意圖、轉錄成文、交給編程代理。語音成為代理式開發的輸入裝置,而轉錄準確率就決定了多少意圖能在這趟旅程中存活。

單次處理的多語系

Grok Voice Transcribe 2.0 支援數十種語言、自動偵測語言,而且——這點值得注意——能在單次處理中跟上一段錄音中途的語言切換。官方表示多語系準確率是相對 1.0 版最大的進步,並給出了與 ElevenLabs Scribe v2、Deepgram Nova-3 的多語系 WER 對比。

語碼轉換(code-switching)正是轉錄系統最容易崩成錯誤語言輸出的場景。對多語地區的客服營運、以及像 Grok 車內助理這樣橫跨市場的產品來說,單次處理的語碼轉換是真正的能力,不是行銷勾選框。

分析:語音層正在整併

從高處俯瞰,過去五週一連串的語音轉文字發布勾勒出清晰的圖像:語音層正在整併到少數幾家擁有完整堆疊的供應商手上——音訊基礎模型、語音代理執行環境、轉錄 API——而不是只賣單一元件的專業廠商。

Google 把 Transcribe 嵌進 Gboard、Chrome 與自家代理平台;微軟用公共事業般的定價錨定 Azure;xAI 的差異化則是垂直整合:那個接客服電話、跟 Tesla 駕駛對話的模型家族,現在就是你花兩美分一分鐘就能呼叫的 API。所有人都在收斂到同一個捆綁包:對話音訊 WER 低於 4%、分離內建、時間戳內建、關鍵詞偏置內建,以及一個把一小時音訊當零頭的價格。

對開發者來說,實際後果是好消息:串流準確率第一名的排名、兩美分的分鐘、以及現有 Speech-to-Text API 整合零程式碼變更的自動升級。Grok Voice Transcribe 2.0 很快會成為 xAI Speech-to-Text API 的預設模型,1.0 版將在幾週內除役(過渡期間可釘選 grok-voice-transcribe-1.0 留在舊版)。

對產業來說,後果更尖銳:轉錄已經不再是一項功能,而是一種基礎設施。那些擁有即時語音代理訓練資料的人——客服通話、車艙對話、影片旁白——會持續複合累積一種用乾淨語料集的競爭對手買不到的優勢。兩美分的分鐘不是價格戰的終點;它是代理時代的入場費——在那個時代裡,對機器說的每一個字,都必須先被擷取、標上時間戳、格式化、理解,然後才輪得到其他任何事發生。