同價位、準確度翻三倍:SpaceXAI 的 Grok Voice Transcribe 2.0 向語音 AI 市場宣戰
SpaceXAI 將語音轉文字錯誤率從 20.6% 一舉壓到 6.8%,價格卻維持每小時 0.10 美元不變——無需改動程式碼,Loom 已全面採用。
本週稍早,SpaceXAI 低調推出了今年最激進的語音轉文字(STT)升級之一。Grok Voice Transcribe 2.0 已在其 Speech-to-Text API 上線,將該模型在 SpaceXAI 內部多語言基準測試上的字錯誤率(WER)從 20.6% 大幅降至 6.8%——單一世代就有約三倍的準確度躍升——而價格完全維持原樣:批次轉錄每小時 0.10 美元,串流每小時 0.20 美元。
在主要語音供應商習慣把每一級準確度當成一個定價級距的市場裡,「同樣價格、三倍準確」是個罕見的姿態。這透露出 xAI 的語音技術堆疊與其文字模型走的是同一條路:以性價比為主要武器。而這項升級推出的時機,恰好是語音代理人(voice agent)經濟正從展示 demo 邁向正式量產流量的轉折點。
這次發布了什麼
Grok Voice Transcribe 2.0 立即可用,同時支援錄音檔與即時串流。根據 SpaceXAI 的發布說明,1.0 版目前仍是預設模型,但 2.0 版預期「很快」就會接手成為預設,1.0 版將在接下來幾週內走向汰除(deprecation)。過渡期間需要舊版的客戶可以釘選(pin)1.0;現有整合完全不需要改程式碼——開發者只要把模型名稱換成 grok-voice-transcribe-2.0 即可。
功能清單讀起來就像正式量產轉錄工作負載真正需要的一切:
- 說話者分離(diarization)——自動標記說話者並穿插在逐字稿中
- 字級時間戳——對齊精度足以支撐字幕與媒體搜尋
- 信心分數——每個詞的訊號,供下游品質過濾使用
- 最多八個聲道——多麥克風錄音一次呼叫即可轉錄
- 關鍵詞偏置(key-term biasing)——可指定強化產品名稱、行話等領域詞彙
- 格式化智慧——數字、貨幣、電子郵件地址正確呈現,而非音譯拼湊
- 移除贅詞——自動清掉「嗯」「呃」,讓逐字稿更乾淨
SpaceXAI 也宣稱,這個模型在真正會搞垮轉錄系統的音訊條件下依然穩定:濃重口音、劣化的電話線路、多人同時說話,以及數十種語言之間的句子中途切換。
數字背後,但有但書
20.6% → 6.8% 的 WER 改進來自 SpaceXAI 自家的內部多語言測試集,也就是說這是公司自行報告的數據,而非獨立驗證。對任何評估這個模型的團隊而言,真正的問題是:這些改進在你的產品實際收到的音訊上——客服中心噪音、會議室殘響、野外錄音——是否依然成立,而不是只在精心策劃的基準測試上。
SpaceXAI 提供了一個外部數據點:在 Artificial Analysis 的排行榜上,該公司表示 Transcribe 2.0 在 32 個串流模型中排名第一。這算是一個有參考價值的訊號,儘管排行榜的音訊分布與正式流量是兩回事。
指標型客戶是 Atlassian 旗下的 Loom,其平台上的每支上傳影片都已經在用這個新模型處理。這是相當有分量的工作量——Loom 每天處理大量非同步影片訊息——但一個滿意的客戶並不足以證明它在市場上各式各樣的工作負載中都能維持效能。
價格戰
定價正是這次發布在戰略上最有趣的地方。批次每小時 0.10 美元、串流每小時 0.20 美元,Grok Voice Transcribe 2.0 直接壓過或打平所有主要競爭對手:
| 供應商 | 批次(每小時) | 串流(每小時) |
|---|---|---|
| Grok Voice Transcribe 2.0 | $0.10 | $0.20 |
| AssemblyAI Universal-2 | $0.15 | 約 $0.27+ |
| ElevenLabs Scribe | $0.22 | $0.39 |
| Deepgram | 約 $0.26 | 約 $0.31+ |
| OpenAI(Whisper 級) | 約 $0.36($0.006/分鐘) | — |
語音 AI 市場已經朝商品化漂移了兩年,但這是大型實驗室迄今最明確的一次「準確度提升、價格不動」。如果 WER 的宣稱在第三方測試下站得住腳,對競爭對手定價的衝擊會立刻顯現——Deepgram、AssemblyAI 與 ElevenLabs 的高階定價都建立在準確度優勢上,而這個優勢現在直接被一個 0.10 美元/小時的模型挑戰。
為什麼是現在:語音代理人浪潮
時機並非偶然。語音 AI 正處於爆發年。即時語音代理人——客服專線、得來速點餐、預約排程、車用助理——的生死都繫於串流轉錄品質。一個在 Artificial Analysis 上 32 個串流模型中排名第一、每小時只要 0.20 美元的模型,正是語音代理人開發者苦苦期盼的零組件,而 SpaceXAI 很清楚這一點。Grok Voice API 家族已經整合了語音對語音、文字轉語音與語音轉文字,外加工具呼叫與即時搜尋;Transcribe 2.0 讓這套堆疊中的轉錄環節足以與任何人競爭。
檯面下還有一層平台戰略。轉錄輸出會餵進檢索、摘要、代理人記憶與合規管線。誰掌握了 STT 層,誰就愈來愈掌握下游一切的資料水龍頭——而在每小時 0.10 美元的價位上,經濟學站在把超大流量導向贏家那一邊。
後續觀察
三個懸而未決的問題,將決定這次發布是里程碑還是小插曲:
- 獨立基準測試。 6.8% WER 的宣稱能否在第三方針對混亂真實音訊的評測中存活?內部測試集與正式流量音訊之間的落差,正是語音供應商傳統上被現實打臉的地方。
- 預設模型切換。 1.0 版目前仍是預設。當 2.0 接手、1.0 汰除之後,任何邊角案例的退步都會在大規模流量下迅速現形。
- 競爭對手的回應。 Deepgram 與 AssemblyAI 都在加速壓低成本曲線;ElevenLabs 則有品牌溢價。語音 AI 的價格戰一旦開打,將加速語音代理人滲透到每一個有電話線的產業。
對開發者來說,盤算很簡單:這次升級免費試用、不需改程式碼,若表現不符預期還能釘選舊版。採用速度預期會很快——而這正是 SpaceXAI 所指望的。