100 毫秒的情感:ElevenLabs Eleven v4 登上語音模型王座
ElevenLabs 於 9 月 28 日發布 Eleven v4 與 Eleven v4 Turbo——全新架構的 TTS 雙模型,以 Elo 1319 登上 Artificial Analysis Speech Arena 第一名,具備約 100 毫秒推論延遲、90 多種語言支援與 10 秒語音克隆。
2026 年 9 月 28 日 14:01 UTC,ElevenLabs 將其「有史以來最快、最具情感表現力」的語音模型推上生產環境——到了中午,旗艦模型已經登上 Artificial Analysis 盲測 Speech Arena 的榜首。Eleven v4 與其低延遲兄弟 Eleven v4 Turbo 並不是對 v3 的小幅修補。它們建立在全新架構之上,而且推出的時機,正是語音 AI 市場悄然成為整個模型經濟中競爭最激烈角落的時刻。
核心賣點是文字轉語音的「情感理解」。ElevenLabs 表示,Eleven v4 能夠「詮釋語氣、節奏、情緒、角色與情境」——同一句「我需要你保持冷靜」,由醫生對惶恐的病患溫柔說出,或由遊戲角色在開戰前對小隊怒吼,模型會從文字本身判斷該怎麼唸。再搭配 Turbo 約 100 毫秒的中位推論延遲,該公司的論點是:你不必再在「聽起來像人」與「反應夠快」之間二選一。
實際上線了什麼
兩個模型,即刻在 ElevenAgents、ElevenCreative 與 ElevenAPI 上可用:
- Eleven v4——品質旗艦,為旁白、有聲書、對話與角色演出而生,這些「怎麼說」和「說什麼」一樣重要的場景。
- Eleven v4 Turbo——同一套研究成果為即時應用蒸餾而成:代理、直播通話、互動遊戲。中位推論延遲約 100 毫秒,WebSocket 串流下中位首音延遲約 150 毫秒,支援雙向串流——句子還沒生成完,音訊就開始播放。
功能清單讀起來像過去兩年 TTS 使用者抱怨的總整理:
- 90 多種語言,且堅持母語口音——用一種語言錄下的聲音,如今能以流利的任何其他語言說話,採用母語口音同時保留原聲 identity。ElevenLabs 強調口音不會在生成過程中漂移回原來的口音。
- 10 秒語音克隆——Instant Voice Clones 只需十秒音訊就能高傳真捕捉聲音,與原聲的相似度顯著提升。v3 時代缺席的 Professional Voice Clones(PVC)也回來了,供最高傳真需求使用。
- 行內音訊標籤——
[laughs]、[said angrily in French accent]、[light rain]、[phone buzzing]這類指令可以控制語氣、情緒與音效,v4 對標籤的遵循比前代更忠實。 - 更佳的 IPA 支援——國際音標的處理顯著改善,自訂發音終於可靠。
- 情境化多說話者對話——模型理解整個場景,說話者會回應對方剛說的話,而不是把孤立句子拼接在一起。
王座背後的數字
第三方基準測試說明了最有力的一部分。在 Artificial Analysis 的 Speech Arena(盲測投票 Elo 排行榜)上,Eleven v4 一登場就站上頂端:
| 排名 | 模型 | Elo |
|---|---|---|
| 1 | Eleven v4(ElevenLabs) | 1319 |
| 2 | Sonic 3.6(Cartesia) | 1276 |
| 3 | Gemini 3.8 Flash TTS(Google) | 1267 |
| 4 | Qwen-Audio-3.0-TTS-Plus(阿里巴巴) | 1258 |
| 5 | Realtime TTS-2 | 1246 |
43 分的 Elo 差距,在先前各家輪流坐莊的排行榜上是決定性的第一名。Google 的 Gemini 3.8 Flash TTS——本身也不過推出幾天——位居第三;阿里巴巴的 Qwen TTS 與各路即時語音挑戰者緊隨其後。語音前沿的推進速度不亞於文字前沿,而且擁擠得多:Cartesia、Inworld、xAI、MiniMax 與 OpenAI 都有競爭力十足的系統。
ElevenLabs 另外補上自家盲測數據:約 75% 的聽者在與競品(Cartesia Sonic 3.6、Inworld TTS-2 與 Google 兩款 Gemini TTS)的對決中偏好 Eleven v4,評審標準是表現力與自然度。這是該公司自己的測量——但與獨立 Elo 結果相互印證。
定價:暫時性的激進
發布定價是一場精心策劃的圈地。為期兩週——到 10 月 12 日為止——API 打出 72% 折扣:
| 模型 | 發布價 / 千字元 | 定價 / 千字元 |
|---|---|---|
| Eleven v4 | $0.022 | $0.08 |
| Eleven v4 Turbo | $0.011 | $0.04 |
回到定價,Eleven v4 是每百萬字元 80 美元——對比 Cartesia Sonic 3.6 的 49 美元與 Google Gemini 3.8 Flash TTS 的 16.5 美元。ElevenLabs 押注情感品質足以支撐比最近對手高 60%、幾乎是 Google 五倍的溢價。折扣到期後企業是否買帳,將是本季最值得關注的定價實驗之一。另外要注意:約 100 毫秒的延遲數據僅適用於 Turbo;ElevenLabs 尚未公布獨立的延遲稽核,兩個數字都是官方自報。
為什麼重要:語音正在成為代理的介面
更深層的故事是架構性的。當 AI 代理從聊天視窗走進電話客服、醫療掛號與遊戲,語音層就不再是可以替換的通用零件,而成了產品本身。一個 90 毫秒內解決帳單爭議但語調平淡的代理,仍然像機器人;一個充滿情感卻要 900 毫秒才回應的代理,則像壞掉了。業界心照不宣的目標——100 毫秒以下回應,大約等於兩個自然人對話時的停頓——在同時要求情感範圍的前提下,一直難以觸及。
Turbo 的約 100 毫秒推論與約 150 毫秒首音,讓它貼近但尚未跨過那條線。更關鍵的是,Eleven v4 Turbo 與 ElevenLabs 的對話代理平台 ElevenAgents 作為單一系統共同最佳化——這是一道低調但重要的護城河。把第三方 LLM、第三方 TTS 與膠水程式拼接起來的代理開發者,無法對整個技術棧做聯合調校;ElevenLabs 的論點是,垂直整合是打造「又快又像人」的代理的唯一路徑。
競爭格局的解讀同樣清楚。Google 在 Eleven v4 之前六天推出了 Gemini 3.8 Flash TTS 與 Flash-Lite TTS——而 Eleven v4 的發布評測就是直接針對它測的。Cartesia 的 Sonic 3.6 在價格與品質上穩居第二。OpenAI、xAI 與 MiniMax 都在同一競技場上。隨著整個技術棧的延遲差距縮小,下一個戰場是「控制力」:開發者能多精確地即時指揮語氣、情緒與節奏——而這正是 Eleven v4 的音訊標籤與情境感知語氣所瞄準的方向。
對開發者來說,遷移的算術很簡單:兩個模型今天就在 API 上線,既有的 Instant Voice Clones 直接沿用,PVC 在 v3 停擺之後終於又能用了,長內容的 request stitching(生成請求串接)也可靠得多。對一個兩年來被迫在「快」與「有感情」之間選邊站的產業來說,這個選擇剛剛變得更難自圓其說。
本文內容取材自 ElevenLabs 官方發布部落格、Artificial Analysis Speech Arena 排行榜(2026 年 9 月 28 日讀取)與第三方定價分析。延遲與偏好數據除標註 Artificial Analysis 者外,皆為該公司自行報告。