← All posts / Models

API 裡的配音工作室:Google Gemini 3.8 TTS 用文字提示導出一場演出

Google 的 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 把靜態語音預設換成可用提示詞操縱的配音工作室——超過 2,000 種聲音、30 秒樣本即可複製聲紋(附同意驗證)、逐行演技指導,以及原生雙人對話場景,全部加上 SynthID 浮水印。

API 裡的配音工作室:Google Gemini 3.8 TTS 用文字提示導出一場演出

語音生成產業在「預設值時代」停滯了十年:從下拉選單挑一個聲音、調整速度與音調,然後接受引擎願意給你的所有表現力。9 月 23 日,Google 對這個模式揮下了大錘。由產品總監 Leland Rechis 與研究主管 Alan Cowen 在 Google 官方部落格發表的 Gemini 3.8 Flash TTS 與更平價的 Gemini 3.8 Flash-Lite TTS,把文字轉語音從「預設播放器」變成 Google 所形容的「動態創意工作室」——一座住在 API 裡的配音間。

兩個模型即日起在 Gemini API 與 Google AI Studio 開放開發者使用,消費端進入 Gemini Notebook,企業版「即將推出」,Flash-Lite TTS 也同步導入 Google Vids。它們補齊了快速擴張的 Gemini Audio 家族——此前已有 3.5 Live Translate、3.5 Transcribe、3.8 Live 與 3.8 Live Extended Thinking。Google 顯然正在組裝一套完整的音訊技術棧,而這對新的 TTS 模型,是它對語音生成市場迄今最激進的進攻。

兩個模型,兩種任務

產品切割是有意的。Gemini 3.8 Flash TTS 是旗艦創作模型,官方文件形容為「錄音室等級的聲音保真度」,專為深度創作指導與角色設計而生。你可以用自然語言憑空發明全新聲音——Google 自己的示範包括墨爾本的高能 DJ、「超級尖細的單調機器人」,以及一條日本龍——然後逐行導演整場演出,細緻控制演技提示、節奏、方言轉換,甚至附和語氣。

Gemini 3.8 Flash-Lite TTS 則是勞役馬:針對大量配音、批次音訊內容與有表現力的語音代理最佳化,在這些場景裡,每分鐘成本比客製角色工作更重要。它保留了語氣與節奏的細部控制,但定價是為每天生成好幾小時語音的管線設計的。

從 30 種聲音到無限聲音庫

最引人注目的轉變是規模。上一代只有 30 種預設聲音;新家族一開場就是超過 2,000 種量產級聲音的資料庫,涵蓋墨西哥西班牙語、魁北克法語、蘇格蘭英語等區域變體。在此之上是生成式聲音設計:用白話描述角色、口音與聲音特徵——支援超過 100 種語言與方言——模型就召喚出一個不存在於任何資料庫的客製聲音。

接著是聲音複製。只要提供 30 秒的音訊樣本——你自己的聲音,或你有權使用的聲音——模型就能重建出一致的聲音檔案。Google 為這件事包上了它應有的繁複程序:使用者必須提供聲音擁有者的口頭同意錄音,且需與參考說話者相符,聲音才能被建立;每一段輸出都以 SynthID 浮水印隱入音訊之中,並附帶 C2PA 內容憑證。值得注意的是,透過 AI Studio 的聲音複製在伊利諾州、德州、歐洲經濟區、英國、瑞士與印度皆不開放——這張安靜的封鎖名單,正是聲音權利法律戰線的地圖。至於可微調資料庫聲音的音色、音高、速度與口音的「聲音混搭」功能,官方標示為即將推出。

導演你的演出

真正打破新疆界的是表演控制。兩個 TTS 版本都接受在腳本內 inline 写入舞台指示——從「沉穩的客服人員」到「氣音的懸疑場景」——並據此調整語氣。長文本生成可在連續數小時的音訊中維持聲音品質、節奏與角色音色,將「說話者漂移」壓到最低——這正是過去讓 AI 有聲書難以入耳的失敗模式。

兩個功能對曾用舊式 TTS 排演對話的人來說特別突出。原生雙人場景調度能從單一腳本導出多輪對話,同時讓兩個聲音保持清楚分離、自然輪替——不必再把各自的生成結果拼接起來、祈禱韻律對得上。而腳本化的聲音碎句讓編劇用 <laughs>、<sigh>、<gasp> 這類標籤注入非語言質地,加上「嗯哼」、「對啊」這種傾聽式的附和,做出精準的喜劇節奏與反應拍點。這是演技指導,不是語音合成。

聲音背後的數字

Google 用基準測試背書這次發表。Gemini 3.8 Flash TTS 以 71.4 分拿下 Hume AI Voice Design Benchmark 總榜第一,口音建模也以 60.8 領先;兩個模型分佔 Hume AI 整體品質指數的第一與第二名。在 Voice Arena 的盲測人類偏好評估中,它們在日語、巴西葡語、越南語、現代標準阿拉伯語、墨西哥西班牙語與印地語等關鍵語言名列前茅,整體支援超過 100 種語言。Google 表示,相較於 Gemini 3.1 Flash TTS,新模型在長文本與雙人劇本控制上有大幅進步。

價格方面,Gemini API 將 Flash TTS 定為文字輸入每百萬 token 0.50 美元、音訊輸出每百萬 token 9 美元——普遍換算約為每小時語音 0.81 美元,年底前的入門優惠據報約為 Flash 每分鐘 1.35 美分、Flash-Lite 0.9 美分;Flash-Lite 在大流量部署上又再壓低一級。第三方觀察者很快點出這對競爭對手的意義:它對 ElevenLabs 與精品語音工作室構成直接價格壓力,尤其在本地化與配音這種量級巨大、卻無法容忍每分鐘溢價的業務上。

這是平台佈局,不只是模型

部署細節暴露了野心。Agora、LiveKit、Pipecat 與 Vercel 等開發者平台正把模型接進即時語音代理技術棧;Google 點名 Figma、HeyGen、Linguana、Wondercraft、99.co 與 Ollang 為首批合作夥伴,將 TTS 家族整合進全球配音、區域口音在地化與大規模對話代理。有業界評論如此總結:當 OpenAI 要你打電話給業務才能拿到客製聲音時,Google 出貨的是一座內建同意驗證的自助配音工作室。

策略解讀很直接。語音正在成為代理的介面,而「自然」的門檻正在快速上升。藉由把生成式聲音設計、權利管理的聲音複製、浮水印與雙人對話導演塞進同一個 API——再用激進的基準測試證明它——Google 正把 Gemini Audio 定位成整個產業語音層的預設選項,就像它在文字模型上打的那場開發者心智之戰。

文字轉語音的預設值時代結束了。取而代之的東西,比較不像語音引擎,而更像一位選角指導。