2,000 種聲音、一個提示詞:Google Gemini 3.8 Flash TTS 把文字轉語音變成創意工作室
Google 發布 Gemini 3.8 Flash TTS 與 Flash-Lite TTS,內建超過 2,000 個生產級聲音、支援 100 多種語言,30 秒樣本即可複製聲音,並可逐行導演語音演出——同時登上 Hume AI Voice Design Benchmark 第一名。
文字轉語音(TTS)長期以來都是 AI 家族裡最無聊的成員:你從下拉選單挑一個聲音、貼上文字,然後得到一段聽起來像 GPS 在唸法律聲明的音檔。2026 年 9 月 23 日,Google 徹底炸毀了這個框架。全新的 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 不只是「唸稿」——你要像電影導演在錄音室裡調教演員一樣「導演」它,而且有超過 2,000 個生產級聲音、涵蓋 100 多種語言與方言可供選角。
Google 自己的發布文案把這個轉變總結得很精準:語音生成從「靜態預設」變成「動態創意工作室」。看過實際功能之後,你會知道這不是行銷話術。
兩個模型,兩種定位
Google 把這次發布拆成兩個層級:
Gemini 3.8 Flash TTS 是專為深度創意導演與角色設計打造的旗艦。你可以用自然語言提示詞從零創造全新聲音——一隻會噴火的日式巨龍、一位墨爾本來的高能 DJ、一個「超級尖細的單調機器人」(這些都是 Google 官方示範)——然後逐行下導演指令,精細控制節奏、口音轉換與附和語(backchanneling)。
Gemini 3.8 Flash-Lite TTS 則是量產型工作馬,針對高流量配音、批次音檔內容產製與成本敏感的語音代理最佳化。
兩個模型都併入快速擴張的 Gemini Audio 家族,與 9 月稍早發布的 3.5 Live Translate、3.5 Transcribe、3.8 Live 及 3.8 Live Extended Thinking 等speech-to-speech 兄弟模型並列。
關鍵數字
- 超過 2,000 個生產級聲音,較前一代的 30 個聲音大幅擴增 66 倍
- 支援 100 多種語言與方言,刻意納入墨西哥西語、魁北克法語、蘇格蘭英語等區域變體
- Hume AI Voice Design Benchmark 第一名(71.4 分),口音建模(60.8)也奪冠
- Hume AI Overall Quality Index 由 Flash 與 Flash-Lite 包辦第一、第二名
- Voice Arena 盲測人類偏好評比在日語、巴西葡語、越南語、現代標準阿拉伯語、墨西哥西語與印度語名列前茅
這些評比成績很重要,因為語音品質的宣向來主觀。Hume AI——本身就是語音 AI 公司,剛被 Google 在自家量尺上擊敗——加上盲測人類偏好評測,是目前業界最接近中立裁判的機制。
帶護欄的聲音複製
整個發布中最具影響力的功能是聲音複製(voice replication):只需 30 秒音檔樣本,就能重建穩定的聲音特徵。深偽恐慌可以先緩一緩——Google 這次 shipped 了比多數同業更嚴格的分層同意架構:
- 口頭同意驗證:系統要求聲音本人提供一段口頭同意錄音,且聲紋必須與參考說話者相符,才能建立聲音。錄音室無法僅憑演員「Email 口頭答應」就複製其聲音。
- SynthID 浮水印:Gemini Audio 家族產出的每一段音檔,都帶有直接織入聲波中的隱形浮水印,即使重新編碼,AI 語音仍可被偵測。
- C2PA 內容憑證:輸出附帶來源詮譯資料,下游平台可驗證出處。
「建立時驗證同意、輸出時加上浮水印」——這正是各國正在起草聲音複製法規的監管者要求實驗室做到的信任架構,而 Google 是直接出貨,不是開支票。
逐行導演對話
最先改變工作流程的功能是逐行演出指導。你可以自己寫舞台指示,或讓 Gemini 詮釋自然劇本提示——這句要冷靜的客服人員,那句要耳語的懸疑場景。長篇生成能在連續數小時的音檔中維持聲音品質與角色音色、將說話者漂移降到最低,直接瞄準有聲書與 Podcast 市場。
兩個功能對擬真度尤其關鍵:
- 原生雙說話者場景調度:從單一劇本導演多輪對話,兩個聲音保持清晰分離,對話輪替自然流暢——不必再分別生成片段後拼貼、祈禱節奏不垮。
- 腳本化聲音爆發與附和語:可插入
<laughs>、<sigh>、<gasp>等非語言提示,以及「嗯哼」、「對啊」這類傾聽式回應——這些次詞彙的黏著劑,讓合成對話聽起來像人話,而不只是「可理解的語音」。
即將推出:聲音混搭(voice remixing),可從聲音庫任選聲音,用提示詞微調音色、音高、語速與口音,例如「加一點淡淡的美國南方口音」或「收斂一點 delivery」。
誰已經在上車
模型今日起在 Google AI Studio(內建語音設計工作區與雙說話者劇本編輯器)、Gemini API、Gemini Notebook 與 Google Vids 上線,Gemini Enterprise 的 API 存取「即將推出」。
即時語音平台 Agora、LiveKit、Pipecat、Vercel 已完成整合,供開發者打造語音代理;Google 並點名 Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang 等合作夥伴,正將新模型用於全球配音、具區域口音的媒體在地化與大規模對話代理。
為什麼這次不只是例行升級
三股潮流讓這次發布的策略意義遠超過一般模型改版。
語音代理的圈地戰。 所有主要實驗室現在都同意:語音(而非聊天視窗)將是下一批數億 AI 使用者的預設介面——電話客服、車用助理、自助機台、穿戴裝置。一個原生支援附和語與雙說話者場景的 TTS 模型,拿掉了過去團隊得繞著舊 TTS API 手工拼裝的最後幾段音訊管線。Flash-Lite 的成本最佳化層級,明擺著就是衝著全天候語音代理的工作負載而來。
配音經濟。 Netflix 時代的在地化教訓是:配音品質決定國際市場。能在數小時音檔中維持穩定聲音身份、按需切換方言(墨西哥西語 vs. 伊比利西語、魁北克法語 vs. 巴黎法語)、又只要 Flash-Lite 價位的模型,等於把每一座片庫都變成可再變現的資產。合作夥伴 Ollang 的加入,指的正是這個用途。
來源證明競賽。 在語音詐騙與深偽電話行銷持續升溫之際,「織入聲波的 SynthID」加上「同意驗證的聲音複製」是 Google畫下的界線:表達能力與可偵測性必須一起出貨,不能拆成兩種 SKU。競爭對手從今以後要同時面對評比問題與政策問題。
但要注意的是模型卡沒說的事——發布當下沒有公開定價、同意聲紋比對系統尚未經第三方紅隊測試、浮水印對抗惡意音訊編輯的穩健性仍是開放研究問題。語音複製詐騙是數十億美元級的問題,一個 30 秒樣本即可複製聲音的能力以 API 規模開放後,幾天內就會有人惡意探測。
結論
Gemini 3.8 Flash TTS 把「從下拉選單挑聲音」升級成「選角、調教、導演一場聲音演出」,而且是在同一週登上業界中立評比榜首的情況下做到的。對創作者而言,錄音室等級的音檔製作成本坍縮成一次 API 呼叫;對 Google 而言,這是在代理堆疊的語音層插旗,所有競爭對手都必須回應。TTS 作為大宗商品的時代結束了;TTS 作為創作媒材的時代,現在開始。