← All posts / Models

Google 推出 Gemini 3.5 Transcribe:會自動潤稿的語音轉文字模型

Google 迄今最精準的語音轉文字模型正式上線:串流 WER 4.0%、支援 85+ 種語言、自動移除贅詞並支援函式呼叫,同步進駐 Gboard、Chrome、Antigravity 與 Gemini API。

Google 推出 Gemini 3.5 Transcribe:會自動潤稿的語音轉文字模型

多年來,語音輸入一直是一項「人人都在用、但沒人真正滿意」的技術。你對著麥克風說話,模型負責轉文字——然後你花上兩倍的時間修正滿篇的「嗯……」、混亂的標點、唸錯的產品名稱,還有那串被聽成隨機片語的訂單編號。Google 在週三給出了答案:Gemini 3.5 Transcribe,該公司迄今最精準的語音轉文字模型,現已對開發者全面開放,並同步部署至 Google 的各項消費者產品。

這次發表不只是例行的模型更新。Google 押注的是:下一場介面之戰的贏家不是更強的聊天機器人,而是「真正能用的語音」——因此在發表當天,Transcribe 就同步進駐 Gboard、Chrome、Google Antigravity 與 macOS 版 Gemini 應用程式,並在 Gemini API 與 Gemini Enterprise Agent Platform 上提供公開預覽。

一個模型家族,兩種 API

Gemini 3.5 Transcribe 以兩個專屬端點的形式推出,分別針對截然不同的使用情境:

  • 即時串流(gemini-3.5-transcribe-live)——透過 Live API 提供雙向連續串流,延遲低於一秒,鎖定互動式語音應用、即時代理與即時字幕。
  • 預錄音訊處理(gemini-3.5-transcribe)——透過 Interactions API 批次轉錄會議、通話紀錄與長篇錄音,並附帶說話者歸屬與字級時間戳。

這樣的區分至關重要。語音代理與即時助理無法容忍批次管線的延遲,而通話後分析更在意歸屬與時間戳而非即時性。藉由讓同一個底層模型家族同時涵蓋互動式與離線工作負載,Google 讓團隊只需依賴一家供應商——以及一致的準確度表現。

關鍵數據:串流 WER 4.0%,定稿速度快 70%

核心數據來自 Artificial Analysis 的獨立評測:串流模式平均字錯率(WER)為 4.0%,非串流為 2.6%。在涵蓋主要語言與地區的多語 FLEURS 基準測試上,模型達到串流 5.50%、非串流 5.04% 的 WER,優於 Google 上一代轉錄模型 Chirp 3。

延遲是另一大躍進。相較 Chirp 3,最終轉錄定稿時間改善 70%——在即時對話中,這是「有感」的差異:三秒的延遲就足以打破「對方真的在聽你說話」的錯覺。Google 也特別強調模型在嘈雜真實環境下的穩健性,以及對郵遞區號、訂單編號等字母數字實體的準確捕捉——這些向來是語音辨識的墳場。

智慧轉錄:那一層「潤稿」引擎

Transcribe 與傳統 ASR 的最大差異,在於 Google 稱之為「智慧轉錄」的能力。模型的設計目標是捕捉自然口語的意圖,而不只是聲學內容:

  • 贅詞移除——自動刪除「嗯」「呃」等填充詞,而「我們週二見——不對,週三」這類自我修正會直接解析為修正後的意圖。
  • 自動格式化——輸出即為潤飾過的結構化文字,而非原始字串。
  • 自訂詞彙——可提供專業術語與特殊拼寫的詞彙表,模型會即時調整轉錄結果。
  • 多說話者辨識——預錄音訊可為最多三位說話者提供附時間戳的歸屬標記(三人以上為實驗性支援)。
  • 函式呼叫——模型可將複雜任務(如圖像生成、檔案分析)委派給其他 Gemini 模型。這項能力現已於 macOS 版 Gemini 應用程式上線,一句「摘要這個檔案並生成一張標題圖」真的會被執行。

函式呼叫這個細節值得留意。它把轉錄從「終端輸出」——文字、管線終點——重新定位為代理式工作流的「入口」。轉錄文字本身成了指令介面。

85+ 種語言與即時語言切換

Transcribe 會自動偵測並轉錄超過 85 種語言,處理各地區口音與多元方言,甚至能在串流中即時切換語言——這是大多數以單一語言音訊訓練的系統直接崩潰的情境。對全球客服中心與多語團隊而言,這是「展示 demo」與「實際部署」的分水嶺。

早期回饋也印證了這點。Google 引述 Vivo、Intellitek Health 與 Lingopal 對模型延遲、準確度與語言廣度的正面評價;Live API 生態系——Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 與 Vision Agents——也已將 Transcribe 整合進各自的即時媒體基礎設施,讓開發者不必自建串流管線就能部署語音介面。

不只進 API,而是全面進駐產品 surface

對一個語音模型而言,這次的消費端部署力道罕見地兇悍:

  • Android 版 Gboard 推出 Rambler,把口語想法轉成格式完整的文字、過濾贅詞——還能用語音進行編輯、改正錯字、切換寫作風格。
  • Chrome 即將支援在任何網頁欄位「開口即打」,用語音撰寫回覆、草擬貼文或提示 Gemini。
  • Google Antigravity 在你授權下,將 Transcribe 結合畫面情境與對話紀錄,在檔名、代理思路與作用中文件上實現極高轉錄精度。
  • macOS 版 Gemini 應用程式結合轉錄與畫面情境,讓你完全用語音驅動多步驟工作流。

策略再清楚不過:Google 要讓語音在「已經有游標的每個地方」成為一等輸入方式,並讓開發者透過 API 複製同樣的體驗。

接下來的賽局

語音領域的競爭正在升溫——OpenAI 的 Whisper 早已定義開源基準線,而每一家主要實驗室如今都把音訊視為多模態的核心腹地,而非附屬品。Google 的優勢在於通路:一個轉錄模型的價值取決於它所在的產品 surface,而能在同一週內把模型推進鍵盤、瀏覽器與 IDE 代理的公司,寥寥可數。

對開發者而言,入口是 Gemini API(透過 Google AI Studio 與 Antigravity)的公開預覽,企業版則透過 Gemini Enterprise Agent Platform 提供,並即將登陸 Gemini Enterprise for Customer Experience。如果這些基準數字能在真實世界的噪音中站得住腳,「為你的聽寫結果道歉」的時代或許終將結束——而「把電腦當成真的在聽你說話的對象」的時代,正在展開。