← All posts / Models

Google Gemini 3.8 Live 邊說邊想:原生語音模型直取語音對話王座

Google 發布 Gemini 3.8 Live 與 3.8 Live Extended Thinking——能邊推理邊說話、背景執行工具呼叫的原生語音模型,並奪下 Speech-to-Speech 品質指標榜首。

Google Gemini 3.8 Live 邊說邊想:原生語音模型直取語音對話王座

語音本該是 AI 最自然的介面——直到你真的試著跟語音助理聊一件複雜的事情為止。市面上多數語音代理至今仍把文字模型夾在語音辨識與語音合成之間,結果只有兩種下場:要嘛秒答但膚淺,要嘛「思考」時整個陷入沉默,留下你對著轉圈圈發呆。2026 年 9 月 15 日,Google 以 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 直接迎擊這個取捨——這對原生語音對語音(speech-to-speech)模型,被官方稱為「迄今最先進的即時對話模型」。

兩個模型,兩種分工

兩個版本的切分相當乾淨。

Gemini 3.8 Live 是主力款,「為規模化與成本效率而生,結合對話智慧、流暢對談與視覺 grounding」。它能在近乎即時的速度下處理視覺輸入——把鏡頭對準棋盤它就能跟你下棋;帶新人走一趟辦公室,它能根據眼前所見即時回答問題。更關鍵的是,它能在對話持續進行的同時於背景執行工具與 API 呼叫:模型先口頭確認你的請求、繼續跟你聊天,等任務完成再回報,而不是卡在半句話之間當機。

Gemini 3.8 Live Extended Thinking 則是重裝版本,「為高複雜度任務而生,具備更強的智慧與多步推理能力」。它的招牌絕活是邊推理邊說話。模型不會在沉思時留下尷尬的死寂,而是用自然的前置口語提示——「讓我查一下……」——先回應你的請求,然後一邊執行多步背景任務、一邊即時旁白進度。在 Google 的示範中,它能把隨手畫的草圖配合近乎即時的語音回饋轉換成可運作的 React 元件,還能協調多步驟訂票流程與非同步函式呼叫——全程不打斷自然對話的節奏。

數據表現

Extended Thinking 交出一張相當漂亮的成績單。Google 表示它以 82.6 分拿下 Artificial Analysis 語音對語音品質指標(Speech-to-Speech Quality Index)總排名第一,在代理式任務完成度上以 τ-Voice 68.6% 領先,並在 Sierra 的 τ-Voice-banking 基準拿下 35.1%;在音訊推理基準 Big Bench Audio 上斬獲 97.7%——而且照 Google 的說法,「與其他前沿模型相比維持極具競爭力的價格」。

基礎版 3.8 Live 則在 Speech Agent Arena 拿下第二。Google 也強調兩個模型在 ServiceNow 的 EVA-Bench(評測語音代理處理複雜企業工作流的基準)上推進了 Pareto 前沿,兼顧準確率與對話品質。值得注意的是,該基準是在 Gemini Enterprise Agent Platform 的 Live API 上跑的——這透露了 Google 眼中真正的客戶是誰:要部署量產語音代理的企業,而不只是跟 Gemini app 閒聊的一般消費者。

會 97 種語言、跟得上你切換

有兩個低調的細節值得點名。第一,Gemini 3.8 Live 能自動偵測並在對話中途於 97 種支援語言之間無縫切換——不用選單、不用重來,你切換它就切換。第二,Google 所有 AI 產品的音訊輸出都以 SynthID 加浮水印,這個難以察覺的浮水印直接織入音訊訊號,讓 AI 生成的語音保持可偵測性——在語音模仿事故頻傳的當下,這已是不可妥協的功能。伴隨這次發布,Google 也同步公布了記載其安全作法的模型卡。

今天就能用在哪裡

這次的首日覆蓋範圍之廣,在模型發布中相當少見:

  • 開發者:兩個模型現已於 Gemini API 與 Google AI Studio 上線。
  • 企業:Gemini Enterprise 私人預覽中,Gemini Enterprise for Customer Experience「即將推出」。
  • 所有用戶:Extended Thinking 今日起陸續進入 Gemini Live,以及 Workspace 中 Google AI Pro 與 Ultra 訂閱者的 Docs Live、Gmail Live、Keep Live;基礎版 3.8 Live 則驅動 Search Live。

Google 也倚重生態系把這兩個模型推進量產。包括 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 與 Vision Agents 在內的開發者平台,如今基於 Gemini Live API 處理即時串流的底層工程;Salesforce、Genspark 與 Lumeris 等早期合作夥伴已開始在新模型上構建,並點名延遲、流暢度與工具呼叫能力是最大差異化。

為什麼重要

產業的重心正從聊天機器人轉向代理(agents)——會做事、而不只是回答的模型——而這波轉移中最難攻的角落正是語音代理。要在即時音訊串流上執行一個看得見、會呼叫工具的代理,延遲預算極其苛刻:每一步推理都在跟人類對話的自然節奏搶時間。目前主流的管線式架構根本藏不住這一點。一個真正能邊說邊想、用旁白取代沉默的模型,在產品性質上是跳躍式的——更像是電話線上稱職的同事,而不是一個附麥克風的表單。

這也讓競爭態勢更清晰。OpenAI 在即時語音技術上著力甚深,Amazon、Microsoft 與一票新創都在搶量產語音代理。Google 宣稱登上 Artificial Analysis 語音對語音指標榜首——若經獨立驗證屬實——加上積極定價與消費端、Workspace、API 三線同日開通,等於宣告它要像當年統治搜尋一樣統治這一層。繼 3 月的 3.1 Flash Live 與上個月的 Gemini 3.8 Flash、Flash Cyber 之後,這個發布節奏說明:即時音訊在 DeepMind 已不是支線實驗,而是模型競賽的主戰場。

當然,老問題依然存在:基準成績能否轉換成混亂真實場景的部署成果、「有競爭力的價格」能否撐過企業級用量的考驗、以及使用者究竟想不想要一個把思考過程說出來的助理。但那個讓語音代理顯得遲鈍的瓶頸——一思考就只能閉嘴——已經被明顯收窄了。

本文基於 Google 官方公告以及 9to5Google、Unite.ai 的報導整理;基準數據均為 Google 自行公布。