← All posts / Tools

Google 給 Gemini 一張臉:Live Avatar 正式上線,企業版支援 97 種語言

Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 正式全面供應——即時唇形同步的視訊虛擬人像、97 種語言自動切換、背景工具呼叫,且每一幀畫面都帶有 SynthID 浮水印。

Google 給 Gemini 一張臉:Live Avatar 正式上線,企業版支援 97 種語言

距離 Google 發表 Gemini 3.8 Live——那個能夠邊說邊思考的語音原生對話模型——只過了十天,Google 就把整幅圖像補齊了,而且是字面意義上的補齊。2026 年 9 月 25 日,Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 正式全面供應(GA),為語音加上了一張即時生成的臉。一個不僅會回答、還會看著你、唇形與回答同步、並能在對話中途切換語言的 AI,如今已是企業級的正式功能,而不是開發者大會上的展示品。

這項技術最早在 Google Cloud Next 2026 預覽,將 Gemini 3.8 Live 的原生語音對話(speech-to-speech)基礎,與近乎即時的視訊生成結合在一起。最終成品是一個對話式視訊代理人(agent),可以部署在網頁、行動應用與互動資訊站(kiosk)上——資訊站這個形態本身就透露了 Google 對落地場景的預期:零售櫃檯、醫院報到機、銀行分行與機場登機門。

Live Avatar 實際上做了什麼

這份功能清單,讀起來像是把純語音代理人過去一路出包的問題逐一列冊改正:

唇形同步的視訊虛擬人像。 人像的嘴部——根據早期實測報告,還包括臉部表情——與生成的語音同步移動。當對話切換語言時,唇形同步會即時調整,不需要重新渲染,也不會在模型換檔時出現定格畫面。

97 種語言、自動偵測。 Gemini 3.8 Live 能理解並說 97 種語言,並自動偵測來電者的語言。對全球客服營運來說,過去需要依地區部署多套語音模型的路由噩夢,如今收斂成單一部署。

背景工具呼叫。 模型能在對話中執行工具與 API 呼叫,而且不會陷入沉默。它先確認你的請求,在背景任務執行期間繼續自然地交談,完成後再回報——這是「把你晾在線上等待」與「一邊辦事一邊跟你聊天」的助理之間的差別。

即時視覺理解。 模型能同時處理即時鏡頭畫面與螢幕分享,並與音訊並行。你一邊用鏡頭照著被撞凹的保險桿、一邊口述事故經過,它同時看得到也聽得到。

不丟失上下文的打斷恢復。 因為對話是原生語音對語音、而非串接式的管線,使用者打斷對話時不會丟失對話狀態或進行中的後端交易——這是早期語音代理人的慢性致命傷。

信任機制:允許清單與浮水印

更有意思的細節其實在防護欄上。客戶開箱即可從一系列經審核的預建人像中挑選部署,但自訂人像——用一張參考照片和一段聲音樣本就生出一張臉——則被擋在嚴格的企業允許清單(allowlist)與驗證流程後面。以今天的規則,個人開發者無法任意生成任何人的擬真分身。

同時,每一條生成的音訊與視訊串流都帶有肉眼不可見的 SynthID 浮水印,因此即使內容離開 Google 的伺服器,Live Avatar 產出的內容仍可被機器驗證為 AI 生成。在合成視訊已成為政治與法律爭議引爆點的今年,推出一張會說話的擬真人臉而不附來源標記,在公關與監管上都站不住腳——Google 顯然做了同樣的判斷。

企業級的姿態也延伸到基礎設施:美國與歐盟端點、可預購的吞吐量(provisioned throughput),以及受監管產業在讓視訊代理人接觸客戶對話之前必然要求的資料治理承諾。至於反應更慢、推理更深的 Gemini 3.8 Live Extended Thinking,目前仍處於非公開預覽階段。

已經上線的客戶

Google 的發布文章附上的是具名部署案例,而不只是合作夥伴標誌牆。Cox Automotive 為 Autotrader 打造了一個購車助理,利用即時螢幕標示與工具呼叫,引導購車者以自然對話完成搜尋、比較與貸款試算。「購物者越來越期待用自己的話描述需求,而不是在層層篩選器和選單裡打轉,」Cox Automotive 產品長 Marianne Johnson 說。

每天在九種印度語言處理超過一百萬通即時通話的 Equal AI,則歸功於新版本在打斷處理、多語對話與工具呼叫可靠度上的改進。「這個 AI 不只是接電話;它替你把事情辦好,」執行長 Akhilesh Damaraju 說。Salesforce 正把 Gemini 3.8 Live 與 Agentforce 結合用於客戶服務,而 Specs 的工程師特別點名語音活動偵測(VAD)與整體延遲的改進,是相較於前幾代 Live 的實質躍進。

從開發者角度看,展示影片說的是同一個故事。其中一支示範保險理賠受理代理人:你一邊說話、一邊用鏡頭展示損壞,理賠筆記本自動逐欄填寫,背景裡一支用 Google Agent Development Kit(ADK)搭建的代理人團隊同時查核保單、套用受理規則、組裝理賠員資料包——而且原始程式碼已開源,任何人都可以重現。

一張臉如何改變經濟學

語音 AI 一直被困在商品化的指標軍備賽裡——比拚延遲毫秒數與每分鐘成本。Google 的產品定位明講:優先級已轉向互動品質,而虛擬人像正是這個賭注最尖銳的表達。一張臉能做到兩件聲音做不到的事。

第一,它把 AI 介面搬進所有已經存在螢幕的地方。每一座資訊站、結帳終端與候診室顯示器,都變成潛在的代理人部署點。第二,也更微妙:視覺臨場感會改變使用者行為。當介面呈現社交線索時,人們打斷得更客氣、聽得更久、完成更多交易。這個效應能否在真實大規模使用者身上存活,仍是未定之數——但這正是企業接下來要實測的問題,因為功能已上線、API 文件已齊備。

反面考量也真實存在。恐怖谷對一部分使用者來說依然恐怖。擬真的企業虛擬人像帶來冒用風險,允許清單能緩解但不能根除。而 SynthID 的驗證效果,取決於下游有沒有人真的去檢查——一個沒人掃描的浮水印,保護不了任何人。

競爭格局解讀

這一步直接施壓於新興的「數位人」市場——那些把虛擬人像當作附加層、疊在第三方語音模型之上的新創——因為 Google 現在把臉、聲音、推理、工具呼叫與浮水印打包進同一個有治理框架的 API。它也與對手形成對照:OpenAI 的語音布局仍以音訊為核心,Anthropic 則完全沒有進入即時消費級模態。Google 押注下一個介面戰場是一張臉,而且率先以企業等級出貨。

對開發者來說,所有零件今天都是公開的:Gemini Enterprise 裡的模型、Google 文件網站上的 Live API 文件、一份用於建構即時雙向串流應用的 Skill,以及不需要完整虛擬人像時的模組化音訊替代方案(Gemini 3.5 Transcribe、3.5 Live Translate 與 3.8 Flash TTS 系列)。自訂人像的存取權與吞吐量預購,則要透過 Google Cloud 業務窗口。

從聲音到臉,只隔了十天。這個節奏本身就是訊息:語音原生模型從發表到生產級虛擬人像平台,用了不到兩週,而每一個有螢幕的企業接觸點,現在都上了牌桌。


資料來源