← All posts / Models

機器的臉孔:Gemini 3.8 Live Avatar 把即時視訊虛擬人像帶進企業現場

Google 將近似即時的視訊生成與語音耦合進 Gemini 3.8 Live with Live Avatar——橫跨 97 種語言的唇形同步虛擬人像、非同步工具呼叫與 SynthID 浮水印,已在 Gemini Enterprise 正式上线。

機器的臉孔:Gemini 3.8 Live Avatar 把即時視訊虛擬人像帶進企業現場

語音助理以「只有聲音、沒有形體」的形態存在了十年。2026 年 9 月 24 日,Google 給了它的對話模型一張臉。由 Gemini Audio 團隊的 Shuo-yiin Chang 與 CJ Zheng 發布、同日在 Gemini Enterprise 正式上線的 Gemini 3.8 Live with Live Avatar,把 Google 原生的即時對話技術堆疊與低延遲串流視訊生成耦合在一起。成果是一個能聽、能看、能說——而且能即時做出表情反應——的 AI 虛擬人像。

這次發布距離底層模型問世僅一週:9 月 15 日 Google 推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,透過 Gemini API、Google AI Studio、Gemini app、Google Workspace 與 Search Live 全面铺開。Live Avatar 是建在這個基礎之上的視覺層,也揭露了 Google 對企業對話 AI 走向的判斷:從聊天視窗與語音選單,邁向更接近「會說話的虛擬人像」、行為上也更像代理人(agent)的形態。

Live Avatar 究竟做些什麼

Live Avatar 的核心,是一套與語音模型同步的串流視訊生成系統。它同時處理視覺與聽覺輸入——攝影鏡頭、螢幕分享與麥克風音訊——並以近乎即時的方式回應兼具表現力的音訊與視訊。Google 的示範影片展示了精準的唇形同步、自然的臉部表情與流暢的輪流發言,包括得體地處理插話打斷,而不會遺失對話上下文或背景交易狀態。

技術上最引人注目的是語言能力。Google 表示 Live Avatar 具備原生的多語言語音對語音同步,能在 97 種語言之間動態調整唇形與表情——而且不會降低視訊畫質或產生視覺漂移。在官方釋出的一段影片中,虛擬人像以英語和日語對話,中途切換語言時嘴部動作仍正確對應。語言偵測與轉換全自動,不需要手動切換。

底層由 Gemini 的推理技術堆疊支撐。非同步工具呼叫(asynchronous tool calling)讓虛擬人像能在對話不中斷的情況下觸發後端操作、抓取資料——Google 的示範是飯店入住:虛擬人像一邊與客人交談,一邊在背景调出訂房細節。另一段 Google Cloud 的示範則是保險理賠受理代理人:客戶對著鏡頭展示車損,虛擬人像同步填写理賠筆記本,同時由 Google Agent Development Kit 建構的代理人團隊在背景驗證保單、套用受理規則、組裝理賠員資料包。

部署目標涵蓋網頁、行動裝置與互動式資訊站(kiosk)——這暗示 Google 想像這些虛擬人像进駐大廳、零售櫃台與客服入口,而不只是待在瀏覽器分頁裡。

模型卡揭露的細節

Google DeepMind 於 2026 年 9 月發布的 Gemini 3.8 Audio 模型卡補上了技術全貌。整個家族——Gemini 3.8 Live、Live Extended Thinking、Flash TTS 與 Flash-Lite TTS——都是以 Gemini 3 Pro 為基礎,而非較小或特化的架構。這點很重要:Google 等於把旗艦級模型推進即時對話服務的場域,賭的是推理成本已經降到足以支撐企業規模的經濟效益。

Live 系列的輸入為音訊、影像、視訊與文字,上下文視窗最高 128K token。輸出為音訊與文字,上限 64K token——但啟用 Live Avatar 後,輸出變成音訊、視訊與文字,且上限縮緊到 24K token,合理推測是為了讓視訊生成維持在延遲預算之內。模型卡說明 Live Avatar 變體能「依據設定的影像與音訊輸入,生成具有自然頭部動作與語音同步的表現力視訊」,並坦率列出連續互動上限:只能支撐數分鐘的連續互動,而非數小時。基礎模型的一般限制——幻覺、越獄抵抗力、偶發的延遲或逾時——同樣存在,不過 Google 表示近期已強化 Frontier Safety 的緩解措施。

企業可從多樣的預設虛擬人像庫中挑選,或自行生成客製人像:只需一張高品質參考圖片,開發者就能產出完整動畫化、具反應能力的虛擬人像,並保留參考圖的樣貌、品牌風格或角色識別。客製人像功能目前透過企業白名單管控,Google 將此定位為身分保障與防濫用機制。搭載 Live Avatar 的 Extended Thinking 變體則仍在私人預覽階段。

浮水印與信任

Google 把透明度措施直接內建進這項功能。Live Avatar 產生的每一道音訊與視訊串流都嵌入 SynthID 浮水印——這種難以察覺的來源訊號織入輸出的像素與音訊之中。對一個以「生成可信人臉」為存在目的的系統而言,這不是附註,而是客服創新與深偽(deepfake)產線之間的分界線。Google 也強調 Live Avatar 內建「尊重身分」的防護措施,而客製人像的白名單程序則是在其上再加一層驗證。

質疑的劇本不難寫:一套企業級、能生成擬真會說話人類、跨 97 種語言唇形同步的機器,正是各種濫用情境的完美素材。Google 的回應是「偵測基礎設施與生成基礎設施同步出貨」——每道串流都有 SynthID、客製容貌有白名單、端點有企業級資料治理。這個平衡能否在技術擴散到白名單之外後繼續維持,將是明年最關鍵的治理問題之一。

為什麼重要

時機本身就很說明問題。Live Avatar 最早在 Google Cloud Next 2026 預覽,如今以美國與歐盟端點、保障吞吐量與企業合規正式上路,正面迎戰一群「數位人」新創,同時動用多數對手難以企及的基礎設施。在 Gemini 3 Pro 等級的模型上跑即時視訊生成,需要的推理產能只有少數幾家廠商擁有。

這也重新定義了介面之爭。OpenAI 的 ChatGPT 語音模式讓對話有了聲音;Meta 的智慧眼鏡把助理戴到臉上;Apple 持續重新想像 Siri。Google 的選擇是讓助理本身成為那張臉——一個有品牌、有表情的虛擬人像,能值守資訊站、帶客戶走完保險理賠,或一邊幫你辦理飯店入住、一邊在背景悄悄調度代理人團隊。

限制依然存在:連續互動只有數分鐘、啟用視訊後輸出上限 24K token、最強大的能力被企業圍籬圈住。但作為方向宣言,Live Avatar 的訊息再明白不過:對話 AI 無臉無貌的時代正在結束,而企業第一線櫃台,會是最先畫下句點的地方。