騙過半數人類的臉:Tavus Griffin 通過視訊版圖靈測試
Tavus 的 Griffin-Lite 在一分鐘視訊通話中讓 48% 的受試者相信它是真人,並登上 NVIDIA VideoFDB 排行榜冠軍——但細節值得仔細檢視。
2026 年 10 月 1 日,Tavus 發表了 Griffin——該公司稱之為全球第一個人類互動模型(Human Interaction Model, HIM):一個全雙工、視訊對視訊的系統,能一邊聽、一邊看、一邊決定何時開口,並即時生成自己的臉孔、聲音與肢體動作。該公司的標語很直白:Griffin 是第一個通過即時視訊圖靈測試的模型。在一項現場研究中,與 Griffin 交談一分鐘的受試者裡,有 48% 相信自己剛剛是在跟一個真人對話。
這個數字值得深究,下文也會深究。但即使把行銷成分完全扣除,Tavus 展示的仍是一場機器對話方式的真正架構躍進——而且背後的獨立評測數據強到足以讓整個產業側目。
Griffin 到底是什麼
今天市面上多數「視訊代理人」系統都是級聯式(cascade)架構:語音辨識餵給語言模型,語言模型餵給語音合成,最後再驅動一個動畫頭像。每個階段都要等上一個階段完成,結果就是熟悉的輪流發言式僵硬——系統無法在你說話時點頭、無法優雅地打斷你,思考時只能留下尷尬的空白。
Griffin 把這條管線折疊成兩個緊密耦合、同時運作的引擎:
- 連續對話建模(Continuous Conversational Modeling)——同時感知傳入的音訊與視訊,以亞秒級的「迷你輪次」持續重新評估對話狀態,決定要說什麼、怎麼說、甚至要不要說。關鍵在於,它輸出的是表達控制訊號——情緒語氣、姿態、臉部表情、手勢——而不只是文字。
- 視聽生成(Audio-Visual Generation)——一對串流生成器(語音與視訊)在控制訊號抵達時就立即轉換成聲音與像素,而不是等整句話備齊才開工。
因為感知在模型說話時從不停止,句中的任何決定——一個停頓、視線移開、一個微笑、一次插話——都會在同一個迷你輪次內反映在聲音與臉上,系統之間沒有交接延遲。它能在你還說話時發出「嗯哼」、在你切入的瞬間停下、還能對鏡頭外看到的東西(比如一顆正在被轉動的魔術方塊)做出反應。
數字背後的真相
視訊方面,Griffin-Lite 以 320 毫秒為單位、一次一個 latent 生成 720p 影像,只需一張參考圖片。其 VAE 在時間軸上壓縮 8 倍,因此在 25 fps 之下每個 latent 涵蓋八幀。在 H100 GPU 上,平均音訊到視訊延遲為 0.43 秒——是次快的前沿串流擴散模型的一半。語音則透過名為 Tavec 的自研編碼器生成:一個卷積自編碼器將 48 kHz 音訊映射成緊湊的連續 latent(每幀 40 個值、每秒 100 幀、無碼本),全因果的解碼器可以小至 10 毫秒的封包串流輸出。語音複製只需要約 10 秒的參考音檔。
獨立驗證來自 NVIDIA 的 VideoFDB 基準測試,它從兩個軌道評分全雙工視聽對話。在生成軌道(模型是否產生正確行為——流暢度、情感匹配、非語言時機)上,Griffin-Lite 得分 3.83 / 5,領先次佳系統(Gemini 2.5 + Anam 的 2.80)超過整整一分,距離人類參考值 3.92 僅差 0.09。在感知軌道(模型是否理解當下情境、是否運用視覺線索而非只聽文字)上,Griffin-Lite 得分 3.73,在全部 15 個受測模型中稱冠,包括 Gemini 2.5 Flash Native(3.17)與 OpenAI 的 gpt-realtime(2.97)。它在兩個軌道上也都拿下最高的接管率對齊(takeover-rate alignment)——62.8% 與 73.8%——意味著它對「何時該開口」的判斷最接近人類的對話節奏。
但陷阱也是真實的
48% 這個數字來自 Tavus 自己的研究,而非外部評測機構。實驗設計:透過一個未具名的招募平台找來 54 位受試者,告訴他們要與「另一位受試者」進行一分鐘視訊,聊聊這一年期待什麼。那位「受試者」其實是 Griffin-Lite。事後,54 人中有 26 人——48%——認為對方是真人。作為對照,Tavus 上一代產品組合(Phoenix-4.5 + Sparrow-2 + Raven-1)在 41 人中只騙過 1 人,約 2.4%。
三個細節讓標題降溫。第一,受試者被事先引導相信對方是人,這在任何圖靈式測試中都會推高通過率。第二,相信對方是真人的人平均信心 79%,說是 AI 的人平均信心 81%——質疑者並不心虛。第三,起疑的人通常在前 20 秒內就下定決心,而對話在「流暢自然」這一項的自評最低(7 分制中拿 4.9 分)。
評測的延遲欄位是另一個誠實的反制訊號:Griffin 在感知軌道上的回應延遲中位數為 2,232 毫秒,比開源模型 MiniCPM-o 的 720 毫秒和人類參考值的 1,400 毫秒都慢。Griffin 贏在感知的品質;它還不是街上最快的。
Tavus 在開放程度上也刻意保守。Griffin-Lite 目前是僅限特定早期測試者的研究預覽版,沒有公開定價,在該公司完成其認為必要的揭露機制之前,不會開放一般客戶使用。更強大的模型據承諾將在後續推出。
為什麼重要
從 2.4% 到 48% 的單代跳躍,是經得起檢驗後仍存活的核心訊號。就算接受所有方法學上的質疑,過去沒有任何對話視訊系統能在即時、開放式、面對面的交談中讓半數交談者誤以為是真人。架構層面的啟示很清楚:真正縮小差距的是全雙工、音視訊聯合生成——而不是更好的級聯管線。
影響可以清楚地切成承諾與風險兩半。承諾這邊,能讀懂表情、尊重停頓、自然共享發言權的代理人,將開啟真正的環境運算:有臨場感的遠端支援、語言練習夥伴、為不善文字互動的人群設計的無障礙介面。風險這邊,一個通過視訊圖靈測試的模型,在揭露機制被強制執行之前,定義上就是一台欺騙引擎。Tavus 顯然有自覺——存取權繫於安全工作——但能力已經被證明存在,而且不會永遠只停留在一家公司的謹慎發布裡。
接下來十二個月,很可能是一場 Tavus 承諾的「更強大 Griffin」與揭露、浮水印、同意基礎設施之間的賽跑。48% 這個數字告訴我們:能力那一側,已經跑得非常快了。