電話裡像真人、照稿卻不行:一家語音代理新創對 GPT-Live-1 的殘酷實測
ThunderPhone 把 OpenAI 的新全雙工語音模型接上真實電話線,用 13,000 token 的保險問答腳本實測:對話自然度驚人,但會把「是」聽成「不是」、保單號碼唸錯、生日讀回一堆數字。
2026 年 9 月 10 日,OpenAI 將 GPT-Live-1 開放給所有開發者,宣傳詞相當誘人:單一全雙工語音模型,在一條連續音訊流上同時聆聽與說話、原生處理打斷,語音層每分鐘只要 5 美分。對所有在做電話機器人的公司來說,這彷彿就是一直缺的那塊拼圖——從此不必再把語音辨識、推理、語音合成三段式管線硬拼在一起。
兩天後,第一份認真的實測報告出爐了,而它是一份兩面刃的成績單。
ThunderPhone 是一家在生產環境營運 47 種語言 AI 電話代理的新創。多數廠商發文吹捧之前不會做的事,他們做了:把模型接上一支真實電話號碼,然後反覆打給它。由共同創辦人 Alex Kolchinski 領軍的團隊,拿了一位保險客戶約 13,000 token 的「暖名單資格確認」腳本來壓力測試——這種腳本有強制逐字唸出的台詞、嚴格的覆誦規則和分支追問,一個答錯就可能變成法遵問題。他們在一個漫長的工作天裡跑了 12 通真實電話、約 25 次模擬訪談,加上一批非結構化測試,並公開了逐字稿與音檔。
好的一面:電話線上最自然的對話者
就純對話機制而言,結論毫無懸念。ThunderPhone 稱 GPT-Live-1 是「我們放上過電話線的、聽起來最自然的對話者」,是真正的一大步。來電者停止說話後,約 1.3 秒(中位數)就聽到它的第一句回應;若不算電話線本身的延遲,約 0.7 秒。團隊完全沒有另外接語音活動偵測(VAD)或輪替判斷邏輯;模型優雅地處理打斷、自然地發出附和聲(「嗯哼」),語速輕快而像真人。
逐字稿說明了這為什麼重要。當來電者更正日期——「呃,不對,是九,二十,呃,七十」——代理立刻順勢確認:「所以是 1970 年 9 月 20 日,對嗎?」然後繼續往下問。當對方在通話中途改答案(「不了,我現在有自己的房子了」),它從容吸收更正,下一題自動改成問獨棟、公寓還是組合屋。據稱在更正、打斷、中途改口的各種情境下,它從未失態。
Kolchinski 寫道:「如果自然度就是全部的工作,這篇文章到這裡就結束了。不幸的是,事情不只如此。」
壞的一面:指令被照字面執行,而不是照常識執行
核心發現是:GPT-Live-1「在照稿通話的關鍵行為上,無法可靠地遵循指令」。最令人不安的失敗模式是答案反轉——不只一次,模型把來電者明確的「是」當成「不是」來回應,要嘛重問一次,要嘛直接當對方拒絕而往下走。在保險資格確認流程裡,「是/否」決定承保範圍與告知事項,這不是無傷大雅的小毛病。
最一致的毛病是過度字面化。腳本寫著:如果來電者說檔案上的居住狀態有誤,就問他們是自有、租屋還是與父母同住。一位來電者回答「不對,我現在是自己的」——這其實已經回答了這個問題。模型照樣把整個選項菜單唸出來:「那麼,您的房子是自有、租屋、與父母同住,還是其他居住狀況?」ThunderPhone 指出,這種字面主義在他們試過的每一版 prompt 中都存在;任何沒有在指令裡明確列出的答案,都被機械式處理,而不是合理地處理。
模型在壓力下還會「想出聲」——某段逐字稿錄到它喃喃自語:「嗯。這題要小心處理。我會確認一下然後繼續。」潛在推理就這樣洩漏進了音訊通道。
數字才是真正的地雷
對受監管的電話流程來說,最致命的發現關乎英數字串。保單號碼、地址、出生日期、證件號碼必須一字不差地覆誦——而這正是 GPT-Live-1 語音表現問題最多的地方。在一段未經修飾的音檔中,模型被要求唸出「8KD2-QX7B-M4V9」,實際唸出的卻是「8KD2-QXY7B-M4V9」——即使它自己的逐字稿是對的,音檔裡仍憑空多插了一個字母。俄語版更糟:「Q」在音檔和逐字稿裡都變成了「X」。
日期也中招。來電者用數字報出生日期——「五五九五」——模型稍後把生日讀回成「五十五,九十五」這串數字,來電者一頭霧水地回:「我不知道你在說什麼五十五九十五,那不是生日。」它偶爾還會把來電者的台詞搶來講,在對方回答「我有」時自己脫口說出「我有」。
口音與 API 但書
在 ThunderPhone 的 47 語矩陣測試中,GPT-Live-1 的俄語流利但帶著濃厚美國口音——對非英語部署是相當大的但書,因為正式環境的 TTS 語音通常聽起來像母語者。第一次盧干達語(Luganda)測試時,它甚至用斯瓦希里語(Swahili)回答。
API 的但書跟模型行為一樣重要:工作階段開始後指令即不可變更,且上限 16,384 token;輸出音訊流永不停止(連靜音都在串流),所以「音訊停了」不能當作回合結束的訊號;模型只能透過新的 v1/live/sessions 端點呼叫——他們測試時 Azure 上還沒有。
為什麼這件事不只是一家新創的事
要 把一份廠商的批判性實測斥為競品的行銷手法很容易——ThunderPhone 自己也賣 Storm 模型,並宣稱它在指令遵循上更強。但這些細節都附有可查證的逐字稿,而這份報告真正指出的,是目前語音代理技術棧的結構性真相:這個產業已經大致解決了「自然」,卻離解決「可靠」還很遠。
OpenAI 的發布文案把「更強的指令遵循」列為招牌特性,這使得實驗室語言與正式環境行為之間的落差,反而成了真正的新聞。一個永遠不失態、卻會悄悄把「是」翻成「否」、或覆誦出一個從未存在過的保單號碼的模型,距離能上受監管通話流程,還差的不只是微幅改進——它需要的是另一種評測體系:建立在冗長、對抗性、強制照稿的通話之上,而不是輕鬆聊天 demo 之上。
這個模式在 2026 年一整年的模型發布中反覆出現:實驗室跑分一路狂飆,實務場測卻不斷撞上同一堵牆。GPT-6 Astra 發布當週,OpenAI 因需求壓垮算力而暫停 Pro 新訂閱;GPT-Live-1 發布當週,我們看到的是「最後一哩」——在 13,000 token 腳本下分毫不差的可靠行為——依然無解。語音是這個落差距離最無情的前線,因為沒有 UI 可以攔截錯誤、沒有撤回按鈕,而且線路另一端往往還有一個主管機關在聽。
ThunderPhone 承諾很快會有更完整的報告。在那之前,任何想在 GPT-Live-1 上開發的人,結論很直接:把它用在它卓越的地方——聽起來像人、從打斷中恢復、節奏自然——然後把逐字覆誦、英數字串和是/否閘門,留在你自己掌控的程式碼裡,或留在你已經用自家最刁鑽來電者測過的模型裡。