會說話也會傾聽的單一模型:OpenAI 將 GPT-Live-1 語音模型正式開放給所有開發者
OpenAI 於 9 月 10 日將 ChatGPT Voice 背後的全雙工語音模型 GPT-Live-1 推上 API,每分鐘 0.05 美元。早期客戶刪掉了 23,000 行程式碼,對話輪替延遲降至 0.8 秒,打斷使用者的機率大減近 8 成。
2026 年 9 月 10 日,OpenAI 推出今年最具份量的 API 產品之一:GPT-Live-1——ChatGPT Voice 背後的全雙工(full-duplex)語音模型——正式向所有開發者開放。語音層每分鐘 0.05 美元(約每小時 3 美元,按秒計費)。自 7 月起數百萬人在 ChatGPT 裡交談過的那個模型,現在只要有 API 金鑰,就能替任何人接電話、上家教課、坐鎮客服線。
這次發布之所以重要,在於它直擊生產環境語音 AI 最大的痛點:串接管線(pipeline)。十年來,語音代理本質上都是一條鏈——語音轉文字、推論模型、文字轉語音——而每一次交接都會增加延遲、丟失脈絡、打斷人類對話的自然節奏。GPT-Live-1 把這條鏈收進單一模型:它邊聽邊說,同時對輸入與輸出的音訊進行推理。它能即時回應插話、處理背景噪音而不逐一複誦每個步驟,並在長時間對話中保留上下文。
真正的主角:委派架構
GPT-Live-1 不只是一顆更強的語音引擎,關鍵在於它的分腦設計。語音模型擔任對話前線——快、社交流暢、隨時在聽。但它不必獨自思考:當請求需要更深的推理或工具呼叫時,GPT-Live-1 會把工作委派給開發者自選的後端文字模型——複雜客訴交給 GPT-6 Astra,排程、訂單查詢這類高流量任務交給更便宜的 Luna,甚至完全可以接第三方模型。
機制是事件驅動的:語音工作階段產生一個 delegation_id,把上下文送給後端系統,再透過名為 session.commentary.append 的事件收回結果。關鍵在於,語音模型會把結果自然地織進進行中的對話,而不是等結果回來後呆板地朗讀一整段文字。任何曾在語音代理「思考」時枯等沈默的人都能明白這一點的分量:GPT-Live-1 會讓對話持續活著——填補停頓、回應對方——後端一完成,答案就無縫接上。
這等於是語音 AI 首次採用與整個模型市場相同的經濟學:只在任務真正需要時才付錢買前線推理,其餘全部路由給便宜、快速的小模型。
數字會說話
OpenAI 公開的評測顯示,相較於上一代 API 語音模型 GPT-Realtime-2.1,這是跨世代的躍進:
- Full Duplex Bench v1.5 互動性(對背景說話聲、旁人對話、回應詞與插話的反應):80.1% 對 45.4%——提升 30 個百分點
- 對話輪替延遲:0.798 秒 對 1.41 秒——幾乎減半
- 工具呼叫 Pass@1(Full Duplex Bench v3,Terra 後端、低推理強度):87.0% 對 60.0%
- Tau3 語音智慧(航空、零售、電信領域的口語客服任務):Pass@1 86.2% 對 45.7%——搭配中等推理強度的 GPT-6 Astra 時名列第一
- Tau 銀行語音知識:97 項銀行知識任務完成 32.0%,前代僅 12.4%
- Artificial Analysis 對話動態(停頓處理、輪替、插話、回應詞):平均 97.3%
模型另附 12 種新語音,涵蓋不同口音、方言與語言;原生輸出 ASR 轉錄與回應文字;支援關鍵詞偏置與英數字元理解;而且雖然它並非輪替式模型,仍提供原生回合偵測,讓開發者可以繼續圍繞明確的回合邊界建構應用。電話支援(含 SIP trunk 整合)讓全雙工電話代理成為一級公民——從餐廳訂位到客戶支援。
早期客戶:更少插話、程式碼砍掉 8 成
早期試用數據罕見地具體:
- 醫療公司 EliseAI 在導入後刪掉了 23,000 行程式碼——CTO Tony Stoyanov 稱語音代理程式碼縮減 80%——把工程人力轉投向預約掛號與就醫導引的患者體驗。
- 語言學習公司 Speak 發現,在 Live Tutor Lessons 中,GPT-Live-1 打斷「只是停下來思考」的學習者的機率降低近 80%。對一個正在努力組句子的語言學習者來說,那幾秒的耐心,就是「把話說完」與「被 AI 搶話」的差別。
- Yelp 已在 Yelp Host 與 Hatch 中用 GPT-Live-1 處理電話訂位與餐點訂單。CTO Alex Levy 回報電話接聽處理率更好,還有一個很「人類」的訊號:「來電者說話的句子更完整、更自然——這告訴我們,電話另一端的體驗真的不一樣了。」
- Fin(Intercom)把對話層接上自家客服系統,讓 AI 語音支援從走走停停的節奏,走向一通自然電話該有的流暢。
- Cognition 則把它與 Devin 並用,離開鍵盤時也能討論想法、交接工作。
定價的取捨
每分鐘 0.05 美元說不上便宜——而且這還沒算後端的帳。如果模型把難題委派給 GPT-6 Astra,開發者得另付那次推理呼叫的費用;代理越常伸手抓前線模型,帳單爬得越快。在 Anthropic、Google 與中國實驗室的競爭壓力下,OpenAI 持續調降 API 價格,但前線推理依然所費不貲。
制衡的力量在於「選擇性」:簡單的排程交給 Luna,真正的難題才上 Astra,而 GPT-Live-1 給了開發者一個把這套路由邏輯套用在語音上的統一介面。對高流量的電話應用來說,這種分層就是產品活得下去與燒光預算的差別。
還有一個值得點名的平台取捨:在傳統串接式架構下,團隊可以為語音堆疊的每個環節挑不同供應商、自由替換零件。GPT-Live-1 接管更多對話,也就代表把更多東西交到 OpenAI 手上。這場豪賭——目前早期客戶的回報算是驗證了——是開發者願意用一部分控制權,換取終於跟得上人類說話節奏的代理。
從 ChatGPT 功能到平台基建
GPT-Live-1 於 2026 年 7 月 8 日隨 ChatGPT Voice 問世,Go、Plus 與 Pro 用戶預設使用 GPT-Live-1,免費用戶則是 GPT-Live-1 mini。7 月 31 日的更新為產生的音訊加入 SynthID 浮水印並提供公開驗證工具。OpenAI 同時向企業推薦 Presence——已採用 GPT-Live-1 的部署型語音與文字代理產品。
本週三的 API 發布補完了這條弧線:一個從 ChatGPT 功能出發的模型,如今成為任何開發者都能立足的平台基建。語音大戰——對上 Google 的 Gemini Live、Amazon 的 Nova Sonic、xAI 的 Grok Voice,以及 ElevenLabs、Vapi、Retell 等一票新創——也將從「demo 品質」轉向生產經濟學、電話整合,以及委派模式在真實通話量下究竟撐不撐得住。
對一個花了多年讓語音代理學會「對人說話」的產業來說,一個會邊聽邊說、知道何時該等、何時該插話、何時該默默把思考委派出去的模型,是真正的轉折點。
Sources
- [1] https://openai.com/index/introducing-gpt-live-1-in-the-api/
- [2] https://the-decoder.com/openais-gpt-live-1-api-lets-developers-build-apps-that-talk-and-listen-at-the-same-time/
- [3] https://thenewstack.io/gpt-live-1-voice-api/
- [4] https://www.unite.ai/openais-gpt-live-1-arrives-in-the-api-at-0-05-per-minute/
- [5] https://community.openai.com/t/introducing-gpt-live-1-in-the-api/1396471