← All posts / Tools

65% 通話零人工:拆解 Ringg 的 GPT-5.6 模型路由攻略

OpenAI 最新客戶案例顯示,獲 Peak XV 投資的班加羅爾語音 AI 新創 Ringg,每月處理超過 700 萬通電話,最多 65% 的例行客戶來電無需人工介入即完成——其四層模型路由架構中,最便宜的 GPT-5.6 Luna 默默承擔了大部分合適任務,成本降低約 90%。

65% 通話零人工:拆解 Ringg 的 GPT-5.6 模型路由攻略

OpenAI 於 9 月 24 日發布的最新客戶案例中,最有趣的數字其實不是 65%。這份案例描述了總部位於班加羅爾、獲 Peak XV 投資的語音 AI 新創 Ringg,如何以 AI 代理人每月處理超過 700 萬通有效電話,其中最多 65% 的例行客戶詢問無需真人介入即可完成,客戶滿意度平均達 4.8 分。這些是典型的廠商案例標題數字。真正新穎的部分藏在架構裡:Ringg 在生產環境同時運行四個不同的 OpenAI 模型,各自負責其性價比最高的工作——而堆疊中最便宜的 GPT-5.6 Luna,已接管足夠多的合適即時流量,讓這些工作負載的模型成本相比 GPT-4.1 降低約 90%。

一個平台、四個模型、四種截然不同的任務

Ringg 的代理人橫跨語音、聊天、WhatsApp 與網頁,其編排層串接 CRM、票務系統、支付工具、排程軟體與內部 API。專責子代理人分別處理客戶資格確認、身分驗證、支援、預約與升級轉接,任務超出自動化邊界時便將結構化的對話摘要移交真人。檢索層結合結構化篩選與對業務紀錄和文件的語意搜尋;針對長對話,系統會在上下文接近約 8 萬 token 時產生結構化摘要,而非不斷重送完整歷史——這是教科書級的輸入成本控制手法,大多數聊天機器人部署至今仍做錯。

但路由表才是核心。多數即時語音與聊天流量仍跑在 GPT-4.1 上,因為它仍是滿足即時對話延遲要求的生產環境預設。GPT-5.6 Luna——目前定價為每百萬輸入 token 0.20 美元、輸出 1.20 美元,相較 GPT-4.1 的 2.00/8.00 美元——負責通過 Ringg 內部品質、延遲與工具使用閘門的合適即時請求。GPT-5.6 Terra(2.00/12.00 美元)處理通話後摘要與情緒分析,Ringg 回報其在印度多種區域語言上準確度出色。至於最強也最貴的 GPT-5.6 Sol(4.00/20.00 美元),則保留給離線工作:評測、提示詞改進與 model-as-judge 品質管控。

這是選擇性模型路由,而非全面遷移——此一區別至關重要。Ringg 並未汰換 GPT-4.1,而是建立了一套驗收閘門管線:先離線測試歷史對話與模擬客戶流程,讓通過的模型承接一小部分即時流量,唯有在生產監控確認穩定後才擴大比重。其路由器還會監看各區域端點健康狀態與延遲,一旦越過閾值便轉移流量。

客戶數字——及其侷限

OpenAI 與 Ringg 引用的部署成果亮眼,但彼此衡量的是不同的東西。保險市場 Policybazaar 回報 67% 通話零人工處理,回應時間從 8–12 分鐘縮短至 60 秒內。健康科技平台 Practo 回報 85% 首次來電解決率、3 秒內回應、營運成本降低 70%——不過「首次來電解決率」與「完全自動化」並非同一指標。投資平台 Groww 回報 72% 特定入站查詢以自助完成,範圍僅限指定的投資查詢類別,而非全部支援流量。

這些數字彼此並不矛盾,但不應平均:它們描述的是不同客戶、不同任務與不同衡量定義。OpenAI 的頁面未公布共同基準、測試期間、原始對話、失敗率或獨立稽核。正如 AI Pricing Guru 對此案例的仔細拆解所指出的,65%、90% 成本降幅與各客戶成果仍屬第一方說法。評估類似部署的買家應比較「每正確解決一通電話的總成本」——包含語音辨識、電信、工具執行、重試、人工升級與品質審核——而非單看模型價格或攔截率。

為何這故事超越客服中心

Ringg 的軌跡展示了語音代理人層在印度的工業化速度。該公司每月處理約 2,000 萬次撥號嘗試,已獲 Peak XV 與 Grishin Robotics 等投資的 1,000 萬美元資金,將代理人從接聽電話擴展至完成企業工作流程,並持續推進醫療與金融服務——這正是「錯誤解決」會帶來合規風險而非節省的受監管領域。

這也標誌著 OpenAI 行銷模型家族方式的微妙轉變。這個案例的經濟亮點不是某個巨型模型包辦一切,而是一套紀律嚴明的路由層:由每百萬 token 0.20 美元的苦力、中階分析者與前沿裁判組成的模型組合,在相近品質下擊敗任何單模型部署。GPT-5.6 Luna 在 AI Pricing Guru 的固定確定性文本測試套件中拿到 48/49,Terra 與 Sol 為 49/49——例行文本工作近乎平手,價差卻達 10 倍。當合適工作負載上的品質差距這麼小、價格差距這麼大時,路由層本身就成了產品。

這一切並不代表真人客服將從印度客服業消失,而是意味著機器與人的分工界線,如今是按意圖、按語言、按成本層來劃分——而且每當更便宜的模型通過閘門,這條線就自動重畫一次。所謂 65%,是這條移動界線的快照,不是終點線。

對任何在前沿 API 上建構代理系統的團隊,實際啟示是:做好全面監控、每個模型升級前先過品質與延遲閘門、用摘要取代重送、把最貴的模型留給裁判而非服務——並把廠商案例數字當作需要在自己流量上重驗的假設,而非可直接入帳的成果。