PhoneLLM Alpha 1:開源 30B 模型在電話語音代理基準上追平 GPT-5.6 Terra,成本僅 1/18
Pipecat 推出的 PhoneLLM Alpha 1 是 NVIDIA Nemotron 3 Nano 30B-A3B 的全參數微調版本,在其 PhoneBench 語音代理基準上以 72.3% 追平 GPT-5.6 Terra,每分鐘成本低 94%,且不受任何商業限制。
Daily 旗下的 Pipecat 團隊發布了 PhoneLLM Alpha 1,一個專為語音代理打造的開放權重語言模型——而它的發布數據在語音 AI 領域投下了一顆小震彈。在該團隊全新的 PhoneBench 基準測試中,這個 300 億參數的模型拿下 72.3% 的分數,與 OpenAI 的 GPT-5.6 Terra(72.4%)僅差 0.1 個百分點,而每分鐘運行成本便宜約 94%,P95 首 token 延遲更比這個前沿模型快了約 1,300 毫秒。
模型現已在 Hugging Face 上以 pipecat-ai/phonellm-alpha-1 之名提供,採用 BSD 2-Clause 授權條款釋出,沒有任何商業使用限制。
PhoneLLM 究竟是什麼
PhoneLLM Alpha 1 是 NVIDIA Nemotron 3 Nano 30B-A3B 的全參數微調版本,使用 NVIDIA NeMo 框架訓練。基礎架構是混合 Mamba-Transformer 的專家混合(MoE)設計:總參數量 300 億,但每個 token 僅啟動 35 億參數——這正是它能實現高速、低成本推論的關鍵。它支援 262,144 token 的上下文視窗,以 bfloat16 safetensors 格式發布,可在標準推論框架上運行——vLLM 或 SGLang 搭配 Nemotron 3 Nano 配方即可。
它的建議推論設定透露了整個設計哲學:temperature=0,並且停用思考模式。這是一個被訓練來行動的模型,而不是大聲推理的模型——因為在電話中,每一秒可見的猶豫都是尷尬的死寂。
為什麼需要一個語音專用模型?
Pipecat 團隊在模型卡中闡述的理由,是 LLM 市場對語音代理存在結構性缺口,而這源自通用模型的兩個缺陷。
延遲問題。 前沿模型針對啟用思考 token 的推理做了最佳化。這在聊天視窗裡沒問題,在電話裡卻是災難。該團隊的實測數據將可接受的「語音到語音」延遲預算定在約 1,500 毫秒——這涵蓋了網路、音訊處理、應用邏輯,以及 STT/LLM/TTS 全部推論的總和。而 GPT-5.6 Terra 在快速模式下,光是自己一個模型的 P95 首 token 延遲就約 1,900 毫秒。換句話說,這個前沿模型的思考速度本身,在音訊還沒被處理之前就已經撐爆了整場對話的預算。Pipecat 自己的延遲預算分解,為 LLM 首 token 延遲設定的目標只有 650 毫秒。
誠信問題。 更令人警惕的是團隊在長篇多輪對話中發現的工具呼叫問題——尤其是在停用思考模式時:模型會說「好的,我已經為您訂好位了」,卻根本沒有實際呼叫訂位工具。對一條客服線路來說,這不是品質 bug——這是信任災難。PhoneLLM 被針對性地訓練在不依賴推理軌跡的情況下、在正確時機呼叫正確的工具,而這次微調把它的未調參基礎模型(Nemotron 3 Nano 30B,在基準上只有悽慘的 28.6%)一路拉到了 72.3%。
PhoneBench Alpha 1 排行榜
伴隨模型一同發布的還有 PhoneBench v1,一個針對多輪電話助理工具呼叫與對話能力的基準測試,涵蓋真實的客服場景。共有 15 個模型受測,由經人工標籤校準的 LLM 評審團評分,衡量電話口語風格、工具呼叫準確度、言行一致度、事實接地、對話連貫性、身分驗證與升級紀律,以及來電者結果。關鍵的是,基準場景與訓練資料完全分離,因此分數檢驗的是泛化能力。
排行榜前段班:
| 排名 | 模型 | 分數 | 權重 | P95 TTFAT | 每分鐘成本 |
|---|---|---|---|---|---|
| 1 | Gemini 3.6 Flash | 78.6% | 專有 | 1,468 ms | $0.0751 |
| 2 | GPT-5.6 Terra | 72.4% | 專有 | 1,957 ms | $0.0347 |
| 3 | PhoneLLM 30B Alpha 1 | 72.3% | 開放 | ~600 ms | $0.0025 |
| 4 | GPT-5.6 Luna | 70.7% | 專有 | 1,736 ms | $0.0035 |
| 5 | Qwen 3.8 27B | 70.0% | 開放 | ~600 ms | $0.0074 |
| 6 | Claude Sonnet 5 | 68.9% | 專有 | 2,166 ms | $0.0520 |
模式非常鮮明。Gemini 3.6 Flash 在原始準確度上領先,但前六名中的每個專有模型,每分鐘成本都是 PhoneLLM 的 7 到 21 倍,而且多數背著會讓人類來電者直接掛斷的 P95 延遲。PhoneLLM 的每分鐘 $0.0025,大約是 GPT-5.6 Terra($0.0347)的 1/18——而且與 API 模型不同,它是開放模型,你可以架在自己的基礎設施上、放在自己的安全防護圈內。
有一點值得留意:未調參的 Nemotron 基礎模型全部墊底(Nano 30B 為 28.6%,Ultra 550B 也只有意外的 38.1%),這提醒我們此處真正發揮作用的是微調——而非基礎架構本身。
更大的轉變:任務微調的開源模型正在吞噬垂直市場
Pipecat 聲明中最有意思的一句話,其實跟這個模型本身無關:「我們看到產業正在轉向小型開放權重模型、針對特定目的微調,而在準確度、推論速度、成本與資料隱私上超越通用前沿模型。」
這才是真正的故事。前沿實驗室不斷推出更大、更通用的推理模型——在通用基準上它們確實獲勝。但生產環境的工作負載並不通用。一個電話代理不需要解決奧林匹亞數學;它需要在 1.5 秒內完成身分驗證、查訂單、訂位子,而且真的執行,成本只要幾分之一美分,還不能把客戶資料洩漏給第三方 API。
PhoneLLM Alpha 1 證明了這套垂直特殊化策略,如今已能達到前沿品質:拿一個高效的開放基礎模型(Nemotron 的混合 Mamba-MoE 設計正是為此而生),用領域軌跡做全參數微調,然後以一個允許任何人商業化的授權條款發布。Pipecat 團隊也提到,他們直接與企業合作,用生產環境的代理軌跡訓練特定用途模型——PhoneLLM 就是這套打法的公開示範。
對於用 Pipecat 這類框架打造語音代理的開發者來說,實際的算計已經改變。問題不再是「我該把電話路由到哪個前沿 API」,而是「這個工作負載到底需不需要前沿 API」。對於金融、醫療、零售與旅宿業的進線客服——也就是 PhoneLLM 訓練鎖定的場景——至少在這個基準上,答案越來越是否定的。
它畢竟還是個「Alpha 1」——僅支援英文、單一垂直領域、部分由 LLM 評審團評分,完整基準架構也尚未隨成熟度發布。但作為 2026 年模型市場走向的訊號,它難以超越:利水市場正從下方被吞噬,每次 35 億個啟動參數。