打電話的是「什麼」?Sierra 的 fleming-1 是 AI 代理人時代的來電顯示
Sierra 新推出的 fleming-1 模型即時分析通話音訊,偵測來電者是否為 AI——為不主動表明身分的代理人補上偵測層,與 Personal Agent Protocol 形成互補。
1988 年,BellSouth 在田納西州曼菲斯啟用了第一個來電顯示服務,回答了每個人接到電話時都會問的問題:這會是誰打來的?三十八年後的今天,Sierra 說,企業面對的是另一個問題:打電話來的是「什麼」?
2026 年 10 月 8 日,Sierra 發表文章〈Caller ID in the age of agents〉,並推出 fleming-1——一個能偵測電話另一端是否為 AI 代理人的模型。這個聽起來小巧的發布,背後的意涵卻不小:企業進線電話——最後一個仍預設「對方是人」的主要客戶接觸點——如今正式成為人機混雜的環境,而「分辨人與機器」的基礎設施正在成為一個產品品類。
問題的起點:代理人打給代理人,純屬意外
這個問題不是 Sierra 在會議室裡憑空想出來的。該公司表示,早在 2025 年就遇過這個狀況:醫療產業中,建立在 Sierra 上的代理人,開始打電話給同樣建立在 Sierra 上的其他代理人。沒有人為「機器人對機器人」的通話做過設計,但當語音代理人成熟到能完成真正的任務時,這種情境就自然發生了。
而這股壓力即將加倍。隨著 Instinct、Muse 這類個人代理人快速普及,Sierra 認為,企業接到的電話中,將有相當大的比例來自於代表消費者行事的 AI——預約門診、爭議扣款、改班機。這些自動來電者中,有些是合法的委託代表,有些是大規模測試帳戶安全的詐騙機器人,還有一些,是真正依賴文字轉語音(TTS)科技講電話的身障使用者。
最後這一群人,正是 Sierra 對 fleming-1 的功能邊界格外謹慎的原因。
提供資訊,不做裁決
Sierra 的論述刻意借鑑來電顯示的歷史:來電顯示從來不會告訴你該不該接。fleming-1 也一樣——它負責標記,不負責決定。
這個模型會即時分析來電者的語音,對音訊中「由 AI 生成」的特徵進行評分。Sierra 對此難度毫不諱言:在電話中分辨合成語音與真人越來越難——背景噪音、悶悶的音質、糟糕的訊號都會蓋掉線索,而 AI 語音本身還在不斷進步。因此 fleming-1 看的不是聲音「聽起來像不像真人」,而是在通話進行中就評估對方的聲音是否為合成——不是事後報表。
關鍵在於,模型預設調校為保守:盡量不誤判真人。被判定「可能是 AI」的來電會被標記,下一步怎麼處理由企業自己決定。Sierra 給了兩個具體的起手式:
- 銀行可以在來電者是代理人時增加一道驗證程序——不是擋掉電話,而是對敏感操作提高門檻。
- 高話量的公司可以先什麼都不改,只開始「測量」代理人來電的頻率,蒐集數據再談政策。
這種「先測量」的姿態相當務實。目前大多數企業對於進線電話中合成語音的佔比,是完全沒有數據的。fleming-1 最直接的價值,或許是作為遙測工具,而非執法工具。
答案的另一半:Personal Agent Protocol
fleming-1 並非孤軍。就在兩天前的 10 月 6 日,Sierra 與 Meta 才剛發布 Personal Agent Protocol(PAP,個人代理人協定)——一個與 Genesys、Instinct、Rocket、Shopify、Stripe、Walmart 等業者共同開發的開放標準,讓個人代理人有直接、經授權的管道與企業往來。代理人使用該協定時,企業知道它是代理人、也知道它代表誰。v0.1 規格書預計 10 月底前發布,並將舉辦設計工作坊、釋出參考實作。
Sierra 的策略明顯是雙管齊下:最好的情況是代理人主動表明身分——這是 PAP 的任務;而 fleming-1 負責那些不表明身分的來電,無論是因為開發者無視協定,還是壞 actors 本來就沒打算暴露自己。
處理過電子郵件身分驗證的人對這個模式不會陌生:SPF 與 DKIM 讓合法寄件者宣告身分,垃圾郵件過濾與內容偵測處理其他所有人。合作式身分識別加上對抗式偵測,互補彼此的盲區。PAP 與 fleming-1,就是同一套架構降臨電話通道。
Sierra 星系架構的一角
fleming-1 也展示了 Sierra 打造模型的方式。該公司的代理人由 15 個以上的前沿模型、開放權重模型與專有模型組裝而成——也就是他們 2025 年 12 月詳述的「constellation(星系)」架構——每個模型依任務選用。Sierra 會跑任務導向的評測,並在現成模型無法滿足要求之處投入微調模型,fleming-1 正是這樣的產物:在劣化的電話音訊中即時偵測合成語音,而且偏向不誤判真人——這正是通用模型表現不佳的那種高風險窄任務。
實務上採用門檻很低:fleming-1 適用於任何建立在 Sierra 上的語音代理人,企業只需開啟功能。它嵌入的是 Sierra 自 2024 年 10 月起經營的語音通道——當時其代理人首度開始接聽電話,可與既有客服中心平台整合、放在傳統 IVR 系統前後,並在需要真人介入時附上 AI 摘要轉接給人類團隊。
為什麼這件事不只在講 Sierra
最直接的解讀是:Sierra 在補自己平台的最後一塊拼圖。更深一層的解讀是:fleming-1 是一個即將成為企業標配的層級的早期玩家——語音通道的代理人流量管理。代理人進入過的每一個通道——網頁、Email、聊天——最終都長出了身分與偵測基礎設施。語音一向是最後也是最難的一關,因為它連最基本的機器可讀身分層都沒有。
三個值得觀察的問題:
- 軍備競賽。 合成語音持續進步,今天調校保守的偵測器,明天可能就得推出 fleming-2、fleming-3。Sierra 的星系架構,暗示他們本來就預期這種迭代節奏。
- 偽陰性 vs. 偽陽性。 把 TTS 使用者標成 AI 是無障礙災難,放過詐騙機器人是資安災難。Sierra 選擇向前者傾斜——合理,但這意味著「被標記」是強訊號,「沒被標記」只是弱訊號。
- 互通性。 PAP 有 Meta、Walmart、Stripe 站台,Visa 則扶植對立協定。fleming-1 這類偵測模型會維持各廠商私有,還是商品化為公共基礎設施,將決定整個市場標準化的速度。
來電顯示最終裝上了每一支電話,因為人們發現它有用。Sierra 押注「知道是不是 AI 打來的」會走向同樣的結局——而這一次,類比或許還說小了。來電顯示告訴你「誰」打來;下一代電信基礎設施得搞清楚的,是「什麼」打來。