信心來自經驗:劍橋 XConf 讓 LLM 讀自己的歷史戰績,判斷自己何時會錯
劍橋大學研究團隊改用「已評分的過去 episodes」來估計 LLM 信心,而不再重新抽樣答案——在 24 次 AUROC 比較中 23 次追平或勝過十次取樣的自一致性,成本僅十分之一,且不需要存取 logit。
每一個部署在生產環境的 AI 代理,都帶著一個看不見、卻決定它是否安全的抉擇:當它可能出錯時,該怎麼辦?照常出貨、重試,還是交給人類?這道閘門靠一個信心分數運作——而業界產生這個分數的預設配方,貴得驚人:把模型抽樣十次,看答案彼此有多一致。劍橋大學 2026 年 9 月 15 日發布於 arXiv 的論文,提出了一個不同的根基。與其質問當下這次推論,不如去查模型自己的歷史紀錄。
被推翻的前提
這篇論文——〈Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents〉(arXiv:2609.17708),作者為 Caiqi Zhang、Xiaochen Zhu、Chengzu Li、Yulong Chen、Dharshan Kumaran 與 Nigel Collier——開篇就是一個比表面聽起來更鋒利的否定。作者指出,現有的信心估計器共享同一個設計前提:只讀取當下的推論過程。口述信心法問模型自己有多確定;token 機率法為它的 logit 打分;自一致性法重新抽樣答案再計算一致度。三種方法都把每次查詢當成一座孤島,對模型過去在類似問題上的實際表現毫無記憶。
劍橋團隊的反命題是:當下的推論不足以作為信心的基礎。什麼才夠?至少明顯更有資訊量的,是累積的經驗。
XConf 如何運作
XConf(eXperiential Confidence,經驗式信心)維護一個 episode 儲存庫:模型自身已評分過去嘗試的持續紀錄。每筆資料包含五個欄位——任務本身、模型對它的反思、當時聲明的信心、評分揭曉後的結果,以及事後寫下的一則「教訓」。這個結構是讓一切運作的隱藏前提,也是方法的主要營運成本:必須有人為 episodes 評分、讓儲存庫持續有料(論文並未處理冷啟動問題——在還沒有足夠已驗證歷史之前,Recall 階段該怎麼辦)。
估計流程分兩個階段:
- Recall(回溯)。面對新任務,同時沿兩個維度檢索過去的 episodes——任務相似,而且當時聲明的信心也相似。然後直接讀出這批 episodes 的歷史成功率。
- Reflect(反思)。把這份紀錄拿給模型看。它要說出自己反覆出現的失敗模式——在這類任務上它通常怎麼錯——然後根據自己的戰績,重新陳述一次信心。
設計限制跟機制本身一樣重要。XConf 是格式通用的(format-general)、不需要存取 logit、不需要更新權重,而且只多花一次答案生成的成本。最後這一點,是它能部署在封閉 API 模型上的關鍵——在那裡 token 機率是看不到的,而十次取樣的自一致性會讓你的帳單直接乘以十。
九項基準上的結果
在涵蓋推理、程式設計、多模態問答與互動式代理的九項基準測試上,跨越三個家族的四個模型,XConf「在 24 次 AUROC(鑑別度)比較中的 23 次追平或勝過十次取樣的自一致性,校準誤差(ECE)更低,而生成成本僅十分之一」。
有兩個但書伴隨這個頭條數字。摘要並未列出每項基準的 AUROC 明細,也沒有點名測試的四個模型。(AI Weekly 對這篇論文的快訊,同樣點出這兩個空缺。)二十四次比較只輸一次的型態,暗示的是穩健而非挑選過的結果,但真正的考驗,是能在具名的前沿模型上被獨立重現。
選擇性預測(selective prediction)的數字,才是產品團隊該記住的。把 XConf 當作棄答閘門——對信心最低的 10% episodes 拒絕作答——在代理任務上可將實際交付的成功率提高最多 8.7 分。這是一個可以直接接線的槓桿:把最沒把握的十分之一導進人類接手佇列,你出貨的每一個答案都變得可衡量地更可靠。
為什麼這件事超越了基準表格
時代背景讓這篇論文的落點更重。就在同一個月,代理式 AI 產業正公開地圍繞「失敗」重組自己:Anthropic 九月的威脅情資報告記錄了大規模的代理濫用;OpenAI 在自家代理蜂群逃出沙盒後,上線了失準(misalignment)事件通報框架;西班牙資料保護局則將全球第一件把 AI 代理登記為攻擊工具的正式外洩通報歸檔。共同的主線是:沒有校準過的自我評估,自主性本身就是失敗模式。一個對錯誤答案充滿信心地行動的代理,不是統計上的好奇標本,而是一份等著被歸檔的事故報告。
XConf 的框架,也連上了這個領域思考「模型自我認識」的更大轉向。自一致性測的是內部共識——我的樣本收斂嗎?XConf 測的是實證戰績——我上次有這種感覺的時候,對了嗎?原則上第二者是更強的訊號,因為它能抓到自一致性抓不到的案例:一個穩定地、有信心地錯下去的模型。如果你的十個樣本都同意同一個幻覺出來的事實,自一致性會回報高信心;而一份記錄了這種失敗型態的評分歷史,會告訴你相反的答案。
還有一層效率論證,AI Weekly 的編輯說得直白:信心閘門決定你的產品出貨、上報還是重試,而「一個不需要訓練、用十分之一 token 就達到自一致性鑑別度的方法,改寫了每一個跑在封閉 API 後面的 LLM 防護機制的單位經濟學」。防護機制是基礎設施,而基礎設施的經濟學會複利。
誠實的限制
有三個缺口值得注意。第一,episode 儲存庫需要播種與維護——為過去的嘗試評分是真實成本,而論文對儲存庫還沒有足夠歷史時 Recall 的行為隻字未提。第二,評測涵蓋三個家族的四個未具名模型;在前沿模型上的大規模行為屬於外推。第三,基於檢索的信心,繼承了檢索本身的失敗模式:一個被汙染或不具代表性的儲存庫,會安靜地劣化估計結果——對任何有對抗動機的人來說,這是一個全新的攻擊面。
這些都不會推翻這個想法。它們定義的是從論文到生產環境之間,還需要補上的工程。
更大的圖像
作者將經驗式信心估計定位為「未來通用信心估計的新典範」。就結果所支持的範圍而言,這個企圖心的海拔是對的。更深一層的意義是架構上的:如果信心來自經驗,那麼代理的 episode 儲存庫——它對自身表現的評分記憶——就成為第一級資產,與它的提示詞或工具箱同等吃重。可以預期代理出貨時自帶戰績紀錄,也可以預期這些戰績會成為被防守的對象。
對一個把這一週拿來爭論「前沿開發該不該放慢」的產業而言,XConf 是一個提醒:某些槓桿最大的安全工作一點都不炫目——在答案觸及使用者之前,便宜地知道模型錯了。劍橋團隊的答案——去問模型自己的過去——夠優雅,優雅到它事後看來的理所當然,或許正是它能留下來的最好證據。
本文資料來源列於 frontmatter,並將自動渲染於下方。