← All posts / Tools

檢索層擊敗了模型:Pinecone Nexus 在 τ-Knowledge 基準測試奪下最高分

同樣的前沿模型、不同的知識層、更好的成績:Pinecone Nexus 正式版上市後,在 Sierra 的 τ-Knowledge 企業知識基準測試拿下最高分,擊敗了基於 OpenAI、Anthropic 與 Google 前沿模型打造的代理。

檢索層擊敗了模型:Pinecone Nexus 在 τ-Knowledge 基準測試奪下最高分

2026 年 8 月 23 日這個平淡的 AI 新聞週末裡,最值得注意的故事不是某個新的前沿模型,而是一套基礎設施:Pinecone Nexus——一個為 AI 代理設計的「知識引擎」(knowledge engine)。它在這個月稍早正式版(GA)上線後,於 Sierra 的開放企業知識基準測試 τ-Knowledge 拿下最高分,擊敗了基於 OpenAI、Anthropic 與 Google 前沿模型打造的代理系統。這則頭條背後的細節,傳達了一個大多數企業 AI 團隊花了兩年才學到的教訓:當代理出錯時,瓶頸通常不是模型,而是檢索層(retrieval layer)。

Nexus 是什麼

Pinecone Nexus 於 2026 年 7 月 1 日進入公開預覽、8 月 6 日正式版上線。它把企業的專有資料與工作流程,編譯(compile)成一個受治理的、代理可直接使用的知識層,放在企業的系統記錄(systems of record)與消費這些資料的 AI 代理之間。

傳統做法裡,代理必須在每次請求時重新拼湊脈絡:搜尋、閱讀、再搜尋,然後在每一輪把目前為止收集到的所有內容重新發送一次。Nexus 則把這些工作提前、一次性地做好,並透過單一查詢介面 KnowQL(一種宣告式查詢語言,規格公開於 spec.knowql.org)對外提供服務。

整套系統由三個部分構成:

  • Manifest(清單):由領域專家(而非中央資料建模團隊)用自己的語言描述這份工作:哪些實體重要、它們之間的關係、以及這份工作需要的答案長什麼樣子。Manifest 的範圍是針對某一項工作,而非整間公司。
  • 編譯後的知識層:Nexus 依據 Manifest 把原始資料編譯成結構化工件:摘要、結構化抽取結果,以及傳統 top-K 檢索會丟掉的實體關係圖譜。
  • KnowQL:代理宣告它需要什麼——問題、輸出形態、範圍、依據與預算——然後在單次呼叫中拿到一個帶型別、帶引用來源的回答。

部署模式刻意做得對企業友善:Nexus 的資料平面跑在客戶自己的雲端(AWS、Google Cloud 或 Azure),文件與編譯後的知識永遠不會離開客戶的基礎設施。客戶自備模型憑證(包括開放權重模型),每個工作流程都可以使用模型集成(ensemble),依步驟挑選合適的模型。編譯後的知識層可以下載封存——這是 Pinecone 特別強調的「不鎖定」保證。

基準測試:同樣的模型,不同的知識層

τ-Knowledge 是 Sierra 的開源基準測試,針對代理式客服工作:對一個包含 698 份文件的金融科技知識庫做多步驟推理、嚴格遵守政策、協調多項工具使用。評分標準是代理能否把底層系統推向正確的最終狀態——一個流暢但引用了錯誤版本政策的答案,得分是零。Sierra 自己公布的結果顯示,最好的前沿模型配置在知識領域只能達到約 26%,比該基準的其他領域難上三到四倍。

Pinecone 提交到 Sierral 排行榜的測試結果,產生了這個週末成為頭條的數字:

  • 搭配 Nexus 知識層的 GPT-5.5 解決了 47.4% 的任務——該基準測試的最高分;未搭配 Nexus 的 GPT-5.5 為 46.4%,同時每任務成本降低 77%。
  • 搭配 Nexus 的 GPT-5.2 達到 36.1%,未輔助為 32.2%——相對準確率提升 12%,每任務成本降低 80%。
  • 機制反映在呼叫次數上:GPT-5.2 每任務的工具呼叫從 42.5 次降到 17.7 次,模型呼叫從 81.7 次降到 42.6 次。GPT-5.5 則從 28.6 次工具呼叫、60.9 次模型呼叫,降到 16.0 與 39.4 次。
  • 成本優勢在 GPT-5.2 的 97 項任務中贏了 97 項,GPT-5.5 贏了 96 項——不是靠平均掩蓋離群值。Pinecone 的說法很具體:這就是一項 1.45 美元的任務變成 0.53 美元的方式。

這些是廠商自行報告的數據,閱讀時應保持警覺。但這個模式與八月其他 AI 新聞相互印證:Linear 的遙測數據發現,程式代理讓 PR 數量增至三倍,卻沒有縮短週期時間,因為瓶頸在審查而非生成。一次又一次,限制都不在模型能力,而在別的地方。

Pinecone 自己的生產數據

更罕見的揭露是,Pinecone 從 2026 年 7 月 17 日起讓 Nexus 支撐自家客服代理,並公布了前後對比:

指標無 Nexus有 Nexus
自主解決率24.6%55.1%
正確分派率76.5%94.2%
輔助率60.5%87.8%

Pinecone 的進線客服工單現在超過一半不需人工介入即可結案。為期五週的公開預覽期間,客戶建立了 300 個知識情境,把 350 萬個原始資料區塊編譯成約 26,000 個結構化、可查詢的知識工件,涵蓋客服知識庫、法律合約、財務申報文件、研究論文、會議紀錄與通話逐字稿。

為什麼重要:知識天花板

Pinecone 的核心論點是:企業代理會先撞到「知識天花板」,而不是「模型天花板」。支撐數據很有說服力:在一項涵蓋 306 個生產環境代理團隊的調查中,可靠性超越了模型能力,成為頭號開發挑戰;68% 的團隊把代理限制在十步以內就要人工接手。同時,混合推論成本年降約 67%,但企業平均 AI 預算卻從 2024 年的 120 萬美元漲到 2026 年的 700 萬美元——因為一個代理任務會跑很多次模型呼叫,每一次都重新發送目前已收集的脈絡。高盛預測,2026 到 2030 年間 token 消耗量將成長 24 倍。

有損的部分正是檢索本身。向量或混合搜尋回傳的是與查詢最相符的文字區塊,卻剝除了區塊之間的關聯;代理必須在每次請求時重新推敲:某條政策如何連到某筆紀錄、某個條款如何限定另一個條款。當答案取決於「關係」而非「段落」時,top-K 檢索就會失靈。

Nexus 的競爭框架瞄準兩種替代方案。其一,代理式 RAG 在每次查詢時重新推導脈絡,資料或任務一變就要重新嵌入。其二,中央本體論(ontology)——Pinecone 點名 Palantir 與微軟那種「把整個事業建模起來」的路線——由不做實際工作的團隊預先編寫,上線當天就開始失真。Nexus 的答案是讓最懂領域的人主導增量策展:新的和變動的來源流入既有知識層,不必整批重建;而當 wiki 說一套、合約寫另一套、其中一份還是三年前的舊版時,策展流程會把衝突浮出來,交給專家裁決。

當然也有誠實的但書:Nexus 位於 Pinecone 更大的平台之內,以 Pinecone Database 作為檢索基礎,因此它是 Pinecone 生態的延伸,而非獨立產品。GA 公告並未公布定價,買家被導向標準的採購洽談。基準測試結果也是 Pinecone 自己跑的。

結語

8 月 23 日這個安靜的週末,給了追逐模型兩年的產業一個有用的修正。如果你的代理在你的文件庫上表現不穩,或者 token 與延遲成本不斷攀升卻看不到準確率提升,天花板很可能在知識層——修好它比換上下一個前沿模型更便宜,也更可能是真正的問題所在。正如 Pinecone 執行長 Ash Ashutosh 在發表時所說:「代理燃燒 token 在原始資料裡磨蹭,所以成本和延遲不斷攀升,準確率卻低於應有水準。Nexus 把知識引擎放進你自己的雲端,提高準確率、降低運行 AI 的總成本,並讓你自己的專家持續塑造代理的工作方式。」

同樣的模型。不同的檢索層。更好的結果。這就是整個故事——而且很可能預告了未來一年企業 AI 競賽的真正戰場。