← All posts / Research

快思考、慢推理:Jev-Mem 把代理記憶體拆成兩套系統,查詢延遲大降 36.7%

一篇新論文用小型 System-One 決策模型取代主導代理記憶的大型 LLM——在 LoCoMo 上答題品質提升 11%、記憶建構快 6.6 倍、查詢延遲僅 0.93 秒。

快思考、慢推理:Jev-Mem 把代理記憶體拆成兩套系統,查詢延遲大降 36.7%

2026 年 9 月 21 日,一個僅三人的研究團隊——Dongming Jiang、Yi Li 與 Bingzhe Li——在 arXiv 發表了論文 Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents,程式碼同步開源到 GitHub,Hugging Face Spaces 上也掛了線上 demo。幾個小時內,它就成為 AI 實務圈熱議的頭條。原因很簡單:這篇論文瞄準了一項幾乎沒有人編列預算的成本——AI 代理「記住事情」的代價。

問題:你的記憶系統話太多了

長時間運行的代理——跨月的編程助手、跨年的個人助理——需要持久記憶:偏好、事件、跨 session 的關聯。但尷尬的現實是,多數現代記憶架構把一本大帳交給大型自回歸 LLM 來管。每次寫入、連結或檢索記憶時,系統都要請一個生成式模型好好想一想:這條記憶跟誰有關?我該去哪裡找?證據夠了嗎?

這樣做行得通,卻把 token 生成——整個技術棧裡最昂貴的單一操作——放到了本質上是「決策」而非「寫作」的操作關鍵路徑上。記憶建構動輒數十分鐘;查詢要花好幾秒;成本隨代理的歷史長度一路膨脹。論文的措辭很直接:這些系統「依賴自回歸 LLM 來控制記憶的組織、檢索與使用,把昂貴的生成放進了記憶操作的關鍵路徑」。

架構:三層平面,一條分工原則

Jev-Mem 的解法借用了 Daniel Kahneman 對快思考與慢思考的經典區分,並在系統層讓它字面成真:

  • System One——控制平面。 一個小型、非生成式的決策模型(Jev)負責所有高頻判斷:記憶分型、建構時的關係推斷、跨圖視圖的查詢路由、檢索預算分配、候選評分,以及最關鍵的適應性停止——判斷證據何時足夠。它不寫文章,只做分類與路由。
  • 記憶平面——結構化、多關係。 每條標準化觀察保留原文、時間戳與出處,並同時參與四種重疊的圖視圖——語義、時間、因果、實體——由向量與關鍵字索引支撐。預設設定保留每一條有效觀察,所以寫入當下看不出重要性的細節,日後仍找得回來。
  • System Two——推理平面。 傳統 LLM(論文評測中用的是 GPT-4o-mini)只在需要複雜推理與最終答案綜合時才被喚醒。

值得整段抄走的設計原則是:貴的模型只看證據;便宜的模型跑完整個搜尋。 檢索變成一個迴圈——向量與關鍵字搜尋給出錨點,控制器挑選圖視圖、分配遍歷力氣、為新候選評分,並在證據足夠或繼續搜尋的期望價值低於門檻時停下來。

對在乎 production 的讀者來說,兩個實作細節特別顯眼。第一,Jev 的決策以型別化輸出暴露——二元命題(“Noul”)與類別選擇(“Choice”)——再由普通程式碼驗證並強制執行圖與檢索的上限。第二,每次執行都會產出可檢視的軌跡:路由決策、預算、停止原因、快取命中、fallback 事件。對於曾經靠讀生成文字 log 來除錯記憶系統的人,光這一點就是生活品質的革命。

數字

在 LoCoMo 長對話基準上,以 GPT-4o-mini 為答題模型、LLM-as-a-Judge 評分:

方法總分 ↑建構時間(秒)↓查詢延遲(秒)↓
Full Context0.481無1.74
A-MEM0.5803,6362.26
MemoryOS0.5533,27632.68
Nemori0.5901,0442.59
MAGMA0.7001,4041.47
Jev-Mem0.7771580.93

三個頭條數字:相對最強基準 MAGMA 有 0.077 絕對值(11.0% 相對) 的品質提升;相對最快的競爭系統 Nemori,記憶建構加速 6.6 倍(158 秒 vs 1,044 秒);相對最快的基準,查詢延遲降低 36.7%(0.93 秒 vs 1.47 秒)。

分類細項比總分更有意思。Jev-Mem 在五種題型中的四種領先——多跳(0.623)、開放域(0.618)、單跳(0.802)與對抗題(0.962);MAGMA 保住時間題王座(0.650 對 0.637)。但對抗題那個數字值得停下來看:設計來誘使代理錯誤回憶的題目,Jev-Mem 拿 0.962,而整段歷史塞滿上下文窗只有 0.205。一套比「全文塞窗」更能抵抗操弄的記憶系統,正是你要讓代理長期持有易受攻擊語境時所需要的——想想會讀入不可信 repo 的編程代理,或讀你 email 的助理。

脈絡與但書

Jev-Mem 落地在一個擁擠的賽場。A-MEM、MemoryOS、Nemori、MAGMA、Mem0,加上一整個「記憶」向量儲存產業,都在搶代理記憶這一層;2026 年的基準文獻也變得夠挑剔——近期的 survey 批評基準飽和、指標效度有問題、以及一堆分數漂亮但每次查詢燒掉 26,000 token 的系統。在這個背景下,Jev-Mem 的貢獻與其說是「更好的記憶」,不如說是「更好的記憶治理模型」:以前要花一次前沿模型生成的決策,現在只花一次分類。

誠實的但書:LoCoMo 只是一個基準,LLM-as-a-Judge 有已知的偏誤;評測只配了一種答題模型(GPT-4o-mini),骨幹敏感性在報告結果中未經檢驗;GitHub README 也坦白說明,公開的執行指令「本身無法重現論文的完整評測」。論文的數字是作者的測量,還不是獨立重製。

不過方向是對的。推理經濟學越來越有利於用小型非生成決策模型處理代理工作中那 95% 的路由與閘門——這是 Jev 生態系整個月以來一直在建立的論點,Laya 等競爭者如今也從開源端加以驗證。Jev-Mem 是迄今最清楚的示範:「System One」模型可以接管代理技術棧的一整個子系統,而不只是一個分類器位置。

如果你在跑持久代理,158 秒的建構時間與秒下的查詢延遲,就是你該拿來檢驗自家記憶層的標尺。論文、程式碼與 demo 今天都已上線。

資料來源