0
| 本文作者: 陳淑瑜 | 2026-07-01 16:53 | 專題:ICML:國際機器學習會議 |
來源:公眾號“AI檔案室
原文鏈接:https://mp.weixin.qq.com/s?__biz=MzYzMTgzMzc0OQ==&mid=2247487005&idx=1&sn=aba5951f3eaf1713add63213c205149e&chksm=f1f29758772ac82dc9eeb574fc92c61825700a0a8cd5d91a111952e97d4550e64809b6e6b978#rd
當你在一個項目中和 AI 助手持續協作了幾周,
突然有一天它忘了上次你們定好的截止日期是 5 月 30 日而不是 6 月 1 日,
你會不會有一種「從頭再來」的無奈?
這恰好是當前 AI Agent 面臨的最核心瓶頸之一:
大語言模型本質上是「無狀態」的,每次對話都是從零開始。
長任務中,
信息要么以原始文本碎片堆砌在一起,要么被粗暴壓縮為模糊摘要而丟失關鍵細節。
2026 年 6 月 29 日,
Microsoft Research 正式對外公布了針對這一問題的解決方案:

一個名為 Memora 的 Agent 長期記憶系統。
論文已被 ICML 2026 接收,
arXiv 預印本早在今年 2 月上線,

代碼也已于 6 月 16 日在 GitHub 以 MIT 協議開源。
更值得注意的是,
這套系統在 LoCoMo 和 LongMemEval 兩個主流的 Agent 長期記憶基準上均達到了當前最優水平。
回看現有記憶方案,無論是 RAG(檢索增強生成)還是 Mem0、Zep、GraphRAG,
本質上都陷入了「魚和熊掌不可兼得」的困境。
一類方案直接嵌入提取的事實或文本片段,能保留細節,
卻產生大量孤立、脆弱的條目,喪失敘事連貫性;

另一類方案將全部經驗壓縮為緊湊摘要,雖然高效,
卻把約束條件、邊界情況和數值細節一并丟棄。
基于知識圖譜的方案雖然增加了一層結構,
卻依賴于剛性本體論,難以跨領域泛化。
Memora 的核心洞察在于將「存儲什么」與「如何檢索」這兩件事徹底拆開。
每個記憶條目由三個組件構成:記憶值(Memory Value)完整保留原始信息而不做任何壓縮;
主抽象(Primary Abstraction)是一個 6 到 8 詞的短語,
捕捉記憶的核心內容,作為更新和聚合的單元;
線索錨點(Cue Anchors)則是從記憶中提取的多個短小標簽,
提供從不同角度找到同一條記憶的路徑。
關鍵設計原則是只索引抽象層和線索錨點,
不直接索引原始記憶值,

這樣既保留了完整的細節信息,又避免了直接索引原始內容帶來的噪音。
這套設計在處理真實工作場景中常見的「半結構化、充滿例外」的信息時尤其有優勢。
比如用戶說了一句「Dave 和 Sarah 同意將原型推遲到 4 月 1 日、試點到 5 月 2 日、MVP 到 5 月 30 日」,
傳統知識圖譜需要預定義實體類型和關系,
任何新關系都需要擴展模式;
而 Memora 的做法是生成主抽象「Dave 和 Sarah 就 Orion 項目更新后的時間表達成一致」,
再附加多條線索錨點如「Dave 的 Orion 項目更新」「Orion 項目原型排期」等。
無論后續查詢是「Dave 最近做了什么」還是「原型什么時候交付」,
都能通過不同的錨點路徑導航到同一條底層記憶。
在檢索層面,Memora 同樣跳出了一次性 top-k 語義搜索的慣性思維,
將檢索過程形式化為一個馬爾可夫決策過程(MDP)。
檢索器不是一次性返回最相似的結果,而是在多步交互中逐步調整:
它可以重新表述查詢(Refine)、從關聯記憶中擴展搜索范圍(Expand)、在信息足夠后主動停止(Stop)。
這種策略可以由強模型驅動,也能通過強化學習蒸餾到小型模型。
團隊已經在 Qwen-2.5-3B-Instruct 上驗證了這套訓練方案,
GRPO 訓練后的檢索器準確率達到 0.841,而基礎模型基線僅為 0.836。
論文在附錄中給出了完整的數學證明框架。
傳統 RAG 實際上是 Memora 的一個特例:
主抽象等于原始內容,線索錨點為空,策略只執行一步查詢加停止。
隱式和顯式知識圖譜檢索也同樣被證明是 Memora 的特例。
更重要的是,論文證明了存在某些檢索函數,
無法被固定 top-k 的扁平相似度搜索或固定單種子擴展的知識圖譜檢索所實現,
而 Memora 可以:這賦予了它理論上超越傳統方法的能力。
在 LoCoMo 基準上(平均 600 輪對話,約 20000 個 token,涵蓋單跳、多跳、時間推理和開放域四類任務),
Memora 的策略檢索模式以 0.863 的 LLM-Judge 評分登頂,
顯著優于完整上下文方法(0.825)、Nemori(0.794)、LangMem(0.734)、Mem0(0.653)、RAG(0.633)和 Zep(0.616)。

在 LongMemEval 基準上(500 個問題覆蓋 5 種記憶能力,上下文長達 115000 個 token),Memora 以 87.4% 的準確率大幅領先全上下文推理的 65.6%,
而消耗的上下文 token 從 115000 降到了 2900,減少了約 98%。
在「知識更新」子任務上,Memora 達到 97.4% 的準確率,
而全上下文方法僅為 76.9%;在「時間推理」上也是 89.5% 對 60.2% 的顯著優勢。
在效率方面,每個對話平均只存儲 344 條記憶條目,約為 Mem0(651 條)的一半。
消融實驗還揭示了一個有趣的現象:
策略檢索器優于語義檢索器,但一旦移除線索錨點,這個優勢就消失了:
說明優勢來自錨點提供的多路徑導航能力,而非策略本身的復雜性。
上下文粒度實驗則顯示,
原始片段情景記憶加事實記憶的組合(0.863)優于摘要情景記憶加事實記憶(0.838),再優于僅事實記憶(0.833),證明情景與事實記憶之間存在互補效應。