0
| 本文作者: 陳淑瑜 | 2026-06-25 15:30 | 專題:ICML:國(guó)際機(jī)器學(xué)習(xí)會(huì)議 |
來(lái)源:公眾號(hào)“gee AI學(xué)習(xí)室”
原文鏈接:https://mp.weixin.qq.com/s?__biz=Mzg2MjYwOTUzMw==&mid=2247493634&idx=1&sn=d54d1af6c33a449b721913d44eaf03ac&chksm=cfd0759c0800897d4537c37826c4b1e4801a280bd128376f2196835188256c997a68ee8222dc#rd
大語(yǔ)言模型(LLM)智能體的競(jìng)爭(zhēng)重心正在發(fā)生轉(zhuǎn)移。單純的“提示詞工程”已不足以應(yīng)對(duì)復(fù)雜的現(xiàn)實(shí)挑戰(zhàn),行業(yè)開始更加關(guān)注如何賦予智能體在復(fù)雜環(huán)境中“深思熟慮的推理能力”、“主動(dòng)重構(gòu)的長(zhǎng)程記憶”以及“在實(shí)戰(zhàn)中自我進(jìn)化的本能”。
本文精選了近期被機(jī)器學(xué)習(xí)頂級(jí)會(huì)議ICML 2026錄用的三篇重磅論文,分別來(lái)自清華大學(xué)(Deliberate Evolution)、新加坡國(guó)立大學(xué)(MRAgent)、以及北京大學(xué)與智譜AI等(MemoPilot)。這三項(xiàng)研究集中展示了LLM智能體在“探索式推理”、“圖記憶重構(gòu)”以及“測(cè)試時(shí)學(xué)習(xí)強(qiáng)化”三個(gè)關(guān)鍵維度的突破。它們共同打破了當(dāng)前大模型在復(fù)雜任務(wù)和長(zhǎng)程交互中的落地瓶頸,打造了更聰明、更持久、更具成長(zhǎng)性的AI“大腦”。
【亮點(diǎn)速覽】
打破試錯(cuò)低效魔咒:現(xiàn)有的基于LLM的符號(hào)回歸(SR)方法嚴(yán)重依賴標(biāo)量反饋(如均方誤差MSE),導(dǎo)致模型只能像無(wú)頭蒼蠅一樣進(jìn)行低效的“試錯(cuò)”搜索,通常需要評(píng)估上千個(gè)候選公式。清華大學(xué)等團(tuán)隊(duì)指出了核心痛點(diǎn):現(xiàn)有方法將“候選生成”與“搜索引導(dǎo)”混為一談。為此,他們提出了一種專為L(zhǎng)LM設(shè)計(jì)的“深思熟慮進(jìn)化(Deliberate Evolution, DE)”智能體框架,大幅提升了樣本效率。

圖1:標(biāo)量反饋vs深思熟慮的進(jìn)化。
傳統(tǒng)的進(jìn)化方法僅靠標(biāo)量分?jǐn)?shù)(如均方誤差)進(jìn)行盲目的試錯(cuò)搜索(圖b);而DE框架則將方向指導(dǎo)、結(jié)構(gòu)診斷和反思記憶注入到候選公式的生成中(圖c),實(shí)現(xiàn)了從“盲目猜測(cè)”到“精準(zhǔn)修改”的范式轉(zhuǎn)移。
【創(chuàng)新點(diǎn)】
解耦生成與控制的“三駕馬車”機(jī)制:
自適應(yīng)算子(Adaptive Operators):提供方向引導(dǎo)。模型不再盲目變異,而是根據(jù)當(dāng)前搜索狀態(tài)明確選擇是進(jìn)行微調(diào)(Refine)、大幅變異(Mutate)、交叉(Crossover)還是推倒重來(lái)(Regenerate)。
工具增強(qiáng)診斷(Tool-augmented Proposal):提供診斷引導(dǎo)。利用數(shù)據(jù)分析器、殘差診斷和量綱驗(yàn)證器,將干癟的誤差分?jǐn)?shù)轉(zhuǎn)化為具體的結(jié)構(gòu)化修改建議(如:提示模型缺少周期函數(shù))。
反思記憶(Reflective Memory):提供歷史引導(dǎo)。自動(dòng)總結(jié)成功模式和失敗教訓(xùn),避免模型在同一個(gè)坑里反復(fù)跌倒。

圖2:DE(深思熟慮進(jìn)化)系統(tǒng)全景圖。
系統(tǒng)在標(biāo)準(zhǔn)的進(jìn)化循環(huán)中,顯式地解耦了大模型的“生成”與“引導(dǎo)”:(a)自適應(yīng)算子提供方向引導(dǎo);(b)數(shù)據(jù)與殘差分析工具提供診斷反饋;(c)從歷史軌跡中提煉的記憶提供排雷指南。
【成果】
極少算力,極限精度:在LLM-SRBench基準(zhǔn)測(cè)試中,DE框架僅使用了標(biāo)準(zhǔn)樣本預(yù)算的40%,就在物理、化學(xué)、材料科學(xué)等多個(gè)領(lǐng)域全面超越了現(xiàn)有的LLM-SR基線模型(如歸一化均方誤差降低了高達(dá)55%)。此外,模型在面對(duì)噪聲數(shù)據(jù)和分布外(OOD)泛化時(shí)展現(xiàn)出了驚人的魯棒性。
【亮點(diǎn)速覽】
摒棄被動(dòng)檢索(RAG),走向主動(dòng)重構(gòu):當(dāng)前的記憶增強(qiáng)大模型(如傳統(tǒng)的RAG)依賴于“檢索-后-推理”的僵化流水線,無(wú)法根據(jù)推理過(guò)程中的新線索動(dòng)態(tài)調(diào)整檢索方向。新加坡國(guó)立大學(xué)團(tuán)隊(duì)從人類認(rèn)知神經(jīng)科學(xué)中汲取靈感(人類記憶是重構(gòu)的,而非讀取的),提出了MRAgent框架,徹底顛覆了傳統(tǒng)的靜態(tài)內(nèi)存提取模式。

圖3:被動(dòng)檢索與主動(dòng)重構(gòu)的邏輯對(duì)比。
面對(duì)復(fù)雜問(wèn)題,傳統(tǒng)的平面記憶或預(yù)設(shè)圖檢索容易因線索不足而陷入死胡同(右上);而MRAgen的主動(dòng)重構(gòu)機(jī)制(左下)允許大模型根據(jù)中間推理結(jié)果(如推斷出時(shí)間節(jié)點(diǎn)),像滾雪球一樣不斷探索出正確的記憶鏈條。
【創(chuàng)新點(diǎn)】
線索-標(biāo)簽-內(nèi)容(Cue-Tag-Content)關(guān)聯(lián)記憶圖:構(gòu)建了一個(gè)多粒度的異構(gòu)記憶圖,將記憶分為具體的“片段(Episodic)”、抽象的“語(yǔ)義(Semantic)”和宏觀的“主題(Topics)”。
主動(dòng)重構(gòu)機(jī)制(Active Reconstruction):將LLM的推理過(guò)程直接嵌入到記憶訪問(wèn)中。智能體可以像偵探一樣,根據(jù)初始線索找到相關(guān)標(biāo)簽,再根據(jù)標(biāo)簽決定是否深入挖掘具體內(nèi)容,并在多步交互中動(dòng)態(tài)剪枝無(wú)關(guān)路徑,防止信息爆炸。

圖4:MRAgent的聯(lián)想記憶重構(gòu)網(wǎng)絡(luò)。
(a)建立起明確編碼語(yǔ)義關(guān)聯(lián)的Cue-Tag-Content(線索-標(biāo)簽-內(nèi)容)異構(gòu)記憶圖;(b)智能體在面對(duì)查詢時(shí),不直接讀取原文,而是通過(guò)大模型在記憶圖上進(jìn)行多輪動(dòng)態(tài)路由與剪枝,實(shí)現(xiàn)按需的記憶重構(gòu)。
【成果】
降本增效的記憶大師:在LoCoMo和LongMemEval等高難度長(zhǎng)文本記憶基準(zhǔn)測(cè)試中,MRAgent相比強(qiáng)基線模型實(shí)現(xiàn)了高達(dá)23%的性能提升。更令人震撼的是其工程效率:通過(guò)按需重構(gòu),它將每個(gè)樣本的提示詞消耗從A-Mem的632k驟降至118k,大幅降低了代幣消耗和運(yùn)行延遲,真正做到了“又快又準(zhǔn)”。
【亮點(diǎn)速覽】
賦能模型在實(shí)戰(zhàn)中“打怪升級(jí)”:大模型在長(zhǎng)期部署中需要通過(guò)經(jīng)驗(yàn)不斷提升自己(測(cè)試時(shí)學(xué)習(xí),TTL)。然而,現(xiàn)有的記憶更新方法多依賴人工設(shè)計(jì)的提示詞規(guī)則,難以在多步交互中對(duì)齊下游目標(biāo)。北京大學(xué)與智譜AI等機(jī)構(gòu)提出了一個(gè)外掛式的“記憶副駕駛(MemoPilot)”,直接使用強(qiáng)化學(xué)習(xí)來(lái)端到端訓(xùn)練模型的“記憶更新過(guò)程”。
【創(chuàng)新點(diǎn)】
將記憶更新轉(zhuǎn)化為馬爾可夫決策過(guò)程(MDP):創(chuàng)新性地不直接更新LLM玩家的參數(shù),而是用強(qiáng)化學(xué)習(xí)(多輪GRPO)專門訓(xùn)練一個(gè)記憶生成器模型。
精細(xì)的信用分配機(jī)制:引入了“逐回合獎(jiǎng)勵(lì)(turn-wise reward)”和“回合級(jí)優(yōu)勢(shì)估計(jì)(turn-level advantage estimation)”。這解決了長(zhǎng)程博弈中獎(jiǎng)勵(lì)稀疏和隨機(jī)性大的問(wèn)題,讓模型明確知道哪一次的記憶更新帶來(lái)了最終的勝利。

圖5:MemoPilot強(qiáng)化學(xué)習(xí)記憶架構(gòu)。
模型將被動(dòng)記錄轉(zhuǎn)變?yōu)橹鲃?dòng)博弈:獨(dú)立于凍結(jié)狀態(tài)的玩家模型,MemoPilot作為一個(gè)外部插件,專門通過(guò)GRPO強(qiáng)化學(xué)習(xí)算法,在與對(duì)手的多輪交互軌跡中訓(xùn)練其提煉戰(zhàn)略、更新記憶和提供行動(dòng)指南的能力。
【成果】
從新手到大師的無(wú)縫切換:在多輪石頭剪刀布(RPS)和德州撲克(LHE)博弈中,搭載MemoPilot的凍結(jié)LLM玩家勝率飆升,在兩個(gè)游戲中的Elo評(píng)分均位列第一(LHE達(dá)1762,RPS達(dá)1590),遠(yuǎn)超DeepSeek-V3.2和所有基線記憶方法。更強(qiáng)大的是,訓(xùn)練好的記憶模型可以實(shí)現(xiàn)零樣本泛化,即插即用地輔助參數(shù)量大得多的未知強(qiáng)模型(如Qwen3-235B),完美驗(yàn)證了“學(xué)得好不如記的好”的策略優(yōu)勢(shì)。

圖6:測(cè)試時(shí)學(xué)習(xí)(TTL)的統(tǒng)治力與零樣本泛化。
在德州撲克實(shí)測(cè)中,搭載MemoPilot的模型(紅線)在幾局之內(nèi)迅速摸清對(duì)手套路,勝率大幅反超(左圖)。更驚艷的是,這個(gè)經(jīng)過(guò)RL訓(xùn)練的記憶插件可以直接“即插即用”地輔助235B的超大參數(shù)模型(右圖),展現(xiàn)了極強(qiáng)的泛化協(xié)同能力。
看完這三篇論文,我最大的感受是——頂會(huì)論文里那些漂亮的創(chuàng)新,背后都是無(wú)數(shù)次的試錯(cuò)和推倒重來(lái)。Deliberate Evolution的作者在rebuttal里改了三版才把‘自適應(yīng)算子’的邏輯講清楚;MRAgent的團(tuán)隊(duì)為了那個(gè)Cue-Tag-Content圖結(jié)構(gòu),前后迭代了7個(gè)版本……
本專題其他文章