來源:公眾號“papertoday”
原文鏈接:https://mp.weixin.qq.com/s/lBR5yh65e_sWeHTxvYlxoQ
最近刷論文,看到美團 LongCat 團隊連發了 3 篇 Agent Skill 技術論文(Skill0、Skill0.5、Skill1),其中 Skill0.5 那個"一半內化、一半外掛"的思路挺有意思——通用技能寫進參數,任務技能留在 prompt,簡單任務還加了反捷徑探測,OOD 場景提升了 13.2%。Agent徹底爆發,美團連發了3篇Skill

01
MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning
MemOCR:面向高效長程推理的版面感知視覺記憶機制
論文下載:https://arxiv.org/abs/2601.21468
論文簡介:長時間跨度的智能體推理需要將不斷增長的交互歷史有效壓縮到有限的上下文窗口中。現有的大多數記憶系統將歷史序列化為文本,其中token級別的開銷是均勻的,且與長度線性增長。為此,我們提出了MemOCR,一種多模態記憶智能體,通過視覺布局實現自適應信息密度的記憶空間分配,從而在緊張的上下文預算下提升長時間跨度推理能力。在長上下文多跳和單跳問答基準測試中,MemOCR優于強文本基線方法,并在極端預算條件下實現了更有效的上下文利用。ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training
ScaleEnv: 從零開始構建可擴展的環境合成系統用于通用交互式工具使用智能體的訓練
論文下載:https://arxiv.org/abs/2602.06820
論文簡介:為智能體配備交互式環境和可驗證任務以進行自我探索,對于培養能夠適應多樣化場景的通用智能體至關重要。我們提出了ScaleEnv,一個完全從零開始構建全交互式環境和可驗證任務的框架。ScaleEnv通過程序化測試確保環境的可靠性,通過工具依賴圖擴展和可執行動作驗證來保證任務的完整性和可解性。在未見過的多輪工具使用基準測試上展示了顯著的性能提升,突顯了強大的泛化能力。AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation
AJ-Bench:面向環境感知評估的智能體裁判基準
論文下載:https://arxiv.org/abs/2604.18240
論文簡介:隨著強化學習不斷推動基于大語言模型的智能體訓練規模化,在復雜環境中可靠地驗證智能體行為變得日益困難。現有方法依賴基于規則的驗證器或 LLM-as-a-Judge 模型,但這些方法難以泛化到狹窄領域之外。Agent-as-a-Judge 通過主動與環境和工具交互以獲取可驗證的證據來解決這一局限性,但其能力仍未得到充分探索。 我們提出了一個基準測試 AJ-Bench,用于系統性地評估"智能體充當評判者"在三個領域——搜索、數據系統和圖形用戶界面——中的表現,涵蓋155個任務和516條標注軌跡。該基準全面評估了評判智能體在信息獲取、狀態驗證和過程驗證方面的能力。實驗表明,相比 LLM-as-a-Judge 基線方法,該方法取得了穩定的性能提升,同時也揭示了基于智能體的驗證中仍存在的重大開放性挑戰。Learning to Self-Verify Makes Language Models Better Reasoners
學習自我驗證使語言模型成為更好的推理者
論文下載:https://arxiv.org/abs/2602.07594
論文簡介:近期的大語言模型在為復雜任務生成有前景的推理路徑方面表現出色,但在驗證自身答案方面仍然薄弱。我們發現學習自我驗證能夠有效提升生成性能,產生更高效的推理軌跡。我們提出了一個多任務強化學習框架,將生成和自我驗證作為兩個獨立但互補的目標進行聯合優化。實驗表明,該方法在生成和驗證能力上均優于僅進行生成訓練的方法。AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition
AgentNoiseBench:噪聲條件下工具使用型大語言模型智能體的魯棒性基準評測
論文下載:https://arxiv.org/pdf/2602.11348
論文簡介:隨著基于大語言模型的智能體越來越多地部署在實際工作流程中,現有的智能體基準測試不足以刻畫智能體在不完美用戶指令和不可靠工具反饋下的魯棒性。我們提出了AgentNoiseBench,一個用于系統評估大語言模型智能體交互式噪聲魯棒性的框架。該基準建模了用戶側指令噪聲和工具側結果噪聲兩種主要噪聲來源,提供模塊化噪聲注入管道和多維度評估指標。通過對25個工具使用模型的評估,發現工具側噪聲通常比用戶側噪聲引起更大幅度的性能下降。V_0: A Generalist Value Model for Any Policy at State Zero
V_0:一種適用于任意策略在初始狀態下的通用價值模型
論文下載:https://arxiv.org/abs/2602.03584
論文簡介:大語言模型的強化學習訓練中的價值模型面臨耦合困境:它們需要與更新中的策略同步訓練。我們提出了V_0,一種通用價值模型,通過將任務重新定義為上下文學習來預測未見策略的性能,從而將價值估計與特定策略參數解耦。實驗結果表明,V_0在GRPO訓練過程中追蹤策略演化方面優于耦合價值模型,能夠優化冷啟動預算分配,并在推理路由中逼近性能-成本的帕累托前沿。LUVE : Latent-Cascaded Ultra-High-Resolution Video Generation with Dual Frequency Experts
LUVE:基于雙頻率專家的潛空間級聯超高分辨率視頻生成
論文下載:https://arxiv.org/abs/2602.11564
論文簡介:為解決超高分辨率視頻生成中連貫性與算力難以兼顧的難題,該論文提出了基于雙頻專家的潛空間級聯框架LUVE。該框架創新性地采用三階段架構:先通過低分辨率生成保障運動一致性;接著利用潛空間上采樣直接提升分辨率,大幅降低內存與計算開銷;最后融合高低頻專家細化高分辨內容,全面增強全局語義與局部細節。實驗表明,LUVE展現出了卓越的逼真度與內容保真度,其核心思想現已成功應用于美團LongCat-Video模型中。Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory
Infinite-World:通過無位姿層次化記憶將交互式世界模型擴展至1000幀
論文下載:https://arxiv.org/abs/2602.02393
論文簡介:Infinite-World 是面向真實場景中的長程交互式世界模型,其目標是在 1000+ 幀生成中保持穩定的視覺記憶和動作響應。針對真實視頻中位姿噪聲大、視角回訪稀少的問題,論文提出三點創新:用無位姿層級記憶壓縮器將歷史 latent 壓縮為固定預算記憶,降低長程建模成本;用不確定性感知動作標注提升噪聲軌跡下的動作學習;再通過高回訪數據微調增強 loop closure 能力。整體上,它讓世界模型更適合從真實視頻學習長時空一致性。WildActor: Unconstrained Identity-Preserving Video Generation
WildActor:無約束身份保持視頻生成
論文下載:https://arxiv.org/pdf/2603.00586
論文簡介:本文提出 WildActor,一種面向無約束身份保留的視頻生成新框架,旨在應對現有方法在動態長鏡頭和視角劇烈切換時面臨的全身體態不一致、面部漂移及姿態僵死偽影。在機制層面,WildActor 構建了含1.6M視頻和18M多視角圖像的大規模數據集 Actor-18M,有效解決原始數據中的正臉偏置;同時引入非對稱身份保留注意力(AIPA)解耦身份與運動生成,并結合身份感知3D旋轉位置編碼(I-ROPE)顯式分離時空 Token,配合視角自適應蒙特卡洛采樣實現了魯棒的任意視角條件控制。實驗表明,WildActor 在新構建的 Actor-Bench 連貫敘事與泛化測試中,不僅全身一致性與文本對齊度顯著超越現有開源及商業大模型,還驗證了其在復雜現實場景下保持物理恒常性的優越性。Navigating the Pareto Frontier of Alignment: Spectrum-Adaptive Fine-Tuning for LLMs
SAFT:面向大語言模型的譜自適應微調方法
論文下載:https://github.com/sjtu-scx/SAFT/blob/main/SAFT.pdf
論文簡介:監督微調常用交叉熵作為目標函數,雖然學習高效,但它并非正確率的光滑近似,還會因為特別關注預測概率低的樣本從而容易對噪音過度擬合并過度自信。DFT則在梯度層面等同優化正確率的光滑近似函數,在保持訓推一致性的同時提升了魯棒性,但也會削弱對可學習的難樣本的學習效率。因此,SFT 與 DFT 構成效率—魯棒性兩個端點,而真實數據應選擇哪種折中取決于其未知的內在 SNR。我們提出輕量的 pre-test protocol:用少量訓練數據分別訓練 SFT/DFT 并在驗證集比較表現,SFT 更優則判定為高 SNR 并選擇幾何插值Geo-SAFT,DFT 更優則判定為低 SNR 并選擇調和插值Har-SAFT。相比仍保留低置信梯度發散的線性插值,SAFT 通過數據自適應的幾何/調和非線性插值匹配不同噪聲 regime,從而獲得更優的魯棒性—效率 Pareto trade-off。TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
TRIP-Bench:真實場景中長時域交互式智能體的基準評測
論文下載:https://arxiv.org/pdf/2602.01675
論文簡介:本論文提出了 TRIP-Bench,一個面向長程交互式 Agent 的旅行規劃評測基準。它基于真實世界數據構建,包含 18 個工具和 40 多類旅行約束,重點考察模型在多輪對話中保持全局約束、調用工具、處理用戶需求變化和方案反復修改的能力。其困難任務最長可達 15 輪用戶交互、150 次以上工具調用,甚至超過 20 萬 tokens 上下文。實驗表明,現有先進模型在該基準上仍表現有限。論文進一步提出 GTPO 多輪強化學習方法,通過獎勵歸一化和輪次級獎勵差分提升模型魯棒性,使 Qwen2.5-32B-Instruct 在評測中超過 Gemini-3-Pro。InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution
InfVSR:面向一致性驅動的流式生成視頻超分辨率
論文下載:https://arxiv.org/pdf/2510.00948
論文簡介:本文提出了 InfVSR,一種面向一致性驅動的流式生成視頻超分辨率新框架,旨在解決擴散式視頻超分方法在長視頻場景中存在的推理效率低、顯存占用大和時序不一致問題。其核心機制包括:將預訓練視頻 DiT 改為因果流式架構,引入滾動 KV 緩存以維持局部過渡平滑性;設計聯合視覺引導通過交叉注意力注入全局語義錨點,抑制累積誤差漂移。訓練階段結合分塊像素監督與跨塊分布匹配,雙重約束時序一致性,并將擴散過程蒸餾為高效單步推理。實驗表明,InfVSR 在多項基準上取得 SOTA 性能,時序一致性顯著領先,推理速度提升 58 倍且長序列顯存占用恒定。DRIVE: Distributional and Retrieval-Augmented Bidding with Value Evaluation
DRIVE:基于混合分布與檢索增強的價值評估出價策略
論文下載:https://arxiv.org/abs/2606.14192
論文簡介:針對標準Decision Transformer (DT)在復雜競價環境中的三大痛點(“平均動作”陷阱、長尾幻覺、缺乏推理優化),提出“生成—檢索—評估”閉環框架:1)用高斯混合模型替代確定性輸出,解決多模態策略坍縮問題;2)引入檢索機制增強長尾場景記憶,避免參數化模型幻覺;3)通過IQL Critic實現閉環擇優,對生成動作與歷史動作進行實時評估。該方案顯著提升決策魯棒性。