0
| 本文作者: 陳淑瑜 | 2026-07-21 11:36 | 專題:IJCAI:國際人工智能聯合會議 |
來源:公眾號“應用機器學習”
原文鏈接:https://mp.weixin.qq.com/s/orC_RX6lDrBMmZrJkByv0w?scene=1&click_id=34
論文介紹
論文題目: Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization (ICML Spotlight)
作者:Junyi Li, Xiaowei Qian, Yingyi Zhang, Wenlin Zhang, Guojing Li, Sheng Zhang, Xiao Han, Yichao Wang, Xiangyu Zhao
論文概述:
現有工具集成語言智能體已能借助搜索引擎、Python 解釋器等外部工具完成復雜推理任務,但主流強化學習對齊方法往往過度關注最終答案準確率,忽視工具調用效率、推理成本與過程級決策質量,導致模型在實際部署中可能出現冗余調用、資源浪費或效率—性能失衡等問題。為此,本文提出 ParetoPO,一種面向工具增強的大模型智能體的兩階段多目標優化框架,旨在同時提升任務表現與工具使用效率。第一階段通過超體積引導的動態標量化方法,根據 Pareto 前沿的全局推進情況自適應調整不同目標的獎勵權重,從而更充分地探索準確率與效率之間的多樣化權衡;第二階段進一步引入基于 Pareto 排名的優勢估計機制,利用非支配排序對軌跡進行 dominance-aware 信用分配,使策略更新更加偏向 Pareto 最優行為,而不依賴固定的線性獎勵組合。實驗覆蓋數學推理與多跳問答任務,結果表明,ParetoPO 相比 ToRL-GRPO、OTC-GRPO、MO-GRPO、Search-R1 等基線方法,能夠在保持甚至提升答案準確率的同時顯著減少工具調用次數,展現出更優的準確率—效率 Pareto 權衡能力。消融實驗和訓練動態分析進一步驗證了動態標量化與 Pareto 排名優化的互補作用,說明該方法為高效、可控的工具增強智能體訓練提供了一種有效范式。
代碼鏈接:https://github.com/Applied-Machine-Learning-Lab/ICML2026_ParetoPO

論文題目:T-GINEE: A Tensor-Based Multilayer Graph Representation Learning (ICML)
作者:Maolin Wang , Xuhui Chen, ZiTing Mai, Zhiqi Li, Tianshuo Wei, Yutian Xiao, Wenlin Zhang, Wanyu Wang, Ruocheng Guo, Haoxuan Li, Zenglin Xu, Xiangyu Zhao
論文概述:針對現實世界中多層網絡(Multilayer Networks)分析現有方法往往獨立處理各層或簡單聚合,未能有效捕捉層間復雜依賴關系且缺乏嚴謹理論支撐的問題,本文提出 T-GINEE,一種基于張量的廣義多層圖估計方程框架。該方法結合張量CP分解與廣義估計方程(GEE),通過共享潛在因子顯式建模跨網絡相關性,并利用工作協方差矩陣處理層間依賴。T-GINEE 在溫和條件下建立了估計的一致性和漸近正態性理論保證。在合成數據及多個真實世界數據集(包括社交、生物及大規模網絡如DBLP和Stack Overflow)上的實驗表明,T-GINEE 在鏈路預測等任務中顯著優于現有的張量分解及矩陣分解基線方法,且在處理百萬級節點的大規模稀疏網絡時具有良好的可擴展性。。
代碼鏈接:https://github.com/Applied-Machine-Learning-Lab/ICML2026_T-GINEE

論文題目:Message Tuning Outshines Graph Prompt Tuning: A Prismatic Space Perspective (ICML)
作者:Yancheng Chen, Dun Ma, Shuai Zhang, Yang Liu, Xixun Lin, Xiangyu Zhao , Wenguo Yang, Wei Chen, Chuan Zhou
論文概述:針對圖基礎模型(GFMs)適配中主流的圖提示微調(Graph Prompt Tuning)方法缺乏嚴格的適應能力度量標準,且僅在輸入空間操作導致受限于凍結主干網絡的“棱鏡效應”壓縮問題,本文提出棱鏡空間理論(PS-Theory),用于量化適配方法的容量并確立圖提示微調的理論上限。基于此理論,本文進一步提出消息微調(Message Tuning for GFMs, MTG),一種輕量級適配方法,通過在GNN主干的每一層注入可學習的消息原型(Message Prototypes)來動態引導消息融合,而不更新預訓練權重。理論證明 MTG 的適配容量可超越圖提示微調的理論上限。在ProG基準上的廣泛實驗顯示,MTG 在少樣本節點/圖分類任務中一致優于最先進的圖提示基線方法,并展現出更強的魯棒性和更低的負遷移率。
代碼鏈接:https://anonymous.4open.science/r/MTG

論文題目:PoemDirector: A Multi-Agent Context-Adaptive Instructional Mode Selection Framework for Chinese Classical Poetry Video Generation (IJCAI)
作者:Tengteng Cheng, Xiaoli Zeng, Jialu Huang, Mingliang Hou, Zitao Liu, Xiangyu Zhao, Weiqi Luo
論文概述:針對中國K-12教育中古典詩詞教學視頻制作成本高、現有自動化方法缺乏系統性教學設計導致解釋淺顯且邏輯不清的問題,本文提出 PoemDirector,一種面向古典詩詞視頻生成的多智能體上下文自適應教學模式選擇框架。該框架受現實創意團隊啟發,以導演智能體(Director Agent)為認知核心,根據詩詞內容和情境創建結構化的創意藍圖,并協調視覺設計、旁白合成及視頻編輯等專用智能體協同工作。PoemDirector 引入了三層教學法解釋結構(字面、意象、主題)和上下文自適應的模式選擇機制,解決了高質量教學與大規模生產之間的沖突。實驗結果表明,該方法在顯著降低人力成本的同時,在解釋深度、知識準確性及詩意意象還原等多項指標上優于基線方法,甚至接近人工制作視頻的水平。
代碼鏈接:https://anonymous.4open.science/status/poem_dataset-1B40

本專題其他文章