0
| 本文作者: 陸毅 | 2026-07-08 17:48 | 專題:ICML:國際機器學習會議 |
ICML 2026現場:8篇論文,從LoRA收斂到VLM"說而不看"
7月8日,機器學習領域最具影響力的頂級學術會議ICML 2026進入正會第二天。本次大會共接收6352篇論文,其中Spotlight論文536篇(占投稿總數的 2.2%),Oral 論文168篇 (僅占投稿總數的 0.7 %)。
作為機器學習領域最頂級的學術會議之一,ICML 今年的 Spotlight 論文涵蓋了從圖像美學評估到無線電信號理解、從3D生成到Agent優化等多個前沿方向。
雷峰網(公眾號:雷峰網)與 AI 科技評論記者在現場為大家帶來一線報道,從 536 篇 Spotlight 論文中精選 8 篇代表作,涵蓋優化理論、智能體評測、強化學習、多模態理解、數據選擇、長上下文推理與數學評估等方向,帶你一文速覽機器學習最前沿的研究風向。(如果你也想讓你的研究成果出現在這里,請與我們聯系)
Online Conformal Prediction via Universal Portfolio Algorithms
在線保序預測(Online Conformal Prediction, OCP)是機器學習領域一個經典問題——如何在保證預測區間長期覆蓋率的同時,生成信息量最大的預測區間。然而,現有方法在學習率調節和特定算法分析上存在明顯局限,往往需要手動調參且適用范圍有限。研究團隊通過對線性化遺憾的理論分析,發現其控制機制直接影響預測區間的覆蓋率,這為方法的通用性和理論基礎提供了關鍵支撐。
基于這一發現,研究團隊提出了 UP-OCP 框架,巧妙地將預測問題轉化為兩資產組合選擇問題,借助普適投資組合算法實現無參數的在線保序預測。這一設計擺脫了對人工調參的依賴,讓方法具備更廣泛的適用性。在多個實驗驗證中,UP-OCP 在區間大小與覆蓋率的權衡上均優于現有基準方法,展現出卓越的泛化能力。
該研究的核心貢獻在于發展了一套通用的覆蓋率理論,首次提出了無需手動參數調節的在線保序預測方法,并通過實驗充分驗證了其廣泛適用性和優越性能,為在線學習領域的預測置信度研究開辟了新的路徑。

論文鏈接:https://arxiv.org/abs/2602.03168
VenusBench-Mobile: A Challenging and User-Centric Benchmark for Mobile GUI Agents with Capability Diagnostics
移動 GUI 智能體近年來發展迅速,但現有基準測試過于以應用為中心且任務單一,無法反映真實移動設備使用場景的多樣性與不穩定性。研究團隊敏銳地觀察到,當前智能體在真實環境中的感知與記憶能力存在顯著缺陷,且對環境變化極度脆弱,而現有基準恰恰掩蓋了這些關鍵不足。
為此,團隊構建了 VenusBench-Mobile——一個更具挑戰性且以用戶為中心的評測基準。該基準以用戶意圖為驅動進行任務設計,建立了基于能力的標注體系,并通過細粒度行為分析全面評估智能體性能。大量實驗表明,現有最先進的智能體在 VenusBench-Mobile 上性能顯著落后于傳統基準,揭示了更真實但復雜的任務及評估方法帶來的全新挑戰。
VenusBench-Mobile 為移動 GUI 智能體的魯棒性和真實環境適應能力評估提供了重要基準,為其可靠的實際部署鋪平了道路,也為智能體研究社區指明了從實驗室走向真實世界的方向。

論文鏈接:https://arxiv.org/abs/2604.06182
LASER: Learning Active Sensing for Continuum Field Reconstruction
在稀疏和受限的傳感條件下,實現連續物理場的高保真測量對科學研究與工程設計至關重要。然而,傳統方法通常依賴靜態或離線優化的傳感策略,在面對復雜的連續物理場時缺乏彈性,難以高效捕捉關鍵信息,更無法適應動態物理狀態的變化。
研究團隊提出了 LASER 框架,將主動感知建模為部分可觀測馬爾科夫決策過程(POMDP),利用連續場潛在世界模型和強化學習策略,在潛在狀態空間中模擬多種傳感場景以動態調整傳感器位置。這一閉環設計打破了固定傳感器布局的局限,使系統能夠根據物理場的實時變化自適應地優化信息采集策略。
通過多個不同連續物理場的實驗驗證,LASER 在稠密和稀疏條件下均顯著優于靜態和離線優化傳感方法,表現出一致的高保真重建能力。該研究提出了首個將主動感知與連續場重建相結合的閉環方法,利用潛在世界模型和強化學習的創新策略,實現了動態、高效的高保真連續場重建,為科學觀測和工程監測領域提供了全新的技術范式。

論文鏈接:https://arxiv.org/abs/2604.19355
On the Convergence Rate of LoRA Gradient Descent
LoRA(低秩適配)算法因其在低參數量條件下高效微調大模型的能力而備受青睞,但其梯度下降的收斂性因缺乏 Lipschitz 平滑性條件,長期以來尚未被清晰理解。當前理論主要集中于漸近性分析或假設強界限條件,而 LoRA 算法在真實使用場景中的行為未得到充分解釋。
為避免強加人工約束,該研究首次對真實場景中的 LoRA 梯度下降算法進行了非漸近性收斂分析。研究團隊重新表述了適配器矩陣的外積問題,使用修正的下降引理處理類似 Lipschitz 性質,并嚴格控制步長參數。通過數值實驗,研究結果與理論預測高度一致,驗證了 LoRA 梯度下降能夠以 O(1/log T) 的速率收斂。
該研究首次在無假設情況下證明了 LoRA 梯度下降的非漸近性收斂性,補充了重要的理論空白并提供了實踐指導。這一理論突破不僅為 LoRA 算法的超參數調優提供了科學依據,也為低秩適配方法在更大規模模型中的應用奠定了堅實的理論基礎。

論文鏈接:https://arxiv.org/abs/2512.18248
Are vlms seeing or just saying? uncovering the illusion of visual re-examination
視覺語言模型(VLMs)在推理過程中常常生成自我反思性語句,如"讓我再仔細看看這張圖片",但這些語句是否真正觸發了視覺再檢查?研究團隊發現,這一現象尚不明確,模型可能只是在利用學習的文本模式"表演"思考,而非真正依賴視覺信息。
實驗結果令人警醒:模型在檢測視覺變化時表現極差,準確率下降高達 60%,且"思考型"模型的脆弱性是"指令型"模型的 3 倍,模型尺度擴展也無助于改善視覺語義匹配能力。研究團隊提出 VisualSwap 框架,在模型生成推理后替換為語義不同但視覺相似的圖像,以此評估模型是否真正識別變化;同時設計了 VS-Bench 基準測試集,從 MathVista 等 4 個數據集創建 800 對圖像對,深入測試了 Qwen3-VL、Kimi-VL、ERNIE-VL 等主流模型。
該研究揭示了一個令人擔憂的現象:現有 VLMs 存在"說而不看"的問題,證明用戶指令交互能提升視覺信息利用,但自反性語句本身無效。通過注意力機制分析,研究進一步揭示了模型的視覺注意力分配問題,為多模態模型的真實視覺理解能力評估敲響了警鐘。

論文鏈接:https://arxiv.org/abs/2605.15864
OPUs: Towards Efficient and Principled Data Selection in Large Language Model Pre-Training in Every Iteration
大語言模型預訓練正從追求更多數據轉向追求更高質量的數據,但現有數據選擇方法存在明顯短板:靜態過濾過于依賴啟發式方案,動態方法又無法充分結合優化器特點。與此同時,高質量公共文本資源日益枯竭,LLM 訓練亟需從關注數據量轉變為關注數據質量。
研究團隊提出動態框架 OPUS,通過優化器誘導的更新空間定義數據效用,并使用 Ghost 技術結合 CountSketch 和 Boltzmann 采樣,確保計算效率和數據多樣性。這一設計將數據選擇過程與訓練動態緊密耦合,讓每一輪迭代都能自適應地篩選最有價值的數據。在 GPT-2 Large/XL 的 FineWeb 和 FineWeb-Edu 數據集上,30B token 訓練中 OPUS 顯著超越基線;在 Qwen3-8B-Base 上,僅用 0.5B token 即可優于完整 3B token 訓練,展現出驚人的跨領域數據高效性。
OPUS 提供了一種能結合動態訓練和優化器特性的高效數據選擇框架,不僅提升了跨規模和領域的數據利用效率,還對工業級預訓練基線產生了顯著優化效果,為 LLM 預訓練的數據策略提供了新的方法論指導。

論文鏈接:https://arxiv.org/abs/2602.05400
IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference
大語言模型的長上下文推理能力日益重要,但標準的軟注意力機制導致 KV 緩存隨序列長度線性增長,成為嚴重的性能瓶頸。現有的 KV 驅逐策略大多為啟發式方法,難以捕捉輸入依賴型的重要性分布,且驅逐操作導致不可逆的信息丟失,極大影響長距離的注意力檢索性能。
研究團隊提出了 IndexMem,包含一個可學習的索引模塊預測 KV 重要性,同時設計輕量級潛在記憶模塊壓縮被驅逐的 token,以殘差形式補償注意力損失。這一雙重機制既保留了關鍵信息,又有效控制了緩存規模。在 RULER、LongBench 等基準測試中,通過 Qwen、Mistral 和 Llama 等模型驗證,IndexMem 在高強度驅逐下實現了高達 25 點的性能提升,同時保持了穩定的長距離檢索能力。
該研究提出了結合可學習索引器和潛在記憶模塊的 KV 管理方法,高效進行長上下文推理,顯著提升了大語言模型的性能和魯棒性,為長上下文 LLM 的推理優化提供了實用的技術方案。

論文鏈接:https://arxiv.org/abs/2605.25475
Judging What We Cannot Solve: A Consequence-Based Approach for Oracle-Free Evaluation of Research-Level Math
當前推理模型在研究級數學問題上取得顯著進展,但驗證過程耗費大量專家時間,成為制約發展的瓶頸。研究團隊觀察到,正確解答應包含足夠的解題方法信息,可用于提升解決相關可驗證問題的效果,而錯誤解答則無法實現這一點——這一差異為自動化評估提供了突破口。
研究團隊提出了一種基于后果的評估指標,通過測試候選解作為上下文示例在相關問題中的表現來評分,完全不依賴于外部驗證者。這一設計巧妙地將評估問題轉化為一個自舉過程:好的解答能夠幫助模型解決更多相關問題,而差的解答則無此效果。研究團隊構建了包含研究級數學問題、專家解答及生成解答的數據集,實驗結果表明,該方法在排名質量和評估準確性上均顯著優于獎勵模型和語言模型評估器。
該研究引入了一種無專家依賴的新型評估方法,在大規模語言模型上實現了顯著性能提升,為數學推理任務的解答評估提供了一種通用框架,有望大幅降低研究級數學問題評估的成本和門檻。

論文鏈接:https://arxiv.org/abs/2602.06291
以上 8 篇論文從理論、方法、評測到應用,展現了 ICML 2026 的多元前沿圖景。雷峰網與 AI 科技評論將持續在現場為大家帶來更多一線報道,如有遺漏或希望進一步交流,歡迎聯系我們!
一個人讀論文太孤單,一群人刷頂會才好玩。
ICML 2026 召開在即,我們正在召集一波含金量極高的 AI 研究者。群內主打實時論文跟蹤與硬核技術探討,拒絕灌水。
? 進群傳送門: 掃碼進群或添加微信Vin_Vivid,備注:論文群 + 關注的 AI 方向。

搞科研/搞技術,信息差很重要。
來,一起快人一步!
上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。