0
| 本文作者: 陳淑瑜 | 2026-07-08 15:43 | 專題:ICML:國際機器學習會議 |
作為機器學習領域最頂級的學術會議之一,ICML 今年的 Spotlight 論文涵蓋了從圖像美學評估到無線電信號理解、從3D生成到Agent優化等多個前沿方向。
雷峰網(公眾號:雷峰網)已派出報道小組赴首爾COEX會展中心參會。在會議現場,我們從Poster展區的數千張學術海報中精選出最具代表性的研究成果,以“一張圖 + 一段解讀”的方式呈現給未能親臨現場的讀者。
以下精選Poster Session 3 九篇Spotlight論文,一文看盡AI研究最值得關注的方向。(如果你也想讓你的研究成果出現在這里,請與我們聯系):
圖像美學評估(IAA)的目標是預測一張圖的整體美學分數,但美學本身由多個屬性共同決定——構圖、色彩、光影、語義內容……不同屬性的相對重要性隨圖像內容和用途而變。然而,作者發現一個令人驚訝的現象:多個主流IAA模型在相同的困難樣本子集上集體失敗,形成穩定的誤差聚類。這是優化層面的系統性偏差影響了評估效果
深入分析后,作者揭示了根源:在端到端訓練中,共享參數的方式讓不同屬性主導的樣本產生方向相反的梯度信號,彼此部分抵消,導致代表性不足的屬性子集持續難以優化。這種“梯度沖突”現象在多種IAA基線模型中一致存在。
為此,作者提出AGREE(Attribute-guided Gradient Routing for Establishing Agreement),一個即插即用的框架。AGREE通過四個互補機制——屬性解耦、語義錨點、敏感性路由和誤差感知重加權,在參數、特征、樣本和損失四個層面緩解梯度沖突。無需額外監督或架構修改,AGREE在5個數據集×6個基線模型上均取得一致提升,整體SRCC最高提升4.8%,困難樣本SRCC最高提升38.5%。

論文鏈接:https://openreview.net/forum?id=GrIs035ec3
2. PhotoAgent:用大視覺模型做探索式美學規劃
PhotoAgent: Exploratory Visual Aesthetic Planning with Large Vision Models
生成模型的快速發展讓指令驅動的圖像編輯展現出巨大潛力,但編輯質量高度依賴用戶精心設計的提示詞——用戶需要自行拆解編輯任務、安排操作順序、逐步給出指令。這種“手動編排”的方式把專業門檻全部推給了用戶。
PhotoAgent重新思考了圖像編輯的范式:將自主圖像編輯建模為一個長期決策問題。它不再依賴用戶逐步提示,而是自動推理用戶的美學意圖,通過樹搜索規劃多步編輯動作,并在閉環執行中利用記憶和視覺反饋迭代優化結果。整個過程就像一位專業的修圖師在自主判斷和調整。
為了支持可靠的評估,作者還構建了UGC-Edit美學評估基準(7000張照片+學習型美學獎勵模型)和包含1017張照片的測試集。實驗證明,PhotoAgent在指令遵循度和視覺質量上均持續優于基線方法,讓普通用戶無需編寫復雜提示即可獲得專業級修圖效果。

論文鏈接:https://openreview.net/forum?id=Ws8swqL5ob
3. RelaxFlow:文本驅動的非模態3D生成
RelaxFlow: Text-Driven Amodal 3D Generation
圖像到3D生成在遮擋場景下面臨固有語義歧義,即僅憑部分觀測往往不足以判斷物體類別。例如一張只露出杯柄的圖片,杯子可能是陶瓷杯、玻璃杯,甚至是一個裝飾花瓶。如何補全被遮擋的部分?用戶應該有權表達自己的意圖。
作者正式定義了“文本驅動的非模態3D生成”任務:文本提示引導不可見區域的補全,同時嚴格保持輸入觀測的視覺保真度。關鍵洞察在于,這兩個目標需要不同的控制粒度:對可見區域需要剛性控制(不許改),對文本引導區域則需要松弛的結構控制(允許創造)。
RelaxFlow是一個無需訓練的雙分支框架,通過多先驗一致性模塊和松弛機制解耦控制粒度。理論上,作者證明了松弛機制等價于對生成向量場施加低通濾波器,抑制高頻細節以隔離與觀測兼容的幾何結構。同時,作者引入了ExtremeOcc-3D和AmbiSem-3D兩個診斷基準。實驗證明RelaxFlow成功引導不可見區域的生成以匹配提示意圖,同時不犧牲視覺保真度。

論文鏈接:https://openreview.net/forum?id=UamxHbDR3p
4. Vision2Web:視覺網站開發的層級化基準
Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification
大語言模型提升了編碼Agent的能力,但對端到端網站開發的系統性評估仍然有限。現有基準往往只關注單一層面(如UI轉代碼),缺少從靜態頁面到全棧開發的完整覆蓋和有效驗證手段。
Vision2Web提出了一個層級化基準,涵蓋三個難度層次:靜態UI轉代碼生成、交互式多頁前端復現、長時序全棧網站開發。基準從真實網站構建,包含193個任務、16個類別、918張原型圖像和1255個測試用例。為支持靈活可靠的評估,作者還提出工作流式Agent驗證范式,結合GUI Agent驗證器和VLM評判器兩個互補組件。
對多個視覺語言模型在不同編碼Agent框架下的評估揭示了關鍵發現:在各任務層級上都存在顯著性能差距,即使最先進的模型在全棧開發任務上仍然表現不佳。這為后續研究指明了方向,端到端網站開發仍是Agent能力的重大挑戰。

論文鏈接:https://arxiv.org/abs/2603.26648
5. CLEAR:端到端無遮罩視頻字幕去除
CLEAR: Context-Aware Learning with End-to-End Mask-Free Inference for Adaptive Video Subtitle Removal
視頻字幕去除在內容本地化和媒體再編輯中至關重要,但現有基于擴散模型的方法在訓練和推理階段都需要顯式的字幕遮罩序列,嚴重限制了實際部署。獲取精確遮罩本身就很費時費力,這讓“去掉字幕”這件看似簡單的事變得復雜。
CLEAR提出了一種無遮罩框架,實現真正的端到端推理。兩階段設計將先驗提取與生成細化解耦:第一階段通過雙編碼器上的自監督正交約束學習解耦的字幕表示;第二階段基于LoRA適配結合生成反饋機制實現動態上下文調整。值得注意的是,CLEAR僅需基礎擴散模型0.77%的參數量進行訓練。
在中文字幕基準上,CLEAR以+6.77dB PSNR和-74.7% VFID大幅優于依賴遮罩的基線方法。更令人驚喜的是,它展現出強大的零樣本泛化能力,在英語、韓語、法語、日語、俄語、德語六種語言上均表現優異,無需任何語言特定訓練。

論文鏈接:https://openreview.net/forum?id=HszNb2xE7P
6. ParetoPO:多目標優化讓工具Agent不止追求準確率
Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization
工具集成語言Agent在復雜推理任務上的能力顯著提升,但現有對齊方法幾乎只關注最大化任務準確率,忽視了工具使用效率等輔助目標。在實際部署中,一個準確率很高但每次調用十幾個工具的Agent,可能不如一個準確率稍低但只需兩三次工具調用的Agent實用。準確率和效率之間的平衡至關重要。
ParetoPO是一個兩階段多目標優化框架。第一階段利用超體積引導的動態標量化,根據全局Pareto前沿進展自適應調整獎勵權重;第二階段用基于Pareto排序的優勢計算替代標量化學習信號,通過支配感知的信用分配促進非支配軌跡,實現跨多個沖突目標的細粒度、動作級優化。
在數學推理和多跳問答任務上的實驗表明,ParetoPO相比靜態和啟發式基線方法,能持續發現具有更優準確率-效率權衡的策略。這項工作為Agent的實用化部署提供了新的優化思路——不只追求“做得對”,更要追求“做得好且做得快”。

論文鏈接:https://arxiv.org/abs/2606.16111
7. PWC-Diff:從去噪到去信道,擴散模型理解無線電信號
From Denoising to De-Channeling: Integrating Physical Channel Priors into Diffusion Models for Radio Signal Understanding
無線信號識別(WSR)利用AI識別被動接收的無線電信號屬性,在頻譜管理等領域有廣泛應用。但現有WSR方法通常直接從接收信號中學習,而這些信號已被物理無線信道(如衰落)嚴重失真。就像戴著模糊眼鏡看世界,只能識別到扭曲后的幻影。
更關鍵的是,當前的去噪擴散模型只具備“去噪”能力,缺乏“去信道”能力,它們能去掉隨機噪聲,卻無法消除物理信道造成的系統性失真。這是一個范式層面的缺口。
PWC-Diff將物理無線信道先驗顯式整合到擴散過程中,實現從“去噪”到“去信道化”的升級。核心架構FusedFormer包含融合模塊和自注意力模塊,聯合捕獲信號在整個擴散軌跡中的時域和頻譜特征,逐步“去信道化”恢復出更接近原始發射信號的表示。在三個WSR任務的多個數據集上取得SOTA性能,理論和消融實驗均驗證了有效性。

論文鏈接:https://openreview.net/forum?id=NUerSGt9wn
8. PaperBanana:給AI科學家自動畫論文插圖
PaperBanana: Automating Academic Illustration for AI Scientists
基于語言模型的自主AI科學家發展迅猛,但生成可出版的學術插圖仍是研究工作流程中勞動密集型的瓶頸。寫論文時,實驗跑完了、文字寫完了,插圖(方法流程圖、架構示意圖、統計圖表……)卻要花大量時間手繪——這讓“AI科學家”的全流程自動化卡在了最后一步。
PaperBanana是一個面向學術插圖自動生成的智能體框架,由最先進的VLM和圖像生成模型驅動。它協調專業化的Agent完成參考檢索、內容與風格規劃、圖像渲染,并通過自批評機制迭代精煉,就像一個會自我審查的插圖助理,不斷改進直到達到出版標準。
為嚴謹評估,作者構建了PaperBananaBench基準,包含292個方法流程圖測試案例,數據來源于NeurIPS 2025出版物。實驗表明PaperBanana在忠實度、簡潔性、可讀性和美觀度四個維度上均持續優于基線方法,還可有效擴展到高質量統計圖表的生成。這項工作為AI科學家全流程自動化補上了關鍵的“插圖缺口”。

論文鏈接:https://openreview.net/forum?id=FneePKFVHT
9. CoCLD:從不規則事件學習耦合連續時間潛在動態
Learning Coupled Continuous-Time Latent Dynamics from Irregular Events
從不規則采樣的事件序列中建模動態依賴關系是現代機器學習的根本性挑戰。現實中,個體層面的狀態隨時間連續演化,同時受到群體層面分布動態的影響:一個用戶的購買行為既受個人偏好驅動,也受市場趨勢影響。但現有方法要么孤立建模個體或群體,要么依賴離散時間近似,無法捕捉長程時序不規則性和稀疏觀測。
CoCLD(Coupled Continuous-Time Latent Dynamics)框架首次在連續時間潛在空間中聯合建模個體潛在動態和群體層面的分布變化,并將二者對齊。它整合了基于擴散的潛在插值器和神經常微分方程(Neural ODE),能在任意時間點實現潛在狀態的有原則插值、生成和對齊。理論上,作者證明了耦合機制在稀疏和不規則觀測下能給出連續時間潛在動態的一致估計量。
實驗涵蓋下一事件預測、移動軌跡生成和序列行為建模等多種任務,CoCLD均展現出有效捕捉動態依賴的能力。這項工作為不規則事件序列建模開辟了新范式——不再割裂個體與群體,而是在連續時間的統一框架中理解二者耦合的動態演化。

論文鏈接:https://openreview.net/forum?id=HfQ0X1lTGg
從圖像美學中的梯度沖突到擴散模型的去信道化,從自主修圖Agent到學術論文插圖自動化——這9篇Spotlight論文展示了AI在不同領域的多元突破。
無論是讓模型更精準地理解美、更高效地使用工具,還是在遮擋中補全3D、在不規則事件中捕捉動態,這些工作都在拓展AI能力的邊界。
雷峰網&AI科技評論將繼續在現場帶來更多ICML 2026的精彩內容,如果你想推薦ICML上的其他論文,歡迎聯系我們進一步交流探討 。
一個人讀論文太孤單,一群人刷頂會才好玩。
ICML 2026 召開在即,我們正在召集一波含金量極高的 AI 研究者。群內主打實時論文跟蹤與硬核技術探討,拒絕灌水。
? 進群傳送門: 掃碼進群或添加微信Vin_Vivid,備注:論文群 + 關注的 AI 方向。

搞科研/搞技術,信息差很重要。
來,一起快人一步!
上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。