0
| 本文作者: 陸毅 | 2026-07-20 11:20 | 專題:ICML 2019 |
ICML 2026現(xiàn)場 | 天氣數(shù)據(jù)壓縮566倍、表格推理僅用萬張圖,八篇Spotlight速讀
過去幾年,AI的進(jìn)步往往伴隨著暴力的“大鍋燉”——把海量數(shù)據(jù)一股腦塞進(jìn)模型,指望它自己頓悟。但這招在應(yīng)對復(fù)雜真實(shí)世界時(shí),正變得越來越低效。
在正在進(jìn)行的 ICML 2026 上,我們從數(shù)百篇 Spotlight 論文中敏銳地捕捉到了一個(gè)新風(fēng)向:AI 正在告別“混沌”,學(xué)會像人類一樣進(jìn)行結(jié)構(gòu)化思考與“解耦”。
當(dāng) AI 學(xué)會“骨肉分離”,它只需 1 萬張圖就能看懂復(fù)雜表格的版式與內(nèi)容;當(dāng)它學(xué)會像人類一樣區(qū)分“我看到的”和“我推斷的”,長程多模態(tài)推理便不再輕易斷片;當(dāng)它像工程師一樣在腦海中建立 3D 正交視角,空間智能的鴻溝被瞬間跨越;而當(dāng)氣象數(shù)據(jù)被抽絲剝繭遷入隱空間,原本需要數(shù)百 TB 算力的天氣預(yù)測被驚人地壓縮了 566 倍。
雷峰網(wǎng) & AI科技評論記者在首爾現(xiàn)場,為您速遞這 8 篇極具啟發(fā)性的 Spotlight 代表作。它們證明了一件事:在算力見頂?shù)慕裉欤鼉?yōu)雅的底層解構(gòu),才是通向更強(qiáng)智能的真正鑰匙。
World-Model Inspired Emotion-aware Token RefinementICML for Training-Free Multimodal Emotion Recognition
多模態(tài)大語言模型在情感識別(MER)方面展現(xiàn)出潛力,但往往不夠可靠——稀疏的情感線索容易被冗余上下文淹沒。雖然微調(diào)有效但成本高昂,而鏈?zhǔn)剿季S推理等無訓(xùn)練方法雖提供了實(shí)用替代方案,卻大多依賴啟發(fā)式提示來影響模型行為,并未在內(nèi)部明確關(guān)注與情感相關(guān)的Token,導(dǎo)致決策相關(guān)的情感Token被環(huán)境噪聲稀釋,產(chǎn)生不穩(wěn)定的預(yù)測。
為在不訓(xùn)練的前提下解決這一限制,研究者從世界模型的視角重新思考MER,將情感視為從嘈雜和冗余的多模態(tài)觀測中推斷出的潛在狀態(tài)。在參數(shù)凍結(jié)的情況下,模型的魯棒性取決于對Token如何以及為何參與推理進(jìn)行約束。基于這一洞察,該方法通過情感感知的Token精煉機(jī)制,在推理過程中動態(tài)調(diào)整Token的參與方式,使與情感決策相關(guān)的Token獲得更高的權(quán)重。
實(shí)驗(yàn)表明,該方法在多個(gè)多模態(tài)情感識別基準(zhǔn)上取得了顯著提升,且無需任何訓(xùn)練即可生效。這一工作為"無訓(xùn)練增強(qiáng)多模態(tài)情感識別"開辟了新路徑,證明了從世界模型視角重新審視情感推理的巨大價(jià)值。

論文鏈接:https://openreview.net/forum?id=ViQO8FlRFR
Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance
大型視覺語言模型(LVLM)在表格圖像推理上面臨嚴(yán)峻挑戰(zhàn),根因在于表格的復(fù)雜布局以及結(jié)構(gòu)與內(nèi)容信息的緊密耦合。現(xiàn)有解決方案要么依賴大量標(biāo)注的監(jiān)督微調(diào)或強(qiáng)化學(xué)習(xí)(成本高、易遺忘),要么需要外部工具(增加延遲和系統(tǒng)復(fù)雜度)。更關(guān)鍵的是,這些方法將結(jié)構(gòu)標(biāo)記和內(nèi)容標(biāo)記混在同一個(gè)序列中,迫使模型學(xué)習(xí)糾纏信號,導(dǎo)致跨布局泛化能力差、樣本效率低。
該研究提出了"骨肉分離"的核心思想——將表格的結(jié)構(gòu)(行列布局、層級關(guān)系)與內(nèi)容(單元格語義)解耦學(xué)習(xí)。訓(xùn)練階段,DiSCo框架通過單元格匿名化技術(shù),讓模型僅從視覺線索中學(xué)習(xí)表格結(jié)構(gòu),同時(shí)通過全局摘要和局部坐標(biāo)查詢學(xué)習(xí)內(nèi)容語義,僅需1萬張表格圖像即可完成對齊。推理階段,Table-GLS框架采用"全局結(jié)構(gòu)探索→子表提取→證據(jù)驅(qū)動推理"三步鏈,無需專門的推理訓(xùn)練或外部工具。
在21個(gè)表格理解與推理基準(zhǔn)上的實(shí)驗(yàn)表明,該框架僅用1萬張對齊數(shù)據(jù)即顯著超越依賴8.2萬至9.7萬標(biāo)注的SFT/RL基線方法,尤其在未見表格結(jié)構(gòu)上展現(xiàn)出強(qiáng)大的泛化能力。這一工作為LVLM表格推理提供了"低標(biāo)注、無工具"的新范式。

論文鏈接:https://arxiv.org/abs/2602.03491
Dual-Latent Memory Routing for Vision-Language Reasoning
多模態(tài)大語言模型(MLLM)在視覺語言推理上取得了長足進(jìn)步,但隨著生成長度增加,性能往往出現(xiàn)退化。一個(gè)關(guān)鍵因素是:在單一增長的上下文中,模型常常丟失早期視覺證據(jù)和中間約束。這類似于人類在處理復(fù)雜任務(wù)時(shí),如果無法有效區(qū)分"看到的"和"推斷出的"信息,就容易出現(xiàn)推理鏈條斷裂。
受人類分別回憶"所見"和"所推"的啟發(fā),DLMR為MLLM配備了雙潛記憶機(jī)制:視覺記憶壓縮圖像證據(jù),推理記憶追蹤中間結(jié)論和約束。一個(gè)路由器在推理過程中動態(tài)決定復(fù)用哪種記憶以及復(fù)用多少,在保持視覺錨定的同時(shí)維持連貫的長程推理。DLMR通過三階段訓(xùn)練(潛記憶構(gòu)建→選擇性路由學(xué)習(xí)),僅引入少量可訓(xùn)練參數(shù),基座MLLM保持凍結(jié)。
實(shí)驗(yàn)表明,DLMR在通用基準(zhǔn)和推理基準(zhǔn)上均取得顯著提升。進(jìn)一步分析揭示了可解釋的、狀態(tài)依賴的路由模式:視覺記憶和推理記憶各司其職,該設(shè)計(jì)有效減少了冗余解碼,提升了長程生成的Token效率。這一工作為"讓MLLM記住該記住的"提供了優(yōu)雅的解決方案。

論文鏈接:https://openreview.net/forum?id=SFWWUr9V7c
Just Noticeable Difference Modeling for Deep Visual Features
深度視覺特征正日益成為視覺系統(tǒng)中的通用接口——在端云部署中,特征在設(shè)備端提取后傳輸用于下游推理;在基礎(chǔ)模型和多任務(wù)流水線中,模塊通過深度特征進(jìn)行組合復(fù)用。然而,當(dāng)需要壓縮、量化或降采樣中間特征以滿足帶寬和延遲約束時(shí),簡單的均方誤差等度量無法反映任務(wù)級別的真實(shí)影響——同樣大小的失真在不同位置可能導(dǎo)致截然不同的下游性能下降。
受圖像處理領(lǐng)域"恰可分辨差異"(JND)概念的啟發(fā),該研究提出FeatJND——一種與任務(wù)對齊的深度特征JND公式,能夠預(yù)測在保持下游任務(wù)性能的前提下,每個(gè)特征的最大可容忍擾動圖。研究者設(shè)計(jì)了標(biāo)準(zhǔn)化分割點(diǎn)上的FeatJND估計(jì)器,并在圖像分類、目標(biāo)檢測和實(shí)例分割三個(gè)任務(wù)上進(jìn)行了驗(yàn)證。
實(shí)驗(yàn)表明,在匹配的失真強(qiáng)度下,基于FeatJND的失真始終比無結(jié)構(gòu)高斯擾動保持更高的任務(wù)性能,歸因可視化顯示FeatJND能有效抑制非關(guān)鍵特征區(qū)域。作為應(yīng)用展示,該方法被進(jìn)一步應(yīng)用于逐Token動態(tài)量化,在相同噪聲預(yù)算下,F(xiàn)eatJND指導(dǎo)的步長分配顯著優(yōu)于隨機(jī)排列和全局均勻步長。這一工作為"特征質(zhì)量控制"提供了首個(gè)實(shí)用且理論有據(jù)的框架。

論文鏈接:https://arxiv.org/abs/2601.21933
3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models
當(dāng)前大語言模型已達(dá)到奧林匹克級別的邏輯推理能力,然而視覺語言模型卻在積木計(jì)數(shù)等基礎(chǔ)空間任務(wù)上頻繁出現(xiàn)反常的失敗。這種能力不匹配揭示了一個(gè)關(guān)鍵的"空間智能鴻溝"——模型無法從2D觀察中構(gòu)建連貫的3D心理表征。通過診斷分析,研究者發(fā)現(xiàn)瓶頸不在于視覺特征不足或推理能力薄弱,而在于缺乏一個(gè)視角一致的空間接口。
3ViewSense框架將空間推理建立在正交視角之上,借鑒工程認(rèn)知領(lǐng)域的做法,提出"模擬與推理"機(jī)制:將復(fù)雜場景分解為規(guī)范的正交投影以解決幾何歧義問題。通過將自我中心感知與非自我中心參考進(jìn)行對齊,該方法實(shí)現(xiàn)了顯式的心理旋轉(zhuǎn)與3D重建,使模型能夠像工程師一樣從多視角理解空間結(jié)構(gòu)。
實(shí)驗(yàn)結(jié)果表明,3ViewSense在空間推理基準(zhǔn)測試中顯著優(yōu)于現(xiàn)有基線方法,在遮擋密集的計(jì)數(shù)任務(wù)和視角一致的空間推理上均取得持續(xù)提升。這一工作不僅精準(zhǔn)定位了VLM空間推理的瓶頸,更為多模態(tài)系統(tǒng)中更強(qiáng)的空間智能提供了一條可擴(kuò)展的路徑。

論文鏈接:https://arxiv.org/abs/2603.07751
Mind Your Margin and Boundary: Are Your Distilled Datasets Truly Robust?
數(shù)據(jù)集蒸餾旨在將大規(guī)模訓(xùn)練數(shù)據(jù)壓縮為少量高效合成樣本,但現(xiàn)有方法大多只優(yōu)化干凈準(zhǔn)確率,對魯棒性缺乏控制。已有的魯棒蒸餾方法雖然提升了對抗魯棒性,但往往在準(zhǔn)確率與魯棒性之間存在權(quán)衡:要么干凈準(zhǔn)確率下降過多,要么在強(qiáng)攻擊下仍然崩潰。研究者發(fā)現(xiàn)兩個(gè)結(jié)構(gòu)性缺陷:一是將所有對抗樣本一視同仁,忽略了真正決定魯棒風(fēng)險(xiǎn)的"小間隔"困難樣本;二是未顯式增加決策邊界附近攻擊集中區(qū)域的類間分離度。
C2R框架從"魯棒間隔"和"決策邊界"兩個(gè)關(guān)鍵角度重新審視蒸餾數(shù)據(jù)的安全性。首先,從魯棒鉸鏈損失出發(fā)推導(dǎo)出擾動得分,近似每個(gè)樣本的魯棒間隔,據(jù)此設(shè)計(jì)攻擊感知課程學(xué)習(xí),優(yōu)先優(yōu)化間隔最小、最易被攻擊的對抗樣本。同時(shí),類平衡的對比魯棒性損失在保證對抗不變性的同時(shí),顯式拓寬決策邊界處的類間分離。為控制計(jì)算成本,該方法還引入了基于線性搜索的PGD攻擊生成策略。
在CIFAR-10/100、Tiny-ImageNet和多個(gè)ImageNet-1K子集上、面對六種攻擊的實(shí)驗(yàn)表明,C2R取得了最佳魯棒準(zhǔn)確率,平均比此前最優(yōu)魯棒蒸餾方法高出2.8%。這一工作為安全敏感場景下的數(shù)據(jù)集蒸餾提供了更可靠的技術(shù)基礎(chǔ)。

論文鏈接:https://arxiv.org/abs/2605.20606
Transforming Weather Data from Pixel to Latent Space
深度學(xué)習(xí)在天氣預(yù)報(bào)、降尺度、降水預(yù)測等任務(wù)中取得顯著進(jìn)展,但大多數(shù)方法直接在像素空間中對天氣數(shù)據(jù)建模,面臨三大挑戰(zhàn):模型輸出容易過平滑,不利于極端天氣事件的刻畫;模型通常只能適用于單一氣壓-變量子集(PVS),缺乏跨場景適應(yīng)能力;像素級天氣數(shù)據(jù)動輒數(shù)百TB甚至PB級,存儲和計(jì)算成本極為高昂。
該研究提出Weather Latent Autoencoder(WLA),將天氣數(shù)據(jù)從高維像素空間轉(zhuǎn)換到統(tǒng)一隱空間。核心創(chuàng)新包括:通過Pressure-Variable Unified Module將不同氣壓-變量組合映射到統(tǒng)一表示,實(shí)現(xiàn)跨場景適應(yīng);將天氣重建與下游任務(wù)解耦,使任務(wù)模型在低成本隱空間中直接訓(xùn)練和預(yù)測,避免像素空間中重建與預(yù)測的互相干擾。基于此,研究團(tuán)隊(duì)構(gòu)建了ERA5-Latent數(shù)據(jù)集。
實(shí)驗(yàn)結(jié)果令人矚目:WLA將原始ERA5數(shù)據(jù)從約244.34 TB壓縮至約0.43 TB,壓縮比達(dá)566倍,同時(shí)下游任務(wù)模型在隱空間中以更低的數(shù)據(jù)成本取得了優(yōu)于像素空間模型的性能。這一工作為大規(guī)模氣象數(shù)據(jù)的高效建模開辟了全新范式,具有深遠(yuǎn)的科學(xué)和工程價(jià)值。

論文鏈接:https://arxiv.org/abs/2503.06623
Distributional Inverse Reinforcement Learning
傳統(tǒng)逆強(qiáng)化學(xué)習(xí)(IRL)通常恢復(fù)確定性獎勵(lì)估計(jì)或僅匹配期望回報(bào),忽略了專家行為中更豐富的結(jié)構(gòu)信息。然而在許多真實(shí)場景中,獎勵(lì)本質(zhì)上是隨機(jī)變量——在機(jī)器人接觸豐富的任務(wù)中,相同狀態(tài)-動作對的回報(bào)表現(xiàn)出高方差;在神經(jīng)科學(xué)中,多巴胺信號在相同行為下也呈現(xiàn)顯著的跨試次偏度。僅匹配期望會將均值相同但方差、偏度、尾部截然不同的兩個(gè)獎勵(lì)分布視為等價(jià),使高階結(jié)構(gòu)對IRL目標(biāo)"不可見"。
DistIRL提出了一種分布式框架,同時(shí)建模獎勵(lì)函數(shù)的不確定性和回報(bào)的完整分布。核心創(chuàng)新在于用一階隨機(jī)優(yōu)勢(FSD)替代期望差異來約束"專家優(yōu)于學(xué)習(xí)者"的關(guān)系——FSD不僅蘊(yùn)含期望優(yōu)勢,還適用于任何單調(diào)效用函數(shù)。對于策略側(cè),不可觀測的FSD指示函數(shù)被松弛為可計(jì)算的失真風(fēng)險(xiǎn)度量(DRM),形成風(fēng)險(xiǎn)敏感的策略目標(biāo)。該方法通過基于能量的模型和變分推斷學(xué)習(xí)獎勵(lì)分布。
理論分析證明了算法的O(ε-2)迭代復(fù)雜度收斂性。在合成基準(zhǔn)、真實(shí)神經(jīng)行為數(shù)據(jù)和MuJoCo控制任務(wù)上的實(shí)驗(yàn)表明,DistIRL恢復(fù)了更具表達(dá)力的獎勵(lì)表示,并取得了最先進(jìn)的模仿學(xué)習(xí)性能。這是首個(gè)從離線演示中同時(shí)學(xué)習(xí)完整獎勵(lì)分布和分布感知策略的系統(tǒng)性框架。

論文鏈接:https://arxiv.org/abs/2510.03013
從多模態(tài)情感識別到表格推理,從空間智能到天氣建模,從數(shù)據(jù)集蒸餾到逆強(qiáng)化學(xué)習(xí),這八篇Spotlight論文展現(xiàn)了ICML 2026的多元創(chuàng)新面貌。它們或揭示能力鴻溝,或打破數(shù)據(jù)瓶頸,或?qū)⒔?jīng)典理論推廣到全新維度,共同指向一個(gè)趨勢:AI研究正在向更深層的認(rèn)知建模、更高效的資源利用和更魯棒的系統(tǒng)設(shè)計(jì)邁進(jìn)。雷峰網(wǎng)(公眾號:雷峰網(wǎng)) & AI科技評論將持續(xù)為您帶來ICML 2026的現(xiàn)場報(bào)道,敬請關(guān)注。
一個(gè)人讀論文太孤單,一群人刷頂會才好玩。
ICML 2026 召開在即,我們正在召集一波含金量極高的 AI 研究者。群內(nèi)主打實(shí)時(shí)論文跟蹤與硬核技術(shù)探討,拒絕灌水。
? 進(jìn)群傳送門: 掃碼進(jìn)群或添加微信Vin_Vivid,備注:論文群 + 關(guān)注的 AI 方向。

搞科研/搞技術(shù),信息差很重要。
來,一起快人一步!
上車,帶你看遍全球 AI 頂會精華
可獨(dú)家暢覽:
專家演講PPT
大會報(bào)告全文
熱門論文解讀
學(xué)術(shù)新星訪談

掃描上方二維碼
或點(diǎn)擊「閱讀原文」關(guān)注專區(qū)。
雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知。
本專題其他文章