0
| 本文作者: 叢末 | 2026-07-07 18:45 | 專題:ICML:國際機器學習會議 |

2026 年 7 月 6 日上午,第 43 屆國際機器學習大會(ICML 2026)在韓國首爾 COEX 會展中心正式拉開帷幕。作為機器學習領域全球最具影響力的學術盛會之一,本屆會議吸引了超過 11000 名來自世界各地的研究人員齊聚首爾。開幕式現場人潮涌動,參會者擠滿了 COEX 的展廳與報告廳,場面極為熱鬧。

本屆ICML創下了歷史性的投稿紀錄——共收到 23918 篇有效投稿,較2025年的 12107 篇翻了一倍。最終,會議共接收了 6352 篇論文,錄用率為26.6%。其中,536篇論文入選Spotlight 論文(占投稿總數 2.2%),僅168篇獲得Oral報告資格(僅占0.7%)。
在投稿規模與錄用數量雙雙破紀錄的背后,曾有一個小插曲給學術界帶來了一點“小震撼”:497 篇論文在評審階段被直接“桌拒”(Desk Reject),占投稿總數的約 2%。
事件的導火索是 ICML 組委會在審稿意見中檢測出 795 處違規使用大語言模型(LLM) 撰寫評審意見的行為,涉及 506 名審稿人。根據ICML于今年1月發布的同行評審新規——若審稿人未能履行職責,其名下所有投稿論文均可能被直接拒稿。因此,組委會對這批既是違規審稿人又是投稿人的 497 篇論文,予以了一刀切的拒稿處理。

截圖自https://blog.icml.cc/2026/03/18/on-violations-of-llm-review-policies/
據 ICML 官方回應,他們并非全面禁止在審稿中使用AI工具,而是要求嚴格遵守相關政策。然而,此次被處罰的審稿人,均是在簽署了“不使用LLM”協議的前提下依然違規使用,且未作任何標注。為鎖定違規行為,組委會在提交的 PDF 論文中嵌入了水印,并采用了“更為復雜的綜合研判手段”,而非依賴單一的AI檢測器。
這一“連坐”式的嚴厲處罰旋即引發激烈爭議。支持者認為這是捍衛學術誠信的必要手段;反對者則質疑AI檢測器存在誤報風險,可能導致無辜學者被“冤殺”,并尖銳地提出:如果審稿意見本身質量過硬,是否真的有必要追究其是否由 AI 撰寫?
這場關于“工具”與“誠信”的爭論,至今仍在發酵。但風波之外,ICML 2026 現場人聲鼎沸,Panel、Tutorial 等議程此刻正接踵召開,ICML 2026 各項大獎也重磅出爐。
▎杰出論文獎(Outstanding Paper Award)
首先引人關注的是本屆會議的杰出論文獎(Outstanding Paper Award),共有兩篇當選。

《The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models》這篇出自清華大學黃高教授團隊的論文,對擴散語言模型(dLLMs)的固有設計理念發起了一次深刻的“靈魂拷問”。
長期以來,dLLMs因其能夠以任意順序生成token而備受推崇,被認為具有更大的靈活性。
然而,黃高團隊通過大量實驗發現了一個反直覺的現象:在數學推理、編程等通用推理任務中,這種“順序自由”反而成了性能的拖累。模型會利用這種靈活性“逃避”生成高不確定性的關鍵token,導致解空間過早坍縮,無法探索更優的解。團隊將這一現象命名為 “靈活性陷阱”。
更令人稱道的是,他們提出的解決方案 JustGRPO,極簡卻有效:在強化學習階段,強制模型放棄復雜的任意順序策略,僅使用標準的從左到右自回歸順序,也就是群組相對策略優化(Group Relative Policy Optimization, GRPO) 進行訓練。
實驗結果顯示,該方法在 GSM8K(512)數學推理基準上達到 89.1% 的準確率,在 MATH-500(512)上達到 45.1%,且完整保留了dLLMs的并行解碼能力,不犧牲推理速度。

這篇論文的最大亮點在于其批判性與顛覆性——它敢于挑戰“靈活性越大越好”的行業共識,用嚴謹的理論分析和實驗證據,揭示了一個被普遍忽視的失效模式,并以一個干凈利落的方法加以解決。這充分體現了華人團隊敏銳的洞察力和扎實的工程實現能力。
來自MIT和耶魯大學的論文《High-Accuracy Sampling for Diffusion Models and Log-Concave Distributions》從理論層面解決了擴散模型采樣的一個長期懸而未決的核心難題:在僅擁有不完美的分數估計(score estimates)時,能否用極少的采樣步驟達到高精度?這篇論文的作者給出了肯定的答案,并提出了一種全新的用于擴散模型采樣的算法,在能夠訪問 ?(δ)-精度的 L2 得分估計(score estimates)的前提下,僅需 polylog(1/δ) 步即可實現 δ-誤差。這是對所有先前結果的指數級改進,意味著模型達到同樣高精度所需的計算量大幅減少。
論文給出了三種不同數據假設下的具體復雜度界限:
最小假設:?( d · polylog(1/δ) ),僅依賴數據維度 d;
非均勻 Lipschitz 條件:?√(dL) polylog(1/δ) ,利用分布的光滑性進一步加速;
內在低維結構:若數據分布具有內在維度 d,復雜度可降至 ?( d · polylog(1/δ) ),實現維度自適應。
值得一提的是,該算法不僅適用于擴散模型,還首次實現了僅靠梯度評估即可達到 polylog(1/δ) 復雜度的通用對數凹分布采樣。這為貝葉斯推斷、統計采樣等廣泛依賴對數凹分布抽樣的領域提供了理論上的突破性工具。
獲得杰出論文榮譽提名(Outstanding Paper Honorable Mention)的論文有五篇,均在各自領域作出了突出貢獻。

論文《The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes》,在RLVR(Reinforcement Learning with Verifiable Rewards,帶可驗證獎勵的強化學習) 背景下研究如何通過白盒欺騙探測器促使AI系統變得誠實。論文作者提出通過強 KL 正則化與檢測器懲罰來有效抑制混淆行為,并在真實代碼環境中驗證了該方法的可靠性。
論文《Motion Attribution for Video Generation》聚焦視頻生成模型訓練數據如何影響生成內容的運動特性這一空白,提出Motive框架,通過運動加權損失掩碼,將視頻中的時間動態與靜態外觀分離開來,利用基于梯度的歸因方法篩選關鍵數據,在VBench上獲得74.1%的人類偏好勝率。
論文《How much can language models memorize?》探討了語言模型能記憶多少訓練數據的問題,提出了一個基于模型參數數量與訓練數據量比例的理論框架來量化記憶能力,發現GPT類模型的記憶容量約為每參數3.6比特, 語言模型的記憶容量大致與模型參數數量成正比,且存在"臨界比例"——當訓練數據量超過模型參數量的某一倍數后,模型會開始遺忘而非繼續記憶新數據。
論文《A Random Matrix Perspective on the Consistency of Diffusion Models》利用隨機矩陣理論,系統解釋了擴散模型在不同數據子集上訓練后仍能生成相似樣本的“一致性”現象。作者將模型簡化為線性情形,通過確定性等價方法精確刻畫了有限數據集對生成輸出的影響,發現輸出主要由數據的共享高斯統計量(均值和協方差)決定,而數據子集的隨機波動僅通過三個因素(數據各向異性、輸入噪聲結構、樣本量)影響生成差異。理論預測不僅能精確匹配線性擴散模型,還能在UNet和DiT等深度架構中定性驗證,從而為擴散模型的訓練可重復性、泛化性和數據效率提供了首個理論基線。
論文《To Grok Grokking: Provable Grokking in Ridge Regression》首次為“Grokking”現象提供了嚴格的數學證明,將這一經驗觀察提升到理論可解釋的高度。通過在過參數化的嶺回歸模型中建立端到端的理論框架,論文不僅精確刻畫了模型從過擬合到泛化的三階段動態過程,更首次量化了“Grokking延遲時間”與學習率、權重衰減等超參數之間的定量界限,從而從理論上證明了通過調節超參數可以有原則地控制甚至消除該現象,并表明Grokking并非深度學習的固有缺陷,這為理解和預測模型泛化行為提供了全新的理論工具。
▎杰出立場論文獎(Outstanding Position Paper Award)
本屆ICML的立場論文賽道同樣競爭激烈,最終獲得杰出立場論文獎的是《Position: The Alignment Community is Unintentionally Building a Censor’s Toolkit》

這篇立場論文將矛頭直指AI安全與對齊研究中的一個令人不安的趨勢。作者指出,當前AI對齊領域的研究者,出發點雖是善意的,卻在無意中構建了一套可用于大規模審查的工具包。作者認為,當前對齊研究開發的許多技術——如內容過濾、意圖檢測、價值觀約束、輸出干預等——本質上具備高度通用性,既能用于防止有害輸出,也極易被挪用于政治審查、信息控制和言論壓制。
論文挑戰了“價值對齊天然是向善力量”的舒適假設,警示即使是最具人文關懷的AI安全技術,也可能被挪用于監控和內容過濾,并呼吁對齊研究者正視這一雙重用途困境,在技術開發中嵌入反審查設計原則,并推動更透明的治理機制,以避免本意良善的安全研究淪為壓制自由的幫兇。
作為一篇立場論文,它不依賴實驗數據,而是以嚴謹的邏輯和犀利的分析,對領域方向提出了根本性質疑,體現了ICML鼓勵批判性思辨的初衷。
《Position: AI/ML Deepfake Research is Misaligned with AI Generated Non-Consensual Intimate Imagery (AIG-NCII)》則獲得杰出立場論文榮譽提名(Outstanding Position Paper Honorable Mention)。

論文揭示了當前 AI/ML 領域在“深度偽造(deepfake)”研究上存在嚴重的“錯位(misalignment)”。研究發現,目前絕大多數技術干預都聚焦于檢測“深度偽造”內容的真偽,以應對其帶來的認知性傷害(epistemic harms),例如防范公眾人物的虛假視頻、打擊欺詐和詐騙等。然而,這種研究重心與現實世界中生成式AI最主要的濫用形式是脫節的——后者是以性化圖像為特征的AI生成的非自愿親密圖像(AIG-NCII)。
論文進一步提出了“以觀看者為中心的認知性傷害(viewer-centric epistemic harms)”與“以受害者為中心的尊嚴傷害(subject-centric dignity harms)”的關鍵區分,并指出,僅僅知道一張圖像是合成的,并不能減輕對受害者的實際傷害,在某些情況下甚至可能加劇這種傷害。
為此,它呼吁研究界應將重點轉向AIG-NCII這類以受害者尊嚴為核心的傷害(subject-centric dignity harms) ,并建議更新威脅模型、將相關問題納入AI安全研究。同時也提醒研究者,在涉足這一高風險領域時必須與相關專家合作并建立安全防護措施。
▎時間檢驗獎(Test of Time Award)

ICML 的時間檢驗獎(Test of Time Award )授予"發表十年后仍對領域產生深遠影響"的論文。今年摘下這頂王冠的是深度強化學習領域的經典之作——《Asynchronous Methods for Deep Reinforcement Learning》。
這篇論文由 Google DeepMind 團隊于 2016 年發表在 ICML 上,第一作者 Volodymyr Mnih 是深度強化學習領域的奠基人之一,此前還領導了 DQN 的開創性工作。研究團隊匯集了 Alex Graves、David Silver 等頂尖學者,代表了當時 RL 研究的最強陣容。
論文針對深度強化學習訓練效率低下的核心瓶頸:DQN 等算法嚴重依賴 GPU 硬件和經驗回放機制,導致訓練成本高、內存開銷大,且難以擴展到連續動作空間。當時即便是最先進的并行方案也需要復雜的多機分布式架構,普通研究者也難以復現。

為此,論文團隊提出了異步多線程訓練框架 A3C,讓多個智能體在獨立環境副本中并行探索,并無鎖地異步更新共享全局網絡。這一設計徹底摒棄了經驗回放,僅依靠多核 CPU 即可實現高效訓練,同時天然支持連續控制任務。論文還系統比較了四種異步變體,其中結合優勢函數的 A3C 表現最優。

實驗結果還表明,A3C 在 57 款 Atari 游戲上僅用 16 核 CPU 就達到了超越 DQN 的性能,且訓練速度顯著提升;并在連續運動控制和3D迷宮導航等任務中表現出卓越的通用性。更深刻的發現是,異步更新引入的梯度噪聲本身起到了去相關作用,這一反直覺的洞察為后續理論分析開辟了新方向。
這篇論文的經典性在于,它顛覆了“穩定訓練必依賴經驗回放”的傳統認知,以極簡的工程設計解決了復雜的分布式訓練難題,將深度強化學習從 GPU 集群推向了個人工作站,奠定了此后十年深度強化學習并行采樣范式的基礎,深刻影響了后續分布式訓練與強化學習應用的架構設計。
時隔十年,這項工作的價值非但沒有褪色,反而在分布式RL的浪潮中被反復印證,時間檢驗獎即是最好的證明。
ICML 2026 不僅是一場技術突破的慶典,更是一次對 AI 研究方向的集體反思。從黃高團隊對“靈活性陷阱”的警醒,到立場論文對“無意中構建審查工具”的批判,這場盛會的核心追問已超越算法與精度本身:機器學習,究竟為誰,為何而做?
未來一周,COEX會展中心將迎來更多前沿思想的碰撞,雷峰網 AI 科技評論記者將在現場為大家帶來更多一線報道,敬請關注!雷鋒雷峰網 雷峰網(公眾號:雷峰網)
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。