0
| 本文作者: 陳淑瑜 | 2026-07-01 17:30 | 專題:ICML:國際機器學習會議 |
來源:公眾號南方科技大學統計與數據科學系
原文鏈接:https://mp.weixin.qq.com/s?__biz=MzIxOTcxNjU2OA==&mid=2247505650&idx=1&sn=e554aa0fe3630b7c81c622b4e2df77d6&chksm=966f55aa0f7153ad2d3dc512e9a9f78d3b7fa4accf6644dc235f2151bba16eef91869e31ec8a#rd
2026年上半年統計與數據科學系師生作為第一作者/通訊作者在機器學習領域頂會(ICML、ICLR)、計算機視覺領域頂會(CVPR)、自然語言處理領域頂會(ACL)以及人工智能綜合頂會(AAAI)共發表論文34篇,成果覆蓋可信人工智能、人工智能的安全隱私、大模型路由、大語言模型、圖像生成等。
01
面向對抗性干擾的匹配市場多臂老虎機學習
Bandit Learning in Matching Markets Robust to Adversarial Corruptions
Bandit學習框架已廣泛應用于未知偏好匹配市場中的在線學習問題。然而,現有算法通常假設用戶反饋真實可靠,而現實場景中,外部噪聲或惡意干擾往往會污染反饋信號。例如,服務器資源分配中的性能偽裝、廣告投放中的點擊欺詐等,都會顯著影響學習與匹配效果。已有算法在面對擾動反饋時表現極為脆弱:即使只有少量反饋被干擾,也可能導致玩家長期匹配到次優臂。針對這一問題,本文系統研究了存在對抗性擾動的去中心化匹配市場Bandit學習問題。圍繞擾動水平已知與未知兩類場景,本文分別設計了穩健學習算法,從理論上證明所提算法能夠收斂至最優穩定匹配,同時刻畫了學習效率與擾動水平之間的依賴關系。仿真實驗進一步驗證了算法的有效性:與現有基線方法相比,本文所提算法在受污染反饋環境中表現出更強的穩健性。

論文作者:
伍哲舜,左金航,徐增林,孔芳*
會議:
國際表征學習大會2026(International Conference on Learning Representations,ICLR2026)
02
面向多維數據恢復的重參數化張量環函數分解
Reparameterized Tensor Ring Functional Decomposition for Multi-Dimensional Data Recovery
張量環分解是高階數據建模的重要工具,但傳統張量環分解受限于固定網格上的離散表示。為將離散張量分解推廣至連續表示,本文提出一種適用于網格與非網格數據的張量環函數分解框架,通過隱式神經表示對張量環因子進行參數化。然而,該連續框架在優化過程中難以有效捕捉精細尺度信息。針對這一問題,本文從頻域角度揭示其內在原因,并提出重參數化張量環函數分解方法,將每個張量環因子表示為可學習潛張量與固定基矩陣的結構化組合。理論分析表明,該機制能夠改善因子學習的訓練動力學,并提供嚴格的Lipschitz連續性保證。在多種網格與非網格數據恢復任務上的實驗表明,所提方法持續優于現有基準方法。


論文作者:
徐陽洋,柯鈞博,文有為,王超*
會議:
國際計算機視覺與模式識別會議2026 (IEEE/CVF Conference on Computer Vision and Pattern Recognition,CVPR 2026)
03
基于引導式微調與遷移的指令微調語言模型增強方法
GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models
經過指令微調的大語言模型已具備較強的通用能力,但在新任務上繼續微調時,往往容易破壞原有的指令遵循和知識能力。現有遷移式微調方法通常先在基礎模型上學習任務更新,再合并回指令模型,但沒有利用指令模型指導訓練過程。本文提出 GIFT,將指令模型從“合并目標”變為“訓練指導者”:通過指令模型的 token 級置信度重加權于基礎模型的 adapter 訓練,使模型聚焦更可靠的學習信號,再將 adapter 合并回指令模型。實驗表明,GIFT 在數學推理、醫學問答等任務上穩定提升性能,同時保持通用能力與指令遵循能力。該工作已被 ACL 2026 Main Conference 接收。

論文作者:
阮志文,杜逸超,鄭劍杰,王龍躍,陳云,李鵬,蘇勁松,劉洋,陳冠華*
會議:
國際計算語言學協會2026(Annual Meeting of the Association for Computational Linguistics,ACL2026)
04
大模型作為文本世界模型的能力評測
From Word to World: Can Large Language Models be Implicit Text-based World Models?
智能體強化學習近年來快速發展,但制約其進一步擴展的瓶頸正從算力與數據轉向經驗——真實環境交互慢、貴且不可逆,使得世界建模成為關鍵路徑。本文聚焦文本環境,系統探究大語言模型能否充當可靠的隱式世界模型,提出 Word2World 框架,將世界建模形式化為固定交互協議下的多輪 next-state 預測,并構建覆蓋逼真度、可擴展性與智能體效用的三層評估體系。在 ALFWorld、SciWorld、TextWorld、WebShop 與 StableToolBench 五類環境上的大規模實驗表明:訓練對齊后的 7B/8B 模型在結構化環境上長程一致性超過 0.90;用作預執行驗證器可為 GPT-4o 在 WebShop 上帶來 +5.5% 提升,用作強化學習暖啟動則在 SciWorld 上獲得約 15% 增益,充分展示了 LLM 作為智能體可回放經驗放大器的通用價值。

論文作者:
李乙俠,王鴻儒*,裘嘉豪,尹榛菲,張冬冬,錢成,李澤平,馬驍騰,陳冠華*,季姮
會議:
國際計算語言學協會2026(Annual Meeting of the Association for Computational Linguistics,ACL2026)
05
面向跨語言與多評測范式的統一推理獎勵模型
UniRRM: Unified Reasoning Reward Models Across Languages and Evaluation Paradigms
強化學習在開放式生成任務中的核心瓶頸,在于獎勵模型難以同時兼顧可靠性、泛化性與可擴展性。現有方法通常依賴昂貴的閉源模型進行評估,或受限于缺乏可解釋性的黑盒標量獎勵,難以統一多語言與多評估范式。為此,我們提出統一推理式獎勵建模框架 UniRRM,并構建覆蓋六大領域、103 種語言的多語言獎勵數據集 MixReward,統一支持pairwise 與 listwise 評估。UniRRM通過精心設計的分階段推理鏈動態生成任務相關評估標準,實現細粒度、輸入自適應的獎勵判斷。實驗表明,UniRRM 在多個基準上取得接近同規模最先進模型的性能,并對未見評估范式(pointwise)展現出泛化能力。同時,UniRRM 可支撐真實 RL 訓練流程,有效提升復雜推理任務中的性能。

論文作者:
賴鵬,杜逸超,吳俊潮,高維博,岳立楠,王龍躍,駱衛華,Derek F. Wong,陳冠華*
會議:
國際機器學習大會2026(International Conference on Machine Learning,ICML2026)
06
貝葉斯采樣如何增益成員推理攻擊?
How does Bayesian Sampling help Membership Inference Attacks?
成員推理攻擊是為了判斷一條數據是否被制定模型訓練過。本文從貝葉斯采樣的視角切入,把以往主流的成員推理攻擊放到"不確定性度量"這一統一框架下來解釋。本文動機也很直接——成員身份的推斷本質上是一個統計推斷問題, 那么"度量不確定"與"減小不確定"實際上是同一件事。基于此,本文利用貝葉斯神經網絡采樣直接去刻畫這種不確定性, 在成員推理攻擊任務上的效率和效果上都得到了顯著提升。

論文作者:
劉真龍,姜文玉,周峰,魏鴻鑫*
會議:
國際機器學習大會2026(International Conference on Machine Learning,ICML2026)
07
可證明的大語言模型訓練數據識別
Provable Training Data Identification for Large Language Models
LLM數據版權的法律訴訟通常需要提供高信度的證據。之前社區里的觀點普遍認為,成員推理攻擊沒法證明某條版權數據真的進了 LLM 的訓練集。本文的處理方式是放棄逐條判定: 從候選集合里挑出一批疑似被訓練過的樣本,用 conformal inference 給這一選擇過程加上統計保證。挑出來的這批樣本里, 有嚴格理論保證其真正來自訓練集的比例足夠高,為未來大模型數據版權的司法實踐提供統計學證據。

論文作者:
劉真龍,曾浩,黃維然,魏鴻鑫*
會議:
國際機器學習大會2026(International Conference on Machine Learning,ICML2026)
08
RACER:面向大語言模型的風險感知校準高效路由方法
RACER: Risk-Aware Calibrated Efficient Routing for Large Language Models
大語言模型在多模型系統中常具有不同能力,如何為每個問題選擇合適模型,是提升效率與性能的關鍵。針對現有路由方法易誤選單一模型、缺乏可靠風險控制的問題,本文提出風險感知校準高效路由方法 RACER,將模型路由轉化為帶風險約束的集合選擇問題。該方法無需重新訓練基礎模型或路由器,可自適應選擇候選模型集合,并通過結果聚合提升回答質量。實驗表明,RACER 在多類任務上實現穩定風險控制,同時提升下游準確率并減少模型調用開銷。

論文作者:
郝賽,曾浩,魏鴻鑫*,荊炳義*
會議:
國際機器學習大會2026(International Conference on Machine Learning,ICML2026)
09
基于流形投影的流匹配分類器自由引導
Improving classifier-free guidance of flow matching via manifold projection
本文從優化視角重新解析了分類器自由引導(CFG)機制,指出傳統CFG依賴線性外推導致的穩定性問題。研究揭示了流匹配模型速度場與平滑距離函數梯度的內在聯系,并將CFG采樣過程建模為帶流形約束的同倫優化問題。據此,本文提出CFG-MP方法,通過增量梯度下降實現流形投影以增強引導穩定性,并進一步推出CFG-MP+,引入安德森加速顯著提升計算效率與采樣質量。該方案無需重訓練或額外模型評估,并在多個大規模生成模型上驗證。

論文作者:
蔡劍鋒、劉海霞、蘇政逸(南科大大三本科生)、王超*
會議:
國際機器學習大會2026(International Conference on Machine Learning,ICML2026)