0
| 本文作者: 陳淑瑜 | 2026-07-28 17:44 | 專題:IJCAI:國際人工智能聯(lián)合會議 |
來源:TJUNLP
原文鏈接:https://mp.weixin.qq.com/s/CSQhDdBV97iaaTl46zUVrg
近期,天津大學(xué)自然語言處理實驗室(TJUNLP)在多個國際頂級學(xué)術(shù)會議上取得佳績,共有4篇論文分別被AAAI 2026、ICML 2026、IJCAI-ECAI 2026和ICASSP 2026接受。研究內(nèi)容涵蓋大模型可解釋性與機(jī)器翻譯、多語言安全對齊、參數(shù)高效微調(diào)、以及大模型安全與后門攻擊等多個前沿方向。
第40屆AAAI人工智能會議(The 40th AAAI Conference on Artificial Intelligence, AAAI 2026)已于2026年1月20日至27日在新加坡舉辦。AAAI是人工智能領(lǐng)域最具影響力的國際學(xué)術(shù)會議之一,是中國計算機(jī)學(xué)會(CCF)推薦的A類國際學(xué)術(shù)會議。
第43屆國際機(jī)器學(xué)習(xí)會議(The 43rd International Conference on Machine Learning, ICML 2026)將于2026年7月6日至11日在韓國首爾舉辦。ICML是機(jī)器學(xué)習(xí)領(lǐng)域的頂級國際學(xué)術(shù)會議,是CCF推薦的A類國際學(xué)術(shù)會議。
第35屆國際人工智能聯(lián)合會議(The 35th International Joint Conference on Artificial Intelligence, IJCAI-ECAI 2026)將于2026年8月15日至21日在德國不來梅舉辦。IJCAI是人工智能領(lǐng)域歷史最悠久的頂級國際學(xué)術(shù)會議之一,是CCF推薦的B類國際學(xué)術(shù)會議。
第51屆IEEE國際聲學(xué)、語音與信號處理會議(The 51st IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP 2026)將于2026年5月4日至8日在西班牙巴塞羅那舉辦。ICASSP是信號處理領(lǐng)域最具影響力的學(xué)術(shù)會議,是CCF推薦的B類國際學(xué)術(shù)會議。
1
Finding the Translation Switch: Discovering and Exploiting the Task-Initiation Features in LLMs
會議:AAAI 2026
作者:吳新維*,劉恒*,趙小虎,任玉琪,徐林龍,王龍躍,熊德意,駱衛(wèi)華,張凱夫
大語言模型(LLMs)即使未經(jīng)任務(wù)特定的微調(diào),也常常展現(xiàn)出強(qiáng)大的翻譯能力。然而,支配這一內(nèi)在能力的內(nèi)部機(jī)制在很大程度上仍不透明。為了揭示這一過程,本文利用稀疏自編碼器(SAEs)并引入了一個用于識別任務(wù)特定特征的新框架。該方法首先召回在翻譯輸入上頻繁共同激活的特征,然后使用基于PCA的一致性指標(biāo)對其進(jìn)行功能一致性過濾,成功分離出一小組"翻譯啟動"特征。因果干預(yù)實驗表明,增強(qiáng)這些特征的激活可以引導(dǎo)模型產(chǎn)生正確的翻譯,而消融這些特征則會導(dǎo)致幻覺和偏離任務(wù)的輸出,從而證實它們是模型內(nèi)在翻譯能力的核心組成部分。進(jìn)一步地,本文利用這一機(jī)制性洞見提出了一種新的數(shù)據(jù)選擇策略,優(yōu)先在"機(jī)制上困難"的樣本上進(jìn)行訓(xùn)練,顯著提升了數(shù)據(jù)效率并抑制了幻覺。此外,這些機(jī)制可以遷移到同一模型家族中更大規(guī)模的模型上。

2
Multilingual Safety Alignment via Representation-Space Separability
會議:ICML 2026
作者:史丹*,韓卓文*,熊德意
大語言模型(LLMs)已被全球各類場景廣泛采用,因此,穩(wěn)健的多語言安全對齊是確保其在不同語言中可靠部署的前提條件。盡管近期取得了諸多進(jìn)展,但LLMs在高資源語言和低資源語言之間仍存在顯著的安全差距:能夠在高資源語言中持續(xù)拒絕有害請求的模型,在低資源語言中往往無法做到這一點。在這項工作中,我們揭示了此類安全失敗源于低資源語言中,有害請求與無害請求在表示空間上的可分性不足。通過幾何分析,我們發(fā)現(xiàn)與英語相比,有害提示與無害提示表示之間的分離程度顯著降低,并且由此產(chǎn)生的跨語言空間距離差距與攻擊成功率密切相關(guān)。基于這些見解,我們提出了一種新型的訓(xùn)練策略——多語言空間距離差距優(yōu)化(Multilingual Spatial Margin Gap-based Optimization,SMO)。它利用主導(dǎo)語言(如英語)中良好對齊的安全幾何結(jié)構(gòu),來增強(qiáng)其他低資源語言的安全對齊效果。SMO 明確利用英語與目標(biāo)語言之間的空間距離差距作為逐樣本的監(jiān)督信號,在保持主導(dǎo)語言原始性能的同時,實現(xiàn)了安全能力的有效跨語言遷移。在 LLaMA-3.1-8B-Instruct 和 Qwen2.5-7B-Instruct 上進(jìn)行的實驗表明,SMO 能夠大幅降低低資源語言中的攻擊成功率(Attack Success Rates, ASR)至接近甚至達(dá)到零,同時保持了強(qiáng)大的通用多語言性能。

3
SeMi-LoRA: Enhancing Low-Rank Adaptation via Separation and Mixing
會議:IJCAI-ECAI 2026
作者:楊振飛,于北溟,林佩勤,劉永康,熊德意
低秩適配(LoRA)已成為參數(shù)高效微調(diào)(PEFT)的標(biāo)準(zhǔn)范式。然而,其低秩約束會限制表達(dá)復(fù)雜權(quán)重更新的能力,導(dǎo)致與全量微調(diào)相比存在性能差距。近期的擴(kuò)展方法雖然提升了表達(dá)能力,但往往犧牲了參數(shù)可合并性,或依賴于稀疏的塊對角更新,從而阻礙了全局信息流動。我們提出了SeMi-LoRA(分離與混合LoRA),這是一個能夠在保持可合并性的同時實現(xiàn)完整高秩更新的新框架。SeMi-LoRA 將適配過程解耦為通道級壓縮,隨后進(jìn)行兩階段的隱空間混合(秩混合和通道混合)。我們的結(jié)構(gòu)分析表明,在固定基礎(chǔ)秩的條件下,有效更新秩隨通道數(shù)量線性增長,并且支持完整更新而非部分稀疏更新。在常識推理、數(shù)學(xué)推理和自然語言理解基準(zhǔn)上的大量實驗表明,SeMi-LoRA 在提升參數(shù)效率的同時,始終優(yōu)于強(qiáng)大的PEFT基線方法。

4
SatBadEdit: Towards Efficient and Robust Multi-Trigger Backdoor Injection in Large Language Models
會議:ICASSP 2026
作者:陳越,趙小虎,吳新維,彭鑒翔,史丹,楊磊,徐林龍,孫越恒,熊德意
向大語言模型(LLMs)進(jìn)行高效且隱蔽的后門注入仍然是一個關(guān)鍵挑戰(zhàn)。雖然近期的模型編輯技術(shù)提供了一種比傳統(tǒng)微調(diào)更高效的替代方案,但它們通常僅限于注入少量觸發(fā)器,且對現(xiàn)有的防御機(jī)制表現(xiàn)出較差的魯棒性。為克服這一局限,我們提出了SatBadEdit,一種基于飽和的新型模型編輯方法,用于植入大量具有高對抗強(qiáng)度的后門。SatBadEdit 獨特地利用批量編輯能力,在單次高效操作中注入大量觸發(fā)器。為了抵消大規(guī)模注入可能帶來的模型不穩(wěn)定性,我們設(shè)計了一種低秩權(quán)重更新與聚合策略。該機(jī)制將參數(shù)修改限制在稀疏的低維子空間內(nèi),在最大化觸發(fā)器有效性和穩(wěn)定性的同時,確保對模型的干擾最小。實驗表明,SatBadEdit 不僅在效率和隱蔽性方面超越了現(xiàn)有的微調(diào)和基于編輯的攻擊方法,而且在多種主流防御機(jī)制下仍保持較高的攻擊成功率。

/ 關(guān)于我們 /
天津大學(xué)自然語言處理實驗室在熊德意教授的帶領(lǐng)下,開展大語言模型、機(jī)器翻譯、AI對齊、AI for Science等方向的研究,建立了省部級科技創(chuàng)新合作平臺,承擔(dān)了國家重點研發(fā)計劃等多項重要研究項目。實驗室具備AI大模型全棧研發(fā)能力,覆蓋數(shù)據(jù)采集與處理、基座模型訓(xùn)練、AI對齊、模型評測及應(yīng)用部署大模型全生命周期,已自主研制中文大模型仁文伏羲、多語言大語言模型FuxiTranyu(覆蓋40+語種并實現(xiàn)基座及對齊模型全開源)及DNA大模型。實驗室圍繞大模型安全、對齊及評測,積累了深厚的大模型安全可控技術(shù),發(fā)布了數(shù)百頁的大模型安全、對齊與評測全面報告,構(gòu)建了大模型評測平臺OpenEval及多個大模型安全評測基準(zhǔn),聯(lián)合發(fā)布了大模型基準(zhǔn)測試白皮書。實驗室致力于為AI大模型構(gòu)筑全面和多維度安全可控體系,助推AI大模型能力與安全協(xié)同發(fā)展!
本專題其他文章