0
| 本文作者: 陳淑瑜 | 2026-07-01 17:25 | 專題:ICML:國際機器學習會議 |
來源:公眾號|復雜網(wǎng)絡(luò)課題組
原文鏈接:https://mp.weixin.qq.com/s?__biz=MzU1ODUyMzE4NA==&mid=2247484122&idx=1&sn=798135e4cf004e1416602faa8c3cbec8&chksm=fd63be6bfcb9847f5799c471af2ab74ee89f130910e52cd632575f4dbd2c836598e37b86b17c#rd
近日,課題組唐偉老師以第一作者身份在機器學習頂會ICML 2026上發(fā)表研究論文《Artemis: Structured Visual Reasoning for Perception Policy Learning》。
近年來,多模態(tài)大語言模型(MLLMs)在視覺問答、圖像描述和跨模態(tài)理解等任務(wù)中取得了顯著進展。然而,現(xiàn)有模型大多依賴自然語言形式的思維鏈進行推理,其推理過程主要發(fā)生在語言空間而非視覺空間。在目標定位、目標檢測、視覺計數(shù)以及數(shù)學圖形理解等需要精確視覺感知的任務(wù)中,模型雖然能夠生成看似合理的解釋,卻經(jīng)常出現(xiàn)目標定位偏差、對象遺漏以及數(shù)量統(tǒng)計錯誤等問題。這表明當前多模態(tài)模型缺乏與視覺事實緊密對齊的中間推理過程,限制了其視覺感知能力與跨任務(wù)泛化能力的進一步提升。

已有研究嘗試利用強化學習提升多模態(tài)模型的推理能力,并取得了一定成效。然而,現(xiàn)有方法大多沿用語言推理鏈作為中間思考過程,難以對推理步驟進行有效監(jiān)督和驗證。同時,自然語言推理與視覺感知任務(wù)之間存在固有差異,語言描述往往難以準確表達目標的空間位置和視覺關(guān)系,容易導致推理過程與真實視覺信息脫節(jié)。受到人類視覺認知機制的啟發(fā),研究團隊認為視覺感知任務(wù)中的推理應(yīng)當直接發(fā)生在視覺空間中,而非依賴語言空間的間接表達。因此,如何構(gòu)建一種可驗證、可監(jiān)督且與視覺事實緊密關(guān)聯(lián)的推理機制,成為提升多模態(tài)模型視覺感知能力的關(guān)鍵問題。
針對上述問題,研究團隊提出了Artemis框架,通過結(jié)構(gòu)化視覺推理實現(xiàn)視覺感知策略學習。在該框架中,模型在推理階段不再生成自然語言形式的思維鏈,而是輸出由目標類別和邊界框坐標組成的結(jié)構(gòu)化視覺證據(jù)序列。通過這種方式,模型需要在回答問題之前顯式關(guān)注與任務(wù)相關(guān)的目標及其空間位置,使中間推理過程能夠直接與真實標注進行匹配和驗證。
在訓練過程中,Artemis基于GRPO強化學習算法構(gòu)建統(tǒng)一優(yōu)化框架,并設(shè)計了由格式獎勵、答案獎勵和結(jié)構(gòu)化視覺推理獎勵組成的獎勵機制。其中,結(jié)構(gòu)化視覺推理獎勵通過評估中間視覺證據(jù)與真實標注之間的一致性,引導模型學習更加準確的視覺感知策略;格式獎勵用于約束輸出結(jié)構(gòu);答案獎勵則負責監(jiān)督最終任務(wù)結(jié)果。通過聯(lián)合優(yōu)化推理過程和最終答案,模型逐步形成面向視覺空間的感知與決策能力。

研究結(jié)果在7個域內(nèi)和域外數(shù)據(jù)集以及10個MLLM通用能力評估數(shù)據(jù)集上都顯示出了強大的性能和泛化能力。
在COCO 2017目標檢測任務(wù)中,Artemis取得31.0 mAP的檢測性能,成為首個在3B參數(shù)規(guī)模下突破30 mAP的統(tǒng)一強化學習視覺感知模型。相比僅針對目標檢測任務(wù)進行優(yōu)化的方法,Artemis在保持檢測性能的同時展現(xiàn)出更強的任務(wù)通用性。

此外,在未參與訓練的視覺計數(shù)和數(shù)學圖形理解任務(wù)上,Artemis同樣展現(xiàn)出優(yōu)異的零樣本泛化能力。在MATHGLANCE基準測試中,Artemis取得49.3%的準確率,顯著優(yōu)于多個主流多模態(tài)模型和強化學習模型。實驗進一步證明,結(jié)構(gòu)化視覺推理不僅能夠提升模型的視覺感知能力,還能夠促進模型學習更加通用的視覺表征,從而實現(xiàn)跨任務(wù)、跨領(lǐng)域的有效遷移。

該研究提出了一種基于結(jié)構(gòu)化視覺推理的統(tǒng)一感知策略學習框架Artemis,通過將推理過程從語言空間轉(zhuǎn)移到視覺空間,實現(xiàn)了對視覺感知過程的顯式建模與強化學習優(yōu)化。實驗結(jié)果表明,結(jié)構(gòu)化視覺推理能夠有效提升多模態(tài)模型在目標定位、目標檢測、視覺計數(shù)和數(shù)學圖形理解等任務(wù)上的性能,同時增強模型的跨域泛化能力。該研究為多模態(tài)大模型視覺感知能力提升提供了新的研究思路,也為未來構(gòu)建更加可信、可解釋的視覺推理系統(tǒng)奠定了基礎(chǔ)。

據(jù)悉,ICML會議由國際機器學習學會主辦,是機器學習理論、算法與統(tǒng)計方法領(lǐng)域的國際核心學術(shù)會議,在中國計算機學會(CCF)推薦目錄中列為A類。從近年的投稿數(shù)據(jù)來看,該會議競爭態(tài)勢持續(xù)加劇:近三年有效投稿量普遍在5000至7500篇之間,錄用率在22%至25%間,對論文的理論深度與實驗復現(xiàn)性提出了極高要求。

本專題其他文章