0
| 本文作者: 陳淑瑜 | 2026-04-28 17:16 | 專題:CVPR 計算機視覺與模式識別會議 |
【封面圖片來源:網站名中國科學院自動化研究所,所有者:GThinker】
多模態大語言模型(MLLM)在文本推理領域已展現出強大的迭代反思能力,但在涉及復雜視覺場景的推理任務中,依然存在明顯缺陷——研究團隊將其定義為視覺慣性(Visual Inertia)現象:盡管 MLLM 在文本語境中擅長進行多輪迭代推理并修正錯誤,但在視覺推理過程中往往不加質疑地依賴最初的視覺解釋,即使這種初始解釋具有誤導性,也很少主動回頭重新審視和修正。
這種現象在初始視覺感知可能具有歧義性或誤導性的復雜任務中(如視錯覺圖像、遮擋場景、細粒度屬性識別等)導致系統性推理失敗。現有 MLLM 缺乏主動觸發重新審視關鍵視覺證據的機制,一旦初始感知出錯,后續推理鏈會沿著錯誤方向越走越偏。
GThinker 提出了 Cue-Rethinking(線索再思考)機制,賦予 MLLM 主動標記關鍵視覺線索并在發現不一致時自動觸發重審的能力,從根本上緩解視覺慣性問題。
GThinker 的核心是 Cue-Rethinking 機制和配套的兩階段訓練框架。
在推理過程中,模型使用 vcues 特殊標簽顯式標記推理所依賴的關鍵視覺線索(如圖像左上角的紅色物體、人物手部的細節等)。初步推理鏈完成后,系統自動觸發反思提示,引導模型逐一回顧所有已標記的視覺線索,檢查是否存在解釋不一致、錯誤或遺漏。一旦發現問題,模型會修正對該線索的理解,并基于新理解重新進行推理,形成推理-標記-再思考-修正的閉環。
通過迭代式多模態標注流程構建符合 Cue-Rethinking 模式的高質量推理數據集 GThinker-11k,使用評判引導的選擇性訓練,專門從失敗樣本中學習如何識別初始視覺解釋的錯誤并觸發再思考。
引入DAPO 強化學習算法,在多場景探索中進一步優化模型在何時觸發再思考、如何有效修正視覺解釋等策略行為,使再思考機制更加精準高效。

GThinker 在 M3CoT 多模態鏈式推理基準上取得 81.5% 的領先成績,在多個多模態推理任務上實現平均 2.1% 的整體提升,量化地證明了視覺再思考機制能顯著改善模型在視覺感知易出錯場景下的推理質量。
GThinker 是首個明確提出并系統性解決視覺慣性的工作,揭示了現有 MLLM 缺乏視覺自我修正機制這一根本性缺陷。Cue-Rethinking 機制類比于人類在解題時會重新審視題目條件的元認知行為,是計算機視覺與認知科學的交叉創新。
論文提供了完整的 GThinker-11k 多模態推理數據集(含11k條帶視覺線索標注的推理軌跡)和可復現的兩階段訓練框架,為后續研究提供了寶貴的開源資產,加速了視覺推理增強技術的社區發展。
──────────────────────────────────────────
上述內容包含AI輔助生成,更詳細信息參見兩個鏈接
原文鏈接:https://arxiv.org/abs/2026.gthinker
解讀來源:https://ia.cas.cn/xwzx/ttxw/202603/t20260317_8160775.html
本專題其他文章