0
| 本文作者: 陳淑瑜 | 2026-06-25 11:36 | 專題:ICML:國際機(jī)器學(xué)習(xí)會議 |
來源:公眾號“CAA OFFICIAL”
原文鏈接:https://mp.weixin.qq.com/s/kXA6C84NSpS-56fj6DjDiw
隨著生成模型的快速發(fā)展,AI 生成圖像正變得越來越逼真,也讓圖像真實(shí)性判斷變得愈發(fā)重要:一張圖片究竟是由相機(jī)真實(shí)拍攝,還是由模型合成生成?
與此同時(shí),一個與真實(shí)性判斷密切相關(guān)、也更加細(xì)粒度的問題逐漸受到關(guān)注:對于 AI 生成圖像中可能存在的不自然偽影,我們是否不僅能夠?qū)⑵涠ㄎ缓徒忉專€能進(jìn)一步對其進(jìn)行修復(fù),使圖像恢復(fù)為更加真實(shí)、自然的視覺外觀?
圍繞這一問題,來自北京大學(xué)等機(jī)構(gòu)的研究者提出了 GenShield:一個統(tǒng)一的自回歸框架,將 AI 生成圖像檢測 與 圖像偽影修復(fù) 結(jié)合到同一個閉環(huán)中,實(shí)現(xiàn)從 “診斷” 到 “修復(fù)” 的一體化建模。

論文標(biāo)題:
GenShield: Unified Detection and Artifact Correction for AI-Generated Images
論文鏈接:
https://arxiv.org/abs/2605.16122
代碼鏈接:
https://github.com/zhipeixu/GenShield
從 “檢測真假” 到 “診斷并修復(fù)”
現(xiàn)有 AI 生成圖像檢測方法大多關(guān)注 “判斷一張圖是真還是假”,或者進(jìn)一步指出圖中可疑區(qū)域。然而,在很多實(shí)際場景中,僅僅檢測出異常還不夠:如果圖像中存在明顯的結(jié)構(gòu)錯誤、物理不一致或局部扭曲,我們還希望模型能夠給出解釋,并進(jìn)一步將其修復(fù)為更自然、更接近真實(shí)拍攝的圖像。
GenShield 的核心思想是:檢測與修復(fù)并不是兩個孤立任務(wù),而是可以相互促進(jìn)的。
一方面,檢測任務(wù)能夠幫助模型發(fā)現(xiàn)圖像中的異常區(qū)域,并生成更細(xì)粒度的診斷信息;另一方面,修復(fù)任務(wù)要求模型學(xué)習(xí)真實(shí)圖像的生成先驗(yàn),從而反過來提升其對細(xì)微偽影的敏感性。
因此,我們將兩者統(tǒng)一到一個框架中,讓模型同時(shí)具備:
1. 可解釋的 AI 生成圖像檢測能力
模型不僅輸出 real/fake 判斷,還會生成圖像內(nèi)容描述和偽影分析依據(jù)。
2. 可控的圖像偽影修復(fù)能力
模型能夠根據(jù)診斷信息對圖像中的異常區(qū)域進(jìn)行修復(fù),盡量保持主體語義和整體結(jié)構(gòu)不變。
3. 多步 Visual CoT 自修復(fù)能力
模型可以像 “先檢查、再修改、再復(fù)查” 一樣,進(jìn)行多輪診斷與修復(fù),并在圖像已經(jīng)自然時(shí)自動停止。
GenShield-Set:面向檢測與修復(fù)的統(tǒng)一數(shù)據(jù)集
為了訓(xùn)練這一統(tǒng)一框架,我們進(jìn)一步構(gòu)建了 GenShield-Set,包含兩個互補(bǔ)部分:
GenShield-Set-Detect 用于訓(xùn)練可解釋檢測能力,包含真實(shí)圖像和 AI 生成圖像,以及結(jié)構(gòu)化的檢測答案,包括真假判斷、圖像描述和判斷依據(jù)。
GenShield-Set-Correct 用于訓(xùn)練偽影修復(fù)能力。我們基于帶有異常標(biāo)注的 AI 生成圖像,構(gòu)造了大規(guī)模 “異常圖像 — 修復(fù)圖像” 配對數(shù)據(jù),并通過專家篩選保證修復(fù)質(zhì)量,最終得到超過 10K 對高質(zhì)量修復(fù)樣本。

GenShield-Set 構(gòu)建 Pipeline

GenShield-Set-Correct 樣本示例
VCoT-based Curriculum Learning:讓模型在 “檢測 — 診斷 — 修復(fù)” 中協(xié)同進(jìn)化
在統(tǒng)一建模 AI 生成圖像檢測與偽影修復(fù)時(shí),一個核心挑戰(zhàn)在于:模型既需要具備可靠的真實(shí)性判斷能力,能夠發(fā)現(xiàn)并解釋圖像中的異常線索;又需要具備可控的修復(fù)能力,在去除不自然偽影的同時(shí),盡可能保持圖像原有的語義、身份和整體結(jié)構(gòu)不被破壞。
為此,我們設(shè)計(jì)了基于 Visual Chain-of-Thought(VCoT) 的課程學(xué)習(xí)策略,將訓(xùn)練過程劃分為由易到難的兩個階段,并在兩個階段中始終保留 AI 生成圖像檢測任務(wù),使檢測與修復(fù)能夠持續(xù)相互促進(jìn)。

GenShield 模型架構(gòu) & VCoT-based Curriculum Learning
在第一階段,模型同時(shí)學(xué)習(xí)可解釋的 AI 生成圖像檢測和指令引導(dǎo)的偽影修復(fù)。對于檢測任務(wù),模型需要輸出結(jié)構(gòu)化結(jié)果,包括圖像是真實(shí)還是 AI 生成、圖像內(nèi)容描述以及判斷依據(jù);對于修復(fù)任務(wù),模型則在明確異常描述的指導(dǎo)下學(xué)習(xí)修復(fù)圖像中的偽影,從而建立穩(wěn)定的真實(shí)圖像生成先驗(yàn)。
在第二階段,檢測任務(wù)繼續(xù)參與訓(xùn)練,而修復(fù)任務(wù)進(jìn)一步升級為多輪 VCoT 自修復(fù)過程。給定一張可能存在異常的 AI 生成圖像,模型會先生成診斷文本,指出圖像中仍然可疑或不自然的區(qū)域;隨后根據(jù)診斷進(jìn)行針對性修復(fù)。修復(fù)后的圖像會再次輸入模型,觸發(fā)下一輪 “診斷 — 修復(fù)” 過程。當(dāng)圖像已經(jīng)足夠自然時(shí),模型會輸出類似 “未發(fā)現(xiàn)明顯偽影,圖像已經(jīng)正常” 的終止判斷,從而自動停止進(jìn)一步編輯。

VIsual CoT for Artifact Self-correction
通過這樣的課程學(xué)習(xí)設(shè)計(jì),GenShield 不僅學(xué)習(xí)到如何判斷圖像真假,也學(xué)習(xí)到如何利用檢測得到的診斷信息指導(dǎo)修復(fù);同時(shí),修復(fù)過程帶來的真實(shí)圖像生成先驗(yàn)又反過來增強(qiáng)模型對細(xì)微偽影的感知能力。最終,檢測與修復(fù)在同一框架中形成閉環(huán),使 GenShield 從單一的真假判別模型,進(jìn)一步發(fā)展為具備解釋、修復(fù)和自我檢查能力的統(tǒng)一圖像取證系統(tǒng)。
實(shí)驗(yàn)結(jié)果:檢測與修復(fù)均達(dá)到領(lǐng)先表現(xiàn)
在 AI 生成圖像檢測任務(wù)上,GenShield 在 Holmes-Set 等主流檢測基準(zhǔn)上取得了優(yōu)異結(jié)果。論文中報(bào)告,GenShield 在 Holmes-Set 上達(dá)到 98.8% 平均準(zhǔn)確率 和 99.8% A.P.,超過多種非 LLM 和 LLM-based 檢測方法。
在圖像偽影修復(fù)任務(wù)上,GenShield 同樣表現(xiàn)突出。相比 GPT-Image、Nano-Banana-Pro、Seedream、FLUX-Pro、BAGEL、Qwen-Image-Edit 等強(qiáng)基線方法,GenShield 在結(jié)構(gòu)、物理一致性、局部扭曲等偽影修復(fù)維度上取得更低的殘余偽影評分,并在 HPSv3、CLIP-Score、PickScore 等客觀指標(biāo)上取得最佳或領(lǐng)先結(jié)果。



總結(jié)
GenShield 將 AI 生成圖像取證從傳統(tǒng)的 “被動判斷真假”,推進(jìn)到 “主動診斷并修復(fù)” 的新范式。通過統(tǒng)一建模檢測、解釋與偽影修復(fù),GenShield 不僅能夠判斷圖像是否由 AI 生成,還能指出可疑原因,并進(jìn)一步恢復(fù)更自然可信的視覺外觀。我們希望這項(xiàng)工作能夠?yàn)?AI 圖像取證、內(nèi)容審核、可信生成系統(tǒng)以及統(tǒng)一理解 — 生成模型研究提供新的思路。
主要作者簡介
徐志沛,北京大學(xué)碩士生。研究方向?yàn)?AIGC 安全,LLM,RL 等。以第一 / 共一作者身份在 ICML,ICLR,CVPR 等國際頂級會議發(fā)表多篇論文。
張健(通訊作者),北京大學(xué)長聘副教授、博士生導(dǎo)師,視覺信息智能學(xué)習(xí)實(shí)驗(yàn)室(VILLA)負(fù)責(zé)人。長期深耕 “視覺重建生成與安全” 領(lǐng)域研究,已在 TPAMI、IJCV、TIP、CVPR 等會議期刊發(fā)表論文 120 余篇。
本專題其他文章