0
| 本文作者: 陳淑瑜 | 2026-06-22 18:25 | 專題:ICML:國際機器學習會議 |
來源:公眾號“深圳市雙銀科技有限公司”
原文鏈接:https://mp.weixin.qq.com/s/SDnSZkRzfoMjGnYvrF0rgg
在本屆國際機器學習頂會 ICML 2026 上,北京大學聯(lián)合合作團隊推出全新統(tǒng)一自回歸框架GenShield,徹底打破行業(yè)割裂現(xiàn)狀:把 AI 生成圖像真?zhèn)螜z測、瑕疵定位、偽影修復三大能力整合進一套系統(tǒng),完成「識別問題→解釋成因→自動修正」全鏈路閉環(huán),將 AIGC 圖像取證從單純真假二分類,推向可診斷、可自修復的全新階段。論文、訓練數(shù)據(jù)集、完整代碼已全部開源。
當下主流 AIGC 圖像工具與檢測系統(tǒng)存在明顯割裂短板:
1、檢測工具只判真假,無法溯源解釋
GenShield 的核心創(chuàng)新正是打通兩者雙向增益關(guān)系,構(gòu)建協(xié)同訓練閉環(huán):檢測輸出細粒度診斷文本,指導模型定向修復;大量真實修復樣本反過來強化模型對細微 AI 瑕疵的捕捉能力。
整套框架依托統(tǒng)一自回歸架構(gòu),一次性實現(xiàn)三類關(guān)鍵能力落地:
不只是簡單輸出真假標簽,模型會同步生成完整圖文診斷報告:完整畫面內(nèi)容描述、可疑區(qū)域定位、紋理 / 光影 / 形體三類偽影判定邏輯,每一條結(jié)論都附帶圖像像素層面佐證,內(nèi)容審核、數(shù)字取證場景可直接采信完整依據(jù)。
接收診斷文本作為修改指令,僅針對標注異常區(qū)域做像素優(yōu)化,嚴格保留原圖主體、人物、物體結(jié)構(gòu)與整體構(gòu)圖,不會隨意改動畫面核心信息;針對手指畸形、物體懸浮、材質(zhì)失真、透視錯亂等各類 AI 典型缺陷針對性修正。
獨創(chuàng)視覺思維鏈(Visual CoT) 自修復機制,形成循環(huán)工作流:
圖像診斷→標注瑕疵→局部修復→重新全圖檢測;
若仍存在不自然痕跡自動進入下一輪迭代,直到模型判定畫面無 AI 偽影后主動終止流程,無需人工反復核對修改效果。
為支撐檢測 + 修復聯(lián)合訓練,團隊搭建行業(yè)首個雙模塊專用標注數(shù)據(jù)集,分為兩大互補子集:
? GenShield-Set-Detect(檢測訓練集)
收錄海量實拍真實圖像、各主流模型生成合成圖,每條樣本配套標準化三元標注:圖片完整描述、真?zhèn)闻卸ā⒍鄺l視覺缺陷判定理由,用于訓練模型解釋性推理能力。
? GenShield-Set-Correct(修復訓練集)
構(gòu)建超 10000 組一對一高質(zhì)量對照樣本,全部由專業(yè)視覺專家篩選校準:左側(cè)帶畸形、扭曲、光影 bug 的 AI 原圖,右側(cè)為結(jié)構(gòu)不變、物理邏輯自然的修復版本,覆蓋人物、靜物、室內(nèi)外景全品類場景。
數(shù)據(jù)集完整覆蓋肢體變形、材質(zhì)過度平滑、透視沖突、懸浮物體等幾十類 AIGC 高頻瑕疵,補齊修復方向高質(zhì)量訓練素材缺口。
團隊設計分層式課程訓練方案,分階段解鎖完整閉環(huán)能力,全程不脫離真?zhèn)螜z測任務,雙向促進模型性能提升:
模型同步學習圖像鑒別與定向修改,輸入明確缺陷描述完成局部優(yōu)化,建立真實照片的視覺先驗,打下基礎(chǔ)識別、編輯能力底座。
進階開啟循環(huán)自檢邏輯,模型自主完成 “診斷 - 修復 - 復檢” 全流程,無需人工逐條下發(fā)修改指令;每一輪檢測輸出的結(jié)論直接作為下一輪編輯輸入,讓檢測精度與修復效果同步迭代提升。
消融實驗數(shù)據(jù)驗證:移除 VCoT 全文上下文推理模塊后,模型綜合效果直接下跌 15 個百分點,足以證明視覺鏈式推理是整套方案核心競爭力。
團隊在業(yè)內(nèi)通用兩大評測基準完成對比測試,GenShield 在檢測、修復兩大賽道均取得最優(yōu)指標:
1、AIGC 鑒偽任務(Holmes-Set 數(shù)據(jù)集)
平均識別準確率 98.8%,平均精度 AP 達 99.8%,大幅超越 LLM 多模態(tài)、傳統(tǒng)像素檢測基線模型,細微紋理類 AI 痕跡識別優(yōu)勢尤為突出。
2、偽影修復任務(SynthScars 評測集)
對比 GPT-Image、FLUX-Pro、Qwen-Image-Edit、BAGEL 等主流圖像編輯模型,GenShield 修復后畫面結(jié)構(gòu)失真、物理矛盾、局部扭曲三類低分指標全面最優(yōu);HPSv3、CLIP-Score、圖像審美評分等客觀量化榜單全部登頂。
同時經(jīng)過多款主流 AI 檢測器測試,經(jīng) GenShield 修改后的圖片仍會被判定為人創(chuàng)作內(nèi)容,不會出現(xiàn) AI 重繪后被工具誤判的問題,完整保留原圖創(chuàng)作者表達風格。
1、內(nèi)容平臺安全審核
長期以來圖像檢測、圖像修復分屬兩條獨立技術(shù)路線,二者缺少協(xié)同訓練框架。北大 GenShield 的出現(xiàn)補齊行業(yè)關(guān)鍵短板,以統(tǒng)一自回歸架構(gòu)實現(xiàn) “識別 - 解釋 - 修復” 閉環(huán),搭配專屬高質(zhì)量標注數(shù)據(jù)集與 VCoT 視覺思維鏈訓練策略,在多項權(quán)威基準刷新最優(yōu)結(jié)果。
整套方案已開源開放,代碼、數(shù)據(jù)集、論文均可公開獲取,為可信 AIGC、數(shù)字取證、內(nèi)容安全領(lǐng)域提供全新技術(shù)范式,也為平衡 AI 生成便利性與內(nèi)容真實性給出可行解決方案。
本專題其他文章