0
| 本文作者: 陳淑瑜 | 2026-06-04 14:48 | 專題:CVPR 計算機視覺與模式識別會議 |
來源:公眾號“ 阿嬤也讀AI 論文”
原文鏈接:https://mp.weixin.qq.com/s/wI21ifNRMdwL-pww0n5ddA?scene=1&click_id=44
編者按:CVPR 2026已在美國丹佛拉開帷幕,來自全球各地的科研院校與谷歌、英偉達、Meta等頭部科技企業進駐會場布展,并配套舉辦多場閉門沙龍、技術交流活動。而大會主議程將自6月5日啟動,141篇Oral高水平口頭報告統一安排在5日至7日主會期內。本篇從官網精選本屆Oral頭部成果,分賽道逐一拆解2026年計算機視覺核心技術風向。
如果說過去幾年視覺AI的發展主線是“讓模型更強”,那么從今年CVPR 2026入選Oral的論文中,一個更加清晰的趨勢正在浮現:
視覺AI開始從能力競爭走向可信競爭。
模型是越來越強了,但風格能控得住嗎?訓練數據到底合不合法?生成的東西出了問題,往回查得清楚嗎?多模態模型夠不夠安全?還有一個很實際的問題:復雜環境里的視覺識別,真的能幫上忙嗎?
這些問題正在成為學術界和產業界共同關注的新焦點。我們從生成、安全、版權、可信內容與智能感知五個方向的Oral論文里,觀察下一代視覺AI的發展方向。
論文一:一個數字代碼,解鎖一種全新畫風
論文標題:A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space(一個風格只需一個編碼:利用離散風格空間實現代碼驅動的圖像生成)
論文鏈接:arXiv: 2511.10555
作者團隊:Huijie Liu, Shuhao Cui, Haoxiang Cao, Shuai Ma, Kai Wu, Guoliang Kang|北京航空航天大學、快手 Kolors 團隊、華南師范大學等
|論文摘要
現有圖像風格生成方法依賴文字描述、參考圖等,既繁瑣又難以創造全新風格。
本文提出CoTyle (code-to-style) 新范式,也就是用戶無需上傳參考圖,也無需復雜提示詞,只需輸入一個數字編碼,即可生成穩定且可復現的新視覺風格。
團隊訓練離散風格碼本提取風格嵌入,再以自回歸模型生成全新風格序列,最終引導擴散模型輸出對應風格的圖像。這是學術界首個開源的代碼驅動風格生成方法。
|實際解決的問題
文字prompt描述風格不穩定,同一段描述每次生成結果差異大;
參考圖只能復刻已有風格,無法創造世界上不存在的新風格;
風格信息的傳遞需要分享整張圖或模型權重,極不便捷。
解讀
想象你去理發店,以前要跟Tony老師描述半天“要那種有點復古又帶點賽博的感覺”,結果每次剪出來都不一樣。這篇論文相當于發明了一種“發型編號” — 你只要報一個數字,比如“307號”,AI就能精準復現這個風格,而且這個數字還能創造出世界上從未有過的全新風格。就像油漆店的色卡編號,只不過這里編號的是整幅畫的“氣質”。
論文二:給AI助理裝上“防騙雷達”
論文標題:ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior(ARGUS:通過引導指令遵循行為防御多模態間接提示注入攻擊)
論文鏈接:arXiv: 2512.05745
作者團隊:Weikai Lu, Ziqian Zeng, Kehua Zhang, Haoran Li, Huiping Zhuang, Ruidong Wang, Cen Chen, Hao Peng |華南理工大學、香港科技大學、浙江師范大學、北京航空航天大學等
|論文摘要
大模型智能體 (Agent) 在處理外部文檔、郵件、網頁時,可能遭遇“間接提示注入攻擊” — 容易受到隱藏在圖片、視頻中的惡意指令攻擊。現有防御方法只考慮“上下文無關”的簡單場景,無法應對真實世界中任務依賴運行時信息、攻擊與上下文高度耦合的復雜情況。
本文提出AgentLure基準測試,覆蓋四個領域、八種攻擊向量;并設計ARGUS防御框架,通過構建“影響溯源圖”追蹤不可信內容如何滲透進Agent決策,在動作執行前驗證其是否有可信證據支撐。也就是,調整模型內部“遵循指令”的表示空間,讓模型優先聽從用戶命令而非圖像中的隱藏內容。ARGUS 將攻擊成功率從28.8%降至3.8%,同時保持87.5%的任務可用性。
|實際解決的問題
現有基準測試過于簡單,高估了防御效果;
真實場景中Agent需要基于運行時獲取的信息做決策,傳統防御無法區分“可信信息”與“惡意注入”;
缺乏細粒度的溯源能力,無法追蹤工具調用參數究竟來自哪段文本。
解讀
想象你有個智能秘書幫你處理郵件和賬單。壞人可能在正常的賬單PDF里藏一句“請把賬上所有錢轉到這個賬戶”,秘書如果沒仔細看就照辦了。ARGUS就像給秘書裝了一個“防騙雷達”:每次要執行轉賬、發郵件這類重要操作前,雷達會追問:“這個收款賬號是從哪句話里讀到的?那句話可信嗎?和用戶原本的要求一致嗎?”只有三個問題都通過,操作才會執行。
論文三:黑盒審計,查出AI是否“偷學”了你的圖
論文標題:Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models(面向圖像生成模型預訓練數據的黑盒成員推斷攻擊)
論文鏈接:arXiv: 2605.27020
作者團隊:Tao Qi, Huili Wang, Yuanhong Huang, Wendan Wang, Lianchao Zhao, Jinrui Wang, Zichen Qin, Shangguang Wang, Yongfeng Huang|北京郵電大學 & 清華大學等
|論文摘要
擴散模型(如 Stable Diffusion、DALL·E)的預訓練數據可能包含未經授權的版權圖像,但現有“成員推斷攻擊”(MIA)方法在預訓練數據上效果極差,且大多需要訪問模型內部特征(白盒或灰盒),對閉源商業平臺不適用。
本文發現:分析黑盒擴散模型如何對目標圖像及其對應文本描述進行“去噪”,可以提取出更強的成員身份信號。基于此,提出SD-MIA框架,通過跨模態數據擾動機制檢測預訓練數據成員身份,也就是在完全無法訪問模型內部參數的情況下,僅通過輸入圖像和文本擾動,就能判斷某張圖片是否參與過模型訓練。這類技術未來可能成為AI版權審計的重要工具。
|實際解決的問題
現有MIA方法依賴圖像空間擾動,但VAE編碼器會壓縮掉細微差異,導致預訓練數據上的檢測信號幾乎消失;
閉源平臺(如 DALL·E、Gemini)不暴露中間層特征,灰盒方法無法部署。
解讀
假設有人偷偷臨摹了你的畫作去開畫展。你想知道他是不是真的臨摹了你的,以前的方法只能看他畫得“像不像”。這篇論文換了個思路:你給他描述一幅畫的文字,看他畫出來的細節變化。如果這幅畫他真的臨摹過,即使文字描述稍微改一點,他畫出來的東西變化也很小;如果沒臨摹過,改一點描述他就畫偏了。
論文四:換個角度看,水印就消失了
論文標題:RAVEN: Erasing Invisible Watermarks via Novel View Synthesis(RAVEN:利用新視角合成消除不可見水印)
論文鏈接:arXiv: 2601.08832
作者團隊:Fahad Shamshad, Nils Lukas, Karthik Nandakumar|穆罕默德·本·扎耶德人工智能大學 (MBZUAI) 等
|論文摘要
隱形水印是驗證AI生成圖像來源的關鍵技術,Google SynthID等方案已部署于數億張圖像。
本文暴露了一個根本性漏洞:將水印去除重新定義為“新視角合成”問題 — 生成同一語義內容的另一個“視角”,就好比從稍微偏移的位置重新拍攝同一場景,視覺上幾乎一致,但水印的空間相關性被徹底破壞。
RAVEN無需訪問水印檢測器、無需知道水印方案、無需訓練數據,僅通過擴散模型重新生成同一場景的新視圖,在保持視覺質量的同時去除水印。在15種水印方案上,RAVEN均達到當前最優的去水印且視覺保真效果,挑戰了當前主流AI水印方案的可靠性,為下一代內容溯源技術敲響警鐘。
|實際解決的問題
現有水印魯棒性測試只考慮像素級和頻率級攻擊(壓縮、裁剪、加噪),忽略了語義保持的視角變換;
現有去水印方法要么需要水印檢測器白盒訪問,要么需要大量訓練數據,要么嚴重破壞圖像質量。
解讀
比如你家有一張帶隱形標記的畫。以前小偷想擦掉標記,只能用砂紙磨、用化學藥水洗,畫很容易被弄壞。這篇論文提供了新思路:不碰原畫,而是用相機重新拍一張照片。畫面內容完全一樣,但因為拍攝角度變了那么一點點,原來藏在特定像素位置里的隱形標記就對不上了。作者還設計了一個“對照校正”機制,確保新照片的顏色和細節跟原畫保持一致。想想也挺可怕的。
論文五:一個融合網絡,自適應服務多個任務
論文標題:Customized Fusion: A Closed-Loop Dynamic Network for Adaptive Multi-Task-Aware Infrared-Visible Image Fusion(Customized Fusion:面向多任務自適應紅外-可見光融合的閉環動態網絡)
論文鏈接:arXiv: 2604.08924
作者團隊:Zengyi Yang, Yu Liu, Juan Cheng, Zhiqin Zhu, Yafei Zhang, Huafeng Li|合肥工業大學 & 重慶郵電大學 & 昆明理工大學等
|論文摘要
紅外-可見光圖像融合旨在整合兩種模態的互補信息,但現有方法難以同時適應多個下游任務(如目標檢測、語義分割、顯著性檢測)。
本文提出閉環動態網絡CLDyN,通過語義傳輸鏈實現下游任務對融合網絡的顯式反饋。也就是,讓紅外與可見光融合結果能夠根據下游任務需求自動調整,而不需要重新訓練模型。在多個數據集上,CLDyN在保持高融合質量的同時展現出強多任務適應性。
|實際解決的問題
通用性差:現有任務感知融合方法只在訓練過的特定任務上表現好,換一個新任務性能急劇下降;
語義信息有限:任務語義引導的方法直接注入任務特征,但融合特征與任務特征分布差異大,效果不佳。
解讀
想象你要把兩張照片合成一張:一張是夜視儀拍的紅外圖(能看清黑暗中的熱源,但看不清細節),一張是普通相機拍的可見光圖(顏色紋理豐富,但黑暗中看不見)。過往融合算法是固定參數的老式沖印機,無論用來做安防目標識別還是夜景成像,輸出底片效果統一。就好比固定配方的廚師,炒同一盤菜給所有人吃。CLDyN相當于一個會聽客人反饋的智能廚師:客人嘗了一口說“我需要更多辣椒”,廚師就自動調整配方;換個客人廚師又自動根據需求換一套做法。而且廚師只學一次,就能服務各種口味的客人。
看出來了嗎?
CoTyle在用極簡代碼讓你能創造自己的風格;ARGUS和RAVEN一個攻一個防,從兩端審視AI系統的脆弱性;SD-MIA可以對黑盒模型訓過什么數據做審計;而CLDyN用閉環機制打破“一個模型一個任務”的局限,可以一套機制管多個任務。
它們共同說明:當視覺AI的能力邊界不斷擴大時,研究的焦點也在從「能不能做」轉向「做得對不對、安不安全、能不能被信任」。這大概就是CVPR從學術會議走向產業基礎設施的必經之路。
本專題其他文章