0
| 本文作者: 吳思?jí)?/a> | 2026-06-26 10:21 | 專題:ICML:國際機(jī)器學(xué)習(xí)會(huì)議 |
原文鏈接:https://mp.weixin.qq.com/s/8GZParVJfj9fBuflTFTzlA
雷峰網(wǎng)(公眾號(hào):雷峰網(wǎng))轉(zhuǎn)載
論文題目:Semantic Robustness Certification for Vision-Language Models
論文鏈接:https://arxiv.org/abs/2606.18839
論文作者:Peiyu Yang、Paul Montague、Feng Liu、Andrew C. Cullen、Amardeep Kaur、Christopher Leckie、Sarah M. Erfani
論文機(jī)構(gòu):The University of Melbourne、Defence Science and Technology Group
代碼地址:https://github.com/ypeiyu/vlm-semantic-cert

視覺語言模型(VLM)已經(jīng)成為開放詞表識(shí)別、圖文檢索、檢測(cè)、分割和視覺問答等任務(wù)的基礎(chǔ)組件。但在真實(shí)應(yīng)用中,輸入圖像經(jīng)常發(fā)生語義層面的變化:物體形狀變了、尺寸變了、風(fēng)格變了、背景變了、視角變了、光照變了。傳統(tǒng)魯棒性認(rèn)證多關(guān)注像素?cái)_動(dòng)、幾何變換或生成模型潛空間變化,很難直接回答一個(gè)更貼近日常部署的問題:當(dāng)圖像沿著某個(gè)“語義方向”變化時(shí),VLM 的預(yù)測(cè)在多大范圍內(nèi)保持不變?
這篇 ICML 2026 論文提出了一個(gè)新的語義魯棒性認(rèn)證框架。核心想法非常漂亮:利用 VLM 的開放詞表能力,把文本提示作為語義代理,用一對(duì) source/target prompt 在圖文共享嵌入空間中定義語義變化方向;再利用 VLM 分類器決策邊界的閉式幾何結(jié)構(gòu),精確計(jì)算預(yù)測(cè)類別保持不變的 semantic extent interval。換句話說,模型不僅判斷“這個(gè)圖像是什么”,還可以被認(rèn)證為“當(dāng)它朝某個(gè)語義屬性變化到什么程度之前,預(yù)測(cè)仍然不會(huì)變”。
魯棒性認(rèn)證的目標(biāo),是給出模型預(yù)測(cè)在一組允許輸入變化下不變的保證。經(jīng)典工作通常圍繞像素級(jí)擾動(dòng),例如 Lp ball 內(nèi)的對(duì)抗擾動(dòng);也有工作處理旋轉(zhuǎn)、平移等幾何變換;近年還有方法在生成模型潛空間中做 semantic transformation certification。
這些方向各有局限。像素級(jí)擾動(dòng)能描述 worst-case 局部變化,卻難以表達(dá)“更圓”“更暗”“更像素描風(fēng)”“換成桌面背景”等語義變化。幾何變換有明確閉式參數(shù),但覆蓋范圍有限。生成模型潛空間可以表達(dá)更復(fù)雜語義,但通常需要針對(duì)每種語義變化準(zhǔn)備足夠數(shù)據(jù)并訓(xùn)練或使用相應(yīng)生成模型,實(shí)際部署成本較高。
VLM 提供了一個(gè)新機(jī)會(huì):圖像和文本被映射到同一個(gè)單位球嵌入空間,分類通常通過圖像 embedding 與類別文本 embedding 的余弦相似度完成。這意味著文本 prompt 本身可以作為語義錨點(diǎn)。作者正是從這里切入,將“語義變化”轉(zhuǎn)化為嵌入空間中由文本 embedding 張成的二維子空間上的連續(xù)變換。

圖中,輸入圖像是 gyoza。若目標(biāo)語義是 triangular,隨著語義 extent 增大,模型預(yù)測(cè)在 0 到 0.77 區(qū)間內(nèi)仍為 Gyoza,超過后會(huì)翻轉(zhuǎn)到 Samosa;若目標(biāo)語義是 on a plate,則整個(gè)區(qū)間內(nèi)預(yù)測(cè)仍保持 Gyoza。這種區(qū)間化輸出比單點(diǎn)預(yù)測(cè)更有診斷價(jià)值。
論文把相關(guān)工作放在三條線索中。
第一是 VLM 魯棒性。已有研究關(guān)注分布偏移、對(duì)抗攻擊、多模態(tài)安全、魯棒優(yōu)化、蒸餾和解釋方法,但多數(shù)是在觀測(cè)到變化后分析或提升模型表現(xiàn),并沒有給出閉式的 prediction-invariant interval。
第二是魯棒性認(rèn)證。隨機(jī)平滑、PixelDP 等概率方法給出置信意義下的認(rèn)證;DeepPoly、CROWN、PRIMA 等抽象解釋或 convex relaxation 方法給出 sound 但可能保守的保證;ReluVal、branch-and-bound 等 complete verifier 追求精確性。這些方法大多面向像素?cái)_動(dòng)或神經(jīng)網(wǎng)絡(luò)內(nèi)部結(jié)構(gòu),不適合直接描述開放詞表語義變化。
第三是輸入變換建模。DeepG、GeoRobust 等關(guān)注閉式幾何變換,ApproxLine、GCERT 等利用生成模型潛空間做語義變化認(rèn)證。本文與它們的關(guān)鍵不同在于:不需要為每個(gè)語義變化額外訓(xùn)練生成模型,而是借助 VLM 自身的文本-圖像嵌入幾何,用 prompt 直接指定語義方向。
論文考慮雙編碼器 VLM。圖像 x 經(jīng)視覺編碼器得到單位 embedding z,類別 prompt 經(jīng)文本編碼器得到單位 embedding uc,分類規(guī)則是選擇與 z 內(nèi)積最大的類別文本 embedding。由于 embedding 都在單位球上,內(nèi)積等價(jià)于余弦相似度。
作者希望定義一個(gè)語義變換 γ(φ),其中 φ 是 semantic extent,表示圖像從 source semantic a 向 target semantic a' 變化的強(qiáng)度。認(rèn)證目標(biāo)是:給定 extent 范圍,判斷 VLM 預(yù)測(cè)在哪些子區(qū)間保持不變,在哪些點(diǎn)發(fā)生類別翻轉(zhuǎn)。
這種表述有兩個(gè)要點(diǎn):
因此,問題從“如何生成所有可能語義變化圖像”變成“如何在 VLM 嵌入幾何中沿語義方向移動(dòng),并精確分析分類邊界”。
論文方法分三步:先證明/利用嵌入空間中的結(jié)構(gòu)化語義,再構(gòu)造語義變換,最后做區(qū)間認(rèn)證。
首先,作者使用一對(duì)文本 prompt 表示 source semantic 和 target semantic。例如 source 是 “a photo of a gyoza”,target 可以是 “a photo of triangular gyoza”。對(duì)應(yīng)文本 embedding ua 與 ua' 張成一個(gè)二維 semantic plane。圖像 embedding z 被分解為兩部分:位于該平面內(nèi)的 z∥,以及與該平面正交的 z⊥。
語義變換只改變平面內(nèi)分量的方向,不改變正交分量。這樣做的直覺是:ua 與 ua' 所定義的平面負(fù)責(zé)描述目標(biāo)語義變化,而 z⊥ 保留與這對(duì)語義無關(guān)的剩余信息。

其次,作者定義 semantic extent φ。φ 控制 z∥ 在 source-target 語義平面中的角度位置。起點(diǎn)對(duì)應(yīng) source semantic,終點(diǎn)對(duì)應(yīng) target semantic。實(shí)際應(yīng)用中,target extent 可以通過兩種方式確定:
Text-specified
Image-specified
最后是 certification。VLM 分類器的決策邊界由類別文本 embedding 的 pairwise bisector 決定,也就是 Voronoi decision regions。把語義變換 γ(φ) 代入類別 margin 后,類別切換點(diǎn)可以寫成 φ 的閉式方程。收集所有可能類別對(duì)的切換點(diǎn)并排序,就可以把 extent 區(qū)間切成若干 prediction-invariant intervals,每個(gè)區(qū)間都有確定預(yù)測(cè)類別。
這就是本文最核心的技術(shù)貢獻(xiàn):不是采樣很多語義變化圖像再觀察模型是否翻轉(zhuǎn),而是在 embedding space 中解析地找出預(yù)測(cè)保持不變的區(qū)間。
論文在 CLIP ViT-B/32 上實(shí)驗(yàn),并覆蓋生成數(shù)據(jù)與真實(shí)數(shù)據(jù)。作者關(guān)注三個(gè)問題:構(gòu)造出的 semantic transformation 是否與目標(biāo)語義一致?認(rèn)證區(qū)間是否能正確對(duì)應(yīng)預(yù)測(cè)變化?在真實(shí)數(shù)據(jù)集上是否比基線更穩(wěn)定?
首先是定性結(jié)果。作者用顏色、形狀、材質(zhì)、風(fēng)格、紋理、背景、視角、光照等 descriptor 構(gòu)造目標(biāo)語義,觀察證書區(qū)間如何變化。

這些例子展示了方法的可解釋性:wallflower 在 red flower、spiral flower、front-view flower 等方向上會(huì)出現(xiàn)不同類別邊界;beagle 在 pointy dog、gray dog、close-up photo 等語義變化下也有不同的穩(wěn)定區(qū)間。證書不只是一個(gè)標(biāo)量 robustness score,而是沿語義方向展開的預(yù)測(cè)軌跡。
論文還將 semantic descriptors 按屬性類型分組,覆蓋 color、shape、material、style、texture、background、viewpoint、illumination 等變化。

然后是證書邊界評(píng)估。作者引入 misalignment budget δ,模擬視覺與文本 embedding 之間可能存在的跨模態(tài)不對(duì)齊。結(jié)果顯示,隨著 δ 增大,stable coverage 會(huì)下降,這是預(yù)期現(xiàn)象;但 empirical invariance 和 conditional invariance 仍保持較高,說明證書邊界整體偏保守但可靠。

在合成語義變化實(shí)驗(yàn)中,作者使用多模態(tài) LLM 生成逐漸變化的圖像序列,覆蓋 OxfordPets、Flowers102、Food101 等數(shù)據(jù)集,并比較 ExactLine、文本指定變換 T-Spec 與圖像指定變換 I-Spec 的 mean absolute discrepancy。數(shù)值越低,表示構(gòu)造的變換與參考語義變化越一致。


在真實(shí)數(shù)據(jù)上,論文使用 DTD、FGVCAircraft、Caltech101、StanfordCars、Flowers102、OxfordPets、Food101、UCF101 等 8 個(gè)圖像識(shí)別數(shù)據(jù)集。由于真實(shí)圖像序列往往不能完全隔離目標(biāo)語義,作者用 VLM 按 prompt similarity 對(duì)圖像排序,構(gòu)造近似的真實(shí)語義變化序列。

整體上,本文方法在合成和真實(shí)數(shù)據(jù)上都比 ExactLine 更穩(wěn)定地對(duì)齊語義變化。I-Spec 通常更強(qiáng),因?yàn)樗褂媚繕?biāo)語義參考圖像;T-Spec 更輕量,因?yàn)橹恍枰谋?prompt,就能指定開放詞表語義。
本文的證書有幾個(gè)實(shí)際用途。
第一,可用于魯棒性審計(jì)。開發(fā)者可以指定“顏色變暗”“背景變成街道”“視角變?yōu)?close-up”等語義方向,檢查 VLM 在多大 extent 內(nèi)預(yù)測(cè)穩(wěn)定。
第二,可用于 failure mode 診斷。證書區(qū)間短,說明模型對(duì)該語義方向敏感;類別翻轉(zhuǎn)點(diǎn)可以揭示模型把哪些屬性當(dāng)作決策依據(jù)。
第三,可用于 prompt learning 或 prompt engineering。不同 prompt 定義的語義方向可能產(chǎn)生不同穩(wěn)定區(qū)間,證書長度可以作為選擇 prompt 的參考標(biāo)準(zhǔn)。
第四,可用于下游圖像文本檢索、檢測(cè)和分割等任務(wù),因?yàn)檫@些任務(wù)往往復(fù)用同一個(gè) image-text scoring mechanism。
不過,作者也強(qiáng)調(diào)了兩個(gè)限制。
一是證書依賴文本代理質(zhì)量以及圖像/文本 embedding 對(duì)齊程度。論文通過 bounded misalignment 顯式建模這部分不確定性,但如果跨模態(tài) gap 很大,證書會(huì)變得保守。
二是真實(shí)世界語義變化很難完全隔離。真實(shí)序列中可能混入非目標(biāo)因素,例如改變背景時(shí)也改變了物體姿態(tài)或光照。因此,證書不應(yīng)被解釋為任意現(xiàn)實(shí)變換下的安全保證,而是對(duì) prompt 指定語義方向和給定 misalignment 假設(shè)下的穩(wěn)定性刻畫。
《Semantic Robustness Certification for Vision-Language Models》提出了一個(gè)面向 VLM 的語義級(jí)魯棒性認(rèn)證框架。它把文本 prompt 作為 semantic proxy,在 VLM 嵌入空間中定義可參數(shù)化的語義變換,并利用分類決策邊界的閉式幾何結(jié)構(gòu),計(jì)算預(yù)測(cè)保持不變的 semantic extent intervals。
這項(xiàng)工作的關(guān)鍵意義在于,它把魯棒性認(rèn)證從像素?cái)_動(dòng)和少數(shù)幾何變換推進(jìn)到開放詞表語義變化:不需要為每個(gè)語義訓(xùn)練生成模型,也不需要額外標(biāo)注數(shù)據(jù),就能用文本描述目標(biāo)語義并獲得可解釋的穩(wěn)定區(qū)間。
對(duì)未來 VLM 部署而言,這類方法可以作為模型審計(jì)、語義漂移監(jiān)控、prompt 選擇和失敗模式分析的基礎(chǔ)工具。它提醒我們:一個(gè)視覺語言模型是否可靠,不僅要看靜態(tài) benchmark 分?jǐn)?shù),還要看它在語義連續(xù)變化過程中,預(yù)測(cè)邊界究竟在哪里。
專知便捷查看,訪問下面網(wǎng)址或點(diǎn)擊最底端“閱讀原文”
https://www.zhuanzhiai.com/vip/0d5fcc77a2b211dd82e3b9ea483758a8
更多AI資料教程請(qǐng)上專知網(wǎng)站 www.zhuanzhiai.com

本專題其他文章