0
| 本文作者: 陳淑瑜 | 2026-04-30 16:04 | 專題:CVPR 計算機視覺與模式識別會議 |
【封面圖片來源:網站名微信公眾號,所有者:機器之心】
在多模態大模型飛速發展的今天,如何精準地將密集的"圖像塊(Patch)"表示與對應概念的"文本嵌入"對齊,依然是阻礙模型邁向更細粒度理解的"致命弱點"。研究團隊在消融實驗中發現了一個反直覺現象:通過塊級別蒸餾出的小參數學生模型,在零樣本分割等密集型圖文對齊任務上,性能竟然大幅反超了規模巨大的教師模型!。
論文提出 TIPSv2,通過三大技術創新大幅提升Patch-Text對齊質量,在零樣本分割等密集任務上全面霸榜。該研究成果《TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment》已成功被計算機視覺頂級會議 CVPR 2026 接收。目前,模型權重(涵蓋從 86M 到 1.1B 參數),代碼以及在線體驗 Demo 已全面開源。

TIPSv2 通過三大核心技術創新,實現了Patch-Text對齊的質的飛躍。
經典iBOT目標函數只針對Masked Tokens計算損失。iBOT++將自監督的Patch級別損失強行擴展到所有Tokens(包括未被遮擋的可見Tokens),在不增加任何額外網絡參數的條件下,ADE150數據集零樣本分割mIoU從3.5飆升至17.6,實現+14.1的巨大飛躍。這一設計使模型在蒸餾過程中充分學習所有Patch的對齊特性。
由于模型同時接收了強有力的文本監督信號,底層視覺骨干網絡在訓練初期就具備很好的穩定性。僅對頂層投影頭執行EMA更新,凍結視覺主干網絡的EMA,在完美保持性能的同時大幅降低訓練顯存需求,使大規模訓練成為可能。
構建極度豐富的數據標注配方,包括傳統Alt-text、PaliGemma生成的密集局部字幕、Gemini Flash生成的深度描述。訓練過程中模型在不同粒度描述之間進行隨機交替,極大提升了模型應對復雜密集對齊任務的魯棒性。

TIPSv2在零樣本分割四大基準測試中全面超越SigLIP2,正面擊敗專門優化此類任務的SILC和DINOv2架構。以更通用、簡潔的架構實現越級超越,證明了細粒度Patch-Text對齊對密集任務的關鍵驅動作用。
TIPSv2-g(1.1B參數)在5個共享評估體系中硬核擊敗業界頂尖PE-core G/14(參數量多出56%,訓練圖文對數據是TIPSv2的47倍),證明了圖文雙模態聯合約束優于單一純視覺預訓練的核心結論。
TIPSv2在6項共享任務中以4:2擊敗參數量6倍于己、訓練數據15倍于己的DINOv3。特征可視化顯示TIPSv2的表征具備極致的平滑性和極強的語義聚焦能力,物體邊界輪廓更精準銳利,區域內部展現更豐富的語義細節。全部模型權重與代碼已開源(Apache 2.0協議)。
──────────────────────────────────────────
上述內容包含AI輔助生成,更詳細信息參見兩個鏈接
論文鏈接:https://gdm-tipsv2.github.io/
解讀來源:https://mp.weixin.qq.com/s/R_Yn6_DytVEEczLKg6ivTA
本專題其他文章