0
| 本文作者: 陳淑瑜 | 2026-06-05 18:38 | 專題:CVPR 計算機視覺與模式識別會議 |
來源:公眾號“我愛計算機視覺”
原文鏈接:https://mp.weixin.qq.com/s/ZAI3_QVi_70Y4AJiGLuxLQ
在計算機視覺的世界里,視頻全景分割(Video Panoptic Segmentation, VPS)一直被視為一項“全能且昂貴”的任務。它不僅要求模型識別出視頻中的每一個像素屬于什么類別(語義分割),還要區分出不同的個體(實例分割),并且在時間軸上準確地將它們關聯起來(目標跟蹤)。
然而,高質量的 VPS 標注成本高得驚人。為了解決這一痛點,來自慕尼黑工業大學、達姆施塔特工業大學、英偉達以及牛津大學等研究團隊聯合推出了 VideoCUPS。它的核心魅力在于:完全不需要人類標注,僅憑普通的單目視頻,就能“自學”成才,實現高質量的視頻全景理解。


近年來,無監督學習在圖像分割領域取得了長足進步。比如之前的 U2Seg 或 CUPS,已經能在不看標簽的情況下把圖片里的車、人、樹分得有模有樣。但當我們把目光轉向視頻時,情況變得復雜了。
視頻多了時間維度,意味著模型不僅要分得準,還要跟得住。現有的無監督方法大多盯著靜態圖像,或者只能處理簡單的、以單個物體為中心的視頻。面對復雜的真實駕駛場景(Scene-Centric),如何利用視頻自帶的運動(Motion)和深度(Depth)線索來構建時序一致的理解?這就是 VideoCUPS 想要回答的問題。

VideoCUPS 的核心邏輯分為兩步:第一步是生成高質量的視頻全景偽標簽;第二步是利用這些偽標簽訓練一個強大的 VPS 模型。
為了在沒有標注的情況下識別物體,研究者們借鑒了格式塔心理學(Gestalt principles)中的“共同命運”原則:即一起運動的像素通常屬于同一個物體。

值得注意的是,相比于之前的 CUPS 依賴雙目(Stereo)相機提供的深度信息,VideoCUPS 僅需單目視頻即可完成上述過程。這種對硬件要求的“降級”,實際上是對算法魯棒性的巨大挑戰。

從上圖可以看到,VideoCUPS 生成的偽標簽在處理非剛性運動(如行人的肢體動作)時表現得更加出色,且跟蹤的生命周期更長。
有了偽標簽,接下來的挑戰是如何訓練模型。偽標簽通常是稀疏的——它只能發現那些正在運動的物體,卻容易漏掉路邊停著的靜止車輛。
為此,團隊引入了 Video DropLoss。其數學表達式如下:
這個損失函數的設計只對那些與偽標簽高度重合(IoU 超過閾值)的預測進行強監督,而給模型留出了“自由發揮”的空間。這樣,模型在訓練過程中就能通過視覺特征的相似性,自動把那些靜止的、未被偽標簽覆蓋的車輛也識別出來。
此外,研究者還設計了自增強視頻 Copy-Paste。模型會把自己預測得最自信的物體“摳”出來,隨機粘貼到其他視頻剪輯中。這種“自我博弈”的方式極大地提升了模型對小物體的檢測和跟蹤能力。
研究團隊在 Cityscapes-VPS、KITTI-STEP、Waymo 和 MOTS 四個具挑戰性的數據集上進行了嚴苛的測試。
在 Cityscapes-VPS 驗證集上,VideoCUPS 表現:

通過消融實驗(下表)可以發現,時序跟蹤和語義平滑對最終性能的提升貢獻巨大,STQ 從 9.3% 一路飆升至 12.1%。

一個優秀的無監督模型不應該只在訓練集上跑得好。實驗顯示,VideoCUPS 在 KITTI-STEP 和 Waymo 等數據集上的泛化表現同樣穩健,STQ 指標均優于所有對比基線。

從可視化結果來看,VideoCUPS 預測的掩碼邊緣更加平滑,對復雜背景下的行人識別也更加準確,甚至能處理一定程度的局部遮擋。

這可能是最令工業界興奮的一點。研究發現,如果將 VideoCUPS 作為預訓練模型,僅使用 10% 的標注數據進行微調,其性能(STQ 32.5%)就能遠超直接從 DINO 初始化微調的效果。這意味著在實際應用中,我們可以極大地減少人工標注的工作量,實現“事半功倍”。

VideoCUPS 的成功,本質上是人類對“先驗知識”的巧妙利用——我們告訴模型“運動一致即物體”,模型便以此為支點,撬動了復雜的視頻全景理解。
說實話,看到無監督模型能把復雜的街景分得這么細致,確實讓人感嘆自監督表征學習的潛力。如果你正苦于 VPS 標注數據的匱乏,待 VideoCUPS 代碼開源后絕對值得一試。
本專題其他文章