0
| 本文作者: 陳淑瑜 | 2026-05-28 15:12 | 專題:CVPR 計算機視覺與模式識別會議 |
來源:3D視覺工坊
原文鏈接:https://mp.weixin.qq.com/s/OeuvkEsZfxOF4SEZcD4wPA
標題:DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving
作者:Yiyao Zhu, Ying Xue, Haiming Zhang, Guangfeng Jiang, Wending Zhou, Xu Yan, Jiantao Gao, Yingjie Cai, Bingbing Liu, Zhen Li, Shaojie Shen
機構:HKUST、CUHK-SZ、USTC、Huawei Foundation Model Department
原文鏈接:https://arxiv.org/abs/2604.00969
基于視覺的自動駕駛技術因其低成本和出色的性能而受到了廣泛關注。與那些采用密集采樣或稀疏采樣方法的模型相比,以高斯分布為核心的方法能夠以一種既全面又高效的方式來描述場景:通過3D語義高斯函數來表征場景中的各種特征。在本文中,我們提出了一種名為DLWM的新算法。該算法基于“雙重潛在世界模型”原理設計,旨在通過兩階段處理來實現以高斯分布為核心的預訓練過程。在第一階段,DLWM通過自監督學習的方式,利用多視圖語義信息和深度圖像來預測3D高斯分布。在第二階段,系統會分別訓練兩個潛在世界模型:一個用于時間相關特征的提取,其輸出結果可用于后續的占用檢測與預測任務;另一個則用于運動規劃,其輸出結果可指導車輛的行駛路徑。通過在SurroundOcc和nuScenes測試基準上的大量實驗表明,DLWM在3D占用檢測、4D占用預測以及運動規劃等方面都取得了顯著的性能提升。
我們用于預訓練和下游任務性能提升的DIWM示意圖。

最近,基于視覺的自動駕駛系統已發展成為一種主流范式,為多傳感器融合方法提供了經濟高效且可擴展的替代方案。該系統利用先進的深度學習,并與多任務頭兼容,能夠保持準確的場景理解和安全的運動規劃。實現穩健自主駕駛的一個基礎挑戰是開發一種場景表示,該表示同時具有表達力、高效性以及時間一致性,以支持感知、預測和規劃任務。
早期方法主要依賴稠密或粗粒度的表示:基于體素的方法使用3D體素網格來表示周圍環境,以計算開銷為代價提供詳細的幾何信息。基于BEV 的方法將多視角特征壓縮到2D平面;后續的稀疏查詢方法用少量稀疏查詢(例如實例框、地圖元素)替代了網格。盡管這些方法相對高效,但它們要么犧牲了垂直細節和稠密幾何信息,要么只給決策模塊留下了粗略的場景知識。為了克服這些局限性,研究轉向了以高斯為中心的表示。一組3D語義高斯提供了全面而稀疏的表示,在細節和效率之間實現了最佳平衡。
盡管以高斯為中心的表示已展現出巨大潛力,但其對大量人工標注的依賴阻礙了可擴展部署。最近利用無標簽數據的預訓練范式提供了一種有前景的解決方案。例如,掩碼自編碼器 (MAE) 等自監督方法采用對比學習進行預訓練,但由于依賴粗糙的監督信號,未能顯式學習3D幾何結構。最近,為了學習完整的幾何表示,基于渲染的方法如UniPAD和ViDAR利用激光雷達深度來監督體素渲染。相比之下,最近的GaussianFlowOcc和SQS表明,僅通過可微的RGB/深度渲染,就可以從無標簽視頻中學習3D高斯本身。然而,針對以高斯為中心的模型全生命周期的全面自監督預訓練策略仍有待探索。
基于對魯棒特征學習的必要性,時間預測成為高層場景演化的下一個挑戰。潛在世界模型已成為無監督時間建模的關鍵方法。它繞過了顯式的圖像或占據生成,直接在緊湊的潛在空間中預測未來的動態。目前,潛在世界模型已用于運動規劃,但很少被探索用于感知和預測等其他關鍵任務,更不用說與以高斯為中心的模型集成了。
然而,這種集成在潛在表示的選擇上提出了一個基本的技術挑戰。由于當前幀和未來幀的高斯查詢是獨立初始化的,它們缺乏一對一的對應關系。因此,高斯查詢的置換等價性使得無法在兩幀之間直接監督高斯查詢特征。幸運的是,3D高斯潑濺 (3DGS) 具有任意視角渲染能力。源自稀疏高斯查詢的BEV柵格化作為一種稠密網格表示,通過垂直堆疊保留了高度信息,并允許清晰的幀間區域對應。因此,我們選擇BEV特征作為最適合時間監督的潛在表示。
為了彌補這一差距并充分利用以高斯為中心的表示和潛在世界模型的優勢,我們提出了DLWM,一種新穎的整體預訓練范式,具有雙潛在世界模型。DLWM采用兩階段方法來統一時空高斯表示學習,在不進行預訓練的情況下改善了所有下游任務(在占據感知上+1.02 mIoU,在占據預測上+2.68 mIoU,在運動規劃上-16% L2誤差)。具體來說,在第一階段,我們重建語義圖和深度圖以學習高斯上下文。利用預訓練的權重,在第二階段,分別使用雙潛在世界模型進行預訓練。第一個模型由高斯流引導,專門設計用于下游的3D占據感知和4D占據預測任務。另一個基于預測的自車軌跡的潛在世界模型用于改進運動規劃。
我們列出本文的貢獻如下:
提出了DLWM,一個用于整體以高斯為中心的預訓練的自監督范式,包括統一的第一階段用于學習以高斯為中心的幾何和語義表示,然后在第二階段分別訓練雙潛在世界模型。
引入了一個由高斯流和自車運動對齊引導的潛在世界模型,用于學習時空高斯特征表示,專門設計用于下游的占據感知和預測任務。
設計了另一個由當前高斯潛變量和預測的自車軌跡引導的潛在世界模型,共同改進時間以高斯為中心的表示和自車軌跡規劃。
DLWM顯著提升了以高斯為中心的占據感知、預測和規劃任務的性能,在SurroundOcc和nuScenes基準測試上取得了最先進的結果。
DLWM的整體流程。階段1專注于通過深度圖和語義圖上的自監督重建,從多視角視頻中學習魯棒的3D高斯場景表示。階段2引入了雙潛在世界模型。a. 高斯流引導模型顯式預測3D高斯流,將當前高斯狀態傳播到未來幀以進行潛變量預測。b. 自車規劃引導模型根據預測的自車軌跡來條件化未來場景預測。所有預測的潛變量都通過凍結的高斯感知模塊,利用來自下一幀多視角圖像的感知特征進行監督。

以流式方式實現4D占用預測。我們通過自車運動對齊將當前的3D高斯分布轉換到下一幀,并用隨機高斯分布填充新區域。

我們在三個具有挑戰性的下游任務上評估了DLWM的有效性:3D占據感知、4D占據預測和運動規劃。
3D占據感知。表1比較了在nuScenes驗證集上使用SurroundOcc標簽的3D語義占據結果。沒有預訓練時,我們的基線模型達到20.83 mIoU和31.77 IoU。經過兩階段預訓練后,模型( ours )提升到21.85 mIoU和34.61 IoU,達到了SOTA水平,相比無預訓練模型分別提高了1.02 mIoU和2.84 IoU。結果證明了我們預訓練策略的優勢。
4D占據預測。表2總結了在nuScenes驗證集上的4D占據預測結果。我們評估了兩個變體:基線(無預訓練)和DLWM(兩階段預訓練)。基準包括Copy&Paste、OccWorld-O/T/S/D [52]。基線已經超越了所有OccWorld變體,在1-3秒平均達到15.09 mIoU和25.65 IoU。預訓練后,我們的方法以平均17.77 mIoU和30.60 IoU建立了新的最先進水平,超越了使用3D占據輸入的OccWorld-O方法。一致的性能提升證實了我們預訓練的世界模型在4D占據預測任務上的優越性。
運動規劃。我們在nuScenes運動規劃任務上評估了DLWM,通過3秒時域上的L2距離和碰撞率來衡量性能(表3)。我們的方法實現了0.46米的平均L2距離,與BEV-Planner并列最佳得分,并超越了像LAW(L2: 0.61米)這樣的專用世界模型。與帶有多個輔助任務的UniAD相比,我們的方法在具有相當碰撞避免能力的情況下取得了更好的L2得分,證實了所設計的潛在世界模型非常有效。此外,我們的兩階段自監督預訓練在L2距離上相比無預訓練的基線帶來了0.09米的顯著提升(從0.55米到0.46米)。


在本工作中,我們提出了DLWM(雙潛在世界模型),一種新穎的兩階段自監督預訓練范式,專為基于視覺的自動駕駛中以高斯為中心的表示而設計。DLWM通過建立兩階段流程來改進稀疏查詢學習和時間一致性:階段1通過多樣化的渲染目標專注于幾何和語義特征學習。階段2引入了我們的雙潛在世界模型,包括高斯流引導和自車規劃引導的潛變量預測。DLWM在占據感知、預測和運動規劃任務上取得了最先進的結果,證實了我們整體以高斯為中心的預訓練框架的實質性、可擴展貢獻。
對更多實驗結果和文章細節感興趣的讀者,可以閱讀一下論文原文~
本專題其他文章