0
| 本文作者: 陳淑瑜 | 2026-05-27 15:35 | 專題:CVPR 計算機視覺與模式識別會議 |
來源:知乎博主“TopR”
原文鏈接:https://zhuanlan.zhihu.com/p/2027411504710922571
論文鏈接:https://arxiv.org/abs/2601.03824
項目代碼:https://github.com/CVL-UESTC/IDESplat
分享我們最近的一篇關于 Generalizable 3D Gaussian Splatting 的工作:IDESplat。這篇論文主要想解決一個很實際的問題:如何更準確地估計深度進而學習到更準確的高斯參數(shù),實現(xiàn)更準確的三維場景重建。
在 generalizable 3DGS 里,網(wǎng)絡需要直接預測一組 Gaussian 參數(shù)來完成場景重建和新視角合成。
其中最關鍵、也最難預測的,其實是 Gaussian 的位置(mean)。
現(xiàn)有很多方法通常會先預測深度,再把深度反投影成 3D 點,作為 Gaussian 中心。這個思路本身沒有問題,但難點在于:深度估計夠不夠準。
而現(xiàn)有方法里,一個比較普遍的限制是:它們大多只依賴 單次 warp 來估計深度概率。這樣做雖然直接,但對跨視角幾何信息的利用其實并不充分,所以預測出來的深度圖往往會比較粗,也不夠穩(wěn)定。深度一旦不準,后面的 Gaussian mean 就會跟著偏,最終影響重建質量。
我們的想法其實很直接:
既然單次 warp 得到的深度概率不夠可靠,那就不要只做一次,而是把深度概率估計做成一個“迭代增強”的過程。
這就是 IDESplat 的核心思路:
通過 iterative depth probability estimation,讓模型在多輪 warp 中不斷強化高置信度的深度候選,逐步得到更精確的深度圖,最終預測出更準確的 Gaussian mean。
我們提出了一個模塊,叫 Depth Probability Boosting Unit(DPBU)。
在每個 DPBU 里,我們不會只做一次跨視角匹配,而是會做多次 warp,得到多個深度概率結果。然后,不是簡單相加,而是采用一種乘法式增強的方式,把這些概率結果融合起來。
這樣做的直觀意義是:
如果某個深度候選在多次匹配里都表現(xiàn)穩(wěn)定,它的概率就會被不斷放大;
如果某個候選只是偶然匹配上了,但不夠穩(wěn)定,它的概率就會被抑制。
所以,DPBU 本質上是在回答一個問題:
哪些深度位置,是在多輪跨視角幾何約束下依然成立的?
除了做概率增強,我們還把整個深度估計設計成一個逐輪細化的過程。
具體來說:
第一輪先在一個較大的深度范圍里做粗搜索;
得到初始深度結果后,后續(xù)迭代圍繞當前結果重新定義更小的搜索范圍;
同時逐步提高特征分辨率,讓后面的估計更細。
這個過程有點像“先粗定位,再局部精修”。
隨著迭代進行,模型會逐漸把注意力集中到更可信的深度區(qū)域上,因此得到的深度圖也會越來越準確。
多次 warp 會帶來一個問題:內存開銷。
為了解決這個問題,我們設計了 Warp-Index Epipolar Attention。它不是像常規(guī)方法那樣保存完整的 dense warping features,而是只記錄 warp 對應的索引,再結合稀疏矩陣乘法來完成相關性計算。
這樣做的好處是:
可以支持多輪 warp 和迭代優(yōu)化,同時把內存成本控制在一個更合理的范圍內。
除了 Gaussian mean 之外,其他 Gaussian 參數(shù)的預測也很重要。為此,我們設計了 Gaussian Focused Module(GFM)。
它的作用可以簡單理解為:
在特征交互時,不是讓所有 Gaussian token 都同等參與,而是盡量篩選出更相關的 token 來做注意力計算,減少無關信息帶來的噪聲。
這一步進一步提升了特征表達質量,也有助于最終重建效果。

圖:IDESplat 整體網(wǎng)絡架構
第一,
我們提出了一個新的 generalizable 3DGS 框架 IDESplat,把深度估計從“單次預測”改成了“迭代增強”。
第二,
我們設計了 DPBU,通過多次 warp 結果的乘法式融合,提升深度概率估計的可靠性。
第三,
我們構建了一個逐步縮小深度搜索范圍、逐步提升特征分辨率的迭代深度估計過程,使深度預測更細、更穩(wěn)。
第四,
我們設計了 Gaussian Focused Module,進一步提升 Gaussian 特征交互的有效性。
實驗結果表明,這個思路不僅有效,而且在性能和泛化上都比較突出。

圖:深度圖可視化對比(IDESplat vs 其他方法)
在 RealEstate10K 上,IDESplat 的 PSNR 達到 27.80 dB,相比 DepthSplat 提升了 0.33 dB。
更重要的是,我們的方法參數(shù)量只有對方的 10.7%,內存占用也更低。
在 ACID 上,IDESplat 也取得了更好的結果。
而在跨數(shù)據(jù)集測試中,模型從 RE10K 直接遷移到 DTU 時,PSNR 還能比 DepthSplat 高 2.95 dB,說明它并不只是對單一數(shù)據(jù)集有效,而是真的具備更強的幾何建模和泛化能力。

圖:IDESplat 新視角合成效果展示
這篇工作最想說明的一點其實是:
對于 generalizable 3DGS 來說,瓶頸往往不只是渲染本身,而是前面的深度概率估計是否足夠可靠。
IDESplat 本質上是在做一件事:
把原來依賴單次 warp 的深度預測,變成一個多輪確認、逐步收斂的過程。
當深度圖變得更準確之后,Gaussian mean 的預測自然會更準,最終帶來更好的場景重建和新視角合成效果。
本專題其他文章