0
| 本文作者: 張璐 | 2026-07-17 14:22 |

作者丨張 璐
編輯丨齊鋮湧
讓機器人真正理解世界,需要更大的語言模型、更逼真的視頻生成,還是別的什么?
雷峰網(公眾號:雷峰網)小編在中山大學與 X-Era AI Lab 團隊的研究中f x了一個意外的答案:很多時候,機器人在新場景下失靈,不是因為它不懂物理,而是因為它"看到的空間變形了"。
CVPR 2026 論文 "VLA Models Are More Generalizable Than You Think: Revisiting Physical and Spatial Modeling"(獲首屆 CVPR Compute Transparency Champion Award)和 ACM MM 2026 論文 "Robotic manipulation is vision-to-geometry mapping (f(v)→g): Vision-geometry backbones over language and video models" 通過一組輕量改進實驗指出:當前視覺-語言-動作模型(VLA)在新視角、光照、紋理和傳感噪聲下表現出的脆弱性,主要來自空間建模的錯位,而不是物理推理或動作控制能力的缺失。

圖 1:論文從 VLA 的視覺擾動問題出發,
把空間建模與物理建模的關系重新放到具身智能的中心。
視覺編碼器在新視角下產生了偏移的空間表征,而后端的語言-動作推理與控制模塊,其實仍然保留著可以被重新調動的物理建模能力。
這把改進焦點從"堆更多數據、上更大模型",轉向了一個更具體的問題:模型看到的空間,是否足夠真實、穩定?

01
傳統上,VLA 被視為一個端到端系統:輸入圖像和語言指令,輸出機器人動作。但這篇論文提出了更細的拆分。

https://arxiv.org/pdf/2512.02902
第一部分是空間建模(Spatial Modeling),由視覺編碼器承擔。它負責從圖像中恢復物體的位置、朝向、遮擋、接觸關系和視角結構,形成供下游策略使用的空間表征。
第二部分是物理建模(Physical Modeling),由 VLM 與動作專家承擔。它結合任務語言、空間表征和動作歷史,進行高層推理并生成可執行動作序列。

圖 2:VLA 可被拆解為空間建模與物理建模。
視角變化首先擾動空間表征,再影響后續動作生成。
論文指出,當相機視角發生變化時,真正改變的是空間配置,而不是任務語義,也不是執行任務所需的物理規律。所以,新視角下的性能下降,更可能來自空間表征與后端策略之間的錯位,而不是整個 VLA 的物理推理失效。
這個判斷意味著:我們不能只問模型是否學到了語言知識或視覺外觀,還必須追問模型內部的空間,是否能夠支撐動作。

02
為驗證這一假設,論文提出了一套 one-shot 魯棒適應框架,用極少量可學習參數校準 VLA 的視覺空間表征,其余部分保持不變。
Feature Token Modulation(FTM) 只引入兩個全局可學習向量,對視覺 token 做簡單的仿射變換,即重新縮放和重新居中特征分布。只學習約 4K 個參數,就把 LIBERO 新視角任務成功率從 48.5% 提升到 87.1%。
Feature Linear Adaptation(FLA) 進一步在 ViT 編碼器的線性層中加入低秩更新,用約 4.7M 個參數完成更深層的特征對齊。在 LIBERO 新視角測試中達到 90.8% 成功率,超過強 LoRA 基線的 90.3%,同時參數量從 467M 降到 4.7M,減少約 99 倍。

圖 3:FTM 與 FLA 通過輕量空間校準,
重新對齊視覺表征與后端動作生成模塊。
在擴展的 LIBERO-V 視覺擾動基準上,FLA 在相機、光照、紋理和噪聲四類擾動下取得 94.8% 平均成功率,FTM 以僅 0.004M 參數達到 90.5%。
這說明,對空間表征進行有針對性的輕量校準,效果不輸全量微調。空間表征是 VLA 泛化鏈條中真正的瓶頸。

03
這篇論文的更深層啟發在于:空間智能與物理智能,是兩個可以被分析、校準、重組的層面。
空間智能對應模型對幾何結構的建模能力——三維位置、視角變化、遮擋關系、物體布局;物理智能則對應模型對動作、接觸、約束和因果后果的建模能力。
這種"空間與物理可分離"的發現,為原生世界動作模型(Veridical World Action Model,VWA)提供了一個自然的起點。
在 VWA 的框架里,空間不是視覺語義的附屬品,而是世界動作模型的幾何基礎;物理也不是動作頭后面訓練出來的表面能力,而是從預訓練階段就要直接學習的時空演化與因果約束。

圖 4:空間與物理的可分離性,為原生世界動作模型
提供了從幾何到物理再到動作的路線。
VLA 中空間與物理的可分離性,說明具身智能模型可以被重新設計為從幾何到物理再到動作的統一系統。
當前許多具身模型仍然沿用"先預訓練視覺語言模型或視頻模型,再后訓練為動作模型"的路線,隱含地假設語言或視頻中的世界知識最終會自然遷移為動作能力。
但真實機器人需要的不是預測下一個詞元,也不只是生成未來畫面,而是在物理世界中預測動作及其后果。
VWA 的核心主張正是對這一錯位的修正:如果最終目標是讓模型在物理空間中行動,那么預訓練階段就應該直接學習真實世界中的狀態、動作和時空變化。
模型要學習密集的 4D+x 物理預測,包括未來三維位置、運動趨勢、接觸狀態、材質屬性、可操作性和環境約束。機器人動作,則可以被看作從這個密集物理預測場中讀出的本體軌跡。

圖 5:VWA的目標不是先學語言或視頻再接動作頭,
而是直接學習動作及其導致的未來世界演化。
真正可縮放的物理智能,可能不來自更大的語言頭或更逼真的視頻頭,而來自一個預訓練目標、表征空間和動作輸出都與物理世界一致的原生世界動作模型。

04
值得一提的是,"VLA Models Are More Generalizable Than You Think"獲得了首屆 CVPR Compute Transparency Champion Award,這是 CVPR 2026 Compute Reporting Initiative 的最高認可,表彰其在計算資源、實驗方法和可復現細節上的示范性報告。
這一榮譽和論文的研究主題形成了有意思的呼應。具身智能需要模型理解真實世界,研究過程本身也需要真實、透明、可復現。
從空間建模與物理建模的分離,到原生世界動作模型的提出,再到計算資源與方法細節的公開報告,這項工作同時推進了兩個方向的透明化:讓機器人更清楚地理解物理世界,也讓研究社區更清楚地理解智能模型是如何被訓練、評估與復現的。
這兩個方向的透明化,最終指向同一件事。
在世界模型、空間智能和物理智能快速匯合的當下,這兩篇論文提供了一個簡潔但重要的判斷:對 VLA 的有效改進,不應只是把語言、視覺和動作繼續堆疊,而應重新理解空間與物理的關系,并在此基礎上構建真正原生于物理世界的動作模型。


上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。