0
| 本文作者: 陳淑瑜 | 2026-07-16 10:41 | 專題:RSS:機器人,科學與系統會議 |
來源:公眾號“AI光點”
原文鏈接:https://mp.weixin.qq.com/s/WYaG9RVRvpC2uVb0pyhsTg?scene=1&click_id=6
超市貨架最里面立著一盒餅干。機械臂已經看見它,夾爪也張得開,可正面被其他商品擋住,側面只剩一條窄縫。傳統系統會繼續找一條不碰任何東西的軌跡;實在找不到,就宣布這次抓取不可行。
人不會這么做。我們會先把紙盒撥轉一點,讓包裝袋替它擋一下,或借旁邊更重的罐子做支點,把原本夾不到的側面露出來。整個過程沒有更靈巧的手指,靈巧來自對環境的利用。
機器人研究把這種能力叫作Extrinsic Dexterity,外在靈巧性。難點在于,貨架上的障礙會跟著接觸繼續運動。手臂碰到一個物體,運動會傳給第二個、第三個;同樣的幾何位置,裝滿飲料的罐子可以借力,空紙盒卻會被一起推走。
這正是 DAPL 想補上的判斷。論文由銀河通用(Galbot)、北京大學、智源研究院、中科院自動化所和上海交大共同完成,王鶴與張智錚擔任通訊作者,并入圍 RSS 2026 Best Paper Finalist。
它把雜亂操作的核心問題,從“哪里能走”推進到了“碰上以后會發生什么”。
抓取優先的操作系統有一套清楚的秩序:先找到物體,再生成抓取姿態,最后規劃一條無碰撞軌跡。這套流程在桌面空曠、目標暴露時很有效,一旦物體擠在一起,安全邊界會迅速吞掉可行空間。
非抓取操作提供了另一條路。機器人可以推、滑、撥、翻,把目標送到更容易抓取的位置。過去的外在靈巧工作已經證明,簡單夾爪也能借桌面、墻面和重力完成復雜動作,但不少方案依賴預先設計的接觸模式、特定動作 primitive,或只在少量物體的簡化場景里學習。
近年的點云表征方法更擅長看清物體形狀與接觸位置,卻仍容易把場景當成靜態幾何。密集環境里,要命的差別恰恰不在輪廓:塑料杯和金屬罐可以占據相同位置,但機械臂推過去以后,一個會滑走,另一個可能成為穩定支點。

*圖 1:DAPL 學到的三類接觸選擇。自由空間足夠時避免無謂碰撞;接觸不可避免時穿過障礙;目標難以翻轉時主動借周圍物體施力。下排展示真實世界測試場景。來源:官方項目頁 teaser。*
因此,論文沒有繼續給靜態點云堆更大的編碼器,而是先問一個更物理的問題:如果此刻執行某個動作,場景中的點下一刻會在哪里、以什么速度移動?
DAPL 分成兩個階段。第一階段訓練一個物理世界模型,輸入目標物體、周圍場景和機械臂末端的局部點云。每個點除了三維位置,還帶有質量與速度;機器人動作作為條件,一起送入 Transformer。模型要預測下一時刻逐點的位置和速度。
這里的逐點預測很關鍵。只預測每個物體的六維位姿,容易把局部碰撞和接觸鏈壓得過粗;只重建靜態形狀,又學不到運動如何在物體之間傳遞。作者還給速度場加入方差約束,避免模型面對大量靜止點時,退化成“所有速度都接近零”的輕松答案。

*圖 2:DAPL 兩階段框架。左側世界模型從帶有質量、速度的局部點云中提取動力學表征,并預測動作后的逐點運動;右側強化學習策略把這份表征與機器人本體狀態、任務目標一起用于控制。來源:官方項目頁方法圖。*
第二階段才輪到強化學習策略。世界模型的隱表示會作為物理先驗,與關節狀態和目標位姿一起進入 actor-critic。策略輸出連續關節控制,由阻抗控制器執行。獎勵仍包含接觸、朝向目標運動和成功項,但不需要為“先撞哪個物體、再借哪個支點”逐條手寫行為腳本。
世界模型與策略會交替更新。早期策略產生的大量笨拙碰撞,反而暴露了更多接觸結果;作者用這些軌跡繼續更新世界模型,再讓更準確的動力學表征指導下一輪策略。三輪迭代中,成功率從 61.3% 上升到 71.8%。
我們認為,這個循環比“世界模型”四個字本身更值得記。模型專門學習當前策略最容易撞上的真實難題;策略變強以后,又會把數據分布推向更有任務價值的接觸。
為了讓這件事可測,團隊構建了 Clutter6D。它關注完整六維物體重排,而非平面上的二維推箱子;場景由約一萬件處理后的 Objaverse 資產組成,包含尺寸、質量、材質與空間關系。
基準按密度分成三檔:Sparse 放 4 個物體,Moderate 放 8 個,Dense 放 12 個。每一檔都有 128 個留出場景;任務不僅檢查目標是否到達指定位置和朝向,也計算非目標物體被擾動了多少。機器人不能靠把桌面全部掃開來換成功率。

*圖 3:Clutter6D 主要結果。S.R. 為成功率,M.O. 為非目標物體平均偏移。場景越密,靜態幾何方法下降越明顯;DAPL 在 Dense 場景達到 44.56%。來源:論文 Table I、官方項目頁。*
最有區分度的是 Dense。靜態接觸表征 CORN 的成功率從稀疏場景的 46.63% 降到 22.22%,DAPL 在 12 個物體的密集場景仍達到44.56%,正好翻了一倍;人工遙操作在同一檔為 20%。與此同時,DAPL 對周圍物體造成的平均偏移為 12.65 厘米,低于 CORN 的 17.43 厘米。
這說明更高成功率并非來自更用力地橫掃障礙。策略需要在接觸不可避免時穿過去,也要在自由空間足夠時收手,還要挑出真正能提供支撐的鄰居。
只看最終分數仍有一個漏洞:DAPL 會不會只是記住了常見幾何布局,所謂動力學表征只是多出來的一組特征?論文用兩類實驗回答了這個問題。
先看消融。在 Sparse 場景中,完整模型達到 71.88%;拿掉速度和物理屬性,只留下逐點世界模型后,成功率降到 42%。換成靜態重建任務,即使保留速度與物理輸入,也只有 29.63%。收益來自預測交互后的運動,而非單純增加模型容量。
更直觀的是質量交換實驗。作者保持物體位置、目標和外觀不變,只交換一塊派與薯片罐的質量。派更重時,策略主動把它當作穩定支點,用接觸產生翻轉所需的力矩;派變輕后,機器人轉而避開它,改借另一件重物完成動作。

*圖 4:相同場景、不同質量分配下的自適應行為。策略會在“借重物發力”和“避開輕物體”之間切換。來源:官方項目頁 Adaptive Behavior 視頻幀。*
同一張幾何地圖給出了兩條不同路線,變化只來自物理屬性。這是論文最接近“策略確實在使用動力學”的證據,也把外在靈巧性說得更準確:并非接觸越多越好,而是知道哪一次接觸會幫助任務。
仿真策略隨后零樣本部署到 Franka Research 3。系統用三臺 RealSense 獲取點云,SAM2 與 XMem 負責分割和跟蹤,FoundationPose 估計位姿;質量由視覺語言模型給出粗略先驗,速度通過時間差分與濾波獲得。作者沒有假設真機能拿到模擬器里的完美物理狀態。
在 10 個真實雜亂場景中,DAPL 平均成功率為48%,人工遙操作為 52%。它沒有在成功率上超過人,但平均執行時間是 42.6秒,快于人工的 55.9 秒。這組結果支持一個克制得多的結論:粗糙的質量和速度估計,已經足以讓策略在真機上做出有用的接觸選擇;它距離普遍超越人的操作能力還很遠。
團隊又把這項能力接到銀河通用 Galbot G1 的貨架任務里。VLM 規劃器先把“拿出餅干盒”轉換成目標位姿;DAPL 負責抓取前最麻煩的一段,把夾不到的商品滑出、轉正,送到下游抓取模塊能夠接手的位置。策略在數字孿生中訓練,沒有使用真實貨架交互數據。
這個組合暴露了 DAPL 的產業位置。它位于語言規劃與最終抓取之間,是一項 pre-grasping skill:當商品排列讓常規抓取失效時,先用環境接觸制造一個可抓狀態。對于真實零售貨架,這往往比再換一套抓取姿態更接近問題本身。
DAPL 把世界模型從視覺預測推進到一個更具體的位置:它不負責想象整段未來,而是為當前控制策略提供局部、逐點、帶物理屬性的接觸后果表征。對機器人學習而言,這條路線的價值在于重新定義了場景。周圍物體不再只有“障礙”和“目標”兩種身份,它們還可能是支點、緩沖、通道,或一碰就會破壞任務的輕質干擾物。
先別把它擴展成通用物理智能。真機評測只有 10 個場景,每個場景 5 次試驗;任務集中在剛性物體的桌面重排,成功閾值與 90 秒預算也寫得很明確。質量和速度仍需要外部模塊估計,論文沒有處理關節物體、柔性包裝、豐富觸覺或長程多階段操作。貨架演示還依賴獨立的 VLM 規劃與抓取模塊,代碼和基準目前也仍在準備中。
但它已經跨過了一個值得 RSS Best Paper Finalist 關注的門檻。過去,機器人看到雜亂場景,首先想到的是避開;DAPL 讓策略有機會先估計碰撞之后的運動,再決定避開、穿過,還是借力。
銀河通用王鶴團隊這項工作最值得留下的,不是把“推”做成了新的萬能動作,而是讓接觸第一次以可學習、可遷移的動力學表征進入策略。貨架越擁擠,這個區別越重要。