0
| 本文作者: 林軍 | 2026-05-02 10:29 |
近日,由浙江人形機器人創新中心聯合香港中文大學、浙江大學等多家高校與科研機構共同完成的機器人空間智能研究 “A retrieval-augmented framework enabling VLM spatial awareness for object-centric robot manipulation”發表于國際頂級機器人學術期刊《Science Robotics》。該研究提出名為RAM(Retrieval-Augmented Manipulation)的三維空間理解與操作模型,為提升機器人在復雜長程任務中的操作可靠性提供了新的技術路徑。
技術背景:大模型時代,機器人的空間智能難題
以視覺語言大模型(VLM)為代表的 AI 技術正在提升機器人理解自然語言指令和分解復雜任務的能力。但從“聽懂指令”到“完成動作”之間,仍存在關鍵鴻溝:機器人需要在三維空間中理解物體的位置、朝向、尺度、可操作區域及相互關系,并將這些信息轉化為可執行的運動約束。
現有大模型多依賴二維圖文數據訓練,缺乏直接的物理世界經驗,在推理物體位姿和空間關系時容易產生不符合物理規律的判斷。如何讓模型獲得可驗證、可遷移的三維空間知識,并將高層語義規劃與底層物理執行連接起來,是具身智能和機器人操作領域的重要問題。
研究成果:RAM框架,用“知識檢索”讓機器人讀懂三維世界
針對這一挑戰,RAM 借鑒檢索增強生成(RAG)的思想,為大模型配備可查詢的外部三維知識庫。機器人執行任務時,模型可以按需檢索物體類別、幾何屬性、功能平面、抓取點等空間先驗信息,從而彌補視覺語言模型自身三維空間理解不足的問題。與將知識隱含在模型參數中不同,RAM 的空間知識更加顯式、可解釋,也便于擴展。
RAM框架整體流程示意圖
RAM 由三個模塊組成。首先是物體類別級知識引擎,研究團隊為每類物體建立標準化三維模板,并標注姿態、尺寸、對稱性、抓取點和功能平面等信息。實驗顯示,這類模板可遷移到不同形狀、尺寸和紋理外觀的同類物體實例上,減少對每個具體物體逐一建模和標注的依賴。
第二個模塊是三維視覺接地模型,負責把知識庫中的標準化先驗遷移到真實場景中的具體物體上。該模型基于視覺基礎模型 DINO 構建,結合二維圖像特征與三維點云信息,建立觀測物體與模板之間的對應關系,從而獲得物體姿態、抓取方式和功能平面等信息。該模塊主要基于合成數據訓練,并在真實場景實驗中展現出對多種未見物體實例的泛化能力。
三維空間知識向真實場景物體的遷移示例
面向鉸接物體的三維空間知識遷移示例
第三個模塊是檢索增強任務規劃器。它將接地后的空間信息以結構化文本形式注入大模型上下文,使大模型在分解復雜指令時能夠生成帶有明確空間約束的操作步驟。例如,對于“把碗放在盤子上”,系統會將“底面與頂面平行對齊”“中心點在水平方向對齊”等約束納入規劃,再轉化為機器人的運動軌跡。
實機驗證:從指令執行到自主決策,檢驗空間智能
為檢驗 RAM的空間智能水平,研究團隊在真實機器人平臺上設計了三個層次遞進的系統實驗,涵蓋 14 項空間操作任務、31 個物體實例和 11 個物體類別。
第一類實驗面向語言指令驅動的空間操作,包括單物體單步、多物體單步和多物體多步任務,測試機器人對位置、朝向、空間關系和長程規劃的理解能力。在總計 120 次重復測試中,RAM 取得 89.17% 的平均成功率。
空間語言指令驅動的機器人操作結果評估
第二類實驗面向圖像引導的空間操作。以看圖擺放餐具為例,機器人需要從二維參考圖中推理物體的三維相對位置和朝向,并映射到當前工作空間中順序執行。在多種參考圖和隨機初始位置測試中,RAM 取得 92.00% 的平均成功率。
圖像引導的機器人操作任務示例
第三類實驗面向基于空間推理的自主決策。研究團隊通過改變臺面高度和物品尺寸構造約束場景,檢驗系統能否根據物理條件選擇合適策略。當直接操作受限時,RAM 能規劃借助中間工具的間接操作方案,體現了其對空間約束的自適應規劃能力。
基于空間約束的自適應任務決策
此外,團隊構建了面向機器人操作場景的空間理解問答評測集,從相對位置、旋轉方向、操作可行性、任務規劃和尺寸估計等維度評估模型的空間認知能力。結果顯示,在該評測集覆蓋的多類空間推理任務中,RAM 整體表現優于多種代表性視覺語言大模型。
機器人空間理解問答評測
除核心任務外,RAM 還展現出一定通用性與擴展性。在模型層面,它可適配 GPT、Claude 和 Qwen-VL 等主流大模型;在操作對象上,從剛體擴展到鉸接物體和可變形物體;在硬件平臺方面,也已在包括配備五指靈巧手的人形機器人等多個平臺上完成驗證。
算法賦能平臺,為人形機器人注入空間智能
人形機器人要走向真實應用場景,不僅需要硬件本體、靈巧手和運動控制能力,也需要理解三維環境、判斷物理約束并規劃可執行動作的算法能力。RAM 所展示的空間智能路徑,與浙江人形機器人創新中心長期關注的人形機器人平臺建設、靈巧操作和具身智能方向高度相關。
目前,中心圍繞關節模組、執行器、整機系統、五指靈巧手和運動控制系統等方向開展研發,同時在視覺感知、三維重建、運動規劃、軌跡優化和大模型驅動的具身智能算法方面持續布局,為前沿算法的部署、測試和工程驗證提供平臺基礎。
產業布局:從前沿技術到多元場景落地
空間智能技術的研究也為人形機器人未來走向復雜應用場景提供了支撐。圍繞平臺建設與場景需求,浙江人形機器人創新中心正持續關注三維感知、任務規劃、靈巧操作和具身智能等關鍵能力的融合發展,推動相關技術在工業制造、家庭服務、智能康養等場景中的探索驗證與逐步落地。
面向智能康養等更具挑戰性的場景,機器人需要在與人近距離交互的環境下完成物品遞送、生活輔助等任務,對空間感知準確性與操作安全性提出更高要求。中心已在深圳成立邇伴智能機器人有限公司,聚焦面向養老康養場景的人形機器人產品與解決方案研發。
未來,浙江人形機器人創新中心將繼續推動前沿研究與工程實踐之間的銜接,圍繞機器人空間認知、長程任務規劃和自主決策等方向開展探索,助力人形機器人在更復雜、更真實的環境中實現可靠操作與智能協作。
雷峰網雷峰網雷峰網(公眾號:雷峰網)
雷峰網特約稿件,未經授權禁止轉載。詳情見轉載須知。