0
| 本文作者: 陸毅 | 2026-07-02 10:39 | 專題:RSS:機器人,科學與系統會議 |
來源:公眾號"北京中關村學院”
鏈接:https://mp.weixin.qq.com/s/YfC_vc-I6xebAR1_tlZa4Q
近日,機器人領域頂級學術會議 Robotics: Science and Systems (RSS) 2026 公布錄用結果,今年會議僅接收了210篇論文。北京中關村學院與清華大學、無問芯穹等聯合團隊的兩項成果成功入選,充分展現了該團隊在強化學習算法及系統、具身智能等前沿方向上的深厚的技術積累與領先的研究實力。
RSS是機器人領域頂級學術會議,以嚴苛的數學嚴謹性、算法可證明性與系統可復現性為核心特色,覆蓋機器人學習、感知、控制、規劃、人機交互等前沿研究方向。往屆會議曾涌現出在高速無人機避障、多機器人協同、人形機器人運動控制等多個方面的突破性工作。會議整體秉持「小而精」的定位,深耕基礎理論與核心算法研究,評審標準嚴格、科研成果質量突出。
RSS 2026
RLinf-USER:面向具身智能的真實世界可擴展在線策略學習系統
近年來,隨著具身智能的發展,研究范式正逐步從“仿真訓練+真實部署”轉向直接在真實世界中進行在線策略學習。然而,與仿真環境不同,真實世界具有不可加速、難以復位、成本高昂以及設備異構等特點,使得數據采集效率低、訓練過程不穩定,傳統依賴同步訓練和單機資源的強化學習系統難以擴展。因此,真實世界策略學習的瓶頸不再僅僅是算法問題,而本質上是一個系統問題。
針對這一挑戰,本文提出了一個統一且可擴展的真實世界在線策略學習系統RLinf-USER,從系統層面重構機器人學習范式。在規模化在線策略學習場景下,存在大規模異質硬件資源(機器人、端云計算卡)難以統一管理和調度的問題,USER采用統一硬件抽象層,將機器人硬件與計算硬件放在相同層級管理,實現“像使用GPU一樣使用機器人” ,具有高度可擴展性。
針對具身大模型在端云協同訓練時面臨的端云網絡跨域互通困難、集中式通信跨域開銷大等問題,USER設計了自適應通信平面,通過網絡隧穿和分布式數據通道降低跨域通信負擔,實現流量本地化, 完成了跨越千里的端云協同訓練(北京、深圳兩地多機同時學習),跨域場景下學習效率提升約3倍。針對仿真世界同步訓練架構效率低的問題,USER設計了全異步訓練架構,解耦數據生成、傳輸、訓練與權重同步,訓練吞吐提升5.7倍。針對長周期在線學習中多模態數據體量持續增長、純內存緩沖區容量受限、純磁盤存儲難以滿足高頻采樣需求的問題,USER設計了持久化緩存感知緩沖區,通過內存緩存與磁盤持久化存儲協同,結合動態索引組織與異步存取機制,實現了海量歷史數據的高效采樣與持續復用。此外,USER在統一的接口下,還支持多樣的學習組件(多種模型、算法和獎勵函數),模塊化的設計易于二次開發。

RLinf-VLA:面向視覺-語言-動作模型強化學習的統一高效框架
近年來,視覺-語言-動作(VLA)模型正成為具身智能的重要基礎,而強化學習(RL)為進一步提升任務成功率提供了關鍵手段。然而,當前 VLA 的 RL 研究仍存在三方面問題:一是模型、算法與仿真器相互割裂,缺乏統一平臺,難以公平比較與靈活擴展;二是渲染、推理與訓練之間耦合緊密,系統資源利用不足,效率受限;三是缺少系統性的訓練經驗總結,導致性能提升不穩定、復現成本較高。
為此,本文提出 RLinf-VLA,一個面向 VLA 強化學習的統一高效框架,其核心特點可概括為“多、快、好”。“多”在于通過統一接口支持多種 VLA 模型、RL 算法與異構仿真器,提升擴展性與評測一致性;“快”在于針對 RL 流水線設計靈活資源分配機制,并為 GPU 并行仿真提出混合細粒度流水線策略,實現1.61倍—1.88倍的訓練加速;“好”在于基于該框架訓練的模型在 LIBERO、ManiSkill 和 RoboTwin 等基準上取得約20%-85%的穩定性能提升,并進一步總結出一套有效的訓練實踐。RLinf-VLA 為具身智能中的 VLA 強化學習研究提供了一個統一、高效且可復現的基礎系統。

接連拿下兩個RSS頂會收錄的亮眼成果,既是北京中關村學院攜手清華大學、無問芯穹等聯合團隊科研創新能力的有力佐證,更是產學研協同研發模式高效賦能前沿探索的生動體現。面向未來,學院將持續聚焦具身智能前沿賽道,深化跨主體產學研聯動創新,以硬核技術積淀,為行業落地應用構筑穩固核心支撐。
論文鏈接:
https://arxiv.org/abs/2602.07837
https://arxiv.org/abs/2510.06710