0
| 本文作者: 叢末 | 2026-07-23 12:09 |

作者丨幸麗娟
編輯丨岑 峰
2026年,具身智能無疑迎來了最受矚目的“爆發期”與“大考年”。當大模型的浪潮席卷物理世界,那些在仿真環境中看似完美的算法,究竟能否在真實的復雜環境中存活?
2026 年7月13日至17日,帶著對這一終極問題的探索,第 22 屆 RSS 2026 在澳大利亞悉尼隆重舉行。作為機器人領域公認的三大頂會之一,RSS 以其嚴苛的錄用標準和獨特的單軌制報告模式著稱:主會期間只有一個主會場,所有參會者同時聆聽同一場主會報告,確保每一篇論文都經得起全場數百位頂尖研究者的審視。
雷峰網 & AI科技評論報道小組已抵達悉尼現場。在開幕首日,我們不僅看到了硬核的學術交鋒,看到了中國產業力量的強勢登場,更感受到了一種屬于機器人研究者的獨特氛圍。

01
7月 13日,RSS 2026在悉尼國際會議中心開幕。大會主席 Luca Carlone 走上講臺,沒有一板一眼地展示論文數據,而是像嘮家常一樣,把大家最關心的議程安排交代得明明白白。

他特意提到,主會議程會在周四全部結束,當晚的宴會大家可以徹底放松。“沒有人需要擔心第二天還要做報告”,對于特種兵式的參會者而言,這句話的含金量不言而喻。
接著,他將目光投向臺下的學生群體,特別是第一次參會的年輕人,分享了兩條發自內心的建議。
第一條建議關于社交:他鼓勵大家,不僅要主動去和大牛搭話,更要珍惜和身邊同齡人相處的機會。“你今天認識的同齡人,可能就是未來這個領域的推動者,你正在為整個職業生涯積累人脈”。
他風趣地分享了一個跟大牛做朋友的萬無一失的辦法,那就是"等你現在的朋友變成大牛"。他拿自己舉例: 2012年也是在悉尼,他和 Kris Hauser 等人都是誰也不認識誰的“無名小卒”,大家天天泡在一起,聊天、吃飯,而十年后,他們輪流當上了會議主席。(注:Kris Hauser 是RSS 2022程序主席)
第二條建議關于心態。他說,現在機器人領域發展太快了,每天都有令人驚嘆的新成果冒出來,但千萬別因此焦慮,別覺得自己跟不上。"你看到的那些炫酷視頻,真實效果并沒有拍的那么好",“你看到的是全世界幾千個研究者加起來的總成果,不是哪一個人比你厲害多少”。
他還提到,能來 RSS,你就已經站在機器人領域最高水平的賽場上了。和世界上最厲害的人同臺競技,有時確實會覺得吃力,但反過來想——你其實也正在和世界上最厲害的人并肩作戰。
在論文投稿壓力與同輩競爭焦慮交織的學術生態里,有人告訴你"你看到的沒那么好"、"你不是一個人在面對",本身就是一種寬慰。而 Luca Carlone 帶著幽默給出的這兩條樸實的建議,比任何技術層面的指導都更讓人感到溫暖。

02
▎“Manipulation 1” Oral 報告
伴隨著他宣布“RSS 2026正式開幕”,首個Oral 報告環節“Manipulation 1”隨即展開,由新加坡國立大學講座教授 David Hsu與斯坦福大學助理教授 Jeannette Bohg 共同主持。
9 篇論文依次亮相,主題集中于雙臂操作、靈巧操作和接觸豐富的操作任務,與近年來RSS論文風向從“單臂抓取”向“靈巧操作”演變的趨勢高度吻合。

Speaker 登場答疑合照
這 9 篇論文大致歸為三個方向。第一個方向是數據效率與泛化,這也是最受關注的方向之一。
BiDemoSyn(Huayi Zhou, Kui Jia)提出從單個真實世界演示中合成數千個多樣化雙臂演示,解決了遙操作勞動強度大與模擬數據存在sim-to-real gap的核心矛盾。
DexImit(Juncheng Mu等)則將單目人類操作視頻自動轉換為物理上合理的機器人數據,首次實現了從任意互聯網視頻到機器人靈巧操作數據的端到端轉換。
SID(Yicheng Ma等)另辟蹊徑,在六個真實世界任務中,僅用兩次演示就在分布外初始化下實現約90%的成功率,為少樣本操作提供了新范式。
第二個方向是觸覺與接觸建模。
Contact-Grounded Policy (CGP)(Zhengtong Xu等)通過預測未來接觸結果并將其映射為可執行的控制器目標,在多指手靈巧任務上顯著優于純視覺和視覺觸覺擴散策略基線。
Semantic-Contact Fields (SCFields)(Kevin Yuchen Ma等)將視覺語義與密集接觸估計統一為3D表示,在刮削、繪制和剝離任務上實現了穩健的類別級泛化。
TactAlign(Youngsun Wi等)則提出用修正流將人類與機器人的觸覺觀測映射到共享潛空間,無需配對數據即可實現跨本體觸覺遷移。
第三個方向是學習與數據策略。
Supervised Mixture-of-Experts (Lorenzo Mazza等)針對手術操作的結構化特點,讓五個專家分別負責五個任務階段,僅憑不到150個演示就學會了復雜的長時程操作。
A Systematic Study of Data Modalities(Fanqi Lin等)大規模考察了五種共同訓練數據模態,發現視覺-語言數據與跨本體機器人數據的組合最有效。
UMI-Underwater(Hao Li等)則開辟了全新場景——在陸地上采集人類演示,零樣本遷移到水下抓取,徹底擺脫了對水下遙操作的依賴。
值得一提的是,這9篇論文中“華人含量”極高,有 4 篇的作者均為華人(BiDemoSyn 、 DexImit、SCFields、SID)、另有 4篇有華人學者參與(CGP、A Systematic Study、UMI-Underwater、TactAlign )。
也就是說,9 篇中有 8 篇涉及華人作者,這一數據從側面印證了中國學者在具身智能與機器人操作前沿領域的活躍度與競爭力。
▎“World Models & Memory” Oral 報告
緊隨“Manipulation 1”之后,“World Models & Memory” Oral 報告環節繼續登場,由澳大利亞昆士蘭科技大學(QUT)教授 Michael Milford 與香港大學助理教授李弘揚(Hongyang Li) 共同主持。
如果說“Manipulation 1”關注的是機器人“如何動”,那這個環節則聚焦于機器人“如何思考”與“如何記憶”——通過構建內部的“世界模型”來預測未來、模擬環境,并借助記憶機制應對長時序任務。

Speaker 登場答疑合照
這個環節的9篇論文主題多元,整體可以分為四個方向:
第一個方向是視頻生成與隱空間世界模型。
LingBot-VA(Lin Li等)將視頻預測與動作推理統一為因果序列,是全球首個開源的自回歸視頻-動作世界模型,在RoboTwin 2.0的50個雙臂操作任務中成功率達92.0%。
Interactive World Simulator(Yixuan Wang等)則利用一致性模型同時進行圖像解碼和隱空間動力學預測,在單張RTX 4090上實現了超過10分鐘、15 FPS的穩定長時程交互模擬。
ViPSim(Longyu Chen等)通過視覺空間與參數空間的協同,將末端執行器姿態的像素對齊投影、深度場景幾何等顯式空間先驗與原始動作序列、相機矩陣等參數空間驅動相結合,確保長時程生成中幾何邊界與數值指令的統一約束。
第二個方向是模擬到現實的遷移。
Simulation Distillation(Jacob Levy等)將模擬器中的結構先驗蒸餾到潛空間世界模型中,再通過在線規劃和短時域動力學微調實現快速真實世界適應。
HAIC(Dongting Li等)則針對人形機器人提出了動力學感知的世界模型,僅從本體感受歷史估計高階物體狀態,實現全身控制與物體操作的協調。
第三個方向是記憶增強與檢索。
Memory Retrieval(Rutav Shah等)聚焦于視覺運動策略中的記憶檢索機制,通過基于注意力的記憶檢索模塊,使策略能夠在長時程任務中調用相關歷史經驗。
RAG-Diff(Ruolin Ye等)則通過檢索增強的引導機制,將擴散策略適配到動態約束中。
第四個方向是策略學習與自我改進。
RISE(Jiazhi Yang等)通過組合式世界模型實現策略的自我改進,在動態積木分類任務中提升超過35%,背包打包提升45%,盒子關閉提升35%。
Act2Goal(Pengfei Zhou等)探索如何從世界模型中蒸餾出通用的目標條件策略,實現對新物體、新空間布局和新環境的強零樣本泛化能力。
從作者來看,“World Models & Memory”口頭報告 9 篇論文全部都有華人學者參與,其中5篇作者全部為華人,延續了“Manipulation 1”環節的高華人占比態勢。

03
當天,11 場 Workshop 同時召開,我們特別前往了香港大學助理教授李弘揚等人組織的 “Towards Robust Execution of Long-Horizon Whole-Body Control Tasks”(面向長時程全身控制任務的魯棒執行)。

這場 Workshop 聚焦一個相當棘手的現實問題:機器人在短時程任務上已經進步很快,但一放到長時程、復雜任務中就容易掉鏈子。討論的話題覆蓋了多階段任務的在線進度估計、運行時故障恢復、層次化與記憶增強策略、以及利用基礎模型做閉環任務規劃等。
其中,清華大學的弋力(Li Yi)教授作為特邀嘉賓,帶來了題為 《Beyond Imitation: Executable, Correctable, and Adaptable Skills for Humanoid Robots》(超越模仿:人形機器人的可執行、可修正、可適應技能)的報告。

他提出,人類運動數據可作人形機器人的行為先驗,但必須經過“可執行、可修正、可適應”三步轉化。他介紹了團隊在“HumanoidGPT”上的最新進展——一個基于20億幀人類運動數據訓練的運動跟蹤基礎模型,展示了清晰的Scaling行為;以及人形機器人打網球的系統級工作——利用人類運動先驗作為搜索空間,通過高層策略從中選擇和組合有效行為,首次實現了人形機器人在真實球場與人類對打。他還討論了 Sim-to-real 的閉環問題,通過關節級神經動力學模型補償模擬器與真實硬件的差異。
另一場是 “4th Workshop on Dexterous Manipulation: Scalable Learning for Human-Level Skills” (第四屆靈巧操作研討會:面向人類級技能的可擴展學習)。靈巧操作作為今年RSS絕對的主角之一,這場 Workshop的氛圍異常“熱鬧”。

這場 Workshop 聚焦靈巧操作在 2026 年正經歷的一場關鍵轉變:核心問題已從“如何控制這些手”轉向“如何規模化靈巧操作”。討論的話題覆蓋了五個層面:
在學習、規劃與控制的協同方面,探討無模型學習與控制理論的混合方法、通用策略與專用策略的取舍;
在數據、模擬與真實世界遷移方面,關注復雜接觸建模與仿真加速、低成本遙操作系統開發以及策略魯棒性;
在感知層面,討論觸覺與視覺的關系以及觸覺傳感器的最優利用;
在硬件層面,聚焦靈巧手的緊湊設計與耐用性;
在動態與強力操作方面,則探討高頻控制下的學習策略與安全柔順性問題。
值得一提的是,方浩樹(Hao-Shu Fang)作為去年該論壇的 Best Paper 獲獎者,也受邀在該論壇上發表了演講。

04
除了學術報告和workshop,展廳里的產業展臺同樣人頭攢動。智元機器人(AGIBOT)、Sharpa 與 千尋智能(Spirit AI) 三家中國公司,以鉑金贊助商的身份亮相本屆 RSS,收獲了Top級關注。
智元機器人的展臺前圍了不少人。這次他們帶來了完整的具身智能產品矩陣,全尺寸人形機器人A2、緊湊型X2、輪式工業機器人G2、四足機器人D1都擺了出來。

其中G2專為工業精密裝配和連續作業設計,通過真實世界強化學習來優化操作。但最抓眼球的還是 OmniHand 靈巧手——多關節靈活設計,能完成接近人手的精細操作。展臺工作人員一直在做動態演示,從抓取到裝配,動作流暢程度讓不少參會者停下腳步。
Sharpa 的展臺同樣熱鬧。這家機器人公司的聯合創始人正是禾賽科技的三位創始人李一帆、向少卿和孫愷。

展臺中央的 Sharpa North 人形機器人是全場焦點。它搭載了Sharpa自研的 Wave 靈巧手,1:1人手比例,22個主動自由度,每個指尖內置超過1000個觸覺傳感單元,壓力靈敏度達0.02N。
千尋智能的展臺前,討論的聲音也不小。這家2024年成立的公司,定位是構建機器人的“通用大腦”。

展臺重點展示了其開源的 Spirit v1.6 具身智能基礎模型——剛剛登頂RoboArena全球排行榜,成為首個做到這一點的中國模型。
三家企業,三種路徑:智元從整機到靈巧手全棧布局,Sharpa以靈巧手為支點撬動整機與模型,千尋智能則專注"通用大腦"這條模型賽道。但共同點是——它們都在用各自的方式回答同一個問題:具身智能如何從實驗室走進現實。
從論文到產業,從研究到產品,RSS 2026 的展臺讓我們看到,具身智能正在加速走向現實。 雷峰網 雷峰網 雷峰網

05
充實而高密度的RSS 2026首日落幕了。
在這里,我們聽到了大會主席“不要焦慮,并肩作戰”的溫情建議;見證了 Oral報告環節華人學者獨占鰲頭,以及機器人“如何動”、“如何思考”的學術風向演進;也看到智元、Sharpa、千尋智能等中國企業站上展臺C位,用產品回應“具身智能如何落地”的時代命題。
大模型賦能下的機器人,正在以前所未有的速度,跨越從實驗室到真實世界的鴻溝。正如我們今天所看到的現場論文分享和令人震撼的展臺所展示的:具身智能的奇點已現曙光,它不再是遙遠的科幻,而是在這群全球最聰明的大腦的日夜打磨中,悄然降臨。
接下來 4 天,AI 科技評論將在 RSS 2026 現場持續帶來報道,敬請關注。雷峰網雷峰網(公眾號:雷峰網)雷峰網
一個人讀論文太孤單,一群人刷頂會才好玩。
RSS 2026 召開在即,我們正在召集一波含金量極高的 AI 研究者。群內主打實時論文跟蹤與硬核技術探討,拒絕灌水。
? 進群傳送門: 掃碼進群或添加微信Luyoyo_2026,備注:論文群 + 關注的 AI 方向。

搞科研/搞技術,信息差很重要。
來,一起快人一步!
上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。