0

作者丨張 璐
編輯丨齊鋮湧
2026年7月14日上午10點,機器人領域國際頂級學術會議 RSS(Robotics: Science and Systems)現場掌聲雷動。
香港大學助理教授、源策未來創始人李弘揚,榮獲 RSS 2026 年度“青年成就獎”(Early Career Spotlight),值得一提的是,他也是該獎項設立20年以來唯一的國人獲獎者。
在隨后的重磅演講中,李弘揚全面闡述了從“全身控制(WBC)”向“全身智能(WBI)”演進的范式轉移,并將其定義為具身智能的下一座“高山”。
演講結束后,李弘揚在現場接受了雷峰網(公眾號:雷峰網)AI科技評論的獨家采訪。以下為本次演講及現場問答的全程實錄:

01
謝謝主持人的熱情介紹。其實我準備了一頁背景介紹的 PPT,結果被你把詞兒全念完了(笑)。
大家好,我是來自香港大學的李弘揚。我們團隊的核心目標,就是通過擴大具身系統的規模,來實現具備通用性和智能化的機器人能力。
今天我的演講主要分為三個部分:第一,為什么我們要從局部操控或單純的全身控制,走向“全身智能(WBI)”;第二,我們在算法、數據、基準測試和硬件上面臨的挑戰與解決方案;第三,對未來的總結。
▎以前我們讓機器人“能走、會拿”,現在我們想讓它“全身一起動起來”
過去,我們看到了許多優秀的專業化能力。比如在環境里導航,或者利用具備高自由度雙手的上肢進行靈巧操作,亦或是讓人形機器人穩定地行走。
也有人嘗試把這些任務組合起來,比如“移動+操控”的串行任務,機器人先導航走到位置,再去伸手拿東西。
但我們想做的是全身協同操控——上肢和下肢在具身智能的驅動下,同時為了一個目標去協作。
在全身智能之前,是傳統的 WBC(系統 0 / 0.5),它的核心是讓參考運動變得可行,關注的是物理穩定性、接觸力以及實時執行。這更偏向底層的控制工程。
而我們倡導的 WBI(全身智能),它的核心是讓機器人學會“行為”。它關注的是全身行為的任務理解、多機器人與多任務之間的協同、在未知環境中的泛化與恢復能力,以及持續學習的能力。

為什么要這種轉變?我舉幾個我們在 Unitree G1 機器人上做實驗的實際例子:
當 G1 去搬一輛非常重的自行車時,它不能只靠手臂,必須調動全身的力量往后拉;當它和人類并排走過一條非常狹窄的通道時,它需要側過身子橫著走;當它想拿沙發下左側的東西時,它的右臂必須自然地撐在沙發上以防摔倒;當它要去夠一個很遠的目標時,它的另一只手臂必須抬起來以保持全身的質心平衡。

這絕對不是簡單的“手臂操控 + 腿部行走(A + B)”,而是全身作為一個整體的協同。我認為,WBI 就是機器人領域下一座必須攻克的“最高山峰”。

RSS 2026 演講現場,李弘揚拆解 WBI 核心技術棧的演進路徑,涵蓋了從長周期全身自主到閉環反應式行為恢復等多層級突破,強調全身智能是一項系統級的宏大工程。
▎我覺得,要想實現全身智能,得給機器人裝一個“超級大腦”,再配上“強壯”的身體。
為了實現這一目標,我們設計了一個預訓練中心架構:

李弘揚現場講解“以預訓練為中心”的全身智能(WBI)核心架構。該架構將具身智能系統清晰劃分為系統2(大模型層)、系統1(人形基礎模型)、系統0.5(行為先驗與約束)及系統0(底層全身控制系統)。
最頂層是“系統 2”(大模型層),負責最高層的語義、記憶和長期規劃。輸入的是高層語言指令,輸出的是拆解后的子目標。
往下是“系統 1”(人形基礎模型),這是直接從頭訓練的原生人形大模型,它輸入視覺和身體狀態,直接輸出身體各部位的動作姿態。
再往下是“系統 0.5”(行為基礎模型),負責提供身體先驗和約束,生成參考運動。
最底層是“系統 0”(底層控制器),也就是傳統的通用追蹤器,確保動作的物理可行性和最終執行。
▎聊聊我們團隊最近折騰出來的幾件大事
圍繞這個架構,我們團隊在算法、數據和硬件上做了一系列努力:
首先是大規模人類機器人協同預訓練。我們利用了超過 10 萬小時的數據、3000 多個環境和 700 多個角色進行了大規模預訓練。
我們得到的最大啟發是:人類數據絕對不是具身智能的“配菜”,它就是泛化能力的核心引擎!

李弘揚介紹的團隊的野外真實場景數據采集項目“EgoHumanoid”。該項目通過讓采集人員在超市購物、戶外散步、整理內務等日常場景中穿戴設備,獲取了海量高質量的第一人稱視角交互數據
其次是基于世界模型的強化學習后訓練(RISE)。傳統的物理世界強化學習太慢了,容易傷硬件,還要頻繁人工重置。我們把“世界模型”引入到了后訓練階段,通過并行的大規模 Rollout(模擬產出),極大地提升了策略更新的效率和準確度。


通過組合式世界模型在虛擬想象空間中進行并行大規模的 Rollout,完成了“動作生成-優勢評估-策略更新”的閉環迭代
▎硬件離完美還有距離,數據的未來也有公式可循
當然,這條路還很長。即使是目前世界上部署量最大的優秀硬件,在實際測試中依然會遇到各種讓人頭疼的“翻車”現場:無線通信導致的丟包、關節過流保護突然癱倒、高負荷運載時的電機過熱等等。硬件離完美還有距離。

在數據配比上,我的觀點是:未來人類中心的數據(Human-centric data)應該占到 80% 到 90% 的絕大多數,而機器人自身的原子技能數據占 10% 到 20%,最后再通過機器人策略進行后訓練。

李弘揚現場發布團隊關于人類原生學習的最新具體成果。該項目提出了一個創新的協同訓練配方,旨在利用大規模人類中心數據直接驅動人形機器人完成復雜任務。

“EgoHumanoid: Co-Training Recipe”全景流程。
想要真正實現 WBI 的全面爆發,我們不妨大膽預測一下公式:大概需要一個 100 億參數(10B)的模型,超過 10 萬小時(100K hours)的高質量人類數據,以及至少 500 到 1000 張 H200 級別的 GPU。

這是一個系統級別的宏大工程,但我相信這一天很快就會到來。
謝謝大家!


02
▎Q1(現場觀眾): 你提到持續改進(Continuous Improvement)是全身智能(WBI)的四大核心之一。你能詳細講講持續學習(Continuous Learning)或者終身學習在你的架構里扮演什么角色嗎?
李弘揚: 謝謝。我們這里強調的持續學習,更側重于物理世界中的“閉環反饋”。比如當機器人被部署到一個全新的環境,或者面對某些失敗任務時,它會從環境獲得負反饋或負面獎勵(Negative Reward)。通過不斷收集這些新環境下的交互數據并反哺模型,讓模型產生自我迭代。這跟純機器學習領域定義的持續學習會稍微有一點點概念上的不同,它更強調具身交互的閉環。

▎Q2(現場觀眾): 大家都知道數據非常關鍵。那你認為我們是應該花大力氣去采集足夠多的真實世界數據,還是去開發一個極度逼真的超寫實仿真環境,直接在里面做廉價的強化學習?
李弘揚:這問得很直接。我認為目前獲取有效數據最快的方式,是基于現有的開源數據和社區協作(比如 Hugging Face 上的優質數據集)。至于仿真環境(Simulation),我認為它在訓練底層的運動控制器(下肢行走、平衡等)時非常有效且成本低廉。但是,如果你想去 scale up(擴大)機器人的高級大腦(系統 1 和系統 2),去理解復雜的語義和千變萬化的任務場景,仿真環境現在能提供的價值還非常有限,我們必須依賴真實世界的數據。
▎Q3(現場觀眾): 如果我們直接把現有的視覺大模型或者多模態大模型,接入到一個更大的動作空間里,是否能直接驅動全身智能?我們有必要去采集專門的全身數據嗎?
李弘揚: 正如我前面提到的,全身智能絕不是“手臂數據 + 腿部數據”的簡單拼接(A + B)。當機器人要完成很多全身協同的任務時,它需要兩條腿作為支撐,同時手臂去發力,這需要全身的動力學在一瞬間進行完美的交織。現有的局部數據或者單純的視覺大模型沒有這種全身協同的先驗。因此,搭建一套能夠采集整個人體/機器人全身傳感器(包括機載相機、IMU 等)的數據流水線,是實現真正全身智能的基礎,這也是視覺大模型替代不了的。
一個人讀論文太孤單,一群人刷頂會才好玩。
RSS 2026 召開在即,我們正在召集一波含金量極高的 AI 研究者。群內主打實時論文跟蹤與硬核技術探討,拒絕灌水。
? 進群傳送門: 掃碼進群或添加微信Luyoyo_2026,備注:論文群 + 關注的 AI 方向。

搞科研/搞技術,信息差很重要。
來,一起快人一步!


上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。