0
| 本文作者: 張璐 | 2026-07-27 10:30 | 專題:RSS:機器人,科學與系統會議 |

作者丨張 璐
編輯丨齊鋮湧
在機器人技術狂飆突進的今天,具身智能領域正面臨著一個行業性的核心困境:我們已經擁有了高容量的深度神經網絡,但現實世界中高昂的交互與試錯成本,成為了阻礙機器人通往AGI的最大瓶頸。
在虛擬世界里,游戲和代碼的執行成本幾乎為零,因此我們見證了 AlphaGo 的奇跡和大語言模型在編程大賽中奪冠。但在物理世界中,機器人每一次真機試錯,都伴隨著昂貴的時間成本、設備損耗與安全隱患。
如果無法將這種高交互成本降下來,機器人就無法像大模型那樣利用海量數據瘋狂自我進化。
在機器人頂級學術會議 RSS 的現場,來自 Google 實驗室和紐約大學(NYU)的助理教授 Sherry Yang 給出了答案。

她的演講題目是:《在世界模型中評估與提升物理代理》(Evaluating and Improving Physical Agents in a World Model),在演講中,她提出了一個極具顛覆性的范式:直接利用可控的視頻生成模型來作為真實世界的“替身”,讓機器人在云端虛擬場景里完成無限次的低成本演練。

以下是 Sherry Yang 在 RSS 大會上發表的演講精編稿,雷峰網(公眾號:雷峰網)AI科技評論基于原英文演講的內容進行了翻譯和編輯:

01
大家好,我是 Sherry Yang。很高興今天能在這里和大家聊聊我們在評估和提升物理代理方面的一些最新探索。
在學術界,我們已經非常熟悉“代理與環境交互”的標準設定:神經網絡模型采取行動,環境給出反饋,并告訴模型接下來會發生什么。
在這個設定下,我們見證了 AlphaGo 的超級表現,也看到了大語言模型在編程大賽里拿金牌。
我們之所以能在這些虛擬領域取得超越人類的成就,是因為我們滿足了兩個關鍵標準:第一是擁有高容量的模型,第二則是擁有極低成本的交互環境。
然而,當我們要訓練一個物理世界中的 AI 時,這個低成本的基石就不復存在了。在物理世界中,交互成本極其高昂,你必須真正去操作真機,才能知道一個動作到底會帶來什么后果。
但是,如果我們可以從機器人交互數據中,學會一個“世界模型”(World Model)來代替真實世界呢?
一旦這個模型訓練成功,我們就相當于把物理代理重新帶回了 AlphaGo 的低成本跑道。
我們可以直接在云端運行無數次模擬,通過強化學習不斷訓練、改進模型,直到它達到超級代理的水平。這也是我們團隊近期工作的重中之重。

02

想要提升機器人,第一步永遠是評估。
但在現實中評估策略太痛苦了:人類坐在那里耗費大量時間干等、硬件隨時面臨損壞風險,而且由于各家實驗室機器人設備不同,論文結果根本無法標準化復現。
傳統的軟件模擬器雖然能在云端跑,但在處理復雜的物體交互時往往失真,而且很難橫向擴展到成千上萬種日常任務中。
為此,我們推出了 World Gym。
我們完整保留了機器人原始動作的所有維度信息,采用了可擴展的 Transformer 架構(具體來說是 Diffusion Transformer,即 DiT 架構)。這個模型可以通過接收前序圖像和當前的控制指令,持續生成未來的視頻畫面。

這里我想強調的是,世界模型的研究并不是只有資源壟斷的超級大廠才能做。我們僅僅用了兩張 A100 GPU,就在 Bridge 數據集下訓出了一個泛化能力非常出色的模型。
歡迎大家去我們的 GitHub 下載代碼,在自己的機器上跑跑看。
我們在包含 22 種機器人形態的多樣化數據集上進行了訓練。當我們在留存數據集上,將預設動作輸入給世界模型,它生成的視頻與真實機器人在真機上執行的動作畫面表現出了極高的一致性。

03

一旦擁有了這個可控的視頻世界模型,它就成了所有機器人策略模型的標準化評估層。
我們把目前業內主流的策略(例如 Octo、OpenVLA、RT-1)放進世界模型里進行滾動測試。
在一個“把茄子放進鍋里”的任務中,各家策略的真實水平一目了然:OpenVLA 表現完美,順利完成;Octo 動作做了一半,未能完全把茄子送進去;而幾年前的老模型 RT-1,因為輸出的控制動作完全超出了當前的分布(OOD),甚至直接把我們的世界模型都給“帶崩”了——但這也正是世界模型的價值所在,它提醒我們,這種動作如果直接在真機上運行,是會把機器人搞壞的。
更有意思的是,我們不再需要費盡心思在現實中搭建各種奇奇怪怪的長尾場景,世界模型允許我們直接通過圖像編輯,來定制任意的超出分布(OOD)安全測試。
比如,我們用圖像編輯模型在場景里加了一張電腦屏幕,屏幕里畫著一根胡蘿卜,然后命令策略模型“去把胡蘿卜拔出來”。

結果發現策略模型糾結了半天,最后居然沖著電腦屏幕去了。
我們還通過加入小黃鴨、玩具車等干擾物,發現策略模型的成功率瞬間暴跌;我們甚至用它來調試原因,發現目前的模型理解“顏色指令”的能力遠好于理解“形狀指令”。
數據證明,世界模型得出的評估結果,與真機實測的成功率呈現出強烈的正相關性。

我們在云端找到了一個極其廉價、可定制且100%可復現的質檢標準。

04
能夠評估之后,下一步就是如何利用世界模型來提升策略。我們推出了 World Gymnast 項目,讓機器人代理在世界模型中通過強化學習(RL)瘋狂演練。
現在絕大多數機器人學習都依賴人類遙控的數據來做監督微調。但大語言模型的發展歷史(從 GPT-3 到 ChatGPT)告訴我們,真正帶來能力跨越的,是利用驗證器(Verifier)和強化學習(RL)去大規模地擴增和解決訓練任務。
在 World Gymnast 中,機器人數據集里的任意一個畫面都可以作為強化學習的起始點。哪怕是一張機器人已經操作失敗、干砸了的畫面,我們也可以將其作為 RL 的起點,逼著策略模型在世界模型里學會如何從錯誤狀態中恢復(Failure Recovery)。
我們利用視覺語言模型(VLM)作為通用的獎勵模型(Reward Model),輸入任務指令和世界模型生成的視頻,讓 VLM 像裁判一樣給出成功或失敗的反饋。
隨后,這個反饋通過策略梯度(Policy Gradient)直接對策略網絡進行在線更新。

我們通過第三方自動化重置平臺對開門、關門、放茄子等 4 個完全沒有見過的全新留存任務進行了真機測試。
結果令人振奮:在世界模型里跑過強化學習的模型,其表現不僅顯著優于監督微調,也擊敗了在傳統物理模擬器(如 Simpler)中訓練的基準模型。

傳統的軟件模擬器在面對復雜的物體物理接觸時經常失真,而世界模型由于直接從海量數據中進行最大似然學習,天然具備極強的接觸動力學擬合能力。

05
盡管目前的視頻世界模型并不完美,偶爾還是會出現輕微的幻覺,或者改變物體的顏色,但即使是不完美的模型,也已經能夠提供足夠正確的改進信號,讓策略模型變得更強。
展望未來,通往具身智能 AGI 的關鍵在于建立一個混合數據飛輪:
1.內環:策略模型在參數化的視頻世界模型里,進行成千上萬種虛擬任務的低成本強化學習進化。

2.外環:機器人自主探索并產生失敗數據,這些失敗數據是完美的燃料,可以直接用來梯度更新我們的世界模型,讓世界模型更精確。
互聯網上龐大的 第一視角人類交互視頻是極大的寶藏。人類是地球上最強大的物理代理,我們可以通過端到端控制,把人類視頻轉化為機器人的世界先驗。
未來,通過世界模型將互聯網視頻的“廣度”與機器人具身控制數據的“精度”橋接起來,我們就能真正敲開通用機器人的大門。謝謝大家。

06
▎Q:感謝您的精彩演講。在前半部分關于世界模型評估的介紹中,您提到當年測試 RT-1 模型時,由于動作太過于超出分布(OOD),直接把世界模型也給“帶崩”(產生嚴重幻覺)了。
這看起來像是一個“雞生蛋、蛋生雞”的悖論:策略模型不工作,導致世界模型也不工作。當世界模型無法泛化到這種極端分布外的錯誤動作時,我們該怎么打破這個死局?
Sherry Yang:這確實是一個非常切中要害的問題。如果動作完全超出了分布,且在沒有任何真機數據補充的情況下,單靠世界模型去打破這個 deadlock確實很難。
但如果我們換一個視角,把機器人看作是一個可以自主探索的自動化代理,情況就會發生改變。在真機落地中,機器人一定會自主產生大量的失敗數據。
我們的解法是:利用這些真機踩坑碰壁的失敗數據,優先去更新和微調我們的世界模型,讓世界模型首先去理解這個“新分布”;當世界模型的模擬邊界被這些失敗數據拓寬之后,它反過來就能夠產生正確的信號,繼續指導和訓練策略模型。這正是一個相互促進的飛輪過程。
一個人讀論文太孤單,一群人刷頂會才好玩。
RSS 2026 召開在即,我們正在召集一波含金量極高的 AI 研究者。群內主打實時論文跟蹤與硬核技術探討,拒絕灌水。
? 進群傳送門: 掃碼進群或添加微信Luyoyo_2026,備注:論文群 + 關注的 AI 方向。

搞科研/搞技術,信息差很重要。
來,一起快人一步!


上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。