0
| 本文作者: 陳淑瑜 | 2026-06-30 14:02 | 專題:RSS:機器人,科學與系統會議 |
來源:公眾號“AI泡哥”
原文鏈接:https://mp.weixin.qq.com/s?__biz=MzA3MjM0MDc2NA==&mid=2247486341&idx=1&sn=bb76f14dcf66bb3015308f06ffb101e1&chksm=9e90cae26f3ac4baf1e4de5fff8cb7af73b00f0650b8f439108e0e0c913d7cda3a7597bcccac#rd
轉眼 2026 年已經過了一半了,robotics 相關會議也陸續進入一個很適合階段性回顧的時間點:AAAI 2026,ICLR 2026已經結束了,ICML 2026 和RSS 2026 的 accepted papers 也已經公布,ICRA 2026(2026 年 6 月 1–5 日)和CVPR 2026(2026年6月 3日 - 7日 ) 正在召開。
雖然 CoRL(2026年11月 9-12日)、NeurIPS(2026年12月6-12日 )、IROS(2026年9月27日至10月1日) 等會議還未公布accepted paper。但對于2026年來說,已經值得先總結一下。為此,本文選擇了10篇有代表性的paper(具有一定"范式意義",引用大,或獲獎【入圍】,或工作扎實等綜合視角進行選擇), 進行詳細介紹: 涵蓋策略、VLA模型(Robot foundation Policy /VLA ), 世界模型(World model),生成式監督(Generative Supervision),Active / Temporal Perception和Diffusion Policy 理論化等議題。
作者: Physical Intelligence
Physical Intelligence的π?是很“老”的文章(2024年11月就“占坑”了【2026年1月修正版】,但是RSS 2026錄用,該文引用近2000);其后,陸續發布π?.5(2025年4月) ,π*?.6(2025年11月),π?.7(2026年4月)【π 系列論文風格很像“頂級機器人學習實驗室 + 大模型公司 + 真實機器人數據工廠”的混合體:有 Berkeley的 robot learning 脈絡(尤其 Sergey Levine / Chelsea Finn),也有 Google RT-1/RT-2/Open X-Embodiment 那條大規模機器人數據路線(Karol Hausman等),還有明顯的創業公司式工程和部署導向(面向家務這個場景)】,本著“一群羊也是趕”的精神,一起梳理一下π系列(如下圖):
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a4357045cfec.png)
π?(從 VLM 到 VLA,解決“語言視覺模型如何輸出真實動作”):傳統 VLM 能看圖、理解語言,但不會控制機器人。機器人需要輸出的是連續、高頻、帶物理約束的動作序列,而不是離散文本 token。π? 旨在解決能否把 VLM 改造成能直接控制機器人的 Vision-Language-Action Model ?
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a435704c4a6e.png)
如上圖,π? 的核心創新就是:把預訓練 VLM 的語義理解能力,和一個 flow-matching action expert 的連續動作生成能力接起來,讓大模型真正從“會看會說”變成“會控制機器人”。白話文:以 VLM/VLA backbone 提取的視覺-語言-機器人狀態特征作為 condition,再接收一個 noised action chunk 和 flow timestep,學習預測從噪聲動作到真實動作的 flow / velocity field。推理時,模型從隨機噪聲動作 chunk 出發,經過若干 flow-matching 更新步驟,生成未來 H 步連續機器人動作,即 chunked action。更直白,就是VLM+diffusion model(flow matching)->chunked action。
π?.5(從 general control 到 open-world generalization): π? 能控制機器人,但一個更難的問題是:機器人能不能離開實驗室,到從未見過的新家里完成真實家務?π?.5 核心問題是 在家務的場景下,如何實現open-world generalization。
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a4357051c9e0.png)
π?.5 基于 π?,通過 heterogeneous tasks 的 co-training,使機器人能在新家中完成廚房、臥室清理等 10–15 分鐘的復雜多階段任務。具體地,π?.5 分成 pre-training 和 post-training 兩階段:pre-training 結合多源數據與離散 token;post-training 專門適配 mobile manipulation,并加入通過 flow matching 輸出連續 action chunk 的 action expert。它使用的數據包括多機器人數據、高層語義預測、web data、verbal instructions 等。白話文:在 π?的基礎上,post-training 專門適配 mobile manipulation,以適應家務的應用場景。
π*?.6(從 imitation 到 experience,解決“機器人如何通過真實部署變強”): π? 和 π?.5 主要還是 imitation learning / co-training 路線。它們能學demo數據,但真實機器人部署后一定會犯錯。π*?.6 的問題變成: 機器人能不能像人一樣,通過反復嘗試、失敗、糾正、反饋,越練越強?
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a43570571ea0.png)
π*?.6 的核心創新是把 VLA 變成一個可以 post-training / RL self-improvement 的系統:Deploy VLA on robot ->collect autonomous rollouts->human corrections / sparse reward->train value function->estimate action advantage->advantage-conditioned VLA training->improved VLA->repeat; 這就是π*?.6 提出 RECAP:RL with Experience and Corrections via Advantage-conditioned Policies。它利用 demonstrations、on-policy collection、expert teleoperated interventions,把真實部署經驗納入訓練。RECAP 可以讓 π*?.6 在真實任務中折衣服、組裝盒子、制作 espresso,并在一些困難任務上將 throughput 提升超過 2 倍、failure rate 大約減半。白話文:π? / π?.5 類似 pretraining + SFT;π*?.6 開始 robot RL post-training(雖然π?.5有post-training ,其目的是為了適應家務場景;π*?.6 的post-training 是面向部署,它必然也有π?.5的post-training,因此,π*?.6 更像是post-post-training)。
π?.7(從 self-improvement 到 steerable generalist foundation model): π*?.6 能通過經驗提高某些任務性能,而進一步,π?.7可能面對的問題: 數據質量不一致,有成功、有失敗、有慢動作、有快動作; 不同機器人形態、不同任務策略混在一起,容易學成平均行為;用戶不僅想讓機器人“做什么”,還想控制它“怎么做”; 機器人需要組合舊技能完成新任務,而不只是復現訓練任務。
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a435705c43af.png)
π?.7 的核心創新點是把 prompt / context 變成機器人行為的控制面板:通過 diverse context conditioning,讓模型可以在 prompt 中接收任務描述、策略信息、episode metadata、subgoal images 等,從而在未微調情況下完成復雜靈巧任務、跨 embodiment 泛化和組合式任務泛化。π?.7 還引入 world model 生成 subgoal images,讓機器人能看到一個“目標狀態草圖”。白話文:π?.7 不是取消訓練,而是改成 context-conditioned training,推理時再通過 prompt/context 選擇不同的行為模式,從而減少每個新任務的fine-tune 的需求。
π-series 的創新逐步形成了一個機器人基礎模型系統范式:Robot Foundation Model =VLA backbone + action expert + flow/diffusion continuous action generation + cross-embodiment data + web / human / robot heterogeneous co-training + high-level semantic subtask inference + real-world experience and correction loop + value / advantage conditioning + metadata / subgoal / memory based context steering;最終,這條路線從 “根據語言做動作” 到“能在真實世界中提示、糾正、訓練、 steer,組合技能解決新任務”。
作者:Physical Intelligence
沒看錯,又是一篇Physical Intelligence的paper (引用也500+)! FAST 之所以必須推薦: 因為π? 系列說明機器人基礎模型可以通過 VLA + flow matching 產生連續動作,而 FAST 說明:動作 tokenization 做對時,動作也可以進入類似 LLM 的 next-token prediction 訓練范式。這是因為,LLM 有 text tokenizer,VLA 也必須有 action tokenizer。問題是,機器人動作不是文字,而是連續、高頻、多維的時間序列。而已有的 per-dimension、per-timestep binning 方法在 high-frequency dexterous skills 上表現很差。
傳統做法是:每個時間步 × 每個動作維度 → 單獨分桶;這會產生大量強相關 token。高頻控制下,相鄰動作變化很小,模型很容易學成“復制上一個 token”,訓練信號變弱。FAST 的核心洞察是:robot action sequence 不是普通離散 token,而是連續時間序列,所以應該先壓縮。為此,FAST用 DCT,Discrete Cosine Transform 把動作序列轉到頻域,再用 BPE 壓縮,形成 Frequency-space Action Sequence Tokenization。如下圖展示了流程:normalized action chunk → DCT frequency components → sparse frequency matrix → flatten → BPE → compressed action tokens。說白了,FAST就是“組合創新”:DCT 來自經典信號/圖像壓縮,BPE 來自文本 tokenizer,把“壓縮式編碼”應用到 VLA 的連續機器人動作 tokenization。
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a4357060f0ed.png)
π? 原始路線更偏 flow matching / diffusion VLA:用 action expert 輸出連續 action chunk。而FAST 證明:如果 action tokenizer 做對了,autoregressive VLA 也可以訓練復雜、高頻、靈巧任務。論文顯示 FAST 可以讓 π?-FAST 在 dexterous / long-horizon manipulation 上匹配 state-of-the-art π? diffusion VLA,同時訓練快 5 倍。同時,本文發布了可以作為 black-box tokenizer 使用的通用 action tokenizer:FAST+ 是一個 universal robot action tokenizer,訓練在 100 萬真實機器人動作軌跡上,可覆蓋 single-arm、bi-manual、mobile robots、多種 action spaces 和 control frequencies。
FAST 將 VLA 的action representation 問題展示為機器人基礎模型的核心問題。與 diffusion / flow VLA 相比,FAST 的優勢是訓練效率和 backbone 兼容性,π?-FAST 可在保持相近表現的同時顯著降低訓練計算;但其代價是 autoregressive action decoding 帶來較高推理延遲。因而,FAST 的定位不是替代所有連續動作生成方法,而是為 VLA scaling 提供 action-tokenization 基礎設施。
作者:Rujia Yang等(清華等)
機器人操作肯定是在 3D 空間中,但當前很多model 主要依賴 2D 圖像,因此其泛化能力必然有限(例如unseen scenarios、new objects、distractors 等情景上泛化能力有限)。 如果機器人要在真實世界中泛化,不能只讓模型“看見圖像”,還要讓模型“知道物體在三維空間中的位置、形狀、尺度和相互關系”。為此,FP3 希望通過3D point cloud 可以把這些幾何關系顯式放進模型輸入里,從而讓 foundation policy 更容易泛化。
FP3 的核心創新是提出了3D point cloud-based language-visuomotor foundation policy ( 1.3B 參數的 3Dfoundation policy ): 用 3D point cloud + language + proprioception 作為多模態輸入,再用 diffusion transformer 輸出 action chunk,也就是把 3D 幾何感知和 diffusion policy 結合起來(如下圖); 同時, 采用 pre-training + few-shot post-training recipe:先在 DROID 60k trajectories 上預訓練,再用每個任務 80 條高質量 demonstrations 做 LoRA fine-tuning。
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a43570657375.png)
FP3用大規模預訓練 3D encoder Uni3D ViT-L(Large):當前 point cloud-based robot policies 通常用 sparse point cloud 和小網絡,而 FP3 增加輸入點數到每視角 4000 points,并使用 300M 參數 Uni3D ViT。同時,它不是一次預測單步動作,而是 diffusion action chunk。 這讓它更接近 Diffusion Policy / RDT / π? 這類生成式動作模型,而不是傳統 reactive controller。
在 2026 的 robotics ,VLA很多路線仍然是:2D image + language → action;但FP3 強調3D世界的交互,例如機器人不是只要“識別杯子”,還要知道:杯子在哪里?杯口朝哪里?能不能抓?手從哪邊過去?等這些問題 3D 的問題。FP3 展示了從 2D VLA 向 3D foundation policy 的轉向的可能。
作者:Zongzheng Zhang等(清華大學等)
當前 VLA 系統主要受限于兩類:要么是 dual-arm low-DoF grippers,要么是 single-arm dexterous hand,無法同時處理雙臂協作和高自由度雙手靈巧操作。Dexora 的目標就是補上這個空白:構建第一個面向 dual-arm, dual-hand, high-DoF manipulation 的開源 VLA 系統。
Dexora的核心創新點: Dexora 是第一個原生面向 dual-arm, dual-hand, high-DoF manipulation 的開源 VLA 系統;embodiment-matched sim + real 大規模數據采集管線,也就是Dexora設計一個能高效采集“人類雙手雙臂動作”的數據機器(Hybrid teleoperation把控制拆成兩部分: 粗粒度手臂運動【custom exoskeleton backpack 捕捉 shoulder-elbow-wrist 角度】,細粒度手指運動【Apple Vision Pro markerless hand tracking 捕捉 3D finger skeleton】);Data-quality-aware training:即使高自由度 teleoperation 也很難保證每條數據都好,Dexora 的做法不是簡單地過濾掉數據,而是訓練一個 discriminator,為每段 demonstration 打質量分,然后把這個分數變成 diffusion loss 的權重(高質量 clip → 權重大 → 多學,低質量 clip → 權重小 → 少學),如下圖:
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a435706b3a8d.png)
如上圖,Dexora 如何處理真實 teleoperation 數據質量不穩定的問題, 第一步先做數據過濾:用加速度、jerk 等指標篩掉抖動大的軌跡,再通過 replay 檢查任務是否成功、是否無碰撞,得到高質量 demo; 第二步訓練一個 discriminator,讓它根據 observation、language、action chunk 和 policy 兼容性分數,判斷每段數據質量高低;第三步在訓練 diffusion-transformer policy 時,把 discriminator 的質量分數變成 loss 權重:高質量數據多學,低質量數據少學。白話文,Dexora 不是盲目模仿,而是“有選擇地學”。
為什么Dexora 值得推薦,是因為它是“高自由度雙臂雙手靈巧操作”的重要基礎工作之一。現有 VLA 多集中在單臂夾爪、雙臂低自由度夾爪,或單臂靈巧手,難以覆蓋真實世界中需要雙手協作和手指精細控制的任務。而Dexora 的核心 insight 是:與其從低自由度夾爪策略向上“補全”靈巧手動作,不如直接在 36-DoF 雙臂雙手平臺上訓練 rich embodiment policy,再向低自由度 embodiment 投影。實驗顯示,Dexora 在 basic tasks 和 dexterous tasks 上均優于 DP、π? 和 GR00T N1,并能跨 single-arm gripper、dual-arm grippers、single-arm low-DoF hand 泛化。它的意義是為高自由度機器人基礎模型提供了硬件、數據、訓練和跨 embodiment 泛化的提供諸多參考。
作者:Haozhan Li等(清華大學等)
當前 VLA 主要依賴大規模機器人demo數據做 SFT,但機器人軌跡昂貴、稀缺且覆蓋有限,導致模型在長時程任務、分布外場景和真實部署中泛化不足。而SimpleVLA-RL 的想法是:借鑒 LLM 的 RL中reward思路,VLA 也可以通過任務成功/失敗的reward,學會action planning。
SimpleVLA-RL的核心創新點: 把 LLM 里的 rule-based online RL 思路遷移到 VLA,形成一個面向機器人閉環交互的 RL post-training 框架; 這是通過基于 veRL 而擴展出 VLA-specific trajectory sampling、parallel multi-environment rendering、training-inference-rendering 一體化框架和優化后的 loss computation;而獎勵設計非常簡單:一條軌跡任務成功就給 1,失敗就給 0。 白話文,模型的學習由“行為驅動”變為“結果驅動”:以前的SFT(Demo演示“抓起來、移動、放下”, 模型就模仿這條路線)是行為驅動,關鍵看像不像;而SimpleVLA-RL是嘗試不同動作,關鍵看成不成功。如下圖:
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a4357070ac95.png)
如上圖,左邊表示傳統 SFT 只能利用有限離線 trajectories,而右邊 SimpleVLA-RL 讓 policy 和 environment 閉環交互,采樣多條 trajectories。 每條軌跡根據任務是否成功獲得 0/1 outcome reward,然后用 group advantage computation 更新 policy。圖中還標出三個探索增強模塊,旨在解決VLA 做 RL 時探索不夠、獎勵太稀疏、梯度容易消失的問題:dynamic sampling( SimpleVLA-RL會對同一個任務采樣多條軌跡,例如 8 條,
如果這 8 條全成功或全失敗,GRPO 的 group advantage 會變成 0,模型學不到“哪條軌跡更好”。所以 dynamic sampling 會丟掉這種“全對/全錯”的 group,只保留:同一個任務(有的軌跡成功,有的軌跡失敗))、higher clip range(GRPO / PPO 會用 clip range 限制 policy 更新幅度,防止模型一下子改太猛。
普通范圍類似:[0.8, 1.2];SimpleVLA-RL 把上界調高到:[0.8, 1.28],其目的是:如果某些低概率動作最后導致任務成功,就允許模型更大膽地提高這些動作的概率。直覺是:機器人以前不敢試的動作,比如“直接推過去”而不是“抓起來再放下”,如果成功了,RL 應該更積極地獎勵它)、higher rollout temperature(temperature 控制采樣隨機性。如果temperature 低,模型更保守,老是重復 SFT 學到的動作;temperature 高,模型會嘗試更多不同動作。論文把 rollout temperature 從 1.0 提高到 1.6,讓 VLA 在環境中探索更多軌跡。這有助于發現新策略,比如論文里提到的 pushcut:模型不再模仿demo里的“抓-移動-放下”,而是學會直接“推過去”)。
為什么SimpleVLA-RL值得推薦,因為它是“通過 reinforcement learning 做 post-training”學習robot foundation model ,而不是SFT。現有 VLA 的核心瓶頸是機器人demo數據昂貴且有限,SFT 往往只能復制訓練軌跡,遇到新場景、新物體或長時程任務時泛化不足。而SimpleVLA-RL 借鑒了 LLM reasoning model 的 RL 經驗:不必為每一步設計復雜獎勵,只需用任務成功/失敗作為reward,就可以讓 VLA 在環境交互中改進 step-by-step action planning。它的意義在于基于已有 SFT policy 基礎上,通過仿真 RL 提升泛化、長時程執行和真實部署等能力。
作者:Chuning Zhu等(University of Washington等)
機器人學習依賴高質量demo,但demo昂貴且規模有限,而大量 video data 雖然便宜豐富,卻沒有 action 標注,難以直接用于 policy learning;同時,video world model 能學習未來畫面變化,卻通常和 action policy 分離,難以直接提升機器人控制。為此,本文UWM(Unified World Models)認為:policy learning 和 world modeling 不應該是兩個模型,而可以是同一個 video-action diffusion model 的不同推理模式。
UWM(Unified World Models)的核心創新點:把 action diffusion 和 video diffusion 放進同一個 diffusion transformer 中。 它最關鍵的設計是給 action 和 future observation 分別設置獨立 diffusion timestep:t_a 和 t_o'; 通過控制這兩個 timestep,模型可以在推理時切換不同功能:policy、forward dynamics、inverse dynamics、video prediction;當把 future observation 的 timestep 設為最大噪聲 T,相當于“遮住未來圖像”,模型就退化成 policy p(a|o); 這種設計還允許模型利用 action-free video data:沒有動作標簽時,就把 action 設成 fully noised / masked,仍然能訓練視頻動態理解。白話文,可以把 UWM 理解成一個“機器人因果關系學習器”(普通 imitation learning: 看到當前圖像 → 預測動作;UWM: 當前圖像 + 動作 + 未來圖像
→ 學習三者之間的關系→推理時按需要遮住某一部分→得到 policy / dynamics / inverse model / video predictor)。如下圖:
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a43570759c9e.png)
如上圖,Unified World Model 可以通過不同 timestep 設置,同時扮演 policy、forward dynamics、inverse dynamics 和 video prediction 四種角色。圖中間的 UWM 接收 current observation、actions、future observations,并分別對 action 和 future observation 做 diffusion。
為什么推薦UWM(Unified World Model )呢? 因為它把 imitation learning、world model、video prediction、inverse dynamics 這些原本分散的方向統一到一個 diffusion framework 中。 其重要意義在于證明 action-free video data 可以通過統一 diffusion timestep 機制進入 robot policy pretraining,而不是只能依賴昂貴 action-labeled robot trajectories。 實驗上,UWM 在真實機器人任務和 LIBERO benchmark 中整體優于 DP、PAD、GR1,并且 co-training action-free videos 后進一步提升 OOD 魯棒性。 對產業來說,它有可能降低了對大規模真實機器人demo的依賴,因為企業通常更容易獲得視頻數據。
作者:Shivansh Patel等(UIUC等)
過去從視頻學機器人操作大致有三條路線:路線 1:真實人類視頻 / 互聯網視頻(問題:視角、手型、物體、環境、機器人 embodiment 差距很大);路線 2:專門采集和機器人環境對齊的人類 demo video(采集麻煩,必須控制視角、物體、場景,很難 scale);路線 3:VLM 直接預測 keypoint / constraint / goal問題(太稀疏,缺少完整動作過程,容易丟掉關鍵幾何與時序細節)。本文RIGVid:生成視頻雖然不是機器人動作數據,但它包含了“物體應該如何運動”的視覺軌跡;只要能把視頻中的物體運動穩定提取成 6D object pose trajectory,就可以繞過 action label,直接變成機器人可執行軌跡。雖然,本文和上一篇 UWM旨在利用“沒有動作標簽的視頻”來減少對真實 robot demo 的依賴,但上一篇 UWM 是“把 video data 變成 policy pretraining 信號”,本篇 RIGVid 是“把 generated video 直接變成 object trajectory”。
本文RIGVid的核心創新點:機器人只模仿 AI-generated videos,不需要真實 physical demo,也不需要 task-specific robot training。 它是把生成視頻轉成 6D object pose trajectory,而不是只提取稀疏 keypoint、dense flow 或 goal image。 具體,它使用 monocular depth estimation + 6D object tracking + object-to-robot retargeting,把視頻里的物體運動變成機器人末端執行軌跡,并且支持 closed-loop execution:執行時實時追蹤物體,如果偏離軌跡,就回退到最近成功點并繼續執行。 白話文,普通 imitation learning是人類或機器人真實demo → 訓練 policy → 機器人執行;而RIGVid是AI 生成一個操作視頻 → 追蹤視頻中物體怎么動 → 機器人照著這個物體軌跡動。如下圖:
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a435707bc94c.png)
如上圖,RIGVid 的完整 pipeline:輸入初始 RGB-D 圖像和語言命令,例如 “Pour Water On Plant”,視頻生成模型先生成一段操作視頻;隨后單目深度估計器給每一幀補深度,6D object tracker 從 RGB-D 視頻中提取物體位姿軌跡;最后系統先抓住物體,再把 object trajectory retarget 成 robot end-effector trajectory。本文不預測機器人動作,而是預測/提取“物體應該如何運動”,再讓機器人去實現這個物體運動。
為什么推薦RIGVid呢?因為它說明了機器人可以從生成模型“想象出來”的視頻中獲得操作監督,而不必完全依賴真實機器人demo,這是generative model × robotics 方向非常有代表性的論文。這意味中,有可能把生成式視頻模型從“視覺內容生成工具”推進為“機器人操作監督來源”。這對服務機器人、家務機器人、輕工業操作、低頻新任務適配都很有啟發。
作者:Lei Xiao等(LiAuto Inc等)
現有 VLA 大多把每個時刻的圖像單獨處理,默認當前圖像已經包含完整狀態(這里隱含一個假設:當前 observation 足夠代表完整世界狀態,也就是把機器人操作當成 MDP( Markov Decision Process)),但真實情況是機器人操作往往是部分可觀測的,需要記住過去動作、過去觀察和交互歷史。也就是,真實機器人控制更像 POMDP(Partially Observable Markov Decision Process):當前圖像只是局部觀察,很多信息可能被遮擋、被歷史動作改變,或者需要從之前的交互中推斷。本文指出,現有 VLA 逐幀獨立處理視覺輸入,會導致模型每一步都“重新看圖”,無法利用過去上下文來關注關鍵區域。
AVA-VLA的核心創新點:以 POMDP的角度去建立VLA policy learning:動作不只依賴當前 observation,也應該依賴歷史 belief / recurrent state。 其中,提出 recurrent state:從上一時刻 action-related hidden state 中提取壓縮表示,用來保存歷史上下文。 同時,提出了 Active Visual Attention, AVA 模塊:用 recurrent state + 當前視覺 token + 語言指令,動態計算每個視覺 token 的重要性,進而把重要性權重注入 LLM 的 attention matrix,讓模型在所有層中增強任務相關視覺 token、削弱無關視覺 token。 訓練上采用 truncated BPTT,避免完整長序列反傳帶來的顯存和計算爆炸。 白話文,AVA-VLA 可以理解為給 VLA 加了一個“任務的記憶 + 聚光燈”:上一時刻 hidden state → recurrent state:我剛才做了什么、看到了什么、任務進展到哪里→Active Visual Attention→當前圖像里哪些 token 更重要?→增強 stove switch / object / contact area→削弱背景、桌面、無關物體→預測當前 action chunk。
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a435708147f8.png)
如上圖,兩個連續 timestep:上一時刻的 hidden state 經過 MLP 投影成 recurrent state,這個 recurrent state 一方面用于初始化當前 action placeholder,另一方面輸入 AVA 模塊。AVA 模塊把 recurrent state 與當前視覺 token、文本 instruction 結合,通過 FiLM、cross-attention、self-attention 生成 soft importance scores。然后這些視覺 token 權重會調制 LLM backbone 內部 attention matrix,使模型在當前幀中主動關注與歷史和任務相關的區域。本質上,AVA-VLA 就是把上一時刻的決策隱狀態變成當前視覺處理的控制信號。
為什么推薦AVA-VLA 呢 ?,因為本文揭示了 VLA 不是單幀圖像理解模型,而是具有閉環序列的決策系統。很多 VLA 論文關注更大的 backbone、更好的 action tokenizer、更強的 decoder、更大的數據集;AVA-VLA 則說明,即使你的模型足夠大,如果每一步都把當前圖像當作完整狀態,仍然會在丟失重要的上下文。對于實際部署的機器人而言,常面對遮擋、視角變化、動作執行錯誤或誤差等等問題;這些都不是單幀 VLA 能正確解決的。
作者: Yanbiao Ji等(上海交大等)
Diffusion Policy 通過學習 demo進而生成復雜、多模態動作,但本質仍然是 behavior cloning:只學“怎么做”,沒有學明白“為什么這個動作更好”。也就是說,它知道動作的數據大體分布,但不知道這些動作背后的偏好、成功的原因、動作好壞的排序等。本文指出,diffusion-based policies 通常模仿 trajectories,但沒有顯式學習到rewards。但同時,另一條路線是 IRL / reward learning,但傳統 IRL 往往訓練不穩定、計算開銷大;而普通 energy-based imitation 又常常只是把 energy 當作 action score,不一定能解釋為可識別的reward。為此,本文認為Diffusion Policy 可能已經隱含了專家策略的 reward gradient / soft Q-function gradient,也就是擴散模型學到的 score field,本質上可能包含“專家偏好往哪里提升”的方向。白話文,普通 Diffusion Policy:學一堆箭頭,告訴動作從噪聲往哪里去,最后生成像專家的動作;本文的EnergyFlow:不只學箭頭,還學一張“能量地形圖”。好動作在低能量谷底,壞動作在高能量區域(箭頭是這張地形圖的梯度)。
EnergyFlow的核心創新點:用一個 scalar energy function Eθ(s, a) 來參數化擴散策略,而不是直接預測 denoising field; 通過自動微分得到 denoising score:Sθ = -?aEθ(s, a),從結構上保證 learned field 是 conservative / integrable field。 同時,提出 centered shaping reward,通過減去 state-dependent baseline 來消除 energy 中無法識別的狀態偏置,使其更適合作為下游 RL reward。 本質上,它把 diffusion-based imitation learning 和 inverse reinforcement learning 接起來,形成“生成動作 + 恢復 reward”的統一框架。白話文,普通 diffusion policy 像是:給你一個動作噪聲,模型告訴你: 往左一點、往上點、再靠近專家動作一點;EnergyFlow 則像是:模型先學出一張能量地圖( 好動作 = 山谷,壞動作 = 山坡 / 山頂),然后動作生成時( 沿著能量下降方向走到低能量動作),reward 提取時選擇低能量( = 更像專家偏好的動作)。
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a4357084c2bf.png)
如上圖,左邊是普通的Diffusion Policy:模型直接預測 denoising vector field εθ(s, a),這個 field 可以把噪聲動作一步步變成專家動作,但它沒有顯式能量函數,因此很難直接輸出 reward。而右邊是 EnergyFlow:模型先參數化 scalar energy Eθ(s, a),再用其梯度 ?Eθ 作為 denoising field;這樣同一個模型既能生成動作,也能輸出 reward signal。概括而言,Diffusion Policy 只學“動作往哪里去”,EnergyFlow 學“為什么往那里去”的能量地形,也因此,EnergyFlow 把 diffusion policy 從純生成模型推進到可解釋的 preference / reward model。
為什么推薦EnergyFlow呢?因為一般的 Diffusion Policy能生成平滑、多模態、接觸豐富的動作;但沒有一個可解釋的機制,而EnergyFlow有可能成為解釋專家行為背后的reward的基礎。也就是,它可能把如下三個方向連接起來:Diffusion Policy(動作生成)+Energy-Based Model(偏好建模)+Inverse Reinforcement Learning(reward)。真實場景里 reward engineering 很貴,人工設計 dense reward 很難,而 sparse success reward 又太弱。EnergyFlow 提供了一種可能路徑:先用 demo訓練 EnergyFlow→得到可生成動作的 policy→同時得到 energy-based reward signal→用于 downstream RL / online improvement / policy refinement;這對各種機器人都有價值,因為這樣可能降低 reward 設計成本,并讓demo數據不僅用于模仿,還能轉化成后續強化學習的reward機制。
作者:Lujie Yang等(Amazon FAR (Frontier AI & Robotics)等)
人形機器人要學復雜動作,需要大量高質量的人類動作demo。但把人的動作轉到機器人身上很難,現有方法常常會出現腳滑、穿模、接觸不準等問題(現有方法大致有兩類,第一類是 teleoperation:可以利用人類實時反饋避免一些 retargeting 錯誤,但成本高、勞動密集、不適合大規模數據生成,而且人和機器人 embodiment gap 仍然存在;第二類是 offline retargeting,通常依賴 keypoint matching、orientation matching 或 soft penalty,能把人類動作轉成人形機器人動作,但經常忽視人-物體、人-地形之間的交互關系,容易出現各種問題【foot skating:腳應該貼地卻在滑;penetration:機器人身體或手穿進物體/地形;contact loss:該接觸時沒有接觸;object interaction mismatch:人類搬箱子的相對關系沒有被機器人保持】)。結果是,機器人后續用強化學習訓練時,不得不靠一堆復雜的獎勵函數來彌補這些數據帶來的問題。而本文認為:人形機器人 retargeting 不能只匹配人的關節點,而要保留“人—物體—地形”的空間關系和接觸關系;只要demo足夠干凈,后續 RL 就可以用極簡 reward 學到復雜 whole-body skills。白話文,白話說,傳統 retargeting 像是在問:人的手在哪里?人的腳在哪里?機器人盡量把手腳放到類似位置;但本文 OmniRetarget 問的是:
人的手和箱子是什么關系?腳和臺階是什么關系?身體、物體、地形之間的空間結構是否被保留下來?
機器人這樣做會不會穿模、腳滑、超關節限制?
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a435708a8a4e.png)
OmniRetarget的核心創新點:用 interaction mesh 顯式建模身體、物體和地形之間的空間/接觸關系; 用 Laplacian deformation minimization 保持交互結構:不是簡單匹配 keypoints,而是盡量保持 source interaction mesh 和 target interaction mesh 的局部幾何關系。 同時,引入 hard kinematic constraints:包括 collision avoidance、joint limits、velocity limits、foot sticking,避免穿模、越界和腳滑;當生成高質量 reference motion 后,RL 訓練可以極簡化:只用 5 個 reward terms、4 個 robot domain randomization terms、純 proprioceptive observation,就能完成復雜任務。 白話文,可以把 OmniRetarget 理解成一個“人形機器人動作翻譯器”:Human motion + object + terrain→interaction mesh:記錄人、物體、地形之間的相對關系→constrained optimization:找一個機器人姿態序列→既像人類動作,又不穿模、不腳滑、不超關節限制→生成 reference motion→RL policy 學會真實機器人可執行動作。如下圖:
![2026年最值得推薦的robotics[具身智能]頂會paper(RSS,ICRA,ICLR ,CVPR,ICML)半年總結](https://static.leiphone.com/uploads/new/images/20260630/6a4357091c611.png)
如上圖,左邊輸入來自 LAFAN1、OMOMO 和 in-house MoCap 的 human motions;中間通過 interaction mesh retargeting,最小化 source mesh 和 target mesh 的 Laplacian deformation,同時滿足 kinematic constraints; 隨后進入 efficient augmentation:同一條demo可以變成不同 terrain、object type、object pose、spatial configuration 下的多條 reference trajectories ; 右側是 RL training:使用生成的 kinematic reference,只需 5 個 rewards、4 個 domain randomization terms 和純 proprioceptive observation,就能訓練 policy ; 最右邊顯示 zero-shot sim-to-real:這些 policy 直接部署到真實 Unitree G1 上完成復雜場景交互任務。
為什么推薦OmniRetarget呢?因為很多人形機器人 RL 的困難來自demo (reference motion )數據有問題:腳滑、穿模、接觸錯位。于是大家不得不用大量 reward terms、contact schedule、foot air-time penalty、slip penalty 等東西補救。OmniRetarget 的工作說明:如果先把數據做好,后面的 RL 就可以簡單很多。也就是,核心問題從“如何設計更復雜 reward”變成“如何生成更好的demo”問題,只要 reference motion 保留了關鍵交互關系,純 proprioceptive policy 也可以完成很復雜的交互,進而可以顯著簡化 RL、提升 sim-to-real 成功率。