0
| 本文作者: 陳淑瑜 | 2026-06-30 10:09 | 專題:RSS:機器人,科學與系統會議 |
來源:公眾號“具身智能之心”
原文鏈接:https://mp.weixin.qq.com/s?__biz=Mzk0ODY4MjU3MQ==&mid=2247532692&idx=2&sn=08d8544f538a059579d6554b63fe2b67&chksm=c2dadfaa211521f06cb132452a1ea166b11689dbc66cea93a877f35ad6ed2b3370392b304a8f#rd
作者丨Jindou Jia 等
編輯丨具身智能之心
本文只做學術分享,如有侵權,聯系刪文
過去幾年,擴散模型和 Flow Matching 給機器人策略生成帶來了范式的轉變:模型不再簡單回歸動作,而是像生成圖像一樣,一步步從原始噪聲生成未來動作。
圖像生成從噪聲開始,很合理。因為一張圖片本來就是“從無到有”地被想象出來。
但機器人不是這樣。它一直有本體感知反饋,知道自己剛才怎么動、關節怎么變化、末端執行器往哪里走。也就是說,機器人天然擁有一串連續的歷史動作,而這串動作本身就是非常強的物理先驗,因為真實世界里的動作不是突然冒出來的,而是沿著上一段動作自然延續下去的。
所以 A2A Flow Matching 最直接的洞察就是:
機器人生成動作,不一定要從隨機噪聲開始。歷史動作本身,就是最好的起點。

該成果已被機器人領域國際頂級學術會議 RSS 2026(Robotics: Science and Systems)錄用。
現在很多擴散策略、流匹配策略,本質上走的是這樣一條路:
隨機噪聲 → 未來動作
A2A 則把它改成:
歷史動作 → 未來動作
這個變化非常關鍵,直接改寫了機器人策略生成的底層范式。
隨機噪聲和真實動作之間隔得太遠,模型必須一步步把無意義的噪聲拉回可執行動作。路徑長,迭代多,推理自然慢。但歷史動作不一樣。它本來就和未來動作相鄰,背后還帶著機器人運動的慣性、趨勢和物理約束。換句話說,歷史動作已經站在了一個很接近答案的位置。
所以 A2A 做的不是“從零生成動作”,而是“順著歷史軌跡繼續往前推”。

具體來說,A2A 把動作生成重新定義為歷史動作分布到未來動作分布的流匹配(Flow Matching)。
關鍵設計在于:歷史動作不是像以往方法那樣,簡單地和視覺特征拼接在一起作為條件,而是被編碼成一個高維潛變量 ,作為流匹配的“起點”。
未來動作則被編碼為目標潛變量 。模型學習一個向量場 ,把 沿著最優傳輸路徑“推”到 。
由于相鄰動作塊在物理上天然相似,嵌入高維潛空間后, 和 的分布距離非常近。這意味著傳輸路徑很短、很直,哪怕只用輕量級的 MLP 架構,單步推理也能完成高質量的映射。

A2A 的整體結構很簡潔,把歷史動作和未來動作都放進一個高維潛空間里,再在這個潛空間里做 Flow Matching。
具體來看,模型主要分成三條路徑:
視覺這一路,歷史圖像經過 ResNet-18 和線性投影,得到一個全局條件向量。
動作這一路,歷史動作序列經過 1D CNN,被編碼成潛變量,作為流匹配的起點。
生成這一路,Flow Net 用 4 個 AdaLN-MLP 塊預測向量場,最后再通過殘差 MLP 解碼成未來動作。

為了把歷史動作編碼的潛空間能變成真實可執行的動作,A2A 設計了三類訓練約束:
Flow Matching Loss:負責學習從歷史動作潛變量 到未來動作潛變量 的向量場。
Reconstruction Loss:保證動作編碼器和解碼器能還原動作塊,維持潛空間拓撲結構。
Inference Consistency Loss:要求通過 ODE 積分得到的和真實未來動作的編碼對齊;同時解碼后的動作,也要和真實未來動作對齊。這個損失對于避免潛空間坍縮至關重要,是支撐單步推理的基石。
真實機器人里,傳感器會有噪聲,執行器會有誤差,初始位姿也可能不準,因此歷史動作也不是絕對可靠。如果模型過度相信歷史動作,一旦歷史軌跡有偏差,后面的動作就可能跟著偏。
于是作者進一步提出了 N-A2A (Noised A2A)。做法很簡單:在歷史動作編碼之前,注入少量高斯噪聲。這能顯著提升對初始狀態不確定性和動作級擾動的魯棒性,并且還能保持動作多模態能力。

在多項仿真(ManiSkill, RLBench, LIBERO)與真實Franka機器人任務中,A2A展現出了極佳的訓練效率、推理速度、以及泛化能力。
首先訓練效率方面,A2A 展現出極快的收斂速度,僅需少量訓練輪次即可達到穩定的100%成功率。在5類仿真任務中,其成功率全面領先于8種主流方法,并在有限數據下也能夠維持高性能表現。


此外,推理速度方面,A2A實現了亞毫秒級的極致推理速度,平均延遲僅約1ms,在單步推理模式下延遲更是低至0.56ms,比傳統擴散策略快20倍,比常規流匹配方法(10步)快5倍。

最后,A2A極大提升了視覺泛化性。例如,實驗中將抓取木塊換成從未見過的發光方塊,傳統擴散和流匹配策略均會徹底失效,而A2A仍可維持80%的高成功率。

無論是面對場景隨機化(Level 1)、燈光擾動(Level 2)還是視角切換(Level 3),A2A 的成功率均領先于現有算法。這歸功于A2A的解耦策略,將動作歷史作為穩固的先驗,減少了對易受干擾視覺特征的依賴。

作者還把這個思想擴展到了視頻預測,提出 Frames-to-Frames Flow Matching。
邏輯是一致的:預測未來幀,也不一定非要從噪聲開始。歷史幀本身就包含運動趨勢和時序信息,用它作為起點,會比隨機噪聲自然得多。這種高效預測視頻的范式也可能為機器人訓練提供更低成本的時序先驗。
A2A 背后的思想不只適用于機器人動作,而是可能適用于一類更廣泛的時序生成問題。只要任務本身有連續性,“歷史到未來”就可能比“噪聲到目標”更合理。
A2A Flow Matching 最值得關注的是它指出了一個很容易被忽略的問題:既然機器人天然有本體感知和歷史動作鏈,為什么還要每次從噪聲里重新找動作?
過去我們習慣把擴散模型、Flow Matching 從圖像生成搬到機器人控制里。但機器人不是圖像,動作也不是憑空出現的。
所以 A2A 的意義可以概括成一句話:
把機器人策略生成從 Noise-to-Action 推進到 Past Action to Future Action。
如果把歷史動作作為生成起點,模型可以獲得更低延遲、更強連續性和更好的真實環境適應性。這一步可能會成為未來高頻控制、長時序任務和真實機器人部署里,一個非常值得繼續挖的方向。