0
| 本文作者: 陳淑瑜 | 2026-07-16 10:48 | 專題:RSS:機器人,科學與系統(tǒng)會議 |
來源:公眾號“強化學習CASIA”
原文鏈接:https://mp.weixin.qq.com/s/qo-2ViC3UV8GXYscXcpRwA?scene=1&click_id=7
中科院自動化所深度強化學習團隊提出了一種新的面向具身基礎模型長期持續(xù)學習的強化學習后訓練方法——LifeLong-RFT。該方法針對現(xiàn)有視覺-語言-動作模型(Vision-Language-Action, VLA)在后訓練階段普遍面臨的數(shù)據(jù)需求高、學習新任務后容易遺忘舊技能等問題,提出了一種無需在線環(huán)境反饋、無需預訓練獎勵模型的強化學習微調(diào)框架。LifeLong-RFT 通過動作塊級 On-policy 強化學習與多維過程獎勵機制,將離線專家示范轉(zhuǎn)化為可用于策略優(yōu)化的細粒度反饋,從而提升 VLA 模型在多任務學習、少樣本新任務適應和持續(xù)學習中的表現(xiàn)。
目前,該工作“Towards Long-Lived Robots: Continual Learning of VLA Models via Reinforcement Fine-Tuning”已被機器人領域頂級會議 Robotics: Science and Systems(RSS 2026)接收。
主頁: https://yuan-liu-lifelong-rft.github.io/
近年來,VLA 模型通過在大規(guī)模、多樣化數(shù)據(jù)上預訓練,逐漸成為構建通用機器人策略的重要方向。與傳統(tǒng)分層機器人系統(tǒng)不同,VLA 模型能夠直接將視覺觀測與語言指令映射為機器人動作,在操作泛化、語言條件控制和跨任務遷移方面展現(xiàn)出潛力。
然而,預訓練模型真正落地到具體機器人平臺和下游任務時,仍然需要后訓練。當前主流方式是監(jiān)督微調(diào)(Supervised Fine-Tuning, SFT),即利用專家示范數(shù)據(jù)讓模型模仿正確動作。SFT 簡單有效,但在長期運行場景下存在兩個關鍵瓶頸:一方面,新任務適應往往需要大量示范數(shù)據(jù);另一方面,模型在學習新任務時容易出現(xiàn)災難性遺忘,導致舊任務性能下降。

圖1 VLA 后訓練中的多任務學習、持續(xù)學習與 SFT/RFT 對比
長期服役機器人需要具備持續(xù)成長能力:它不僅要能在有限示范下快速掌握新技能,還要盡可能保留已經(jīng)學會的舊技能。這對應持續(xù)學習中的穩(wěn)定性與可塑性權衡問題。若模型過度適應新數(shù)據(jù),舊知識會被覆蓋;若模型過度保持舊知識,新任務又難以學好。
大語言模型領域的近期研究表明,基于模型自身采樣結果進行優(yōu)化的On-policy強化學習,在持續(xù)后訓練中可能比SFT 更具抗遺忘能力。這一觀察自然引出一個問題:能否將On-policy強化學習引入VLA 后訓練,使機器人模型在持續(xù)學習中學新不忘舊?
直接照搬現(xiàn)有VLA-RL方法并不容易。目前主流的強化學習微調(diào)通常依賴仿真器、真實機器人交互或世界模型提供獎勵或反饋,需要完整軌跡rollout,訓練成本高,獎勵稀疏且不易擴展。對于大規(guī)模任務和真實機器人場景,這種依賴會顯著限制方法的可用性。
為解決上述問題,LifeLong-RFT采用了一條更輕量的思路:在離線專家示范數(shù)據(jù)給定的觀測和語言指令上,讓當前策略模型自行采樣動作塊,而不是直接復制數(shù)據(jù)集中動作;隨后,根據(jù)采樣動作塊與專家動作塊之間的差異,為每個動作塊計算過程獎勵,并通過GRPO 進行策略優(yōu)化。
整體框架
如圖2所示,該框架的核心是多維過程獎勵(Multi-Dimensional Process Reward, MDPR)。MDPR 并不等待機器人完成完整任務后才判斷成敗,而是在動作生成過程中,從離散 token、連續(xù)軌跡和輸出格式三個維度評估動作塊質(zhì)量。

圖2 Lifelong-RFT框架圖
離散動作一致性獎勵(QACR)
VLA模型通常基于視覺語言模型骨干生成離散動作token。QACR 通過逐位置比較預測動作token與專家動作token 的一致性,獎勵更接近專家動作的輸出,并懲罰動作遺漏或幻覺生成,提升離散動作空間中的預測準確性。
連續(xù)軌跡對齊獎勵(CTAR)
僅在 token 層面對齊并不一定意味著機器人動作可以精確執(zhí)行。CTAR 將動作 token 解碼為連續(xù)動作塊,進一步比較末端位姿和夾爪狀態(tài)與專家軌跡的偏差,為動作控制層面提供更密集的獎勵信號。并且消融實驗顯示,去掉 CTAR 會導致 LIBERO 平均成功率大幅下降,說明連續(xù)軌跡對齊是動作可執(zhí)行性的關鍵。
格式合規(guī)獎勵(FCR)
由于生成式 VLA 可能輸出動作維度不匹配、預測 horizon 不一致等無效格式,FCR 用二值獎勵約束輸出結構,使生成結果滿足動作 tokenizer 的解碼要求,保證后續(xù)動作塊能夠被機器人執(zhí)行。
論文在 SimplerEnv、LIBERO 和真實 Franka 機器人平臺上進行了系統(tǒng)驗證,覆蓋多任務學習、持續(xù)學習、消融實驗和少樣本新任務適應等設置。整體結果表明,LifeLong-RFT 不僅能夠提升當前任務性能,也能顯著改善持續(xù)學習過程中的抗遺忘能力。
多任務聯(lián)合后訓練實驗
在多任務學習實驗中,LifeLong-RFT 在 SimplerEnv 上相較 NORA-Long SFT 基線,在 WidowX 平臺平均成功率提升 3.4 個百分點,在 Google Robot 平臺提升 4.3 個百分點。在 LIBERO 四類任務上,LifeLong-RFT 取得 95.6% 的平均成功率,較基線提升 3.8 個百分點。
在真實機器人實驗中,方法在拾取香蕉、拾取面包、拉抽屜和掛中國結四個任務上均優(yōu)于對比方法。以 NORA-Long 為基座時,RFT 后的平均成功率由 78.8% 提升至 87.5%,提升8.7 個百分點;其中“掛中國結”任務提升 15.0 個百分點。
表1 Lifelong-RFT與SFT方法在Simpler Env Benchmark上性能對比

表2 Lifelong-RFT與SFT方法在LIBERO Benchmark上性能對比

表3 Lifelong-RFT與SFT方法在真實機器人實驗上性能對比

持續(xù)學習后訓練實驗
在持續(xù)學習實驗中,模型先學習基礎任務,再按順序接收新任務。LIBERO 中每個新任務僅提供 10 條示范,并為舊任務保留少量經(jīng)驗回放數(shù)據(jù);真實機器人實驗中每個任務使用 20 條示范。結果顯示,LifeLong-RFT在前向遷移(FWT)、負向后向遷移(NBT,越低越好)和學習周期平均表現(xiàn)(AUC)上均顯著優(yōu)于 SFT 基線。例如在真實機器人持續(xù)學習中,FWT 從 56.3 提升至 80.0,NBT 從 18.3 降至 6.1,AUC 從 44.2 提升至 75.9,說明模型在學習新任務的同時能夠更好地保留舊任務能力。
表4 Lifelong-RFT與SFT方法在LIBERO Benchmark上性能對比

表5 Lifelong-RFT與SFT方法在真實機器人實驗上性能對比

此外,LifeLong-RFT 在少樣本新任務適應中也表現(xiàn)突出。在“Pick Orange Juice”任務上,僅使用 5 條示范即可達到 100% 成功率,而 SFT 使用 50 條示范時為 98%;在“Pick Bowl”任務上,LifeLong-RFT 使用 5 條示范即可匹配 SFT 使用 50 條示范的表現(xiàn),并在 10 條示范時達到 100%。

圖3 新任務少樣本適應效率對比更詳細的實驗結果可查看論文。
在本研究中,LifeLong-RFT將 VLA 后訓練從單階段任務適配推進到面向長期服役機器人的持續(xù)學習范式。該方法利用動作塊級 on-policy 強化學習和多維過程獎勵機制,在不依賴在線環(huán)境反饋和預訓練獎勵模型的情況下,為策略優(yōu)化提供了可驗證、細粒度且可擴展的獎勵信號。實驗結果表明,LifeLong-RFT能夠在多任務學習中提升成功率,在持續(xù)學習中有效緩解災難性遺忘,并顯著降低新任務適應所需的數(shù)據(jù)量。該工作為VLA 模型從“完成已訓練任務”走向“長期學習與持續(xù)成長”的機器人智能體提供了一條有價值的后訓練路徑。
當然,當前方法主要面向離散動作模型,未來若能進一步擴展到連續(xù)動作 VLA,并與更復雜的真實機器人部署場景結合,將有望推動具身基礎模型更快走向?qū)嶋H應用。
本專題其他文章