0
| 本文作者: 鄭佳美 | 2026-07-16 23:10 |

當(dāng)下的具身智能行業(yè),正站在從“數(shù)據(jù)驅(qū)動”邁向“經(jīng)驗驅(qū)動”的關(guān)鍵拐點上。機器人不再滿足于靜態(tài)模仿,而是需要在真實世界中持續(xù)學(xué)習(xí)、在線進(jìn)化。但在現(xiàn)實中,強化學(xué)習(xí)流程復(fù)雜、系統(tǒng)組件異構(gòu)、資源形態(tài)多樣以及真實世界在線學(xué)習(xí)難以規(guī)模化等關(guān)鍵問題,成為影響具身智能走進(jìn)真實世界的行業(yè)痛點。
今天,由無問芯穹聯(lián)合清華大學(xué)等共同研發(fā)的全球首個面向具身智能持續(xù)進(jìn)化的大規(guī)模強化學(xué)習(xí)基礎(chǔ)設(shè)施項目 RLinf,正式宣布升級為 RLinf v0.3,為破解具身智能行業(yè)發(fā)展瓶頸構(gòu)建了新一代“進(jìn)化底座”!

RLinf v0.1 和 v0.2 分別完成了強化學(xué)習(xí)系統(tǒng)抽象與真實世界在線學(xué)習(xí)基礎(chǔ)設(shè)施建設(shè)。新版RLinf v0.3 進(jìn)一步升級為面向具身智能持續(xù)進(jìn)化的一站式開發(fā)平臺,首次完整打通數(shù)據(jù)采集、數(shù)據(jù)管理、監(jiān)督微調(diào)(SFT)、強化學(xué)習(xí)(RL)、模型評測以及真機部署等關(guān)鍵環(huán)節(jié),實現(xiàn)從仿真訓(xùn)練到真實機器人在線學(xué)習(xí)、再到持續(xù)迭代優(yōu)化的統(tǒng)一開發(fā)閉環(huán)。
由此,RLinf不僅能夠高效訓(xùn)練機器人策略,更能夠支撐機器人在真實世界中的長期持續(xù)進(jìn)化。
具體來說,RLinf v0.3圍繞模型、算法、真機、仿真、系統(tǒng)五個維度,進(jìn)行了全面升級,系統(tǒng)性地降低具身智能開發(fā)門檻,提升訓(xùn)練效率與部署靈活性,覆蓋更加豐富的具身智能開源生態(tài)。
針對強化學(xué)習(xí)中“參數(shù)難調(diào)、結(jié)果難復(fù)現(xiàn)”的行業(yè)痛點,RLinf 始終將訓(xùn)練效果的嚴(yán)格可復(fù)現(xiàn)作為核心標(biāo)準(zhǔn)。在此次 v0.3 正式發(fā)布前,研發(fā)團隊已對大量應(yīng)用示例完成了深度的復(fù)現(xiàn)性測試,詳見v0.3 Release Notes。
本次發(fā)版已與包括百度智能云在內(nèi)的多家云廠商協(xié)同上線。
RLinf v0.3 Release Notes:https://rlinf--1379.org.readthedocs.build/zh-cn/1379/rst_source/resources/release_v0.3.html
快速上手:
https://docs.neogpu.com/posts/rlinf-ppo-vla.html
https://cloud.baidu.com/doc/AIHC/s/fmrenj9u1
Github鏈接:https://github.com/RLinf/RLinf
RLinf Tech Report:https://arxiv.org/abs/2509.15965
RLinf v0.3繼續(xù)擴展模型生態(tài),新增 6 款具身模型支持,涵蓋世界模型、VLA 模型及系統(tǒng)級加速:
? 新增 Dexbotic DM0 模型支持,在 LIBERO 上用 PPO 進(jìn)行在線 RL 微調(diào)。
? 新增 DreamZero 模型支持:基于 WAN2.1/2.2 視頻生成世界模型微調(diào)的 VLA 策略,集成進(jìn) SFT 工作流,通過 FSDP2/CUDA Graph 等系統(tǒng)級加速取得近4倍吞吐提升。
? 新增 GR00T-N1.6 / N1.7 模型 RL 微調(diào)支持。
? 新增 ABot-M0 模型支持。
? 新增 StarVLA 模型支持(GRPO on LIBERO)。
? 新增 LingBot-VLA 模型支持(RoboTwin 環(huán)境 SFT/RL)。
新版在真機 RL、仿真 RL 和人在環(huán)學(xué)習(xí)三個方向均有重要算法新增,表現(xiàn)出SOTA的真機任務(wù)成功率。具體:
真機強化學(xué)習(xí)算法:
? 將 DSRL(Diffusion Steering via Reinforcement Learning)擴展至 Pi0.5 模型。
? 新增 RECAP(基于離線優(yōu)勢估計的策略優(yōu)化)訓(xùn)練流水線支持。
? 新增 SAC-Flow 算法支持,并擴展到 DOS-W1 等真機場景。
仿真強化學(xué)習(xí)算法:
? Async PPO:在 v0.2 基礎(chǔ)上擴展支持 MLP 等新策略,并新增 async DSRL 配置。
? 新增 D4RL 離線 IQL 訓(xùn)練支持(Antmaze / Kitchen-Adroit / MuJoCo,基于 FSDPStrategy)。
人在環(huán)學(xué)習(xí):
? 新增 DAgger 在線模仿學(xué)習(xí)算法支持(LIBERO、ManiSkill、RoboTwin、真機 PnP 多場景)。
? 新增 HG-DAgger(Human-Gated DAgger)真機在線訓(xùn)練支持。
新版全面打通數(shù)據(jù)采集 → SFT → RL → 真機部署的閉環(huán)鏈路,新增 3 種遙操作方式、3 款真機平臺、2 款末端執(zhí)行器,真機實操能力顯著增強:
數(shù)據(jù)采集支持:
? 新增 空間鼠標(biāo)(Spacemouse) 遙操作數(shù)據(jù)采集支持。
? 新增 VR 遙操作 數(shù)據(jù)采集支持。
? 新增 GELLO 遙操作 數(shù)據(jù)采集支持。
訓(xùn)練鏈路支持:
? 新增 LeRobot 格式數(shù)據(jù)采集 支持,便于與 HuggingFace LeRobot 生態(tài)互通。
? 新增 Pi0 真機 SFT 部署 支持,打通數(shù)據(jù)采集 → SFT → 真機部署鏈路。
? 新增 真機 reward model 數(shù)據(jù)采集 支持(采集帶標(biāo)注 reward 訓(xùn)練數(shù)據(jù))。
真機平臺與末端支持:
? 新增 雙臂 Franka 平臺支持(關(guān)節(jié)空間與 TCP/rot6d 控制、數(shù)據(jù)采集、SFT、部署)。
? 新增 GimArm 真機平臺支持。
? 新增 DOS-W1 真機平臺支持。
? 新增 Franka DexHand 靈巧手 末端執(zhí)行器支持。
? 新增 Franka Robotiq 夾爪后端支持。
? 新增 Franka Robotiq 及 ZED / LUMOS V4L2 相機與夾爪后端支持。
RLinf v0.3提升仿真強化學(xué)習(xí)的場景覆蓋,新增 5 種仿真器,完善基于仿真器的訓(xùn)練示例與效果:
? 新增 Genesis 仿真器支持。
? 新增 Polaris 仿真器支持。
? 新增 RoboVerse 仿真器支持。
? 完善 Behavior 環(huán)境支持:新增 v3.7.1 / v3.7.2 版本補丁、π0.5 PPO 配置與 object/pose randomization。
? 新增 Libero+ / LiberoPro 變體環(huán)境支持。
? 新增 Embodichain(CartPole) 環(huán)境支持。
? 新增 IsaacLab 上 π0.5 PPO finetuning 支持。
? 新增 RoboCasa close-drawer 等 RL 示例支持。
RLinf v0.3在系統(tǒng)層面新增多項重磅組件:
? Reward Model組件:支持embodied reward worker + ResNet/VLM reward model。
? Value Model組件:通用基礎(chǔ)設(shè)施,支撐Pi0.6 RECAP等流水線。
? SGLang推理服務(wù)化組件:HTTP server + router模式,可作為reward服務(wù)/rollout推理后端。
? 解耦環(huán)境執(zhí)行組件:解除Env Worker與Rollout Worker一對一綁定,提升GPU利用率。
性能優(yōu)化方面,新增torch.compile加速、rollout與訓(xùn)練overlap、權(quán)重同步升級(broadcast/增量同步/分桶同步/僅同步可訓(xùn)練參數(shù))、FSDP全offload支持,并修復(fù)了顯存泄漏等關(guān)鍵問題。
值得關(guān)注的是,RLinf v0.3全面支持昇騰Ascend(CANN/torch-npu)、AMD ROCm、Musa等國產(chǎn)及異構(gòu)AI計算平臺,真正做到跨機器人、跨模型、跨仿真器、跨計算硬件的統(tǒng)一訓(xùn)練能力。
RLinf v0.3為智能體 RL 場景提供了更強大的訓(xùn)練和評測基礎(chǔ):
? 新增 AgentLightning 多輪單智能體 RL 訓(xùn)練與 Calc-X 評測支持。
? 新增 Megatron-Bridge actor 后端支持(基于 Megatron-mbridge 模型的 RL 訓(xùn)練與 SFT)。
? 將 SearchR1 重構(gòu)為多輪接口,并新增 WideSeek judge 的內(nèi)置 sglang 支持。
RLinf 自開源以來,以開放共享為核心理念,迅速形成全球影響力。截至目前在 GitHub 已獲得 4100+ Stars 、 600+ Forks、100+ Contributors,成為具身智能與大模型強化學(xué)習(xí)領(lǐng)域最受關(guān)注的基礎(chǔ)設(shè)施項目之一。
RLinf 已被 Isaac Lab 官方收錄為其首個面向具身大模型的訓(xùn)練引擎,體現(xiàn)了其在具身智能基礎(chǔ)設(shè)施方向的國際技術(shù)引領(lǐng)能力。值得一提的是,RLinf團隊與 NVIDIA 團隊合作的醫(yī)療器械組裝任務(wù)成功登上 NVIDIA GTC 2026,進(jìn)一步驗證了其全球技術(shù)影響力。
此外,項目榮獲 EAI-100年度十大突破獎,入選Pytorch Ecosystem、螞蟻開源榜,代表其在具身智能基礎(chǔ)設(shè)施領(lǐng)域的技術(shù)領(lǐng)先性與行業(yè)認(rèn)可度。
未來,RLinf將堅持開源路線,提升易用性,并攜手社區(qū)同行持續(xù)貢獻(xiàn)前沿算法。為了更好地與社區(qū)互動,RLinf團隊也已經(jīng)創(chuàng)建開發(fā)Roadmap(https://github.com/RLinf/RLinf/issues/1322),建立答疑群(https://raw.githubusercontent.com/RLinf/misc/refs/heads/main/pic/wechat.jpg),歡迎研究者們加入社區(qū),共同開發(fā)!