0
| 本文作者: 陸毅 | 2026-06-30 15:19 | 專(zhuān)題:RSS:機(jī)器人,科學(xué)與系統(tǒng)會(huì)議 |
來(lái)源:公眾號(hào)“機(jī)器之心”
鏈接:https://mp.weixin.qq.com/s/SmpQ7MKd2R_z9oqkMngGWw
在音樂(lè)術(shù)語(yǔ)中,Legato(連音)意味著音符之間平滑過(guò)渡、毫無(wú)間斷,演奏出流暢優(yōu)美的旋律。鋼琴家的手指在琴鍵上滑動(dòng),小提琴家的弓在琴弦上連貫運(yùn)行 —— 這種 "連音" 技巧讓音樂(lè)充滿生命力。一位真正掌握連音技巧的演奏者,不需要靠后期剪輯來(lái)彌補(bǔ)斷點(diǎn),而是能夠知道如何讓每一個(gè)音符自然地流向下一個(gè)。
機(jī)器人領(lǐng)域同樣在追求這樣的 "連音" 效果:讓機(jī)器人的動(dòng)作像音樂(lè)一樣流暢自然,沒(méi)有猶豫和停頓。然而,要讓一臺(tái)機(jī)器人真正做到這一點(diǎn),遠(yuǎn)比想象中困難。
近日,千尋智能高陽(yáng)團(tuán)隊(duì)的研究成果 《Learning Native Continuation for Action Chunking Flow Policies》 被機(jī)器人頂會(huì) RSS 2026 接收!這項(xiàng)工作從訓(xùn)練機(jī)制出發(fā),讓機(jī)器人動(dòng)作天然具有連續(xù)性,實(shí)現(xiàn)了 "連音" 般的流暢執(zhí)行,在五個(gè)真實(shí)世界操作任務(wù)上超越了現(xiàn)有方法,為具身智能領(lǐng)域的動(dòng)作生成研究提供了新的思路。

論文標(biāo)題:Learning Native Continuation for Action Chunking Flow Policies
論文鏈接:https://arxiv.org/pdf/2602.12978
項(xiàng)目主頁(yè):https://lyfeng001.github.io/Legato/
1. 機(jī)器人為什么會(huì) "猶豫"?
想象一下,你讓機(jī)器人倒水、疊碗或折毛巾,它卻在執(zhí)行過(guò)程中頻繁停頓、猶豫不決,甚至突然改變主意 —— 比如原本計(jì)劃用左手抓取物體,執(zhí)行到一半?yún)s又想換成右手,結(jié)果兩只手都沒(méi)抓到,白白浪費(fèi)了時(shí)間。這種 "猶豫" 不僅讓動(dòng)作看起來(lái)別扭,還會(huì)直接拖慢任務(wù)完成的速度,在需要精準(zhǔn)配合的場(chǎng)景下甚至?xí)?dǎo)致任務(wù)失敗。
這背后的根源,要從當(dāng)前主流的機(jī)器人基礎(chǔ)模型的動(dòng)作建模方式說(shuō)起。
1.1 動(dòng)作分塊:一把雙刃劍
目前,主流的 Vision Language Action(VLA)模型普遍采用一種叫做 "動(dòng)作分塊"(Action Chunking)的技術(shù):機(jī)器人不是每次只規(guī)劃下一個(gè)動(dòng)作,而是一口氣規(guī)劃出未來(lái)一段時(shí)間(比如接下來(lái) 1 秒)的完整動(dòng)作序列,然后依次執(zhí)行。這樣做有兩個(gè)明顯的好處:
動(dòng)作更連貫,因?yàn)槟P湍芸吹礁L(zhǎng)時(shí)間范圍內(nèi)的規(guī)劃;
推理效率更高,不需要每個(gè)單獨(dú)的時(shí)間步的動(dòng)作都調(diào)用一次模型。
但問(wèn)題也隨之而來(lái):每當(dāng)一段動(dòng)作序列執(zhí)行完畢、下一段序列接上來(lái)的時(shí)候,兩段序列之間往往存在明顯的不連續(xù)性。就像兩段錄音硬拼在一起,接縫處總會(huì)有一個(gè)突兀的 "斷點(diǎn)"—— 機(jī)器人會(huì)在這個(gè)瞬間出現(xiàn)停頓、抖動(dòng),甚至方向突變。這個(gè)問(wèn)題在需要高頻控制的精細(xì)操作任務(wù)中尤為明顯。
更深層的原因在于,基于流匹配(Flow Matching)的 VLA 模型本身具有多模態(tài)性 —— 面對(duì)同一個(gè)場(chǎng)景,模型可能規(guī)劃出多種合理的動(dòng)作方案(比如用左手或右手抓取)。當(dāng)兩段動(dòng)作序列獨(dú)立生成時(shí),前一段選擇了方案 A,后一段卻可能選擇了方案 B,兩者在接縫處發(fā)生 "模態(tài)切換",導(dǎo)致機(jī)器人的動(dòng)作出現(xiàn)突兀的跳變。
這種現(xiàn)象在任務(wù)中途尤為危險(xiǎn):機(jī)器人已經(jīng)伸出了左手,卻在下一個(gè)動(dòng)作塊里突然決定改用右手,不僅動(dòng)作難看,還可能直接碰倒目標(biāo)物體。
1.2 RTC 的修補(bǔ)
為了解決這個(gè)問(wèn)題,研究者們提出了 Real-Time Chunking(RTC)方法。它的思路是:在生成新的動(dòng)作序列時(shí),把上一段序列末尾還沒(méi)執(zhí)行完的部分 "借" 過(guò)來(lái),用來(lái)引導(dǎo)下一個(gè)序列的生成,通過(guò)讓下一個(gè)序列的前半部分和上一個(gè)序列沒(méi)有執(zhí)行的部分比較像,來(lái)保證兩段序列之間的平滑過(guò)渡。
這個(gè)方法具有非常好的效果,也因此得到了廣泛應(yīng)用。可以把它理解為一種 "接力棒傳遞" 的機(jī)制:新的動(dòng)作序列不是憑空開(kāi)始,而是從上一段序列的后半部分 "接棒" 繼續(xù)。
然而,這個(gè)方法實(shí)際上存在一些不可避免的缺陷:
推理階段 RTC:連續(xù)性機(jī)制只在推理時(shí)臨時(shí) "打補(bǔ)丁",模型在訓(xùn)練時(shí)從未見(jiàn)過(guò)這種情況。訓(xùn)練和推理的條件不一致,就像一個(gè)學(xué)生平時(shí)練習(xí)的題型和考試題型完全不同 —— 模型在推理時(shí)面對(duì) "部分已知的前綴" 時(shí),并不知道該如何正確利用這些信息,容易產(chǎn)生 "虛假的多模態(tài)切換",也就是機(jī)器人在執(zhí)行過(guò)程中突然 "改變主意"。
訓(xùn)練階段 RTC:雖然在訓(xùn)練時(shí)也引入了這種拼接機(jī)制,但做法是直接把前綴片段硬拼接到執(zhí)行部分的前面,并將這部分固定、不再更新。這樣一來(lái),前綴和后續(xù)動(dòng)作之間依然缺乏有機(jī)聯(lián)系:模型只是被告知 "前面這段是固定的,你只需要生成后面的部分"。
兩種方式都沒(méi)有從根本上解決問(wèn)題:連續(xù)性是從外部強(qiáng)加給模型的,而不是模型自己學(xué)會(huì)的。這就好比一個(gè)演奏者不是真正掌握了連音技巧,而是靠后期剪輯把兩段錄音拼在一起 —— 聽(tīng)起來(lái)勉強(qiáng)過(guò)得去,但終究缺少那種渾然天成的流暢感。

2. Legato 的解決方案
讓連續(xù)性成為模型的 "天賦"
Legato 的核心思想可以用一句話概括:與其在推理時(shí)給模型 "打補(bǔ)丁",不如在訓(xùn)練時(shí)就讓模型學(xué)會(huì)如何天然地生成連續(xù)的動(dòng)作。
這個(gè)思路的轉(zhuǎn)變看似簡(jiǎn)單,實(shí)現(xiàn)起來(lái)卻需要解決兩個(gè)關(guān)鍵問(wèn)題:
第一,如何在訓(xùn)練時(shí)讓模型真正 "看到" 并學(xué)會(huì)利用已知的前綴信息;
第二,如何確保訓(xùn)練時(shí)學(xué)到的行為和推理時(shí)實(shí)際執(zhí)行的行為完全一致,不出現(xiàn) "雙重標(biāo)準(zhǔn)"。
Legato 通過(guò)四個(gè)精心設(shè)計(jì)的機(jī)制,系統(tǒng)性地解決了這兩個(gè)問(wèn)題。一個(gè)直覺(jué)上的類(lèi)比是:我們希望機(jī)器人就像一位經(jīng)驗(yàn)豐富的接力跑運(yùn)動(dòng)員:不僅知道自己該跑哪一段,還清楚地知道上一棒跑到了哪里、速度是多少,并據(jù)此調(diào)整自己起跑的節(jié)奏,而不是每次都從靜止?fàn)顟B(tài)重新出發(fā)。

2.1 噪聲-真實(shí)值混合機(jī)制
在標(biāo)準(zhǔn)的流匹配(Flow Matching)訓(xùn)練中,模型每次都是從完全隨機(jī)的噪聲出發(fā),通過(guò)多步去噪,最終生成完整的動(dòng)作序列。這就好比讓一個(gè)學(xué)生每次都從一張白紙開(kāi)始作答 —— 他永遠(yuǎn)不知道 "如果已經(jīng)寫(xiě)了一半,接下來(lái)該怎么寫(xiě)"。長(zhǎng)此以往,模型只會(huì)從零開(kāi)始規(guī)劃,一旦推理時(shí)被要求 "接著已有的動(dòng)作繼續(xù)",就會(huì)手足無(wú)措。
Legato 改變了這一點(diǎn),它引入了引導(dǎo)向量 ω∈[0,1]^H,用來(lái)控制每個(gè)時(shí)間步的初始狀態(tài),將訓(xùn)練時(shí)的起點(diǎn)從 "純?cè)肼?quot; 變成 "噪聲與真實(shí)動(dòng)作的混合":
對(duì)于已經(jīng)執(zhí)行過(guò)的前綴部分(ω=1):初始狀態(tài)直接就是真實(shí)動(dòng)作,模型知道 "這里已經(jīng)發(fā)生了什么",需要在此基礎(chǔ)上繼續(xù)規(guī)劃
對(duì)于需要自由預(yù)測(cè)的未來(lái)部分(ω=0):初始狀態(tài)是純?cè)肼暎P托枰耆灾饕?guī)劃
對(duì)于中間的過(guò)渡區(qū)域(0<ω<1):初始狀態(tài)是真實(shí)動(dòng)作和噪聲的混合,引導(dǎo)強(qiáng)度從強(qiáng)到弱逐漸減弱,形成平滑的過(guò)渡
用公式表達(dá)就是:
其中 A 是真實(shí)動(dòng)作,ε 是噪聲,⊙ 表示逐元素相乘。通過(guò)這種設(shè)計(jì),模型在訓(xùn)練時(shí)就能反復(fù)練習(xí) "如何從部分已知的狀態(tài)出發(fā),生成流暢的后續(xù)動(dòng)作",而不是每次都從零開(kāi)始。久而久之,模型自然就學(xué)會(huì)了如何利用已知的前綴信息:這種能力是從訓(xùn)練中內(nèi)化的,而不是推理時(shí)臨時(shí)拼湊的。
2.2 逐步引導(dǎo)的去噪動(dòng)力學(xué)
僅僅改變初始狀態(tài)還不夠。研究團(tuán)隊(duì)發(fā)現(xiàn)了一個(gè)重要現(xiàn)象:如果只在初始化時(shí)引入引導(dǎo),隨著去噪步驟的推進(jìn),模型會(huì)逐漸 "忘記" 已知的前綴信息。就像一個(gè)人在嘈雜的環(huán)境中試圖記住一段旋律,時(shí)間越長(zhǎng),記憶就越模糊,最終生成的動(dòng)作仍然可能偏離預(yù)期。
研究團(tuán)隊(duì)通過(guò)實(shí)驗(yàn)驗(yàn)證了這一點(diǎn):?jiǎn)未我龑?dǎo)(one-shot guidance)在去噪過(guò)程中確實(shí)無(wú)法維持對(duì)前綴的約束,前綴區(qū)域的動(dòng)作會(huì)隨著去噪步驟的推進(jìn)逐漸漂移。
為了解決這個(gè)問(wèn)題,Legato 在每一步去噪前都進(jìn)行混合,而不是只在初始化時(shí):

這就像給模型裝了一個(gè) "記憶錨":無(wú)論去噪進(jìn)行到哪一步,模型都會(huì)被不斷提醒 "前綴是什么樣的",并圍繞這個(gè)約束來(lái)規(guī)劃后續(xù)動(dòng)作。這種逐步引導(dǎo)的機(jī)制,使得前綴區(qū)、過(guò)渡區(qū)和自由生成區(qū)形成一個(gè)統(tǒng)一、連貫的動(dòng)力學(xué)系統(tǒng),而不是三段割裂的拼接。
2.3 訓(xùn)練-推理一致性
問(wèn)題在于:推理時(shí),模型在每一步去噪前都會(huì)進(jìn)行真實(shí)值和噪聲的混合(即上面的逐步引導(dǎo));但訓(xùn)練時(shí),標(biāo)準(zhǔn)流匹配的優(yōu)化目標(biāo)是針對(duì) "從純?cè)肼暢霭l(fā)的去噪過(guò)程" 設(shè)計(jì)的,并沒(méi)有考慮這種逐步引導(dǎo)的存在。所以如果不針對(duì)訓(xùn)練目標(biāo)進(jìn)行調(diào)整,訓(xùn)練的目標(biāo)即標(biāo)準(zhǔn)流匹配與實(shí)際執(zhí)行的動(dòng)力學(xué)實(shí)際上是不一致的。
Legato 的解決方案:重新推導(dǎo)訓(xùn)練目標(biāo),使其與逐步引導(dǎo)的推理動(dòng)力學(xué)完全對(duì)齊。具體來(lái)說(shuō),研究團(tuán)隊(duì)從逐步引導(dǎo)的動(dòng)力學(xué)方程出發(fā),反推出了一個(gè)新的速度場(chǎng)訓(xùn)練目標(biāo):


這個(gè)公式的妙處在于:它保留了標(biāo)準(zhǔn)流匹配的幾何方向(即 "朝著真實(shí)動(dòng)作運(yùn)動(dòng)" 的大方向不變),只是根據(jù)引導(dǎo)強(qiáng)度 κ 調(diào)整了速度的大小。換句話說(shuō),Legato 并沒(méi)有顛覆流匹配的基本框架,而是在其基礎(chǔ)上做了一個(gè)精準(zhǔn)的 "校準(zhǔn)"—— 讓訓(xùn)練時(shí)學(xué)到的速度場(chǎng),與推理時(shí)逐步引導(dǎo)所產(chǎn)生的有效速度場(chǎng)完全吻合。
這樣一來(lái),訓(xùn)練和推理之間的 "雙重標(biāo)準(zhǔn)" 被徹底消除,模型在推理時(shí)的行為完全符合它訓(xùn)練時(shí)學(xué)到的規(guī)律。

2.4 隨機(jī)化混合參數(shù)
在真實(shí)部署中,不同的硬件平臺(tái)推理速度不同(高端 GPU 和邊緣計(jì)算設(shè)備的延遲可能相差數(shù)倍),不同的任務(wù)對(duì)動(dòng)作流暢度的要求也不同(精細(xì)操作需要更強(qiáng)的連續(xù)性,而快速移動(dòng)任務(wù)則更注重響應(yīng)速度)。如果每換一個(gè)場(chǎng)景就要重新訓(xùn)練一個(gè)模型,代價(jià)太高,也不現(xiàn)實(shí)。
Legato 的解決方案是:在訓(xùn)練時(shí)對(duì)混合參數(shù) (d,r) 進(jìn)行隨機(jī)化,讓模型在訓(xùn)練階段就見(jiàn)識(shí)各種不同的引導(dǎo)向量:
d(推理延遲):控制前綴的長(zhǎng)度,對(duì)應(yīng)不同硬件平臺(tái)的計(jì)算速度。d 越大,說(shuō)明推理延遲越高,需要 "借用" 的前綴越長(zhǎng)
r(過(guò)渡區(qū)長(zhǎng)度):控制從強(qiáng)引導(dǎo)到弱引導(dǎo)的過(guò)渡速度,決定動(dòng)作的流暢程度。r 越大,過(guò)渡越平緩,動(dòng)作越流暢;r 越小,過(guò)渡越陡峭,模型響應(yīng)越靈敏
通過(guò)在訓(xùn)練時(shí)讓模型見(jiàn)識(shí)各種不同的 (d, r) 組合,同一個(gè)模型在推理時(shí)只需要調(diào)整這兩個(gè)參數(shù),就能適配不同的硬件延遲和流暢度需求,無(wú)需重新訓(xùn)練。這大大降低了 Legato 在實(shí)際部署中的門(mén)檻。同時(shí),由于模型在訓(xùn)練時(shí)已經(jīng)見(jiàn)過(guò)各種調(diào)度情況,推理時(shí)的行為也更加穩(wěn)定魯棒,不會(huì)因?yàn)閰?shù)的細(xì)微變化而出現(xiàn)大幅波動(dòng)。
3. 實(shí)驗(yàn)結(jié)果
研究團(tuán)隊(duì)在雙臂機(jī)器人上進(jìn)行了廣泛的真實(shí)世界實(shí)驗(yàn),涵蓋五個(gè)操作任務(wù):疊碗、倒東西、拾取放置、疊毛巾、開(kāi)抽屜。這些任務(wù)的選取頗具代表性:它們不僅覆蓋了旋轉(zhuǎn)主導(dǎo)、平移主導(dǎo)等多樣的運(yùn)動(dòng)模式,還包含了大量需要在多個(gè)選項(xiàng)中做出選擇的場(chǎng)景 —— 比如疊碗時(shí)選擇抓哪個(gè)碗、拾取放置時(shí)決定用左手還是右手。
這類(lèi)多模態(tài)選擇場(chǎng)景,正是最容易觸發(fā) "虛假多模態(tài)切換" 的地方,也是檢驗(yàn)連續(xù)性方法的最佳試金石。

3.1 基本實(shí)驗(yàn)結(jié)果
實(shí)驗(yàn)結(jié)果表明,Legato 相對(duì)于 RTC 以及 Training-Time RTC 均有一定的優(yōu)勢(shì):
猶豫明顯減少:機(jī)器人在執(zhí)行過(guò)程中的停頓和 "改變主意" 現(xiàn)象大幅降低,動(dòng)作軌跡更加干凈利落。從軌跡圖上可以直觀地看到,Legato 的執(zhí)行曲線更加平滑,而 RTC 的曲線則呈現(xiàn)出明顯的鋸齒狀波動(dòng),這些波動(dòng)正是機(jī)器人在兩種動(dòng)作方案之間反復(fù)橫跳的痕跡
任務(wù)完成時(shí)間縮短:在五個(gè)任務(wù)上平均縮短約 10%,在倒東西等高度依賴(lài)連續(xù)性的任務(wù)上提升尤為突出,最高提升幅度超過(guò) 20%
軌跡平滑性顯著提升:以 NSPARC 指標(biāo)衡量,平均提升約 10%,部分任務(wù)(如倒東西)提升幅度超過(guò) 40%


更多的消融實(shí)驗(yàn)、仿真測(cè)試以及詳細(xì)分析可參考原文。
3.2 實(shí)際部署使用指南
研究發(fā)現(xiàn),在 d=delay, s=0.5H, r=H-d-s 的參數(shù)設(shè)置下,模型的表現(xiàn)較好。其中 H 是動(dòng)作序列的總長(zhǎng)度,d 對(duì)應(yīng)實(shí)際的推理延遲,s 是每個(gè)序列執(zhí)行的步數(shù),r 則是過(guò)渡區(qū)的長(zhǎng)度。這個(gè)參數(shù)設(shè)置在大多數(shù)任務(wù)和硬件平臺(tái)上都能取得不錯(cuò)的效果,可以作為部署時(shí)的默認(rèn)配置。
與此同時(shí),該研究推薦在一個(gè)標(biāo)準(zhǔn) flow matching 訓(xùn)練至較好的 base model 基礎(chǔ)上進(jìn)行 Legato 的 finetune,會(huì)獲得更好的模型表現(xiàn)。
4. 總結(jié)
Legato 提出了一種讓流匹配策略天然具備連續(xù)性的訓(xùn)練方法,從根本上解決了動(dòng)作分塊策略中長(zhǎng)期存在的連續(xù)性問(wèn)題。它的核心貢獻(xiàn)在于:
原生連續(xù)性:讓模型從訓(xùn)練階段就學(xué)會(huì)如何從 "部分已知的動(dòng)作" 出發(fā)生成后續(xù)動(dòng)作,連續(xù)性是模型內(nèi)化的能力,而不是推理時(shí)外部修補(bǔ)的結(jié)果
訓(xùn)練-推理一致性:通過(guò)重塑速度場(chǎng),從數(shù)學(xué)上保證訓(xùn)練和推理的動(dòng)力學(xué)完全對(duì)齊,從根本上消除虛假多模態(tài)切換,而不是用更強(qiáng)的約束去壓制它
靈活可控:通過(guò)隨機(jī)化混合參數(shù),一個(gè)模型即可適配不同硬件延遲和流暢度需求,大幅降低實(shí)際部署的門(mén)檻
Legato 讓機(jī)器人的動(dòng)作真正像音樂(lè)中的連音一樣:不是兩段錄音的生硬拼接,而是演奏者發(fā)自?xún)?nèi)心、渾然天成的流暢表達(dá)。隨著具身智能走向更廣泛的真實(shí)世界應(yīng)用,這種 "天然流暢" 的能力,將成為機(jī)器人部署時(shí)流暢執(zhí)行運(yùn)動(dòng)不可或缺的條件。
希望 Legato 這篇工作能夠?yàn)榫呱碇悄苌鐓^(qū)帶來(lái)新的啟發(fā),推動(dòng)機(jī)器人操作技術(shù)邁向更高的水平。
? THE END
轉(zhuǎn)載請(qǐng)聯(lián)系本公眾號(hào)獲得授權(quán)
投稿或?qū)で髨?bào)道:liyazhou@jiqizhixin.com
本專(zhuān)題其他文章