0
| 本文作者: 雷鋒專欄 | 2026-08-03 21:52 |
自變量機器人今日發布 HOST 框架(Human-to-robot One-Shot Skill AcquisiTion,人類到機器人單樣本技能獲取)并開源,能讓機器人僅觀察一段數十秒的人類視頻就學會新技能,同時保留已掌握的技能。
HOST 采用了一種開創性的方法:不去將人類動作翻譯為機器人動作并試圖模仿,而是讓機器人先想象執行動作后的結果,再從結果拆分出需要執行的動作。
這種全新方法的效果令人欣喜:機器人從一段 29 秒人類視頻中學習技能的成功率高達 62%,超越零樣本基線 45%。相比 Pi-0.5 + 微調方案,HOST 所需數據量減少 50 倍,學習技能速度提升 500 倍。
模仿人類“觀察學習”過程,自動對齊視頻任務進度
HOST 的思路來自認知科學中的“觀察學習”理論:人類面對不熟悉的任務時,不需要通過長期練習或者窮舉來學習,而是以先驗能力在大腦中模擬動作的預期效果,然后執行相應動作。
自變量研究人員受此啟發,將 HOST 的學習方案從“訓練時微調循環”變為“推理時技能獲取”,讓機器人通過觀察人類執行任務來學習新技能。
機器人首先要解決的問題是:如何對齊自己執行任務的進度和視頻中的進度?
舉例來說:同樣工作 10 秒,視頻中的人可能已經切完菜、開始炒菜了,機器人還在切菜。如果只僅按時間對齊,機器人就會丟失任務進度。
對此,HOST的做法是“按任務進度對齊”。HOST 會將視頻每一幀和機器人操作每一步都轉化為同一向量空間里的向量;然后利用“動態時間規整”算法,自動對齊“人類視頻的第 X 幀和機器人操作的第 Y 步”。如此一來,機器人執行到每一步時,看到的永遠都是和任務進度對齊的那一幀。
憑借這種方法,HOST 將對齊任務進度的時間誤差降低了一個數量級,能夠做到機器人執行與視頻示范的精準同步。
機器人不再模仿人類動作,而是從動作結果反推過程
機器人學習人類經驗的第二個難點在于:機器人身體結構與人完全不同,無法簡單跟隨視頻“照著做”,需要找到一種動作的翻譯方式。
機器人的構型千奇百怪,如何找到一套通用解法?HOST 規避了“對照身體結構”的問題,分為三步解決:
首先,機器人需要判斷自己進行到任務的哪個部分。其次,機器人需要將人類執行完動作的畫面翻譯成機器人自身視角和身體結構的畫面。舉例來說,機器人看到人類拿起一杯水,就要想象出機器人拿起水杯的畫面。最后,機器人從畫面推斷出需要執行的動作,并執行這些動作。
這個解法的優勢在于,它利用“看到人類動作結果-想象出機器人動作結果-拆解結果對應的機器人動作”的思路,讓機器人利用視覺推理看到結果畫面,再反推動作過程,而不是機械地模仿人類動作,從而繞開了“動作映射”的問題。 
模型訓練兩步走:先預測機器人動作,再遷移到人類教學
HOST 的核心部分是一個帶有視覺預測功能的級聯策略模型。它采用雙專家 MoT 架構,如同兩個分工明確的大腦:“視覺大腦”(視頻專家)專門處理視頻畫面、定位任務進度、預測未來圖景;“動作大腦”(動作專家)負責將預測圖景轉化為需要執行的動作,并控制執行。
在訓練模型時,自變量團隊將訓練過程拆分為“同體預訓練”和“人機視頻訓練”兩個階段。在同體預訓練階段,機器人通過學習機器人自身執行任務的視頻,學會預測完成任務后的狀態,并生成對應動作。在人機視頻訓練階段,機器人進一步學習人類演示視頻,將人類執行任務的過程轉化為機器人視角下的任務結果,再根據目標結果推理完成任務所需的動作,實現從人類示范到機器人技能的遷移。
如此分兩步訓練的優勢在于:人與機器人執行同一任務的匹配數據相對稀缺,機器人執行任務的視頻與軌跡則容易采集得多。先觀看機器人視頻打好“基本功”,再遷移到人類視頻學習,能大幅提升數據訓練模型的效率。
學習新技能成功率高達 62%,較主流方法提速 500 倍
HOST 模型的權重在訓練好后即凍結,僅在推理過程中觀看視頻和復現技能。盡管全部學習素材只有一段視頻,它的學習效果仍令人感到欣喜:
僅觀看一段平均 29 秒的人類視頻,HOST 復現技能的成功率高達 62%。相比之下,Vid2Robot/AWDA 同樣從一段視頻中學習技能,成功率僅有 19%。如果采用微調模型的方法,給 Pi-0.5 示范 50 個機器人任務并花 4 小時微調訓練,成功率也僅有 38%。
相比 Pi-0.5 + 微調方案,HOST 僅需 1/50 的數據樣本量和 1/500 的學習時間,就能讓成功率大幅提升 24%,成為當前表現最好的機器人技能學習方案。

不僅如此,HOST 還能最大限度地保留已經學習的技能,因為它僅根據視頻來復現技能:視頻更像是“菜譜”,可以放入書架隨時調取。如此便實現了技能的持久化記憶和聯想機制。相比之下,Pi-0.5 + 微調方案學習新技能后,過去技能的保留率僅有 17%。
在泛化性方面,HOST 測試了 50 個包含不同物體、工具和基本動作的任務,均學習到新技能。在魯棒性方面,HOST 面對改變光照、替換物體、替換場景和移動物體等干擾,成功率仍全部保持在 50% 以上。即使中途把物品挪走,HOST 也能調整回來繼續任務。這說明 HOST 不是在“死記硬背”動作序列,而是真正理解任務、動態規劃下一步動作。
普通人也能教授新技能,機器人邁向靈活學習新階段
簡單來說,HOST 將機器人學習技能的范式從“訓練時微調循環”改變為“推理時技能獲取”。它僅從一段數十秒的人類視頻去學習技能,成功率則遠超主流模型經過后訓練微調的效果。不僅如此,HOST 還能隨時調取技能,解決了“災難性遺忘”的問題。
對此,自變量機器人團隊表示:“在具身智能走出實驗室、走進千家萬戶的進程中,不應該只靠專業人員采集數據、反復訓練來獲得新技能。人與人之間通過示范傳遞技能,是更加自然高效的學習方式。HOST 將技能獲取從少數人的專業流程,轉變為任何人都能用一段視頻完成教學。”
目前,HOST 的研究論文和代碼已經全部開源。未來機器人在家庭勞動時,有望擺脫專業化的數據采集和訓練過程,通過直觀的人類演示就學會新技能。這將讓智能機器人成為真正貼心可用的“家庭伙伴”,讓智能機器人服務人類的每一天。(雷峰網(公眾號:雷峰網))