0
| 本文作者: 吳思?jí)?/a> | 2026-05-28 15:56 | 專題:ICRA 國(guó)際機(jī)器人與自動(dòng)化會(huì)議 |
論文原文鏈接
arXiv預(yù)印本頁(yè)面:https://arxiv.org/abs/2602.02142v2
arXiv全文PDF:https://arxiv.org/pdf/2602.02142v2
DBLP頁(yè)面:https://dblp.uni-trier.de/pid/00/9938.html(內(nèi)含更詳細(xì)的引用信息)
Semantic Scholar頁(yè)面:https://www.semanticscholar.org/paper/FD-VLA:-Force-Distilled-Vision-Language-Action-for-Zhao-Wang/84496e9c36fa5b863f5702abb1dbc5560ee7db5b
原文作者:公眾號(hào)“計(jì)算機(jī)頂會(huì)大全”
原文鏈接:https://mp.weixin.qq.com/s/SbiHonAq0qYEP-sC-sB-bA
ICRA 2026| FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation

過去,VLA模型主要依賴視覺和語(yǔ)言來完成機(jī)器人操作,但在真實(shí)場(chǎng)景中,很多任務(wù)并不是看見就能做好。比如插頭插入、按鈕按壓、擦白板等接觸豐富任務(wù),真正影響成功率的是接觸力、阻力變化、摩擦和細(xì)微形變。
這篇論文關(guān)注的正是VLA的力覺短板。論文提出FD-VLA,通過力蒸餾機(jī)制,讓模型在訓(xùn)練階段利用真實(shí)力信號(hào)學(xué)習(xí)潛在力表示;在推理階段,則不再依賴實(shí)體力傳感器,而是根據(jù)視覺觀察和機(jī)器人本體狀態(tài)預(yù)測(cè)力標(biāo)記,并與視覺語(yǔ)言信息共同生成動(dòng)作。這樣既保留了力覺對(duì)接觸操作的幫助,又降低了真實(shí)部署時(shí)對(duì)昂貴、脆弱傳感器的依賴。

創(chuàng)新點(diǎn)主要在于三方面:一是把力覺信息以蒸餾方式融入VLA,而不是簡(jiǎn)單拼接原始力信號(hào);二是利用視覺和本體狀態(tài)預(yù)測(cè)接觸相關(guān)力表示,提升任務(wù)相關(guān)性和魯棒性;三是在真實(shí)機(jī)器人平臺(tái)上驗(yàn)證擦白板、按按鈕、插頭插入等典型接觸任務(wù)。實(shí)驗(yàn)表明,F(xiàn)D-VLA整體成功率明顯高于無力覺版本和直接輸入原始力信號(hào)的方法,說明可學(xué)習(xí)的力表示比粗暴使用傳感器數(shù)據(jù)更有效。
這篇論文的價(jià)值在于,它把VLA從看懂再行動(dòng)推進(jìn)到理解接觸再行動(dòng)。對(duì)具身智能研究來說,力覺蒸餾、觸覺增強(qiáng)、狀態(tài)建模和接觸豐富操作,正在成為VLA實(shí)用化落地的重要發(fā)文切口。
雷峰網(wǎng)(公眾號(hào):雷峰網(wǎng))
本專題其他文章