0
| 本文作者: 鄭佳美 | 2026-06-05 18:12 | 專題:ICRA 國際機器人與自動化會議 |

作者丨鄭佳美
編輯丨馬曉寧
2026 年 6 月 4 日,在 ICRA 2026 “Robot perception and spatial AI” Keynote Session 上,波恩大學(xué)教授 Maren Bennewitz 發(fā)表了關(guān)于主動感知機器人的演講,直指真實機器人部署中的一個基本困境:機器人面對的世界往往是雜亂、持續(xù)變化且只能部分觀測的,僅靠被動觀察無法完成可靠理解。
Bennewitz 的核心判斷是:機器人要真正進(jìn)入家庭、農(nóng)業(yè)和服務(wù)場景,不能只把感知當(dāng)作“看一眼”的過程,而必須把感知、預(yù)測、先驗知識和動作規(guī)劃放到同一個閉環(huán)里。機器人需要主動移動視角、推動或抓取遮擋物,用最少的動作獲得最多的信息。
她在演講中給出了三類典型場景:
其一,在貨架或桌面等遮擋環(huán)境中,機器人通過不確定性感知的語義地圖,決定哪些物體值得移動;
其二,在家庭物體搜索中,機器人利用 3D 場景圖、LLM 語義先驗、幾何約束和物體重定位規(guī)律,在不重新探索全屋的情況下按需尋找物體;
其三,在農(nóng)業(yè)監(jiān)測與果實采摘中,機器人借助上一時刻的地圖先驗、非剛性配準(zhǔn)和葉片形變模型,規(guī)劃更高效的觀測與操作動作。
這場演講的關(guān)鍵洞察在于:主動感知并不是“多看幾眼”,而是把“看哪里、動什么、何時停止”變成信息增益最大化問題。對于機器人而言,世界不是一張靜態(tài)照片,而是一組可以通過行動逐步揭開的信念分布。
1、真實環(huán)境的核心難點不是沒有圖像,而是不確定性和遮擋:機器人必須知道自己不知道什么。
2、主動感知的價值在于把動作變成信息采集工具:換視角、推開物體、移動葉片,都是為了降低地圖和語義的不確定性。
3、先驗知識并不替代感知,而是幫助機器人更聰明地選擇下一步:LLM 提供語義常識,幾何模型過濾不可能位置,重定位模型學(xué)習(xí)人類移動物體的習(xí)慣。
4、在農(nóng)業(yè)機器人中,時間維度同樣重要:上一輪完整重建可以作為下一輪觀測規(guī)劃的先驗,讓機器人在重復(fù)監(jiān)測中避免從零開始。
5、面向采摘等高價值任務(wù),機器人需要從“識別果實”進(jìn)一步走向“估計可采摘性”,并理解葉片、視角和目標(biāo)之間的遮擋關(guān)系。
總的來看,Bennewitz 試圖回答的是一個非常現(xiàn)實的問題:當(dāng)機器人無法一次看清世界時,它應(yīng)該如何通過行動把未知變成已知?她的答案是,用信念表示世界,用先驗約束搜索,用動作主動降低不確定性。
以下是AI 科技評論對 Maren Bennewitz 在 ICRA 2026 大會發(fā)表的演講實錄整理。內(nèi)容基于英文現(xiàn)場轉(zhuǎn)寫進(jìn)行不改原意的中文整理。

01
正如我們都知道的,機器人運行在雜亂、變化且只能部分觀測的環(huán)境中。因此,單純被動觀察遠(yuǎn)遠(yuǎn)不夠。為了完成任務(wù),主動感知環(huán)境是必要的。主動感知機器人必須在行動中整合感知、預(yù)測、先驗信息和動作,主動獲取信息,并提升對環(huán)境的理解。
今天我將介紹機器人如何高效增強它對世界的知識,主要圍繞雜亂場景和隱藏物體展開。更具體地說,我會講機器人如何利用先驗和試探性動作,在少量步驟內(nèi)完成感知和操作。
先看一個場景。我們有一個貨架,前面有幾個盒子,擋住了后方空間的視線。問題是,我們怎樣才能看見盒子后面的物體?也就是說,機器人如何推理前方物體背后可能存在什么?雷峰網(wǎng)
在這個例子里,僅僅改變視角是不夠的。機器人必須移動場景中的一些物體,才能看見后面并覆蓋被遮擋的空間。這就是我們關(guān)注的問題。
我們使用一種帶有不確定性的度量語義地圖表示。這個表示既可以推理場景中的所有物體,也可以推理操作動作及其約束的影響。我們學(xué)習(xí)一個模型,預(yù)測這個地圖表示會如何隨著動作結(jié)果而演化。也就是說,我們預(yù)測場景會如何因為視角變化、推動或者抓取而改變,并把它作為動作如何改變世界的先驗。

基于這個學(xué)習(xí)到的模型,我們可以推斷動作的效果。因此,機器人會選擇那些能夠降低環(huán)境表示不確定性、降低度量語義表示不確定性的最佳動作。比如在這個案例里,機器人可以先向左推動一個盒子,然后抓取另一個盒子,把它移到一側(cè),從而看見此前被遮擋的空間,并識別其中的物體。雷峰網(wǎng)
我們學(xué)習(xí)動作條件網(wǎng)絡(luò),預(yù)測占據(jù)、語義以及相應(yīng)的不確定性。這些網(wǎng)絡(luò)會預(yù)測機器人執(zhí)行某個動作之后,信念會如何變化。網(wǎng)絡(luò)也會預(yù)測對應(yīng)的不確定性。隨后,我們選擇那些能夠降低不確定性、或者提高預(yù)期信息增益的動作。我們會在接下來兩個動作的序列上做優(yōu)化,選擇最大化信息增益、降低不確定性的序列。

這里是我們的目標(biāo)函數(shù)。對于純粹的視角變化,我們考慮預(yù)期信息增益;對于抓取、推動物體以移除后方遮擋空間的動作,我們還會額外考慮動作成本。然后,我們評估下一步測試動作帶來的信息增益,并在兩個動作的序列上進(jìn)行優(yōu)化,以最大化信息、降低不確定性。

這是我們與合作者共同開發(fā)的方法。接下來可以看到系統(tǒng)運行的過程:左邊是帶有相機的機器人實驗平臺,右邊顯示機器人已經(jīng)識別出的物體。最開始,機器人已經(jīng)識別了一些物體,而它的任務(wù)是識別場景中的所有物體。
使用我們的方法,機器人會查看世界中的不確定性地圖,選擇最好的動作來處理場景中的所有物體。它會移動一些物體,抓取一些物體,把它們放到一側(cè),從而觀察后方空間。最后,機器人識別出了場景中的所有物體。當(dāng)然,機器人只會移除那些為了覆蓋整個空間而必須移除的物體,并會在之后把它們放回貨架。
這里可以看到,機器人能夠維護(hù)關(guān)于環(huán)境中物體的長期信念。因此,即使存在遮擋,它也知道物體在貨架上的位置。

02
接下來一個問題是:機器人如何在更大的場景中搜索物體?例如在一個完整家庭環(huán)境中,物體會頻繁移動、重新放置,也可能被隱藏在家具內(nèi)部。我們?nèi)绾巫寵C器人在用戶需要某個物體時進(jìn)行搜索,而不是重新探索整個環(huán)境?
為此,我們把環(huán)境重建為一個 3D 場景圖,就像前一場報告中也展示過的那樣。這個圖包含房間、家具和隔層結(jié)構(gòu)。我們利用這個圖來推理被搜索物體可能位于哪里,并把被搜索物體視為相關(guān)過程中的動態(tài)節(jié)點。

在搜索物體時,我們進(jìn)行空間信念推理,利用這個圖表示來推理物體的位置。比如這里的例子中,機器人的任務(wù)是尋找一個物體。環(huán)境中有三個可能的位置:貨架、書桌和咖啡桌。
第一步,我們使用來自 LLM 的語義先驗,初始化關(guān)于搜索物體位置的信念。在這個例子里,機器人一開始認(rèn)為最可能的位置是貨架,其次書桌和咖啡桌也有一定概率。
當(dāng)然,我們也考慮幾何信息。我們會預(yù)測目標(biāo)物體是否應(yīng)該能夠放在某個位置上。如果這個物體太大,無法放進(jìn)某個隔層,那么我們就會降低它在該位置的概率,相應(yīng)地提高其他位置的概率。
最后,非常重要的是,我們會基于重定位動態(tài)來更新信念。也就是說,機器人學(xué)習(xí)環(huán)境中的物體重定位轉(zhuǎn)移概率。

整體流程有三步。首先,LLM 根據(jù)場景圖為我們預(yù)測候選放置位置。它的輸入是場景圖,輸出是候選位置,例如家具節(jié)點或者隔層節(jié)點,然后我們把這些排序轉(zhuǎn)換成關(guān)于位置的先驗。
其次,我們基于目標(biāo)物體尺寸過濾掉不可行的位置。再次,我們基于觀察到的稀疏數(shù)據(jù)更新重定位轉(zhuǎn)移概率,讓機器人學(xué)習(xí)人的移動習(xí)慣,并隨著時間調(diào)整搜索策略。
我們把這些因素結(jié)合到全局定位中。由于被搜索物體可能在沒有被觀察到的情況下發(fā)生變化,我們也允許一定概率擴散到環(huán)境中的其他區(qū)域。最后,我們進(jìn)行代價感知的動作選擇,在物體可訪問性、預(yù)期動作成本以及對人的影響之間做平衡,由機器人選擇最有用的位置進(jìn)行檢查。
我們在家庭環(huán)境數(shù)據(jù)上評估了這個方法,場景中的物體會發(fā)生重定位。評估時,我們給定固定的搜索預(yù)算,并測試機器人能否找到目標(biāo)物體。如果不使用任何先驗信息,只在可能搜索位置上使用均勻先驗,那么成功率較低。
加入語義先驗和幾何先驗后,搜索成功率會提高;進(jìn)一步加入學(xué)習(xí)到的重定位轉(zhuǎn)移后,在固定時間預(yù)算下,成功率還能進(jìn)一步提高。因此,這個方法能夠支持按需搜索,而不需要重新探索整個環(huán)境,因為機器人會隨時間維護(hù)長期信念。


03
現(xiàn)在我們考慮持續(xù)變化的環(huán)境。一個具體例子是農(nóng)業(yè)環(huán)境:植物會生長,外觀也會隨時間變化。我們考慮園藝或農(nóng)業(yè)應(yīng)用中的作物重復(fù)監(jiān)測。監(jiān)測會被反復(fù)執(zhí)行,例如每周兩次,我們希望通過監(jiān)測變化來估計產(chǎn)量。
當(dāng)然,我們不希望每次都從頭開始。想法是使用上一個時間點學(xué)習(xí)到的模型,來指導(dǎo)當(dāng)前時間點的視角規(guī)劃和重建。當(dāng)作物生長時,它們會帶來嚴(yán)重的遮擋,因此我們需要利用上一輪的先驗。
我們的平臺會在作物行之間移動,并帶有固定的相機陣列。隨著平臺穿過環(huán)境,我們可以部分重建作物行。但由于作物有許多行,而且存在遮擋,當(dāng)前數(shù)據(jù)中會出現(xiàn)空洞。于是,我們的想法是利用上一時間步的模型作為先驗,進(jìn)行高效的視角規(guī)劃,移動投影或相機來填補當(dāng)前時間戳數(shù)據(jù)中的空洞。

具體來說,我們會對上一時間步的重建模型進(jìn)行非剛性配準(zhǔn)。上一時間步的模型更完整,而當(dāng)前時間步只有部分重建。我們把上一次的模型配準(zhǔn)到當(dāng)前的部分重建上,也就是把兩個點云以非剛性的方式對齊。
之后,我們執(zhí)行一個優(yōu)化過程。現(xiàn)在我們有了一個近似表面,可以使用集合覆蓋優(yōu)化:在估計表面上采樣目標(biāo)點,然后選擇能夠覆蓋這些目標(biāo)點的視角。隨后,我們執(zhí)行覆蓋優(yōu)化,并用旅行商問題計算一條近似最優(yōu)路徑。

在真實溫室數(shù)據(jù)中,首先可以看到移動平臺靜態(tài)相機得到的部分重建。由于遮擋,當(dāng)前數(shù)據(jù)里有空洞。然后,我們把上一輪數(shù)據(jù)對齊到當(dāng)前部分?jǐn)?shù)據(jù),基于近似表面執(zhí)行視角規(guī)劃,再規(guī)劃路徑并在平臺上執(zhí)行,從而收集覆蓋植物的新數(shù)據(jù)。
最后,我們得到了一條高效路徑,覆蓋了所有表面,也填補了當(dāng)前數(shù)據(jù)中的空洞。這個模型隨后又可以用于下一時間步的監(jiān)測。

04
剛才我們看到,先驗地圖可以幫助重復(fù)監(jiān)測中的視角規(guī)劃更高效。但像甜椒或番茄這樣的果實仍然會被部分遮擋,因為機器人不能僅僅依靠尋找它們就完成任務(wù)。有時,移動葉片是必要的,這樣才能可靠估計果實形狀和可采摘性。
在這項工作中,我們使用葉片形變模型來評估候選動作、評估可能的視角,并預(yù)測葉片背后的可見性。通過這種方式,我們可以揭示被遮擋的區(qū)域,并估計果實的尺寸。

到目前為止,我們假設(shè)遮擋葉片是已知的,也就是說機器人知道應(yīng)該操作哪片葉子,才能看見后方缺失的部分。而我們現(xiàn)在正在做的是學(xué)習(xí)一種用于遮擋推理的表示。我們的目標(biāo)是學(xué)習(xí)一種統(tǒng)一圖表示,建模可見性關(guān)系和遮擋關(guān)系。利用這個圖,機器人可以識別哪片葉子從哪個方向遮擋了目標(biāo),以及應(yīng)該按什么順序進(jìn)行處理。
例如,我們會估計觀察方向。在一個例子中,根據(jù)這個圖,我們得到果實和葉片的排序,并結(jié)合觀察方向判斷某片葉子的遮擋排名最高。因此我們知道,這片葉子需要被推到一側(cè),才能顯露果實并估計它的形狀。
剛才介紹的這些技術(shù)可以用于估計可采摘狀態(tài),然后進(jìn)一步執(zhí)行實際采摘。這里可以看到,機器人能夠使用一個包含相機、切割器和操作器的三臂系統(tǒng),可靠地識別作物并完成相關(guān)操作。

最后總結(jié)一下。機器人在很多場景中都運行在雜亂、變化且只能部分觀測的環(huán)境里。因此,機器人需要同時規(guī)劃觀察動作和操作動作,用于物體搜索、地圖構(gòu)建和環(huán)境重建。
我展示了先驗如何引導(dǎo)感知以及感知和操作動作的規(guī)劃。因此,先驗有助于實現(xiàn)高效的主動感知。
我還展示了信念傳播如何支持對遮擋物體以及操作動作效果的推理。通過主動選擇能夠降低不確定性、提升可觀測性并處理遮擋的動作,我們能夠增強機器人的能力,讓機器人更好地獲取知識、理解環(huán)境。
正如我最后提到的,下一步我們將通過學(xué)習(xí)和表示可見性圖以及遮擋關(guān)系,進(jìn)一步推理遮擋問題;同時也會繼續(xù)研究生成式方法和相關(guān)服務(wù)機器人應(yīng)用。


05
聽眾提問:移動葉片這個動作看起來代價比較高。為了估計果實的可采摘性,到底需要實際移動多少?能不能依賴關(guān)于果實外形和可采摘性的先驗信息,即使我們沒有完整看到果實?
Maren Bennewitz:謝謝你的問題。首先,我們會使用形狀補全方法。比如我們只部分觀察到甜椒時,可以使用一些方法來估計并補全它的形狀。
然后,我們會對葉片使用形變模型。我們使用一種形變圖來估計葉片能夠如何被操作、應(yīng)該往哪個方向移動。之后,我們再估計被遮擋的區(qū)域是否能夠被顯露出來。這個過程目前當(dāng)然仍然有成本,但最終我們能夠得到關(guān)于甜椒更完整的信息。
聽眾提問:所以你們確實需要移除遮擋物,才能估計它是否可采摘嗎?
Maren Bennewitz:我可能沒有完全理解你的問題。你是說僅僅估計可采摘狀態(tài),對嗎?對于可采摘狀態(tài)本身,也許并不總是需要移除葉片;但我們這里討論的是移除葉片來估計形狀、估計合適的操作過程。因此,對于另一些設(shè)置,你也許不需要真的移除葉片,但可以做出相應(yīng)決策。
聽眾提問:謝謝你的報告。我很欣賞這種基于信念的方法。我想問的是,當(dāng)物體被完全遮擋時,物體本身會出現(xiàn)在你的信念先驗中嗎?如果目標(biāo)完全被遮擋,這種基于信念的方法如何適應(yīng)?
Maren Bennewitz:一開始,機器人完全不知道后面有什么。這是對的。因此,這個區(qū)域會有很高的不確定性,因為我們不了解這個區(qū)域。于是,機器人會推理應(yīng)該移動哪些物體,才能看見后面。也就是說,我們會給這個區(qū)域的占據(jù)和語義賦予較高的不確定性。
聽眾提問:所以信念是關(guān)于區(qū)域的,而不是關(guān)于物體的?
Maren Bennewitz:正是如此。我們使用的是度量語義地圖表示,信念是在這個度量語義表示上的。基于這個表示,物體隨后才會被識別出來。謝謝。
去哪看 ICRA 核心【演講/論文】詳解?
為了讓國內(nèi)的研發(fā)者、創(chuàng)業(yè)者與投資人能夠毫無時差地掌握本屆 ICRA 2026 的完整干貨,雷峰網(wǎng)(公眾號:雷峰網(wǎng))已全面上線【ICRA 2026 深度專區(qū)】。
專區(qū)不僅全面收錄了重磅論文的工程化解讀、專家前沿演講,更將持續(xù)更新前方記者的第一手會議動態(tài)。
掃描下方二維碼,或點擊「閱讀原文」關(guān)注專區(qū)。

與全球 8000 名頂尖大腦同步呼吸,搶先透視具身智能的下一個五年!

雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知。
本專題其他文章