0
| 本文作者: 陸毅 | 2026-06-30 15:07 | 專題:RSS:機器人,科學與系統會議 |
來源:公眾號“無界動力”
原文鏈接:https://mp.weixin.qq.com/s/sI0EiAur3PbDQ54ka_SJ5Q
作為深耕通用具身智能技術研發的團隊,無界動力聯合上海交通大學人工智能學院 AutoLab 團隊,正式推出全新通用導航評測基準OmniNavBench,相關成果已被機器人領域頂會 RSS 2026 收錄。該基準直擊當前具身導航領域評測體系碎片化、仿真與真實場景脫節、機器人適配性單一等行業痛點,打造出業內首個支持跨技能協同、跨機型泛化、真人行為驅動的一體化評測平臺,為通用導航算法的迭代與落地樹立全新標準。
論文標題:Beyond Isolation: A Unified Benchmark for General-Purpose Navigation
論文地址:https://arxiv.org/abs/2605.09441
項目主頁:http://omninavbench.cloud-ip.cc
開源倉庫:https://github.com/AutoLab-SAI-SJTU/OmniNavBench
01. 現存導航評測體系,究竟存在哪些短板?
具身導航是支撐各類智能機器人運行的核心基礎能力,發展至今已衍生出豐富的任務形態:從早期的視覺語言導航(VLN)、點位目標導航(PointNav),逐步拓展至物體目標導航(ObjectNav)、社交導航(SocialNav)、人機跟隨(Human Following)以及具身問答(EQA)等多元場景。
如今,業內已經涌現出 Uni-NaVid、OmniNav 等一批主打 “通用統一” 的導航模型,算法層面正朝著多任務融合的方向穩步前進。但與之相悖的是,行業配套的評測體系依舊處于各自孤立的狀態。
目前主流評測基準均為單一任務定制開發:視覺語言導航依托 R2R 數據集測試,物體導航使用 HM3D-OVON 基準,具身問答則基于 OpenEQA 開展驗證。各個平臺相互獨立,僅能考核模型的單項技能,完全無法模擬真實場景中,智能體需要連貫切換多項導航能力的復雜工況。
除此之外,現有評測體系還存在兩大核心短板: 第一,行為模式脫離真實應用。絕大多數基準的運動軌跡由最短路徑算法自動生成,這類理想化軌跡缺少人類導航過程中試探觀察、預判避讓、路徑微調等自然行為,導致模型在仿真環境中表現優異,落地到真實機器人后性能大幅下滑。 第二,機器人機型適配性單一。現有評測大多僅針對輪式機器人設計,無法檢驗同一套導航算法在四足、人形等不同構型機器人上的運行效果,難以評估算法的通用泛化能力。
而我們此次打造 OmniNavBench,核心目標就是補齊上述短板,構建一套貼合產業落地需求、全面客觀的通用導航評測新標準。
02. 全面解讀:OmniNavBench 一體化評測基準

組合式指令:單任務串聯多項導航技能
區別于傳統基準 “單任務單指令” 的模式,OmniNavBench 創新性采用組合式指令設計,單條任務指令會整合 2 至 4 種及以上不同類型的導航子任務,要求智能體在連貫的流程中依次完成。
舉個典型示例:“跟隨前方人員走進臥室,隨后轉身直行前往廚房,途中避讓餐桌旁的行人,找到臺面上的微波爐并清點周邊鍋具數量。” 這條指令依次涵蓋人機跟隨、視覺語言導航、社交導航、物體目標導航、具身問答六大能力原語。整套基準按照子任務數量劃分難度梯度,能夠層層遞進地檢驗模型多任務銜接、長時序規劃的綜合能力。
多機型兼容:一套指令適配三類主流機器人
OmniNavBench 基于 NVIDIA Isaac Sim 仿真平臺搭建,原生支持輪式、四足、人形三種形態差異極大的機器人。同一套測試指令無需修改算法代碼,即可在三類機器人上完成全流程評測,直觀檢驗算法對不同運動結構、不同視覺視角的適配能力。
平臺同時兼容航點級控制、速度指令控制以及離散動作三大主流控制接口,全面覆蓋當前機器人主流控制方案,進一步提升評測的通用性。

真人遙操作軌跡:還原真實導航行為
整套基準包含1779 條專家軌跡,全部由工作人員通過遙操作方式實地采集,摒棄了傳統算法生成的最短路徑。軌跡平均行駛長度達 16.7 米,完整保留人類導航時環視觀察、預判避障、臨時調整路線等真實行為特征。
實測數據顯示,人類行駛軌跡與算法最短路徑在地標利用等關鍵維度存在明顯差異(如 CityNav 場景中占比 36.3% vs 24.6%),這類細節是訓練高魯棒性導航策略的關鍵,也是銜接仿真與真機落地的重要紐帶。
大規模場景與多樣化指令:強化跨域泛化測試
場景層面,基準共計收錄170 個場景,由 85 個 GRScenes 合成場景(家居、商業空間)與 85 個 Matterport3D 真實掃描場景組成,覆蓋居家、辦公、商圈等主流環境,可充分驗證算法的跨場景泛化能力。 指令層面,我們基于 1779 條核心指令,借助通義千問 3-Max 大模型生成簡潔版、第一人稱視角版、詳細版三類風格變體,最終形成7116 條風格化指令,單條指令平均長度為 42 個詞匯,全方位考核模型對不同語言表達形式的理解能力。
03. 實測驗證:主流通用導航模型的真實能力邊界

我們選取 PoliFormer、Uni-NaVid、MTU3D、OmniNav 四款業內代表性通用導航模型開展零樣本評測,測試結果直觀暴露了當前通用導航算法存在的多項核心問題:
結論 1:復雜組合任務下,模型性能出現大幅衰減
所有參與測試的模型,在 OmniNavBench 上的表現遠低于其在單任務基準中的測試結果。四款模型整體最高任務成功率僅為 8.74%(OmniNav,四足機器人 Aliengo),多數測試場景成功率不足 2%。該現象在三類機器人構型中普遍存在,證明這是當前通用導航算法的共性短板,并非單一平臺適配問題。
結論 2:單項技能達標,多任務銜接能力嚴重不足
數據顯示,多款模型的子任務完成率(SGC)與整體任務成功率(SR)差距懸殊。以 Uni-NaVid 在 Aliengo 機器人上的表現為例,其子任務完成率可達 44.54%,但整體任務成功率僅 1.96%。這說明現有模型能夠獨立完成各類單一導航任務,但無法在連續流程中順暢切換多項技能,多任務時序銜接是核心瓶頸。
結論 3:“抵達目標” 不等于 “完成任務”,存在落地最后一環缺陷
模型理論最優成功率(OSR)遠高于實際任務成功率,依舊以 Uni-NaVid 為例,其 OSR 為 26.47%,但實際成功率僅 1.96%。這一現象表明,智能體大多可以物理抵達目標區域,但無法精準判斷任務終止時機,這也是端到端導航算法在真機落地過程中普遍存在的 “最后一厘米” 難題。
結論 4:動態社交交互能力薄弱,缺乏安全避讓意識
人機跟隨成功率(HFS)、人機跟隨占比(HFR)兩項數據整體偏低,四款模型中最優人機跟隨成功率僅為 45.16%(Uni-NaVid,輪式機器人 Carter),且在足式機器人上進一步下降。同時,社交入侵指數(SII)普遍偏高,反映出當前導航模型缺少基礎的社交距離感知能力,動態場景交互安全性不足。
結論 5:算法對機器人構型高度敏感,跨機型泛化能力差
同一算法在不同機器人上的表現天差地別:OmniNav 在四足機器人 Aliengo 上任務成功率為 8.74%,在輪式機器人 Carter 上降至 1.96%,部署于人形機器人 H1 時成功率直接歸零。人形機器人需要持續保持機身平衡,算法的微小缺陷都會引發摔倒問題(摔倒率高達 60%-80%),相比輪式機器人,容錯空間大幅縮小。
04 指令風格消融實驗:模型語言泛化能力有待提升
我們針對 OmniNav、Uni-NaVid 兩款模型開展指令風格消融實驗,測試不同句式表達對模型性能的影響。結果發現,簡潔版、第一人稱視角指令能夠小幅提升模型任務成功率,其中 OmniNav 的成功率從 8.74% 提升至 14.47%;而細節豐富的長指令則會讓模型表現持平甚至下降。
這一結果印證,當前導航模型存在句式過擬合問題,對多樣化自然語言指令的理解與泛化能力仍有較大優化空間。
04. 指令風格消融實驗:模型語言泛化能力有待提升
我們針對 OmniNav、Uni-NaVid 兩款模型開展指令風格消融實驗,測試不同句式表達對模型性能的影響。結果發現,簡潔版、第一人稱視角指令能夠小幅提升模型任務成功率,其中 OmniNav 的成功率從 8.74% 提升至 14.47%;而細節豐富的長指令則會讓模型表現持平甚至下降。
這一結果印證,當前導航模型存在句式過擬合問題,對多樣化自然語言指令的理解與泛化能力仍有較大優化空間。

05. 橫向對比:OmniNavBench 重塑導航評測標準
對比業內現有主流導航評測基準,OmniNavBench 是目前唯一一個同時實現六大導航任務全覆蓋、支持多機型跨構型評測、基于真人遙操作軌跡搭建的一體化通用導航基準。徹底打破了過往評測體系碎片化、脫離真實應用的局限,為行業提供了統一、客觀、貼近落地場景的評測標尺。

總結與未來展望
通過 OmniNavBench 的實測數據可以清晰看到:現階段主打 “通用” 的導航模型,在面對跨技能組合、跨機型部署、長時序連續任務等真實場景時,依舊存在顯著的能力短板。結合實驗結果,我們梳理出下一代通用具身導航算法的核心突破方向:
1. 強化長時序任務進度追蹤能力,實現多項導航技能的流暢切換與有序執行;
2. 優化任務終止決策邏輯,解決 “抵達目標卻無法停止” 的落地難題;
3. 提升動態社交交互能力,讓智能體具備安全避讓、社交距離感知等基礎行為能力;
4. 增強算法跨機型泛化性,降低不同機器人構型帶來的性能波動;
5. 優化語言理解模塊,擺脫單一句式依賴,提升對多樣化指令的適配能力。
未來,無界動力將持續聯合上海交通大學 AutoLab 團隊,依托 OmniNavBench 這套評測基準,持續推進通用具身導航技術的研發與迭代。同時我們將持續開放平臺能力、完善數據集與工具鏈,攜手行業伙伴,共同推動具身導航技術從實驗室走向規模化落地,助力通用具身智能產業高質量發展。