0
| 本文作者: 鄭佳美 | 2026-07-06 16:48 |
近日,大曉機(jī)器人正式開源新一代統(tǒng)一具身基模型 ACE-Brain-0.5,面向 Physical Agentic AI 這一新范式,推動(dòng)具身智能走向真實(shí)物理世界中的自主執(zhí)行。Physical Agentic AI 指能在真實(shí)物理世界中圍繞目標(biāo)自主感知環(huán)境、理解任務(wù)、規(guī)劃、行動(dòng),并在交互反饋中持續(xù)調(diào)整和進(jìn)化的智能體。作為 ACE-Brain-0 的重大升級(jí),ACE-Brain-0.5 以空間智能為底座,將機(jī)器人基礎(chǔ)模型從“理解世界”推進(jìn)至“理解、規(guī)劃、行動(dòng)、評(píng)估、進(jìn)化”一體化的閉環(huán)認(rèn)知階段。在單一 8B 參數(shù)主干下,模型統(tǒng)一整合空間感知、決策規(guī)劃、具身交互與自我評(píng)估四大核心能力,并通過(guò) SSR+ 訓(xùn)練策略協(xié)調(diào) Grounding、導(dǎo)航、操作和進(jìn)度評(píng)估等異質(zhì)接口,為物理智能體邁向持續(xù)自我進(jìn)化奠定統(tǒng)一而可擴(kuò)展的認(rèn)知底座。
當(dāng)前,具身 AI 正處于從“模塊化拼接”走向“原生自主智能”的關(guān)鍵轉(zhuǎn)折點(diǎn)。現(xiàn)有 VLA 模型擅長(zhǎng)生成動(dòng)作,卻往往受限于空間推理、長(zhǎng)程規(guī)劃與自我糾錯(cuò);依賴多模型編排的 AI 智能體系統(tǒng)雖能完成復(fù)雜流程,卻缺少統(tǒng)一的認(rèn)知表征,造成接口割裂、誤差累積與系統(tǒng)遲滯。ACE-Brain-0.5 正是對(duì)這一行業(yè)痛點(diǎn)的系統(tǒng)性回應(yīng):用一個(gè)統(tǒng)一具身基模型貫通物理智能體認(rèn)知鏈路,讓機(jī)器人在一個(gè)“大腦”中完成從看懂環(huán)境、拆解任務(wù)、物理執(zhí)行到評(píng)估進(jìn)展的全過(guò)程。
在多項(xiàng)國(guó)際權(quán)威具身智能評(píng)測(cè)中,ACE-Brain-0.5 以單一 8B 具身基模型,系統(tǒng)性超越了 OpenAI GPT-5.4、谷歌 Gemini-2.5-Pro、Anthropic Claude-Sonnet-4.6、英偉達(dá) GR00T N1.6、Physical Intelligence π?/π?.?、OpenVLA、Qwen-VLA-Instruct、NaVid、Uni-NaVid、RoboReward、Robometer 等全球主流開源與閉源模型。不同于依賴任務(wù)專用模型或多模型拼接的路線,ACE-Brain-0.5 在同一基模型中貫通空間理解、導(dǎo)航?jīng)Q策、機(jī)器人操作與自我評(píng)估,展現(xiàn)出全鏈路全球第一的技術(shù)實(shí)力。這些多維度 SOTA 結(jié)果表明,統(tǒng)一具身基模型正在推動(dòng)機(jī)器人基礎(chǔ)模型從單點(diǎn)能力競(jìng)爭(zhēng),走向面向真實(shí)物理世界的系統(tǒng)級(jí)智能。
范式創(chuàng)新:重新定義具身基模型,統(tǒng)一感知、規(guī)劃、執(zhí)行、評(píng)估和進(jìn)化
ACE-Brain-0.5 首先改變的是統(tǒng)一具身基模型的定義。回顧具身智能的發(fā)展,第一階段把將感知、規(guī)劃、執(zhí)行拆分為獨(dú)立模塊,雖具備可解釋性,卻難以適應(yīng)開放復(fù)雜環(huán)境;第二階段許多具身模型直接從觀測(cè)生成動(dòng)作,提升了端到端操作能力,但仍偏向動(dòng)作執(zhí)行,缺少空間理解、長(zhǎng)程規(guī)劃與執(zhí)行評(píng)估;第三階段多個(gè)機(jī)器人智能體通過(guò)大語(yǔ)言模型調(diào)度工具和專家模塊完成復(fù)雜任務(wù),但本質(zhì)仍是多模型協(xié)作,難以形成統(tǒng)一認(rèn)知表征。

ACE-Brain-0.5 面向 Physical Agentic AI 提出的統(tǒng)一具身基模型屬于第四個(gè)階段,把感知、規(guī)劃、執(zhí)行、評(píng)估和自我進(jìn)化統(tǒng)一到同一模型中。這意味著,機(jī)器人基礎(chǔ)模型正在從模塊化流水線、 VLA 動(dòng)作策略和多模型智能體,邁向統(tǒng)一認(rèn)知架構(gòu)的新階段;其價(jià)值不只是讓機(jī)器人“動(dòng)起來(lái)”,更是讓機(jī)器人開始具備圍繞真實(shí)世界目標(biāo)進(jìn)行感知、推理、行動(dòng)與反饋的完整認(rèn)知鏈路。
系統(tǒng)創(chuàng)新:建立感知-規(guī)劃-行動(dòng)-評(píng)估的閉環(huán)
真實(shí)世界任務(wù)很少是“一步動(dòng)作”完成的。以機(jī)器人前往酒店洗衣房清洗衣物為例,它需要先定位洗衣房和洗衣機(jī),識(shí)別艙門、按鈕、洗滌劑和可操作區(qū)域;再理解“放入衣物、添加洗滌劑、選擇程序”的執(zhí)行順序;隨后完成開門、投放、按鍵等連續(xù)操作;一旦出現(xiàn)艙門未閉合或衣物卡滯,還需判斷問(wèn)題所在并及時(shí)修正。
這類任務(wù)要求機(jī)器人具備完整的認(rèn)識(shí)閉環(huán)。傳統(tǒng)機(jī)器人系統(tǒng)往往依賴多個(gè)專用模塊拼接完成這條鏈路,鏈路越長(zhǎng),接口越多,誤差累積和系統(tǒng)不穩(wěn)定性就越突出。ACE-Brain-0.5 的系統(tǒng)創(chuàng)新,在于將這一閉環(huán)放入統(tǒng)一模型之中。它讓機(jī)器人開始具備“自我檢查”的能力:不是做完動(dòng)作就結(jié)束,而是持續(xù)判斷自己離目標(biāo)更近了還是更遠(yuǎn)了。一旦任務(wù)進(jìn)展停滯或出現(xiàn)偏差,自我監(jiān)控信號(hào)就能夠?yàn)楹罄m(xù)恢復(fù)、糾錯(cuò)和重新規(guī)劃提供依據(jù)。
架構(gòu)創(chuàng)新:慢腦理解規(guī)劃,快腦實(shí)時(shí)控制
要把統(tǒng)一基模型真正用于機(jī)器人控制,還必須解決一個(gè)現(xiàn)實(shí)問(wèn)題:機(jī)器人不能每動(dòng)一下都重新“深思熟慮”。高層任務(wù)理解與多模態(tài)推理需要更強(qiáng)的語(yǔ)義能力,而底層導(dǎo)航與操作控制又要求低延遲、強(qiáng)反饋、連續(xù)執(zhí)行。

ACE-Brain-0.5 因此引入“雙時(shí)間尺度”的架構(gòu):一方面,通過(guò)視覺(jué)編碼器與大語(yǔ)言模型融合用戶指令、單視圖、多視圖和自我中心視頻,形成高層具身狀態(tài),用于空間感知、任務(wù)分解、狀態(tài)感知和高層規(guī)劃;另一方面,通過(guò)快速視覺(jué)編碼器與動(dòng)作專家,直接接收最新多視角觀測(cè)和動(dòng)作噪聲,提供實(shí)時(shí)視覺(jué)反饋,并生成導(dǎo)航、操作等低延遲動(dòng)作輸出。
這種設(shè)計(jì)讓機(jī)器人形成“慢腦”和“快腦”的協(xié)同機(jī)制:慢腦負(fù)責(zé)感知、規(guī)劃和多模態(tài)推理,輸出文本推理、區(qū)域框、指向、可供性和軌跡等結(jié)果;快腦負(fù)責(zé)實(shí)時(shí)感知和短時(shí)預(yù)測(cè),快速反應(yīng)和動(dòng)作執(zhí)行。二者協(xié)同,使 ACE-Brain-0.5 不只是理解模型,也不是單一動(dòng)作策略,而是一個(gè)真正面向物理執(zhí)行的閉環(huán)認(rèn)知系統(tǒng)。
訓(xùn)練創(chuàng)新:SSR+ 策略讓全棧具身能力共存
真正把多種機(jī)器人能力統(tǒng)一到一個(gè)模型中,并不是簡(jiǎn)單把所有數(shù)據(jù)倒進(jìn)去。空間問(wèn)答和任務(wù)規(guī)劃依賴文本生成,Grounding 需要輸出點(diǎn)、區(qū)域或邊界框,導(dǎo)航需要序列動(dòng)作預(yù)測(cè),操作需要連續(xù)動(dòng)作片段,進(jìn)度評(píng)估又要求對(duì)軌跡狀態(tài)進(jìn)行時(shí)間維度判斷。這些能力不僅任務(wù)不同,輸出接口也不同。若直接混合訓(xùn)練,模型很容易出現(xiàn)接口沖突:保留了任務(wù)知識(shí),卻輸出了錯(cuò)誤格式;強(qiáng)化了某項(xiàng)能力,卻干擾了另一項(xiàng)能力。
ACE-Brain-0.5 的關(guān)鍵訓(xùn)練創(chuàng)新是 SSR+。它在 ACE-Brain-0 的 Scaffold-Specialize-Reconcile 基礎(chǔ)上加入 Reactivate 階段:先訓(xùn)練多個(gè)面向 QA、Grounding、導(dǎo)航、操作和進(jìn)度評(píng)估的專門化 Checkpoint,再通過(guò)任務(wù)向量合并完成能力調(diào)和,將不同具身技能納入同一參數(shù)空間,最后使用輕量級(jí)混合 SFT 重新激活任務(wù)能力、校準(zhǔn)輸出接口、減少?zèng)_突,并恢復(fù)不同任務(wù)之間的切換能力。換言之,SSR+ 是一種面向統(tǒng)一具身基模型的實(shí)用能力調(diào)和策略,多種機(jī)器人專家能力不再是彼此孤立的模塊,而是在同一基礎(chǔ)模型中穩(wěn)定共存、協(xié)同調(diào)用,合成為一個(gè)統(tǒng)一大腦。
全鏈路評(píng)測(cè):統(tǒng)一大腦不是口號(hào),而是可驗(yàn)證能力
在國(guó)際權(quán)威具身智能評(píng)測(cè)中,ACE-Brain-0.5 系統(tǒng)性超越了當(dāng)前主流閉源多模態(tài)模型、開源導(dǎo)航模型、VLA 操作模型與機(jī)器人獎(jiǎng)勵(lì)模型,斬獲多項(xiàng)全球第一:在空間認(rèn)知與具身推理任務(wù)中,超過(guò) OpenAI GPT-5.4、Google Gemini-2.5-Pro、Anthropic Claude-Sonnet-4.6 以及 ACE-Brain-0、RynnBrain、RoboBrain 等代表性模型;在具身導(dǎo)航任務(wù)中,領(lǐng)先 NaVid、Uni-NaVid、NaVILA等開源基線;在機(jī)器人操作任務(wù)中,超越英偉達(dá) GR00T N1.6、Physical Intelligence π?/π?.?、OpenVLA、Qwen-VLA-Instruct、GTA-VLA、X-VLA、Uni-VLA 等主流 VLA 方法;在進(jìn)度評(píng)估任務(wù)中,則超過(guò) Robometer、RoboReward、RoboDopamine 等代表性機(jī)器人獎(jiǎng)勵(lì)模型,展現(xiàn)出從空間理解、導(dǎo)航?jīng)Q策、操作執(zhí)行到自我監(jiān)控的全鏈路領(lǐng)先能力,證明ACE-Brain-0.5 是一條已在國(guó)際權(quán)威基準(zhǔn)上得到驗(yàn)證的 Physical Agentic AI 技術(shù)路徑。
在具身空間感知與規(guī)劃維度,ACE-Brain-0.5 在 VSI、MMSI、MindCube、ScanQA、SQA3D、ScanRefer、Multi3DRef、RefSpatial、PointArena、RoboAfford 等 18 個(gè)非空空間基準(zhǔn)中的 14 項(xiàng)超過(guò)前代 ACE-Brain-0。其中,ACE-Brain-0.5 在 MindCube 空間心智建模基準(zhǔn)上達(dá)到 86.3%,較 ACE-Brain-0 提升 4.2 個(gè)百分點(diǎn);在 SQA3D 三維場(chǎng)景問(wèn)答基準(zhǔn)上達(dá)到 62.6%,較前代提升 7.8個(gè)百分點(diǎn);在 Multi3DRef 三維多目標(biāo)視覺(jué)指代定位基準(zhǔn)上達(dá)到 72.4%,超過(guò)ACE-Brain-0(55.9%);在ScanRefer語(yǔ)言對(duì)齊 3D 感知評(píng)測(cè)中達(dá)到70.2%;在 RefSpatial、PointArena、RoboAfford 等面向機(jī)器人空間定位與可供性理解的任務(wù)上,分別實(shí)現(xiàn) 29.6、23.8、18.6 個(gè)百分點(diǎn)的大幅提升,證明模型的空間智能已從單純場(chǎng)景理解進(jìn)一步擴(kuò)展到面向行動(dòng)的空間推理。

在具身導(dǎo)航維度,ACE-Brain-0.5 在 VLN-CE 的 R2R 與 RxR Val-Unseen 基準(zhǔn)上表現(xiàn)穩(wěn)健,顯著優(yōu)于 NaVid、Uni-NaVid 等主流開源導(dǎo)航模型。在 R2R Val-Unseen 上,ACE-Brain-0.5 取得 57.4% 的成功率(SR)和 51.7% 的路徑效率加權(quán)成功率(SPL),超過(guò) NaVid 的 41.9%/36.5% 與 Uni-NaVid 的 47.0%/42.7%;其 Specialist 版本進(jìn)一步提升至 62.2% SR 與 56.2% SPL。在 RxR Val-Unseen 上,ACE-Brain-0.5 達(dá)到 63.8% SR、47.9% SPL 和 64.6 nDTW,整體領(lǐng)先 NaVid、Uni-NaVid、NaVILA等開源基線,體現(xiàn)出其在長(zhǎng)程語(yǔ)言指令跟隨、視覺(jué)歷史整合和部分可觀測(cè)場(chǎng)景決策中的綜合能力。

在機(jī)器人操作維度,ACE-Brain-0.5 同樣取得 SOTA 級(jí)表現(xiàn)。在 LIBERO 語(yǔ)言條件操作基準(zhǔn)上,ACE-Brain-0.5 取得 98.2% 的平均成功率,超過(guò) Qwen-VLA-Instruct(97.9%)、OpenVLA-OFT(97.1%)、GR00T N1.6(97.0%)、π?.?(96.9%)等強(qiáng)基線;其中 Spatial 與 Object 兩個(gè)任務(wù)套件均達(dá)到 100.0%,Long 長(zhǎng)程任務(wù)達(dá)到 97.0%,顯示其空間理解與任務(wù)級(jí)表征能夠有效轉(zhuǎn)化為可執(zhí)行操作能力。在 SimplerEnv-Bridge 基準(zhǔn)上,ACE-Brain-0.5-VLA 取得 82.3% 的平均成功率,刷新該基準(zhǔn) SOTA,超過(guò) GTA-VLA(81.2%)、X-VLA(76.0%)、Qwen-VLA-Instruct(73.7%)、Uni-VLA(69.8%)等方法,并在 Eggplant 任務(wù)上達(dá)到 100.0%,證明模型具備強(qiáng)跨物體操作泛化能力。
|
|
在進(jìn)度評(píng)估維度,ACE-Brain-0.5 在 Robometer 構(gòu)建的 RBM-EVAL-ID 與 RBM-EVAL-OOD 基準(zhǔn)上均保持領(lǐng)先,展現(xiàn)出統(tǒng)一具身基模型所需的自我監(jiān)控能力。該任務(wù)要求模型根據(jù)機(jī)器人軌跡預(yù)測(cè)任務(wù)進(jìn)度,并判斷不同執(zhí)行質(zhì)量軌跡之間的相對(duì)優(yōu)劣。在 RBM-EVAL-ID 上,ACE-Brain-0.5 的 VOC 相關(guān)性達(dá)到 0.94/0.80,超過(guò) Robometer-4B(0.92/0.78)、RoboReward-8B(0.82/0.51)等開源獎(jiǎng)勵(lì)模型;在更具挑戰(zhàn)的 RBM-EVAL-OOD 上,ACE-Brain-0.5 達(dá)到 0.96/0.88,同樣領(lǐng)先 Robometer-4B(0.94/0.81)與 RoboReward-8B(0.88/0.60)。這意味著模型不僅能在熟悉任務(wù)中判斷執(zhí)行進(jìn)度,也能在未見本體、相機(jī)視角和場(chǎng)景中保持穩(wěn)定評(píng)估能力。

面向 Physical Agentic AI,走向統(tǒng)一機(jī)器人認(rèn)知架構(gòu)
ACE-Brain-0.5 的意義,不只在于單項(xiàng)指標(biāo)領(lǐng)先,更在于為 Physical Agentic AI 提供了一套可落地的統(tǒng)一建模路徑。從 ACE-Brain-0 的空間智能底座,到 ACE-Brain-0.5 的統(tǒng)一閉環(huán)大腦,大曉機(jī)器人正在沿著一條清晰的技術(shù)路線推進(jìn):先讓機(jī)器人具備穩(wěn)定的空間理解能力,再進(jìn)一步打通感知、規(guī)劃、行動(dòng)和評(píng)估的全鏈路,使模型逐步具備面向真實(shí)世界任務(wù)的閉環(huán)執(zhí)行能力。
面向自動(dòng)駕駛、低空經(jīng)濟(jì)、工業(yè)機(jī)器人、家庭服務(wù)等真實(shí)場(chǎng)景,一個(gè)能夠看懂環(huán)境、規(guī)劃步驟、執(zhí)行動(dòng)作并評(píng)估結(jié)果的統(tǒng)一具身基模型,將成為物理世界 AI 走向規(guī)模化應(yīng)用的重要基礎(chǔ)。ACE-Brain-0.5 現(xiàn)已正式開源,大曉機(jī)器人希望以此為起點(diǎn),與全球開發(fā)者共同驗(yàn)證、完善和擴(kuò)展統(tǒng)一具身基模型,讓 Physical Agentic AI 在真實(shí)任務(wù)和實(shí)際場(chǎng)景中持續(xù)演進(jìn)。