0
| 本文作者: 叢末 | 2026-07-23 11:56 | 專題:WAIC:世界人工智能大會 |

作者丨幸麗娟
編輯丨張 賢
一個模型能把“機器人端著水杯在運動”的畫面生成得無比逼真,水紋絲不動,機器人動作平穩。
但模型并不理解——水,實際上應當從水杯中潑濺出來。畫面美好,物理崩塌。
這也是世界模型賽道最核心的困局:生成不等于理解,理解不等于行動。
物理 AI 真正需要的,是從“知道世界長什么樣”到“知道世界怎么運行”再到“知道該怎么行動”的完整能力鏈。
7月19日,由世界人工智能大會主辦、大曉機器人承辦的世界模型“六小龍”巔峰論壇,這道命題擺上了桌面。
從“理解”到“執行”這道鴻溝怎么填?本次論壇,用三個層面做出了回應——
一是理論底座和“行業共識”。 諾貝爾經濟學獎得主Thomas J.Sargent首次站在具身智能的舞臺上,用理性預期理論為世界模型提供了跨學科的理論底座;
大曉機器人、螞蟻靈波、自變量機器人、智元機器人、無界動力、極佳視界——國內世界模型第一梯隊的“六小龍”首次同臺論道。具身智能核心玩家,第一次坐在一起,碰撞共識。
二是系統性解法首次亮相。 大曉董事長王曉剛提出“具身世界模型第一性原理”與“具身模型信息密度定律”兩大支點;開悟世界模型 3.1、以人為中心的環境式數據采集方案2.0、三大垂直場景解決方案曉途、曉滿、曉新悉數發布——從理論到技術再到產品,一套完整的方法論清晰呈現。
三是世界模型行業終于有了統一考場。 Physical IQ物智正式發布,首個具身原生、面向多場景、多本體、多任務的物理智能評測基準平臺,讓“自說自話”成為過去。
三個層次的探討,串起一條清晰的主線:這場論壇,在給物理AI“鋪路”——鋪一條從理論到標準、從技術到產業的完整路徑。

01
大曉董事長王曉剛在《物理 AI 的開悟時刻》的主旨演講中指出,數字世界模型失誤僅影響圖文生成,而物理場景下智能體預判偏差將產生不可逆真實損失。

他進一步給出“大曉”的解法——“具身世界模型第一性原理”和“具身模型信息密度定律”。
他認為,從具身世界模型第一性原理來看,唯有高密度地錨定控制狀態,才能在不穩定的世界中最小化行動代價。

圖注:具身第一性原理公式,機器人的行動代價與關鍵信息和控制充分狀態正相關:機器人知道的關鍵信息(CID)越多,理解的控制充分狀態(CSS)就越準確,執行的時候犯錯就越少(Action Cost J 就越低)
而具身模型信息密度定律則強調,數據的價值不在數量堆疊,而在信息密度,會改變行動結果的信息,就是有價值的信息。

在此定律下,L1-L2級數據僅能支撐基礎預訓練,L3-L4級數據止步于已知任務的擬合;唯有當數據邁入L5,深度融入三維力觸覺、失敗恢復軌跡和開放場景變量時,世界模型才真正掙脫“描述”的桎梏,抵達泛化、反思與自進化的“開悟”之境。
這個判斷的行業價值在于:它給出了一套可操作的數據分級標準,而不是空談“數據是燃料”。
他進一步提出,只有當具身世界模型錨定第一性原理 ,依托多模態高密度信息萃取、控制充分狀態錨定,在復雜不確定環境中最大限度降低機器人行動試錯成本, 物理AI 的開悟時刻,才能加速到來。

諾貝爾經濟學獎得主 Thomas J.Sargent 則在《理性預期、人工智能與世界模型》的演講中,辯證剖析了現有人工智能體系在罕見、未知場景下的認知局限:AI 可以從反復發生的事情中學習,但對那些很少發生、從未見過或尚未被嘗試的事情,它仍可能一無所知。
這句話精準戳中了具身智能的軟肋——機器人真正的考驗,恰恰來自物理世界中那些突發、不可預演的瞬間。

世界模型“六小龍”圓桌對話上,來自國內世界模型研發第一梯隊的六位掌舵人同臺論道,他們分別是:大曉機器人首席科學家陶大程、螞蟻靈波首席科學家沈宇軍、極佳視界首席科學家朱政、無界動力聯合創始人兼CTO 夏中譜、智元機器人 AI 算法總監任廣輝、自變量機器人CTO 王昊。
談論中,陶大程拋出了一個直擊行業痛點的問題:現在世界模型的榜單,很多仍在沿用視頻生成時代的老標準——畫質好不好、時長夠不夠、一致性高不高。
按照這套標尺,一個模型完全可以把“機器人端著水杯在運動”的畫面生成得無比逼真,水紋絲不動,機器人動作平穩。但模型并不理解——水,實際上應當從水杯中潑濺出來。畫面美好,物理崩塌。
那一個好的世界模型,到底該用什么來衡量?
嘉賓們的深度碰撞下,共識浮現——三個層次、九個核心維度:
▎生成智能——入場券。
核心是物理合理性,模型需了解常識物理與3D多視角一致性,知道鐵比棉花掉得快。
▎認知智能——硬實力。
泛化性檢驗模型是否真正理解物理因果而非機械記憶;
反事實預測以當前狀態加動作推演未來,且動作往往是反事實的,能否正確推演是理解世界因果的核心試金石;
長期表示能力考察模型能否提取世界公共表示并形成長程記憶;
預測精度則決定了對幾何、運動、力學規律的掌握程度。
▎物理智能——終極標尺。
動作準確性衡量模型支持的動作種類及執行準確度;
時效性強調快速推理加即時反饋,這也是具身場景的剛性約束;
決策增益指向世界模型對最終決策策略的可量化提升;
真機驗證則回歸Fewshot背景下多任務真機成功率這一硬指標,是“做得成”的最直接證明。
這九條評價標準,其實也回應了本次圓桌的核心命題——物理AI從“理解”到“執行”究竟需要跨越哪些能力鴻溝。三層智能、九個維度,勾勒出的正是一條從“畫得像”到“想得對”再到“做得成”的完整進化路徑,為世界模型賽道指明了方向標尺。
值得一提的是,這三個層次的攻克方向,也與Karios 3.1在“生成-認知-物理”三位一體上的技術架構深度呼應。這不僅驗證了大曉提出的具身世界模型第一性原理,更預示著一條以真實行動為錨點的技術路線,正從前沿探索走向行業共識。

02
論壇現場,大曉還正式發布三大核心成果:開悟世界模型 3.1(Kairos 3.1)、環境式數據采集方案 2.0,以及覆蓋三大垂直場景的成套解決方案,從“大腦”到“數據”再到“場景”,為物理 AI 規模化落地構建起完整技術底座。

▎大腦層:Kairos 3.1 ,錨定具身世界模型第一性原理
Kairos 3.1 的設計邏輯很明確:不追求對物理的“像素級”完美復刻,而是聚焦于“為行動而理解”。
這意味著模型不需要無所不知,只需從高維感知中篩出與物理因果強相關的關鍵變量,在每個時刻錨定足以驅動可靠決策的“控制充分狀態”,忽略其余冗余干擾。

在架構層面,Kairos 3.1 依托混合 Transformer 與共享混合注意力機制,將視覺觀測、語言指令、力觸狀態、策略軌跡等多維數據壓縮進統一隱空間,形成高密度表征向量。
統一空間為三大智能的融合提供了底層基礎:生成智能構建物理世界的內在表征,物理智能掌握因果推演與平行世界模擬,認知智能則負責復雜推理與長程任務分解。
三者不再是各自獨立的能力模塊,而是在同一架構下深度耦合,讓機器人從“生成虛擬未來”轉向“預判行動對世界的真實影響”,真正理解行動后果。
在運行機制上,模型先通過世界理解完成長程任務拆解與環境評估,再在平行空間開展物理因果推演與多策略演算,篩選輸出最優動作預測,同步完成過程分析與結果評估并將狀態反饋模型,進一步實現完整的自進化閉環。

空間理解方面,空間理解核心底座 ACE-BRAIN-0.5 在空間理解、導航決策、機器人操作與自我評估等評測基準上斬獲十二項全球 SOTA,模型真正擁有了“懂物理”的能力。
物理生成與推演方面,Kairos-HomeWorld 為模型提供了一套“物理因果的驗證場”——首次實現全屋生成與物體全交互,內置 30 萬套中國住宅平面圖、5000 個全屋仿真場景與 8700 個覆蓋六大物理屬性的 3D 資產,高度還原中國家庭居住特征,讓模型在平行空間中同步推演多條動作軌跡,從失敗方案中篩選最優路徑輸出真機。

性能層面, 在 NVIDIA Jetson Thor 平臺 BF16 精度下,Kairos 3.1 8B 模型推理延遲僅 125 毫秒,依托自研 KairosRT 高性能計算引擎,在保持世界模型高智能上限的同時實現端側實時推理。此外,Kairos 3.1 已在生成預測權威榜單刷新 SOTA。
Kairos 3.1 構建起完整技術閉環,推動機器人真正實現理解世界、推演未來、自主行動并持續成長,為具身智能規模化落地奠定了核心大腦底座。
▎數據側:基于“信息密度定律”,發布環境式數據采集方案2.0
大腦決定了智能的上限,但大腦靠什么訓練?
大曉同步發布以人為中心的環境式數據采集方案2.0——全維感知“采得全”、深層解構“標得細”、統合映射“用得妙”。

采得全——ACE Ego Kit。 “頭—手—胸”三位一體分體輕量化無線套件,行業首款集成三維力觸與動捕信息的 ACE Sense Glove 采集手套,可實現 0.01N 力觸覺靈敏度、小于 2° 關節角誤差,20 余種異構傳感器同步誤差嚴控 1 毫秒內,精準錄入含物理因果律的真實交互數據。
標得細——ACE Data Engine。 全自動化生產平臺,內置全球首創生成式 4D 手部動捕范式 ACE-ViDiHand,面向長程任務斬獲三項全球第一,攻克遮擋與快速移動難題,以 0.997 的幀級準確率讓動作平滑度躍升 4.8 倍。
用得妙——ACE Ego Matrix。 開源具身數據標準底座,實現空間坐標、本體結構、動作時序與數據質量“四大統一”,打破硬件壁壘,讓不同采集人員、不同控制頻率的異構機器人“說同一種語言”。目前,其已在 RoboCase 與 RoboTwin 雙榜斬獲行業冠軍。

與此同時,大曉正式向全行業開源 L5 級家居復雜任務數據集 ACE-Data-0,以真實物理交互與高精度標注,為全球具身模型訓練注入高質量“燃料”,推動機器人在物理世界對齊中完成真正的智能涌現。
▎場景落地:三大場景解決方案,平行求解產業方程
大腦與數據,終須回歸真實場景接受檢驗。
依托以人為中心的環境式數采底座,疊加開悟世界模型的強大泛化能力,大曉推出三套標準化行業方案——即時零售“曉滿”、酒店服務“曉新”、開放場景自主作業“曉途”,以同一套技術底座,平行求解三個不同產業的效率方程。
“曉滿”:解即時零售的“極限履約”方程。 多 SKU、窄過道、全天候訂單波峰——這是即時零售的行業痼疾。

大曉推出配備履約機器人 W1 的“曉滿”方案,在僅 75 厘米的極限過道中,W1 以小于 2 的自重負載比與 ≤1N 的極致力控,打通“機械控制—世界模型—訂單倉儲”全鏈路,實現一體化閉環履約,支持天級輕量化部署,已在閃購倉、便利店等業態上線運行。
未來一年內,大曉機器人將完成1000家零售場景規模化落地,未來兩年拓展鋪設1萬家量級的零售店。
“曉新”:解酒店服務的“人力成本”方程。 夜間洗衣需求占全天 80%,夜班招工難、人力成本高企。

大曉打造靈活適配各星級非標洗衣房的“曉新”方案,機器人自主完成衣物“收、放、洗、疊”及熨燙全流程,將高度依賴人工的環節轉化為連續閉環作業,大幅削減夜班人力投入,從容化解節假日訂單積壓,破解酒店運營結構性難題。
“曉途”:解開場景的“復雜環境”方程。 面對戶外多變環境,大曉推出“曉途”四足全域作業方案,依托通用智能大腦適配多形態四足機器人,實現室內外無縫切換、動靜態避障與多機協同調度,全程無人干預完成安防巡檢、城市治理、文旅導覽等任務。

目前方案已在漕河涇、上海濱江、天津海棠花節常態化運行,開啟公共空間7×24小時自主運營新模式。
三套方案,三個行業,同一套數采、模型與部署底座。其落地軌跡清晰指向一個趨勢:具身智能正從單一場景的專用工具,邁向可跨行業復用的通用能力。
這也正是大曉推動物理 AI 規模化商用的核心邏輯——不是做一個個孤立的“項目”,而是構建可復制、可進化的“底座”,讓機器人在真實世界中持續求解產業方程。

03
世界模型行業統一“考場”
針對世界模型廠商“自己當運動員、又當裁判”的行業困局,本次論壇,大曉也牽頭帶來了解法——Physical IQ 物智。

這是首個具身原生,面向多場景、多本體、多任務的物理智能評測基準平臺,由上海人工智能行業協會、河套學院、中國信通院華東分院聯合發起,20余家高校與產業機構共建。
其中學術界包括上海交大、南洋理工、港中文、港大等一流學府;產業界匯聚宇樹、匯川技術、傅利葉、國地中心、鈦虎、靈心巧手、大曉、自變量、極佳、無界動力、影溯、百度云、輝羲等相關主流廠商。
據介紹,Physical IQ 物智能夠以統一協議貫通零售、工業、家居等真實場景,公平量化不同機器人本體與世界模型的物理智能水平,讓行業告別“自說自話”,從此有標可依、有據可比。
大曉同步推進的,還有從云端算力到商業場景的鏈路閉環。
算力側,大曉發起“世界模型云生態共建”,百度智能云、阿里云、華為云、騰訊云、華山云、商湯大裝置悉數加入。
數據底座上,與漕河涇開發區共建“具身智能產業創新平臺”;商業落地上,則攜手中石油、快客達、商湯善惠、新奧集團,布局無人倉店、前置倉、智能巡檢等場景。
從物理考場到數據底座,從場景部署到算力生態——大曉的布局邏輯清晰:把底座做扎實,把標準立清楚,把世界模型的“朋友圈”建起來。

04
這場論壇,嘉賓夠重磅,技術發布夠硬核,更為關鍵的是——它系統地回答了世界模型從“理解”走向“執行”的三個核心問題:
怎么理解世界? 具身第一性原理給出了邊界和共識——機器人不需要裝下整個世界,只需錨定“為行動而理解”的控制充分狀態。
拿什么訓練? 信息密度定律重新定義了數據的價值刻度,環境式數據采集方案2.0提供了從采集、標注到使用的完整工具鏈。
怎么比好壞? Physical IQ 統一了考場,讓自說自話成為過去,有標可依、有據可比成為現實。
從Kairos 3.1的自進化閉環,到數據方案的標準化輸出,再到曉滿、曉新、曉途的場景驗證,最后以Physical IQ為行業立標——大曉推動實現的,是用一套系統性的方法論,把物理AI從一個抽象的“技術問題”拆解為可工程化、可度量、可復制的產業問題。
世界模型不在于讓機器“更像人”,更是為了讓機器在物理世界里“更可靠”。這或許才是物理AI真正的“開悟時刻”。雷峰網(公眾號:雷峰網)雷峰網雷峰
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。