0

編輯丨李希
今年關于具身智能的討論里,有一個問題始終繞不開:機器人進了家門,到底靠什么讓人愿意留著它?
工廠的邏輯很簡單:干得準、跑得穩,得能運行,還能創收。但家庭場景不一樣:一個動作失誤、一次對意圖的理解偏差,用戶的心理容錯率幾乎為零——錯一次,機器人就可能就被退貨,或者放在角落吃灰。
這個現實,讓行業分出了兩條路。一條路上的公司,繼續死磕物理智能,讓機器人能夠無限接近理解物理世界;另一條開始往回退一步,先想清楚一件事——機器人要怎么理解人,才能在人身邊待得住。
星熾動力顯然是后者。為了了解他們的想法,AI 科技評論和公司的 CTO 李達聊了聊。
李達的履歷并不神秘。中科院自動化所博士,師從譚鐵牛院士,長期做視覺導航和連續學習,成果多次在領域頂級期刊發表,上過 IEEE TIP。進入星熾動力之前,李博士曾在自動化所工作學習十余年,學術底子算得上扎實,但他現在做的,是把這些積累倒進一個家庭場景里,重新審視一個被忽視很久的問題:機器人如果不懂人,憑什么跟人一起生活?
“今天的具身大腦講的更多的是‘環境動力學’——但我們不光要考慮物理環境的變化,也要把用戶的狀態推演出來。”討論中,李達常常強調這一點。
為此,星熾動力推出的 PULSE 架構,是把具身大腦拆成了“雙軌”:一條軌跑物理環境的感知和推演,另一條軌跑用戶狀態的感知和推演。兩條軌不是孤立運行,而是在特征層面做交叉驗證。

物理信息告訴機器人“環境怎么了”,用戶狀態信息告訴機器人“人怎么了”,兩者合并,才能輸出一個更靠譜的決策。
家庭場景里,人不是環境里的一件物體,而是交互的中心。如果機器人的認知模型里只有桌子、杯子、沙發,卻沒有坐沙發的人的狀態,那它永遠只能做一個被動的命令行工具——人發指令,機器執行,像在用 CLI(命令行)操作一臺機器。
但在家里,如果老人、小孩沒法很明確地提出指令,那么機器人是否就沒法在家庭場景好好工作?
怎么讓機器人理解人?PULSE 的答案落在三個關鍵詞上:意圖、信念、偏好。
意圖是用戶說了什么、做了什么,機器人能不能讀懂。
信念更有意思——李達舉了一個例子:男主人認為牛奶還在微波爐里,但女主人已經拿出來了。男主人持有的是一個“錯誤信念”。如果機器人只盯著物理世界,它看到的是微波爐里沒有牛奶,它不會理解男主人接下來要去做的動作是基于一個錯誤的前提。但如果機器人有能力表征人的信念狀態,它就能主動提醒:“牛奶已經被拿出來了。”這種糾偏能力,才是家庭場景里真正有用的智能。
偏好則更長期,涉及用戶的習慣、邊界、隱私,需要靠持續的交互來積累。
這三者構成的理解模型,不是掛在系統外的一個附加模塊,而是被李達團隊直接嵌入世界模型的條件化輸入里。用戶狀態被表征為隱空間的特征向量,以類似 token 的形式參與跨注意力計算,和環境特征做對齊。
這個技術選擇透露了一個清晰的價值判斷:理解人和理解物理世界,在認知架構上應該是平權的,甚至人的優先級更高。
為什么?因為落地節奏不同。
物理世界太復雜,泛化太難。一個在80公分高的桌子上訓練好的抓取模型,換到75公分的桌子上就可能失效。要在所有家庭、所有物品、所有光照條件下做到物理智能的通用,李達認為短期內難以實現。
但人的理解模型不一樣。雖然人也復雜,但人的行為在單個家庭里是有規律的。一個人每天喝水的杯子、回家的時間、說話的語氣,都有跡可循。如果機器人能先在一個具體的家庭里把“這個人”理解清楚,它的可用性就會迅速提升。
可用性上去了,用戶的使用頻率也就能夠提升,拿著這些基于用戶實際反饋的數據,星熾的機器人也可以借由這些和自家本體強耦合的真機數據,去進一步提升具身大腦的能力。
不追求一個模型解決全宇宙的問題,先讓機器人在一戶人家里不出錯、不惹人煩、偶爾讓人覺得貼心。這個目標比通用物理智能近得多。
PULSE 端云結合的落地策略也印證了這一點,云端負責全局迭代,端側跑測試時適應——機器人在使用中遇到新分布的數據,直接在本地做調優,不用等云端回傳。這種設計天然適配家庭場景:每個家庭都不一樣,每個家庭的機器人都應該長出自己的理解模型。
說到底,物理智能解決的是“能不能做到”,而人的理解模型解決的是“該不該做、什么時候做、怎么做才合適”。在家庭這個容錯率極低的環境里,后者的優先級恐怕還要再往前排一排。
這可能也是李達想表達的最核心的一句話:具身智能在家庭落地的關鍵,不是讓機器人更像一個萬能工具,而是讓它更像一個懂得察言觀色的伙伴。

以下是 AI 科技評論和李達的對談實錄,AI 科技評論做了不變原意的編撰。
▎AI 科技評論:能為我們講講 PULSE 架構的特點嗎?
李達:PULSE這個名字我們其實是有些寓意的。一方面,我們希望它是一個永續的、能夠和人的價值對齊,并能夠持續演進的系統。另一方面,"PULSE"這個詞本身也有脈搏的意思。我們覺得機器人有了PULSE之后,就有了生命,也就能夠真正地伴隨用戶一起成長。
如果用幾個詞介紹 PULSE 的核心閉環,就是:看懂環境,理解用戶,雙軌推演,接受反饋,持續進化。
當前行業內具身世界模型更關注環境動力學,也就是關注周圍物理環境的演變。但是星熾動力主打 C 端家庭場景,就離不開和人的交互。所以我們希望能夠讓機器人具備“社會屬性”。
因此,我們在構建PULSE世界動作模型時,跨出了行業的第一步:不僅推演物理環境的變化,更要把“用戶狀態的變化”也推演出來。機器人在采取行動前,不僅要算清“杯子會不會掉”,還要推演出“這個舉動會不會打擾到主人”。
我們最終的目的,是賦予機器人真正的“心智”,但什么是心智呢?人的心智,是他在一個團體當中,我應該知道怎么去做才能更好的融入團體。所以我們也希望機器人不僅可以執行命令,還要懂得主動預判你的需求,貼合你的偏好,并且極其克制地尊重你的家庭邊界等等。
▎AI 科技評論:這可能和做情感還不太一樣。
李達:純粹的“情感交互”往往停留在語言層面,通過聊天提供情緒價值和陪伴;而我們在星熾動力要做的是通過“心智理論(ToM)”,將家庭場景中高度復雜的“個性化”,轉化為一個可計算、可訓練、可驗證的數學模型。
這種基于心智的個性化模型,核心錨定在三個維度:信念(Belief)、意圖(Intention)和偏好(Preference)。
偏好依賴于機器人的長期情境記憶,而“信念”則是機器人理解人類認知偏差的關鍵。我舉個非常經典的家庭場景:男主人把牛奶放進微波爐加熱后離開,女主人隨后將其取出。此時,不知情的男主人腦海中就產生了一個“牛奶還在微波爐里”的虛假信念(False Belief)。當他再次走向微波爐時,具備心智模型的機器人就能精準識別出這種“信息差”,主動出聲提示甚至直接遞上牛奶,完成認知糾偏。
而在“意圖”層面,我們不再滿足于機器人只能聽懂直接指令,而是要求它具備兩項核心能力:一是“主動預判”,即通過用戶的行為動作提前推斷其潛在需求,做到“眼里有活”;二是結合“偏好對齊”,評估機器人的執行動作和分寸,是否真正符合該用戶的心理期望。
為了支撐這套復雜的認知中樞,在前期構建用戶狀態表征時,我們引入了基于自解釋增強的多模態大模型來進行底層建模。
▎AI 科技評論:要做個性化,記憶肯定是很重要的。
李達:是的,記憶是個性化的基石。為了兼顧機器人響應的低延遲與理解的深度,我們在PULSE的記憶模塊上,設計了一套自適應任務復雜度的“三層記憶架構”:結構化規則層、RAG(檢索增強生成)語義層,以及底層的參數化模型層。
比如最直觀的結構化規則層,負責處理高確定性的物理時空檢索。當用戶問“我的剪刀呢?”,這是一個精準匹配的尋物指令,系統無需去激活龐大的底層模型做深層表征挖掘,直接在規則記憶庫中調用即可。
但如果用戶的指令是模糊或高度意圖化的,比如只說了一句“幫我倒杯水”,這就觸及了“RAG語義層”。光靠規則是無法匹配這句指令的,系統需要通過 RAG 從過往的歷史交互切片(Episodic Memory)中,檢索出與“倒水”相關的語境與習慣(比如用什么杯子、常喝的溫度),以此對齊當前意圖。
當面對更為復雜的長尾場景、深層的情感共鳴,甚至遇到毫無歷史規則可循的突發狀況(Zero-shot)時,就需要“底層模型層”的重度介入。通過大模型的認知推理與泛化能力,對長期沉淀的用戶行為進行深度的因果歸因與價值挖掘。這種層層遞進的設計,確保了我們的機器人既能做到“極速響應”,又能做到“深思熟慮”。
▎AI 科技評論:不僅有記憶,還得有更好的上下文語境理解。
李達:對的,在家庭真實交互中,一句看似簡單的“給我倒杯水”,本質上是一個“高維且高度模糊”的指令。它隱含了海量的決策分支:水溫多少?什么杯子?純凈水還是電解質水?這些信息無法單純靠死記硬背來提取,機器人必須具備基于時空上下文的意圖消歧能力。
這種能力的底層支撐,是我們PULSE架構中的“室內態勢協同感知”模塊。比如,當用戶大汗淋漓地推開家門說“倒杯水”,機器人不應該只是機械地去接一杯溫水,它需要瞬間完成兩個維度的態勢融合:
第一是物理環境感知,通過物聯網或環境傳感器,獲取當前的極熱天氣與室內高溫狀態;第二是用戶狀態感知,通過第一視角的視覺模型捕捉“滿身是汗”的特征,甚至結合毫米波雷達提取呼吸心率等生理信號。
獲取這些多源異構數據在硬件層面并不難,真正的技術壁壘在于后端的多模態融合與跨域決策。基于這套感知,機器人不僅會決定遞上一杯補充電解質的運動飲料,還會聯動全屋智能生態——比如我們目前已經與海爾智家、涂鴉智能深度打通,機器人可以自主指令空調下調溫度。
因此,我們把室內態勢感知明確劃分為物理環境和用戶狀態兩個維度。這兩部分的感知結果,將共同作為輸入,接入后續的世界動作模型。而這正是我們提出的"雙軌世界模型"的核心:既要對物理世界的演變進行推演,也要對用戶狀態的變化進行推演。只有將這兩者并行處理,機器人才能在家庭場景中真正理解人的需求。
▎AI 科技評論:另一方面其實對于具身來講,只有正確數據是不是足夠了?
李達:遠遠不夠。在具身智能的真實落地中,“正確的常識”只能保證機器人能走通基本流程,而真正的護城河,恰恰是那些“錯誤數據”、“糾偏數據”以及“長尾的分布外數據(OOD)”。機器人在用戶即時糾錯中產生的反饋數據,才是我們做后訓練(Post-training)最珍貴的燃料。
在PULSE架構的數據回流設計中,我們將這些反饋分成了兩條線處理:一條是云端的全局迭代,用于基礎大模型能力的長期對齊與泛化;但更關鍵的是另一條線——端側的測試時適應(TTA, Test-Time Adaptation)。機器人必須具備實時的不確定性估計(Uncertainty Estimation)與OOD檢測能力,一旦識別出歧義數據,就能快速讓模型適應新的數據分布。這對機器人的糾偏速度要求很高,因為家庭場景里用戶的心理容錯率極低——錯一次,可能就被退貨或閑置。
所以在策略上,我們就需要非常謹慎,不能因為歷史數據里用戶曾經這么做過,就替用戶直接把任務完成了。人的狀態有起伏,情緒可能多變。當機器人分析出當前執行某項任務的不確定性較高時,應該主動詢問用戶:"我幫您把這件事做了,行不行?"如果用戶同意,再執行;如果用戶表現出不耐煩,就靜默處理。
最理想的閉環是,機器人在完成每一個決策或動作后,能夠實時捕獲用戶的多模態顯隱式反饋。無論是憤怒的微表情、不耐煩的語氣,還是豎起大拇指夸一句“你真棒”,系統都會將這些自然流露的信號回傳,轉化為偏好對齊模型中的正負獎勵。這才是具身大腦“越用越聰明、越用越懂分寸”的本質路徑。
▎AI 科技評論:后訓練對你們來說是一個很重要的策略。
李達:我覺得后訓練肯定很重要,但這個要分時期來看。
從認知仿生學的角度來看,人類成長是一個增量學習的過程,我們在掌握一項新技能時,是基于已有的常識基座進行局部的突觸鏈接調整,而不是把從小到大的所有記憶翻出來“全量重訓”一遍。具身大模型的后訓練,本質上就是模擬這種人類的“終身學習”機制——在新家庭、新場景中,以極低的算力成本對齊新的偏好。
但我們也非常客觀看待現階段的技術局限。當后訓練走向極致,也就是真正意義上的“連續學習(Continual Learning)”時,不可避免會面臨災難性遺忘問題。
這是一個非常現實的風險:如果模型一直接收新知識、不斷進行微調,那些此前好不容易建立起來的基礎通用技能,會不會因為網絡權重的覆寫而丟失?這就像俗話說的“狗熊掰棒子”,學了新的家庭習慣,卻忘了最基礎的物理常識。這種風險不僅存在,而且在現有的大模型架構中概率極高。因此,如何在“敏捷吸收新知”與“穩固歷史常識”之間建立有效的參數隔離與記憶重塑機制,也是我們當前在工程落地上投入極大精力去攻克的難點問題。
▎AI 科技評論:今天星熾動力怎么看具身大腦的泛化?我們距離實現動作的即興和舉一反三還有多遠?
李達:當前行業距離真正泛化還有相當長的一段路要走。
現在很多VLA模型,一旦物理參數變了,比如實驗室精調時桌子高度是80公分,到真實家庭變成了75公分,它大概率就不知道該怎么抓了,這說明現階段的泛化是非常脆弱的。如果大家只是在實驗室里閉門造車,死磕算法架構,這永遠是個無解的死循環,因為我們根本窮舉不完真實家庭里千奇百怪的參數。
所以,星熾動力破局的思路,是緊緊貼合我們“本體+大腦+數據”三位一體的戰略飛輪。我們不寄希望于某種神奇的算法能立刻實現通用泛化,我們走的是用規模換數據、用數據反哺模型泛化的務實路徑。所以星熾動力的模型,一定能率先在星熾自己的硬件本體上實現最穩健的泛化。
至于未來動作的即興編排,那是在我們的原子庫泛化能力足夠強之后,依靠上層大模型規劃和底層具身OS調度來自然實現的水到渠成。
▎AI 科技評論:隱私問題我們會怎么考量?
李達:隱私絕對是C端家庭機器人的生死線。在星熾動力,我們對隱私的考量不僅停留在“獲取用戶知情同意(Consent)”這種合規底線上,更是將隱私保護機制直接原生地設計在了PULSE的技術架構里,也就是所謂的“Privacy by Design(隱私即設計)”。
具體來說,我們通過“端側計算”和“模態解耦”來徹底切斷隱私泄露的源頭。
首先,在核心的行為理解上,我們不需要把包含用戶真實面貌、穿著的RGB高清畫面傳回云端。在端側,我們就直接將視覺流轉化為了低維的骨架點(Skeleton/Pose)信息。脫敏后的骨架序列,在行為識別算法上的性能反而更好!因為衣著紋理、背景光影在很多時候是冗余的噪聲,剝離這些反而讓模型更專注、更魯棒。
其次,對于人臉微表情、生理狀態這些極度敏感但算力要求不高的感知任務,我們全部在前端直接閉環處理。系統最終傳給云端大腦的,只是幾個類似于“高興”、“疲憊”的結構化語義標簽,沒有任何原始圖像。
環境數據也是同理。我們不需要上傳用戶家里的照片來做預演,我們提取的是場景的結構化語義描述(Semantic Scene Graph)。云端拿到的只是一組描述物體空間關系的文本和拓撲圖。
▎AI 科技評論:謝謝李博的分享,我們再問最后一個問題:星熾動力的 Mission 是什么?
李達:讓機器人真正走進千家萬戶。我們聚焦家庭場景,希望打造一款在長期陪伴中不斷學習、越來越懂你的家庭伙伴機器人,讓機器人更自然地融入每個人的日常生活。