0
| 本文作者: 雷鋒專欄 | 2026-07-15 21:59 |
具身模型企業(yè)已經(jīng)不滿足于發(fā)布模型本身,不滿足于對(duì)現(xiàn)成技術(shù)框架的調(diào)用,開始向著更底層的大模型訓(xùn)練基礎(chǔ)設(shè)施進(jìn)發(fā)了。這對(duì)具身模型企業(yè)的模型工程化落地,對(duì)具身智能行業(yè)整體提升訓(xùn)練模型的效率,對(duì)中國具身企業(yè)競(jìng)逐全球技術(shù)影響力,都邁出了意義非凡的一步。
近日,自變量機(jī)器人發(fā)布用于模型訓(xùn)練的 DMuon 優(yōu)化器,這是對(duì) Muon 神經(jīng)網(wǎng)絡(luò)優(yōu)化器的分布式改造,能消除將 Muon 優(yōu)化器應(yīng)用于分布式訓(xùn)練時(shí)額外引入的系統(tǒng)開支,將訓(xùn)練具身模型的效率提速約 30%。
不僅如此,DMuon 與 Muon 的使用方式完全兼容,只需3行代碼就可引入模型訓(xùn)練,有望成為具身模型訓(xùn)練時(shí)的新的“默認(rèn)選項(xiàng)”,成為整個(gè)具身智能行業(yè)的一塊技術(shù)“基石”。

訓(xùn)練模型的行業(yè)難題,鮮有具身企業(yè)能插手
簡單來說,神經(jīng)網(wǎng)絡(luò)優(yōu)化器是大模型訓(xùn)練時(shí)的“指揮官”,會(huì)告訴模型往哪個(gè)方向調(diào)整模型權(quán)重,以及調(diào)整權(quán)重的步長等。
在近兩年,由于 Muon 優(yōu)化器在訓(xùn)練模型時(shí)計(jì)算收斂更快、所需計(jì)算步數(shù)更少,逐漸取代了原本大規(guī)模使用的 AdamW,應(yīng)用在 Kimi-K2 和 DeepSeek-V4 等模型的訓(xùn)練中。為 Muon 優(yōu)化器作出技術(shù)貢獻(xiàn)的,也是 OpenAI、Kimi、DeepSeek 等這些知名的大語言模型企業(yè)。
但由于大模型訓(xùn)練開銷巨大,往往需要利用 GPU 集群分布式訓(xùn)練。這時(shí) Muon 就會(huì)出現(xiàn)“水土不服”:其最核心的計(jì)算步驟 N–S 迭代,需要知道完整的權(quán)重矩陣才能計(jì)算,使得每個(gè) GPU 都需要重復(fù)計(jì)算、拼裝出完整的矩陣,還需要頻繁地互相通信。
相比之下,AdamW 僅僅“逐元素更新”,不需要看到矩陣全貌,反而不受到分布式訓(xùn)練的影響。這使得 Muon 雖然計(jì)算收斂更快、所需計(jì)算步數(shù)更少,但每一步訓(xùn)練的耗時(shí)卻比 AdamW 更多,達(dá)到了其 2.2 倍之多。
一進(jìn)一出中,Muon 的優(yōu)勢(shì)被額外計(jì)算和通信所消耗。在生產(chǎn)級(jí)別的分布式訓(xùn)練中,是使用 Muon 還是 AdamW 更劃算,尚且需要企業(yè)自己權(quán)衡抉擇。
對(duì)于具身模型訓(xùn)練來說,這種額外開銷的影響尤甚。因?yàn)榫呱砟P偷臅r(shí)序上下文更短,前向-反向傳播的計(jì)算占比更小,額外引入的計(jì)算和通信占比更大,對(duì)訓(xùn)練效率的拖累也更嚴(yán)重。這成為具身模型訓(xùn)練提效要解決的首要難題。但一直以來,鮮有國內(nèi)具身模型企業(yè)具備足夠的技術(shù)能力,對(duì)底層的大模型訓(xùn)練基礎(chǔ)設(shè)施進(jìn)行改造。
自變量三招“馴服” Muon,額外開銷從 120% 驟降到 2%
自變量機(jī)器人作為國內(nèi)技術(shù)最領(lǐng)先的具身模型企業(yè),主動(dòng)扛起技術(shù)開拓的旗幟,提出了自己的解法:
此次發(fā)布的 DMuon,將 Muon 進(jìn)行分布式改造,每步訓(xùn)練時(shí)間從 AdamW 的 2.2 倍驟降到 1.02 倍,幾乎完全消除了額外的計(jì)算和通信影響。
這讓 Muon 從“理論上很美、生產(chǎn)上很貴”,變成一個(gè)模型訓(xùn)練時(shí)可以默認(rèn)啟用的選項(xiàng)。自變量還將 DMuon 完全開源,只需 3 行代碼就能引入,并且與 Muon 的訓(xùn)練框架完全兼容,真正做到了“即開即用”,零成本讓整個(gè)行業(yè)受益。
簡單來說,DMuon 提出了三項(xiàng)改進(jìn)方法:
首先是 Owner 中心執(zhí)行與通信優(yōu)化。過去每個(gè) GPU 都需要重復(fù)計(jì)算完整的梯度和N–S迭代,造成很大的計(jì)算浪費(fèi)。DMuon 則指定唯一的 Owner 負(fù)責(zé)計(jì)算,再將計(jì)算結(jié)果分發(fā)給其他 GPU。不僅如此,DMuon 還將這些通信“插空”放在計(jì)算的空檔里,避免突發(fā)大量通信引發(fā)“擁堵”。 
其次是針對(duì)每種不同形狀的矩陣“自動(dòng)”進(jìn)行優(yōu)化。由于不同矩陣的“形狀”差異很大,適合它們的計(jì)算方式和底層內(nèi)核也各不相同。DMuon 不僅會(huì)針對(duì)性地優(yōu)化計(jì)算,還會(huì)“批量”生成大量內(nèi)核,遇到新形狀的矩陣就測(cè)試哪種內(nèi)核效果最好,以后遇到同樣形狀的矩陣可以用相同內(nèi)核應(yīng)對(duì)。
第三是均衡地分配不同 Owner 的工作量。由于不同矩陣的計(jì)算耗時(shí)差別很大,為避免有的 GPU 滿載、有的 GPU 空閑,DMuon 會(huì)針對(duì)每種矩陣形狀分別跑一遍完整的計(jì)算,記錄下真實(shí)的耗時(shí),然后最小化“跑得最慢”的矩陣耗時(shí),來提升整體的計(jì)算效率。
從“打造模型產(chǎn)品”到“建設(shè)生產(chǎn)線”,自變量扛起具身模型技術(shù)旗幟
這些優(yōu)化讓 DMuon 擅長應(yīng)對(duì)分布式計(jì)算,通過一系列優(yōu)化提升訓(xùn)練效率。整體計(jì)算下來,自變量發(fā)現(xiàn),相比未優(yōu)化的 Muon,DMuon 能將具身模型分布式訓(xùn)練的效率提升 30%,真正成為訓(xùn)練大模型的“利器”。
在 DMuon 本身的技術(shù)提效以外,這背后反映出的具身模型企業(yè)的技術(shù)崛起,以及代表的具身行業(yè)的轉(zhuǎn)變,同樣值得行業(yè)關(guān)注。
由于具身模型比大語言模型起步更晚,企業(yè)技術(shù)實(shí)力普遍不及大語言模型企業(yè)深厚。在過去幾年里,具身模型公司大多調(diào)用“前輩們”開發(fā)好的現(xiàn)成技術(shù)框架,鮮有向底層基礎(chǔ)設(shè)施這一“技術(shù)珠峰”攀登突破。能以現(xiàn)成技術(shù)工具訓(xùn)練出好的模型、在榜單評(píng)測(cè)中爭先,就是大部分具身模型公司的目標(biāo)。
但具身模型的訓(xùn)練不是一蹴而就,需要多個(gè)版本持續(xù)迭代和積累。如果將具身模型比作“產(chǎn)品”,那么建設(shè)“生產(chǎn)線”同樣重要,是能改變整個(gè)行業(yè)訓(xùn)練模型效率的大事。
DMuon 的發(fā)布,恰恰證明自變量這樣技術(shù)領(lǐng)先的具身模型公司,開始走出訓(xùn)練模型的“手工作業(yè)”階段,將資源投向具身模型的“工程化”生產(chǎn)提效。如果將訓(xùn)練大模型比作生產(chǎn)汽車,那么自變量就在做生產(chǎn)流水線的技術(shù)改造,著眼于訓(xùn)練模型的長期效率,而不只是關(guān)注一個(gè)版本的模型本身。
更重要的是,此前 Kimi 等公司對(duì) Muon 的技術(shù)貢獻(xiàn)獲得了業(yè)界認(rèn)可。但在全球范圍,還沒有一家具身模型公司能做到類似的成果。自變量不僅將 DMuon 分布式改造,還將技術(shù)開源打包,讓模型開發(fā)者只需 3 行代碼就能快速引入生產(chǎn)。這幫助具身智能整個(gè)行業(yè)都能訓(xùn)得更快、跑得更遠(yuǎn),成為向國內(nèi)乃至全球技術(shù)社區(qū)的一次饋贈(zèng)。
放眼未來,具身模型因其應(yīng)用于物理世界的獨(dú)特性,正在成為與大語言模型平行的新的一極。具身模型企業(yè)也終將扛起技術(shù)旗幟,從技術(shù)“跟隨者”轉(zhuǎn)變?yōu)椤伴_創(chuàng)者”,去引領(lǐng)技術(shù)風(fēng)向。自變量此次發(fā)布 DMuon,恰是這種具身智能行業(yè)技術(shù)崛起的一座里程碑。(雷峰網(wǎng)(公眾號(hào):雷峰網(wǎng)))