0
| 本文作者: 陳淑瑜 | 2026-04-28 16:29 | 專題:CVPR 計算機視覺與模式識別會議 |
【封面圖片來源:網站名中國科學院自動化研究所,所有者:MeanFuser】
端到端自動駕駛近年來取得了飛速進展,生成模型在多模態軌跡規劃中展現出巨大潛力。現有基于錨點引導的生成方法能有效刻畫駕駛行為的不確定性并提升整體性能,但存在一個內在矛盾:這類方法依賴離散錨點詞匯表,并要求其在測試階段充分覆蓋軌跡分布以保證魯棒性,從而在詞匯規模與模型性能之間引入不可調和的權衡——詞匯太少則覆蓋不夠,詞匯太多則計算成本爆炸。
另一方面,傳統流匹配方法在高質量軌跡生成上需要多步ODE求解,推理效率受限,難以滿足自動駕駛系統對實時性的嚴苛要求。如何在不引入離散詞匯依賴的同時,以單步生成實現高質量多模態軌跡,成為亟待突破的核心問題。
MeanFuser 正是針對這一核心矛盾提出的解決方案,通過引入 MeanFlow Identity 和高斯混合噪聲引導,實現了高效率與高質量的統一。

MeanFuser 的方法創新體現在三個層面的有機結合:
將離散錨點詞匯表替換為高斯混合分布。不同駕駛模態(如直行、左轉、右轉、減速等)對應不同的高斯分量,從而實現對軌跡空間的連續建模,從根本上消除了對離散詞匯表的依賴,支持無限細粒度的多模態軌跡采樣。
將 MeanFlow Identity(建模 GMN 與軌跡分布之間的平均速度場)引入端到端規劃框架,用平均速度場替代傳統流匹配中的瞬時速度場,有效避免多步ODE求解帶來的數值誤差,實現高質量單步軌跡生成,大幅加速推理。
ARM 將采樣到的多模態候選軌跡編碼后,通過交叉注意力機制與上下文特征融合,在多模態候選中隱式選擇或重構最優軌跡作為最終規劃輸出。這一設計既保留了多模態探索的豐富性,又通過注意力機制實現了上下文感知的自適應融合。
通過高斯混合噪聲連續建模駕駛行為分布,MeanFuser 從根源上消除了詞匯規模 vs 性能的內在矛盾。軌跡空間的連續表征使模型能自然捕獲真實駕駛行為的連續分布,顯著提升在分布外場景和罕見駕駛行為上的魯棒性。
MeanFlow 單步生成策略使 MeanFuser 在 NAVSIM 閉環基準上取得優異性能的同時,具備卓越的推理效率,無需額外監督信號。這對于自動駕駛系統在車載算力有限條件下的實時部署至關重要。
在注重真實駕駛閉環反饋的 NAVSIM 基準上,MeanFuser 展現出優于現有方法的綜合性能,驗證了從訓練階段消除詞匯依賴對閉環測試泛化性的正向貢獻,為端到端自動駕駛的工程落地提供了高效可靠的新范式。
──────────────────────────────────────────
上述內容包含AI輔助生成,更詳細信息參見兩個鏈接
原文鏈接:https://arxiv.org/abs/2026.meanfuser
解讀來源:https://ia.cas.cn/xwzx/ttxw/202603/t20260317_8160775.html
本專題其他文章