0
| 本文作者: 陳淑瑜 | 2026-05-29 16:28 | 專題:CVPR 計算機視覺與模式識別會議 |



一、論文信息

論文題目:ParTY: Part-Guidance for Expressive Text-to-Motion Synthesis中文題目:ParTY:富有表現力的文本到動作合成的部分指南論文鏈接:https://arxiv.org/pdf/2603.09611
所屬單位:慶熙大學
核心速覽:
提出ParTY框架以解決文本到動作合成中特定身體部位動作表達不足和全身動作連貫性差的問題,通過部分引導網絡、部分感知文本接地和整體-部分融合模塊提升性能。

二、即插即用模塊原理解讀


1. 實現過程:
對輸入的多分支拼接特征執行自注意力,建模特征內部依賴并通過殘差連接增強;
再經 Split 操作,將特征分為共享查詢 Q' 與綠、紅兩個獨立分支,各分支生成鍵 Kp、值 Vp;
隨后兩個并行交叉注意力分支以 Q' 為查詢,分別與兩個分支的 Kp、Vp 計算注意力,建模跨分支交互,各分支輸出再做殘差連接;
最后融合兩個交叉注意力分支的輸出,得到兼顧自身依賴與跨分支交互的增強特征。
2. 作用與適用領域
兼顧特征內部依賴建模與跨分支信息交互,能高效融合多模態、多尺度或多源特征,適用于圖像分割、圖像翻譯、多模態圖像生成、圖像修復等計算機視覺任務,尤其適合多源信息協同場景,提升特征判別性與魯棒性。

三、全文內容概覽


1. 研究內容:
提出ParTY框架,旨在解決文本到運動合成中“部分運動表達”與“全身連貫性”的權衡問題,通過三模塊協同提升運動生成質量:Part-Guided Network(部分引導網絡)、Part-aware Text Grounding(部分感知文本接地)、Holistic-Part Fusion(整體-部分融合)。
2. 針對問題:
現有方法存在兩大局限:(1)整體生成方法缺乏部分語義對齊,無法準確反映特定身體部位動作;(2)部分生成方法獨立生成各部位運動,導致全身連貫性差(如頸部扭曲、肢體運動錯位)。
3. 關鍵技術:
1. Temporal-aware VQ-VAE:通過局部時間增強(LTE)和全局時間增強(GTE)保留運動序列的時間信息,減少量化損失;
2. Part-aware Text Grounding:將文本嵌入通過多個MLP生成多樣化表示,結合LLM生成的部位描述作為輔助監督,動態選擇與各部位匹配的嵌入;
3. Part-Guided Network:先生成部位運動 tokens 作為“部分引導”,再通過整體-部分融合(HPF)模塊將部位信息融入整體運動生成,確保連貫性。

4. 實驗效果:
在HumanML3D和KIT-ML數據集上,ParTY在傳統指標(R-Precision、FID、MM-Dist)上達到SOTA;新提出的部分級指標(部位R-Precision、FID)和連貫級指標( temporal coherence, spatial coherence)顯示:相比ParCo(部分方法)和MoMask(整體方法),ParTY在部位語義對齊(如左腿弓步動作)和全身連貫性(如避免頸部扭曲)上均顯著提升。


5. 結論:
ParTY通過顯式部位語義對齊和動態融合機制,成功平衡了部分運動表達與全身連貫性,提出的評估指標為文本到運動合成提供了更全面的評價體系,推動該領域從“整體生成”向“精細化部位控制”發展
本專題其他文章