0
| 本文作者: 陳淑瑜 | 2026-06-02 16:57 | 專題:CVPR 計算機視覺與模式識別會議 |
來源:公眾號“數字內容合成與偽造檢測”
原文鏈接:https://mp.weixin.qq.com/s/bdgq0Hl1oHDYm82DicJBow
計算機視覺領域頂級會議 IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026(CVPR 2026)將于6月3日至7日在美國丹佛舉辦。本屆CVPR共收到16,092份有效論文投稿,最終主會錄用論文4,090篇(錄用率25.42%)。
本文將介紹一篇關于擴散模型加速的CVPR 2026論文。

★題目:ResCa: Residual Caching for Diffusion Transformers Acceleration
作者:Haipeng Fang, Yu Li, Fan Tang, Yixing Lu, Juan Cao, Sheng Tang
論文鏈接:
https://openaccess.thecvf.com/content/CVPR2026/papers/Fang_ResCa_Residual_Caching_for_Diffusion_Transformers_Acceleration_CVPR_2026_paper.pdf(點擊“閱讀原文”可直接跳轉)
Diffusion Transformer正在成為高質量圖像與視頻生成的核心架構。從FLUX到HunyuanVideo,生成效果越來越強,但推理成本也越來越高:每一步去噪都要需要大量token,每個token都經過海量計算。如何在盡可能不損失生成質量的前提下,讓DiT跑得更快?本文提出ResCa(Residual Caching),一個訓練無關的擴散 Transformer 加速框架。它的核心想法可以概括為:只讓少量“代理 token”真實去噪,再用它們的殘差變化帶動其他token模擬去噪。
研究背景:已有Token裁剪方法都會偏離原始去噪軌跡
現有特征級加速方法通常從 token reduction 入手,減少每一步真正參與計算的 token 數量。典型路線主要有兩類:
1. 緩存舊 token:如 ToCa、TokenCache 等,復用前一時間步的 token 特征,但由于未經歷當前時間步更新,形成 non-updated 的去噪方向。
2. 合并相似 token:如 ToMeSD、SDTM 等,把相似token合并后統一計算,但合并后的特征不再完全屬于原token自己,形成 non-self 的去噪方向。

圖1:去噪軌跡對比示意圖. (a)原始去噪軌跡 (b)緩存方法 (c) 合并方法 (d) ResCa
也就是說,傳統方法雖然減少了計算,卻可能破壞擴散模型原本的去噪軌跡。
關鍵洞察:與其緩存特征,不如緩存“變化”
ResCa的核心觀察是:沿著相似歷史軌跡運動的 token,它們的殘差變化也相似。這里的“殘差”指的是 token 特征在相鄰時間步之間的變化,而不是網絡里的 skip connection 。0階殘差對應原始特征, n階殘差反映n-1階殘差的變化。
這一視角帶來了一個重要轉變:過去的方法更多在復用“特征狀態”,而 ResCa 選擇復用“去噪方向”。為了驗證這一點,我們基于 FLUX.1 分析了兩個問題:
在哪里找相似殘差?只看單步特征相似度并不可靠,基于歷史去噪軌跡進行聚類,能更準確地找到殘差變化相似的 token 。
如何使用相似殘差?1-, 2- , 3- 階殘差比原始特征更可復用,同時歷史殘差關系能夠幫助估計未來殘差的可信度。

圖2:預實驗分析:軌跡聚類更容易找到相似殘差,1,2,3階殘差更適合復用
核心方法:ResCa 的代理去噪框架
本文提出ResCa(Residual Caching),一個免訓練的DiT加速框架。ResCa 的整體流程非常直觀:在 dense timestep 中,全量計算并緩存 token ;在 sparse timestep 中,每個簇只選擇一個 proxy token 真實去噪,其余 driven tokens 通過 proxy 的殘差進行模擬更新。

圖3:ResCa整體架構
> 模塊一:時序增強軌跡聚類(Temporal-Enhanced Trajectory Clustering)
TETC 的目標是把“未來殘差可能相似”的 token 分到同一個簇中。
計算每個時間步的 token 相似度:對于歷史軌跡序列中的每個時間步,ResCa 計算 token 兩兩之間的余弦相似度,得到單步相似度矩陣。
累積時序增強相似度:越接近當前的時間步,越能反映接下來的變化趨勢,因此采用帶平滑因子的時間移動平均,賦予近期時間步更高權重。
基于軌跡相似度進行聚類:基于相似度矩陣后進行 K-medoids 聚類;每個簇中選擇一個 token 作為 proxy token ,其余 token 則作為 driven tokens。
> 模塊二:代理驅動去噪模擬(Proxy-Driven Denoising Simulation)
PDDS 是 ResCa 的核心。它回答的問題是:當只有 proxy token 被真實去噪后,如何更新同簇中那些沒有經過完整網絡計算的 driven tokens?
真實去噪proxy token:對 proxy token 執行完整的 Transformer 計算,得到它在當前時間步的真實去噪結果,并通過遞歸有限差分構造多階殘差。
估計driven tokens的未來殘差:根據 driven token 與 proxy token 的歷史殘差一致性,計算 order-specific confidence weight,以衡量 proxy 未來殘差的可信度,并在 driven token 自身殘差基礎上引入可信的方向校正。
通過隱式 ODE 更新 driven tokens:采用隱式 ODE (implicit Euler、implicit BDF2 和 implicit Taylor) 更新 driven tokens,平衡加速效率與生成質量。
實驗分析:高加速比下,質量仍然穩定
> Text-to-Image FLUX
在 FLUX.1-dev 上,ResCa 在多個加速檔位下都保持了較高質量。定性結果中,ResCa 在水壺反射、機器人肢體、人腦紋理等細節上保留得更好。

表1:基于FLUX的定量對比

圖4:基于FLUX的生成圖像對比
> Text-to-Video HunyuanVideo
在 HunyuanVideo 上,ResCa-IE 以 5.53× FLOPs 加速 取得 79.98 的 VBench 得分,是同檔加速方法中的最佳結果。定性對比顯示,其他方法可能出現瓶蓋位置錯誤、水花細節缺失、鼓槌物體缺失等問題,而 ResCa 在語義對齊和細節完整性上更加穩定。

表2:基于HunyuanVideo的定量對比

圖5:基于HunyuanVideo的生成視頻對比
更詳細的實驗分析請見論文原文。
總結
ResCa 為擴散 Transformer 加速提供了一個新的視角:不緩存舊狀態,而緩存殘差變化。通過“代理去噪”,ResCa 在保留 token 自身軌跡的同時,引入來自 proxy token 的未來殘差校正,從而同時保持 self 與 updated 的去噪方向。這一訓練無關框架可以自然集成到 DiT、FLUX、HunyuanVideo 等模型中,并在圖像生成、視頻生成和不同加速檔位下展現出穩定優勢。
我們希望 ResCa 能為擴散模型高效推理提供新的啟發,也推動 proxy denoising 范式在生成式視覺模型中的進一步探索。
(Project Page: https://fanghaipeng.github.io/ResCa/)
本專題其他文章