0
| 本文作者: 陳淑瑜 | 2026-05-26 17:34 | 專題:CVPR 計算機視覺與模式識別會議 |
? DeltaTok: Temporal Difference Tokenization for Video Generation
摘要:DeltaTok 工作解決了視頻生成中 token 序列過長導致計算開銷巨大的問題。核心創新在于以 1 個 token 表示幀間變化(Delta),而非完整幀,實現約 1000× 壓縮率;設計哲學為“不要增加 token 數量表征復雜度,而是壓縮時間本身”。完整技術棧為 DINO 特征 → Delta Token → 語義分割輸出,端到端延遲約 600ms。該工作入選 CVPR 2026 Highlight,X 平臺互動量持續增長(26 贊 / 3.5K views,較上期增長 37%)。
鏈接:https://x.com/junfanzhu98/status/2058454014212358599
? DeltaWorld: Learning World Models with Temporal Difference Tokens
摘要:DeltaWorld 工作解決了世界模型中多未來預測的效率瓶頸問題。通過學習 Delta token 的分布而非原始幀分布,實現多未來預測;與 DeltaTok 共享“壓縮時間本身”的設計哲學,DeltaWorld 將世界模型從逐幀預測升級為幀間變化建模。該工作同樣入選 CVPR 2026 Highlight,World Model Reading Club CVPR 預熱系列第 9 期 Part 1 由朱俊帆主講 Recap,技術解讀持續深入。
鏈接:https://x.com/junfanzhu98/status/2058454014212358599
? Reactor World Model Side Event @CVPR 2026
摘要:Reactor World 在 CVPR 2026 期間舉辦線下活動,主題為 World Models 和 Realtime Video,面向參會者開放。該 Side Event 為本期互動量最高推文(34 贊 / 1.5K views),標志著世界模型研究從論文發表走向社區化運營——研究者不再滿足于被動等待審稿結果,而是主動組織線下深度交流。該活動在 CVPR 期間(6/3~6/7)舉行,預期將產出世界模型前沿方向的一手討論素材。
鏈接:https://x.com/taiuti/status/2058919054317072817

? T4V Workshop @CVPR 2026 — Transformers for Vision and Multimodal AI
摘要:T4V Workshop 由 NVIDIA / UNC / Meta 聯合組織,主題涵蓋 image / video / 3D / MLLM / efficient attention / SSMs 六大方向。六位 Keynote 演講者已確認:Ranjay Krishna、Thomas Gu、Sherry Yang、Jc Niebles、Zhuang Liu、Tong Peter,覆蓋視覺理解、多模態大模型、3D 生成等前沿領域。Workshop 時間為 6/3(Wed)1:45-5:40pm,Room 607。本期互動 20 贊 / 907 views,NVIDIA 和 Meta 的聯合背書使其成為 CVPR 期間最受關注的 Workshop 之一。
鏈接:https://x.com/CMHungSteven/status/2058946589763436669 雷峰網(公眾號:雷峰網)

本專題其他文章