0
| 本文作者: 陳淑瑜 | 2026-06-04 14:26 | 專題:CVPR 計(jì)算機(jī)視覺與模式識(shí)別會(huì)議 |
原文鏈接:https://mp.weixin.qq.com/s/kR6VUwldmDC1RuDRJdfFDA


論文鏈接:
https://openaccess.thecvf.com/content/CVPR2026/papers/Chen_alphaMatte4K__muMatting_Dataset_and_Model_for_Ultra-Micro_Precision_Alpha_CVPR_2026_paper.pdf
論文簡(jiǎn)介:
高分辨率人體視頻摳圖要求模型準(zhǔn)確預(yù)測(cè)半透明區(qū)域的 alpha 遮罩,同時(shí)保持跨幀穩(wěn)定。但這一任務(wù)長(zhǎng)期受到兩個(gè)問題限制:一是高質(zhì)量 4K 標(biāo)注數(shù)據(jù)不足,二是高分辨率下計(jì)算成本較高。我們提出 Matte4K 和 Matting,從數(shù)據(jù)和模型兩個(gè)層面解決問題。Matte4K 是一個(gè)大規(guī)模 4K 人體視頻摳圖數(shù)據(jù)集,通過基于物理的渲染獲得更精確的標(biāo)注和更自然的物理一致性。Matting 則是一個(gè)分辨率無關(guān)的兩階段視頻摳圖框架:先進(jìn)行粗略遮罩定位,再通過稀疏 3D 卷積和時(shí)間調(diào)制器細(xì)化關(guān)鍵區(qū)域。這樣既能提升細(xì)節(jié)精度,也能增強(qiáng)時(shí)序一致性。這項(xiàng)工作為高分辨率人體視頻摳圖提供了更扎實(shí)的數(shù)據(jù)基礎(chǔ)和模型方案,也進(jìn)一步推動(dòng)了該技術(shù)在真實(shí)視頻編輯場(chǎng)景中的應(yīng)用。


論文鏈接:
https://arxiv.org/pdf/2511.10555
論文簡(jiǎn)介:視覺風(fēng)格生成常常依賴復(fù)雜提示詞、參考圖像或額外微調(diào),使用門檻較高,也不容易穩(wěn)定復(fù)現(xiàn)。我們提出 CoTyle,關(guān)注一個(gè)新的問題:能否只用一個(gè)數(shù)值編碼,就控制并生成一種穩(wěn)定、可復(fù)現(xiàn)的新風(fēng)格。圍繞這一任務(wù),我們先從圖像集合中學(xué)習(xí)離散風(fēng)格碼本,再訓(xùn)練自回歸風(fēng)格生成器建模風(fēng)格分布。推理時(shí),一個(gè)數(shù)值風(fēng)格編碼會(huì)被映射成唯一的風(fēng)格嵌入,并進(jìn)一步引導(dǎo)文本到圖像擴(kuò)散模型生成對(duì)應(yīng)風(fēng)格圖像。相比傳統(tǒng)方式,CoTyle 的輸入更簡(jiǎn)單,風(fēng)格空間更豐富,也更容易復(fù)現(xiàn)。它的意義在于,把復(fù)雜風(fēng)格控制壓縮成一個(gè)可操作、可擴(kuò)展的編碼問題,為風(fēng)格化圖像生成提供了一種更輕量、更靈活的方式。


論文鏈接:
https://arxiv.org/pdf/2603.25527
論文簡(jiǎn)介:視頻生成模型的發(fā)展高度依賴訓(xùn)練數(shù)據(jù),但好數(shù)據(jù)并不容易獲得。我們發(fā)現(xiàn),視頻數(shù)據(jù)中存在一個(gè)普遍矛盾:畫質(zhì)高的視頻往往運(yùn)動(dòng)不夠豐富,運(yùn)動(dòng)豐富的視頻又可能畫質(zhì)不夠好。我們將其稱為“運(yùn)動(dòng)-視覺質(zhì)量困境”。圍繞這一問題,我們提出 TQD,即時(shí)間步感知質(zhì)量解耦。我們通過分析視頻擴(kuò)散模型的學(xué)習(xí)過程發(fā)現(xiàn),不同類型數(shù)據(jù)在不同時(shí)間步上發(fā)揮的作用并不相同:運(yùn)動(dòng)豐富的數(shù)據(jù)更適合在較高時(shí)間步發(fā)揮作用,高視覺質(zhì)量數(shù)據(jù)則更適合在較低時(shí)間步提供細(xì)節(jié)學(xué)習(xí)信號(hào)。因此,我們通過調(diào)整采樣分布,讓不同數(shù)據(jù)在更合適的訓(xùn)練階段被使用。TQD 的意義在于,它不再把“完美數(shù)據(jù)”作為唯一前提,而是更充分地利用不平衡數(shù)據(jù),為視頻生成訓(xùn)練提供了更現(xiàn)實(shí)、更高效的數(shù)據(jù)使用方式。


論文鏈接:
https://arxiv.org/pdf/2603.22271
論文簡(jiǎn)介:視頻超分辨率不僅要求畫面更清晰,也要求生成過程足夠高效。擴(kuò)散模型雖然帶來了更好的畫質(zhì),但多步采樣的計(jì)算成本較高,限制了實(shí)際使用。我們提出 DUO-VSR,核心目標(biāo)就是在保證視覺質(zhì)量的同時(shí)提升生成效率。它采用三階段訓(xùn)練框架,并通過雙流蒸餾策略,將分布匹配蒸餾與對(duì)抗性監(jiān)督結(jié)合起來。一方面,模型通過蒸餾學(xué)習(xí)更高效的生成路徑;另一方面,對(duì)抗性監(jiān)督幫助模型保留更自然、更真實(shí)的視覺細(xì)節(jié)。最后,我們還加入偏好引導(dǎo)精煉,使結(jié)果更符合人眼觀感。DUO-VSR 的價(jià)值在于,它讓“一步生成”的視頻超分不僅更快,也能保持較高畫質(zhì),為視頻增強(qiáng)在真實(shí)應(yīng)用中的落地提供了更實(shí)用的方案。


論文鏈接:
https://arxiv.org/pdf/2512.21514
論文簡(jiǎn)介:強(qiáng)化學(xué)習(xí)可以提升圖像生成質(zhì)量,但我們觀察到,模型在訓(xùn)練后期容易出現(xiàn)“越訓(xùn)越像”的問題:圖像質(zhì)量可能提高,但創(chuàng)造性和多樣性下降。我們認(rèn)為,這背后既有獎(jiǎng)勵(lì)設(shè)計(jì)的問題,也有生成動(dòng)態(tài)的問題。傳統(tǒng) GRPO 更關(guān)注單張圖像的質(zhì)量獎(jiǎng)勵(lì),容易讓模型集中到少數(shù)高獎(jiǎng)勵(lì)模式;同時(shí),正則化機(jī)制沒有充分保護(hù)早期去噪階段的多樣性。針對(duì)這一問題,我們從兩個(gè)層面進(jìn)行改進(jìn):在獎(jiǎng)勵(lì)層面,引入基于語義分組的分布級(jí)創(chuàng)造力獎(jiǎng)勵(lì);在生成層面,設(shè)計(jì)結(jié)構(gòu)感知正則化,在早期階段更好地保留多樣性。實(shí)驗(yàn)表明,在保持生成質(zhì)量的同時(shí),我們的方法能夠明顯提升語義多樣性。這項(xiàng)工作關(guān)注的不是單純“生成更好看”,而是在質(zhì)量與創(chuàng)造力之間建立更合理的平衡。


論文鏈接:
https://arxiv.org/pdf/2510.22319
論文簡(jiǎn)介:GRPO 在生成模型后訓(xùn)練中應(yīng)用廣泛,但我們發(fā)現(xiàn),現(xiàn)有框架中的重要性比率裁剪機(jī)制存在系統(tǒng)性偏移,可能導(dǎo)致隱式過度優(yōu)化。也就是說,代理獎(jiǎng)勵(lì)還在上升,但圖像質(zhì)量、文本對(duì)齊等真正重要的指標(biāo)卻開始下降。為解決這一問題,我們提出 GRPO-Guard,對(duì)現(xiàn)有 GRPO 框架進(jìn)行增強(qiáng)。它通過比率歸一化,讓重要性比率更加平衡,保證裁剪機(jī)制能夠真正限制有害更新;同時(shí)通過梯度重加權(quán),避免某些時(shí)間步區(qū)域出現(xiàn)過度優(yōu)化。GRPO-Guard 的意義在于,讓強(qiáng)化學(xué)習(xí)后訓(xùn)練過程更加穩(wěn)定可靠。它不是簡(jiǎn)單追求更高獎(jiǎng)勵(lì),而是關(guān)注獎(jiǎng)勵(lì)提升背后生成質(zhì)量是否真正同步提升,從而提高生成模型后訓(xùn)練的可用性。


論文鏈接:
https://arxiv.org/html/2602.06959v1/
論文簡(jiǎn)介:電影級(jí)視頻創(chuàng)作往往需要精準(zhǔn)控制場(chǎng)景、主體和鏡頭運(yùn)動(dòng),但真實(shí)拍攝需要搭建布景,成本高、周期長(zhǎng)。我們提出 CineScene,希望用生成模型降低電影級(jí)場(chǎng)景創(chuàng)作的門檻。它面向一個(gè)更具體的任務(wù):給定靜態(tài)環(huán)境的多張圖像,生成包含動(dòng)態(tài)主體、場(chǎng)景一致且攝像機(jī)軌跡可控的視頻。為實(shí)現(xiàn)這一目標(biāo),我們利用隱式 3D 感知場(chǎng)景表示,把靜態(tài)場(chǎng)景中的空間先驗(yàn)注入到預(yù)訓(xùn)練文本到視頻模型中,使模型能夠在理解場(chǎng)景結(jié)構(gòu)的基礎(chǔ)上生成動(dòng)態(tài)內(nèi)容。我們還使用 Unreal Engine 5 構(gòu)建場(chǎng)景解耦數(shù)據(jù)集,解決訓(xùn)練數(shù)據(jù)不足的問題。CineScene 的意義在于,它讓 AI 視頻生成更接近專業(yè)影視制作需求,不只是生成畫面,而是生成可控鏡頭、穩(wěn)定場(chǎng)景和動(dòng)態(tài)主體共同構(gòu)成的電影化視頻。


論文鏈接:
https://arxiv.org/pdf/2511.21395
論文簡(jiǎn)介:這項(xiàng)工作關(guān)注的是 AI 視覺推理中的一個(gè)核心問題:模型能否像人一樣,在“腦海中”完成抽象視覺思考,而不是依賴外部工具進(jìn)行輔助推理。圍繞這一方向,我們提出了 Monet,一個(gè)面向多模態(tài)大語言模型的訓(xùn)練框架。它讓模型能夠直接在潛在視覺空間中進(jìn)行推理,并生成連續(xù)嵌入向量作為“中間視覺思維”。在訓(xùn)練上,我們構(gòu)建了 Monet-SFT-125K 數(shù)據(jù)集,并設(shè)計(jì) VLPO 強(qiáng)化學(xué)習(xí)方法,進(jìn)一步提升模型在潛在空間中的視覺推理能力。最終,Monet-7B 在真實(shí)世界感知、推理和抽象視覺任務(wù)上都取得了明顯提升。這項(xiàng)工作也說明,讓模型具備更接近人類的視覺思考能力,可能不只依賴外部工具調(diào)用,更需要讓模型在自身表示空間中學(xué)會(huì)“看見”和“思考”。


論文鏈接:
https://arxiv.org/pdf/2512.03041
論文簡(jiǎn)介:單鏡頭視頻生成已經(jīng)取得了很大進(jìn)展,但真正的敘事視頻往往由多個(gè)鏡頭組成,需要鏡頭切換、敘事連貫、主體一致和場(chǎng)景控制。我們提出 MultiShotMaster,正是面向多鏡頭視頻生成這一更接近真實(shí)創(chuàng)作流程的任務(wù)。它通過兩種 RoPE 變體擴(kuò)展預(yù)訓(xùn)練單鏡頭模型:多鏡頭敘事 RoPE 用于處理鏡頭切換和時(shí)間順序,時(shí)空位置感知 RoPE 用于注入?yún)⒖夹畔⒑?grounding 信號(hào)。為了支撐訓(xùn)練,我們還建立了自動(dòng)化數(shù)據(jù)標(biāo)注流程,提取多鏡頭視頻、描述文本、參考圖像和跨鏡頭定位信息。MultiShotMaster 的意義在于,它讓視頻生成從“生成一個(gè)片段”進(jìn)一步走向“組織一段敘事”,能夠支持鏡頭數(shù)量、鏡頭時(shí)長(zhǎng)、主體運(yùn)動(dòng)和場(chǎng)景背景的靈活控制,為 AI 視頻創(chuàng)作提供更完整的鏡頭語言能力。


論文鏈接:
https://arxiv.org/pdf/2604.00503
論文簡(jiǎn)介:開放集目標(biāo)檢測(cè)希望模型識(shí)別固定類別之外的新物體,但文本提示往往難以準(zhǔn)確描述復(fù)雜視覺概念,稀有類別的圖文數(shù)據(jù)也相對(duì)不足。我們提出 PET-DINO,一個(gè)同時(shí)支持文本提示和視覺提示的通用檢測(cè)器。它通過 AFVPG 模塊生成更易對(duì)齊視覺概念的提示表示,并結(jié)合 IBP 和 DMD 兩種訓(xùn)練策略,讓模型同時(shí)學(xué)習(xí)多種提示路徑。PET-DINO 的意義在于,它讓開放集檢測(cè)從單純依賴文本類別,進(jìn)一步走向文本與視覺提示協(xié)同,在零樣本檢測(cè)、復(fù)雜物體識(shí)別和專業(yè)場(chǎng)景中具備更好的泛化能力。


論文鏈接:
https://arxiv.org/pdf/2603.07561
論文簡(jiǎn)介:個(gè)性化概念定制已經(jīng)能夠生成較高保真的人物、物體或風(fēng)格,但一個(gè)常見問題是:模型在學(xué)習(xí)新概念時(shí),可能會(huì)破壞原本的生成能力。我們提出 PureCC,希望讓概念定制變得更“干凈”。它的核心思路是把目標(biāo)概念學(xué)習(xí)和原始模型能力保持進(jìn)行解耦:一方面學(xué)習(xí)用戶指定的新概念,另一方面盡量保留原始模型的條件預(yù)測(cè)能力。為此,我們?cè)O(shè)計(jì)了雙分支訓(xùn)練流程,并引入自適應(yīng)引導(dǎo)尺度 λ?,動(dòng)態(tài)平衡定制保真度和模型保持。PureCC 的意義在于,它不只是追求“像不像某個(gè)定制對(duì)象”,也關(guān)注模型在定制之后是否仍然穩(wěn)定、通用、可控。這對(duì)于個(gè)性化生成真正走向?qū)嶋H應(yīng)用非常關(guān)鍵。


論文鏈接:
https://arxiv.org/pdf/2509.24897
論文簡(jiǎn)介:統(tǒng)一視覺理解與視覺生成,是通向通用 AI 的重要方向。但一個(gè)容易被忽略的問題是:把兩種能力放進(jìn)同一個(gè)模型,并不等于它們真的能夠互相促進(jìn)。圍繞這一問題,我們提出了 RealUnify,希望回答“統(tǒng)一模型是否真正實(shí)現(xiàn)了理解與生成的協(xié)同”。RealUnify 設(shè)計(jì)了“理解增強(qiáng)生成”和“生成增強(qiáng)理解”兩類任務(wù),既考察模型能否用推理能力指導(dǎo)圖像生成,也考察模型能否借助生成式模擬完成視覺理解。我們還引入雙階段評(píng)估協(xié)議,用來判斷模型的失敗究竟來自基礎(chǔ)能力不足,還是協(xié)同機(jī)制沒有真正建立。通過對(duì)多個(gè)領(lǐng)先統(tǒng)一模型和專業(yè)基線的評(píng)測(cè),我們發(fā)現(xiàn),當(dāng)前模型距離真正的雙向協(xié)同仍有差距。這項(xiàng)工作為未來統(tǒng)一模型的發(fā)展提供了更清晰的評(píng)估坐標(biāo)。


論文鏈接:
https://arxiv.org/pdf/2603.21002
論文簡(jiǎn)介:高分辨率視頻生成面臨一個(gè)直接矛盾:用戶希望畫面更清晰,但推理速度會(huì)顯著變慢。很多加速方法雖然提高了效率,卻容易損失原始模型的布局、語義和運(yùn)動(dòng)風(fēng)格。我們提出 SURF,希望在生成效率和模型“原本味道”之間取得平衡。它將生成過程分為預(yù)覽和精煉兩個(gè)階段:先快速生成低分辨率預(yù)覽,再通過 Refiner 進(jìn)行高分辨率增強(qiáng)。我們發(fā)現(xiàn),直接降低推理分辨率會(huì)破壞模型原有特征,因此設(shè)計(jì)了噪聲重移位策略,讓模型在初始階段保留原始分辨率信息,后續(xù)再切換到低分辨率以提升效率。SURF 的意義在于,它不是簡(jiǎn)單壓縮生成流程,而是在盡量保持模型原始能力和風(fēng)格的前提下,加速高分辨率視頻生成。


論文鏈接:
https://arxiv.org/pdf/2512.12675
論文簡(jiǎn)介:主體驅(qū)動(dòng)圖像生成已經(jīng)可以處理多個(gè)主體,但在真實(shí)復(fù)雜場(chǎng)景中,一個(gè)更關(guān)鍵的問題是:當(dāng)輸入里有多個(gè)候選主體時(shí),模型能否準(zhǔn)確識(shí)別用戶真正想生成的那個(gè)主體。我們提出 Scone,重點(diǎn)補(bǔ)足這一“區(qū)分能力”。Scone 將理解專家和生成專家結(jié)合起來,讓理解模塊先承擔(dān)語義判斷和信息傳遞的角色,再引導(dǎo)生成模塊在減少干擾的同時(shí)保持目標(biāo)主體身份。訓(xùn)練上,我們采用兩階段策略:先學(xué)習(xí)多主體組合能力,再通過語義對(duì)齊和注意力掩碼增強(qiáng)區(qū)分能力。我們還提出 SconeEval,用于專門評(píng)估組合與區(qū)分表現(xiàn)。Scone 的價(jià)值在于,它讓主體生成不只是“把多個(gè)東西組合在一起”,而是能夠在復(fù)雜輸入中理解用戶意圖,并準(zhǔn)確生成指定對(duì)象。


論文鏈接:
https://arxiv.org/pdf/2601.04033v2
論文簡(jiǎn)介:視頻生成質(zhì)量評(píng)估不能只看畫質(zhì)、運(yùn)動(dòng)和文本對(duì)齊,還要關(guān)注畫面結(jié)構(gòu)是否合理。很多生成視頻中的問題并不是“不清晰”,而是物體外觀異常、交互關(guān)系錯(cuò)誤、結(jié)構(gòu)發(fā)生失真。我們提出 REACT,專門用于評(píng)估生成視頻中的結(jié)構(gòu)失真。它會(huì)對(duì)視頻幀進(jìn)行推理,識(shí)別可能的問題區(qū)域,并給出分?jǐn)?shù)和歸因標(biāo)簽。為訓(xùn)練這一模型,我們構(gòu)建了大規(guī)模人類偏好數(shù)據(jù)集,并建立結(jié)構(gòu)失真分類體系,同時(shí)結(jié)合思維鏈合成流程補(bǔ)充訓(xùn)練數(shù)據(jù)。REACT 采用監(jiān)督微調(diào)和強(qiáng)化學(xué)習(xí)兩階段訓(xùn)練,使模型既具備領(lǐng)域知識(shí),也能更貼近人類偏好。它的價(jià)值在于,為視頻生成提供了更細(xì)粒度、更可解釋的質(zhì)量評(píng)估工具,幫助模型不僅生成“好看的視頻”,也生成結(jié)構(gòu)更合理的視頻。


論文鏈接:
https://arxiv.org/pdf/2512.07831
論文簡(jiǎn)介:視頻生成模型正在變得越來越強(qiáng),但多數(shù)模型仍然依賴單一條件輸入,例如只看文本、姿態(tài)或深度中的某一種。這會(huì)限制模型對(duì)真實(shí)物理世界的整體理解。我們提出 UnityVideo,希望讓視頻生成模型能夠同時(shí)理解多種模態(tài)信息,包括分割掩碼、人體骨架、DensePose、光流和深度圖等。為了統(tǒng)一這些不同模態(tài)和訓(xùn)練方式,我們?cè)O(shè)計(jì)了動(dòng)態(tài)加噪機(jī)制、模態(tài)切換器和上下文學(xué)習(xí)器,并構(gòu)建了包含 130 萬樣本的大規(guī)模統(tǒng)一數(shù)據(jù)集。UnityVideo 的重點(diǎn)不只是“支持更多輸入條件”,而是讓模型學(xué)會(huì)把多種物理線索放在一起理解。實(shí)驗(yàn)結(jié)果也表明,這種統(tǒng)一學(xué)習(xí)方式能夠提升視頻質(zhì)量、一致性和零樣本泛化能力,讓生成結(jié)果更符合真實(shí)世界的結(jié)構(gòu)約束。


論文鏈接:
https://arxiv.org/pdf/2512.19686
論文簡(jiǎn)介:思維鏈機(jī)制已經(jīng)被證明可以提升模型生成能力,但我們發(fā)現(xiàn),當(dāng)前模型的“思考”更多圍繞文本提示展開,對(duì)視覺上下文的關(guān)注仍然不夠。這會(huì)帶來一個(gè)實(shí)際問題:生成過程中人物身份、物體屬性、畫面風(fēng)格等關(guān)鍵信息容易發(fā)生偏移。針對(duì)這一點(diǎn),我們把視覺上下文一致性引入模型推理過程,讓模型在生成前先明確“哪些視覺元素必須保持一致”,再在生成過程中不斷檢查和修正。具體來說,我們?cè)O(shè)計(jì)了自適應(yīng)視覺規(guī)劃和迭代式視覺校正兩個(gè)機(jī)制:前者生成視覺檢查清單,后者引導(dǎo)模型進(jìn)行反思和優(yōu)化。通過監(jiān)督微調(diào)和 Flow-GRPO 強(qiáng)化學(xué)習(xí),我們進(jìn)一步強(qiáng)化模型保持視覺一致性的能力。這項(xiàng)工作強(qiáng)調(diào)的是,多模態(tài)生成不能只“聽懂文字”,還要真正“記住畫面”。


論文鏈接:
https://arxiv.org/pdf/2511.16669v2
論文簡(jiǎn)介:語言模型已經(jīng)在很多實(shí)際場(chǎng)景中發(fā)揮價(jià)值,但視頻生成的應(yīng)用還遠(yuǎn)不止娛樂內(nèi)容。我們關(guān)注到,視頻天然適合表達(dá)動(dòng)態(tài)過程和物理操作,例如教學(xué)、演示、預(yù)測(cè)下一步動(dòng)作等。基于這一觀察,我們提出“視頻作為答案的下一個(gè)事件預(yù)測(cè)”任務(wù),讓模型不再只是用文字回答“接下來會(huì)發(fā)生什么”,而是直接生成一段動(dòng)態(tài)視頻作為答案。這意味著從“講述”走向“展示”。為實(shí)現(xiàn)這一目標(biāo),我們提出 VANS,通過強(qiáng)化學(xué)習(xí)將視覺語言模型和視頻擴(kuò)散模型對(duì)齊。視覺語言模型負(fù)責(zé)理解輸入并生成可視化描述,視頻擴(kuò)散模型負(fù)責(zé)把描述轉(zhuǎn)化為符合上下文的視頻。我們還構(gòu)建了 VANS-Data-100K 數(shù)據(jù)集。VANS 的意義在于,它拓展了視頻生成的使用方式,讓視頻成為一種更直觀、更具表現(xiàn)力的回答形式。


論文鏈接:
https://arxiv.org/pdf/2601.22275
論文簡(jiǎn)介:長(zhǎng)視頻生成對(duì)模型的上下文建模能力提出了更高要求,但傳統(tǒng)注意力機(jī)制的二次復(fù)雜度會(huì)帶來巨大計(jì)算壓力。我們提出 VMonarch,核心是利用視頻 DiT 中天然存在的稀疏時(shí)空注意力模式,用 Monarch 矩陣進(jìn)行高效表示和計(jì)算。簡(jiǎn)單來說,我們希望讓模型不再對(duì)所有時(shí)空位置進(jìn)行同等計(jì)算,而是更高效地捕捉真正重要的幀內(nèi)和幀間關(guān)系。VMonarch 通過時(shí)空 Monarch 分解建模視頻相關(guān)性,并結(jié)合重計(jì)算策略和在線熵算法,提升長(zhǎng)序列下Monarch注意力的穩(wěn)定性與計(jì)算效率。實(shí)驗(yàn)表明,它在保持生成質(zhì)量的同時(shí),大幅降低注意力計(jì)算量,并顯著加速長(zhǎng)視頻注意力計(jì)算。這項(xiàng)工作從新角度探索了視頻生成底層效率問題,為更長(zhǎng)、更復(fù)雜的視頻生成提供了基礎(chǔ)支撐。


論文鏈接:
https://arxiv.org/pdf/2511.23386
論文簡(jiǎn)介:統(tǒng)一多模態(tài)模型需要一個(gè)關(guān)鍵能力:用同一套表示同時(shí)支持理解、生成和重建。過去很多方法需要使用不同編碼器分別處理這些任務(wù),難以真正實(shí)現(xiàn)統(tǒng)一。我們提出 VQRAE,探索在單一分詞器中同時(shí)產(chǎn)生用于圖像理解的連續(xù)語義特征,以及用于視覺生成的離散令牌。具體來說,我們?cè)陬A(yù)訓(xùn)練視覺基礎(chǔ)模型之上構(gòu)建對(duì)稱 ViT 解碼器,并通過兩階段訓(xùn)練學(xué)習(xí)高維語義 VQ 碼本。這樣的設(shè)計(jì)既能保留語義理解能力,也能支持生成和細(xì)粒度重建。我們還發(fā)現(xiàn),高維碼本對(duì)語義量化非常關(guān)鍵,當(dāng)碼本維度達(dá)到 1536 時(shí),可以實(shí)現(xiàn)很高的利用率。VQRAE 的價(jià)值在于,它為統(tǒng)一模型提供了一種更兼顧理解與生成的視覺表示方式,也為未來自回歸多模態(tài)模型的擴(kuò)展提供了基礎(chǔ)。


論文鏈接:
https://arxiv.org/pdf/2602.03796
論文簡(jiǎn)介:人體運(yùn)動(dòng)控制是視頻生成中的重要能力,但現(xiàn)有方法通常依賴 2D 姿態(tài)或顯式 3D 參數(shù)模型。前者難以支持新視角,后者又容易受到重建誤差影響,限制視頻生成模型自身的 3D 感知能力。我們提出的 3DiMo,嘗試從更符合生成模型特點(diǎn)的 3D 感知視角重新理解運(yùn)動(dòng)控制。相比直接使用外部重建結(jié)果,我們采用隱式、視角無關(guān)的運(yùn)動(dòng)表征,讓運(yùn)動(dòng)信息自然對(duì)齊視頻生成器已有的空間先驗(yàn)。模型會(huì)將驅(qū)動(dòng)幀提煉為緊湊的隱式運(yùn)動(dòng)編碼,并注入到預(yù)訓(xùn)練視頻生成模型中。通過多視角監(jiān)督和幾何監(jiān)督,3DiMo 能夠?qū)W習(xí)更真實(shí)的 3D 空間運(yùn)動(dòng)理解。它的意義在于,讓人物運(yùn)動(dòng)控制不再只是“照著姿態(tài)畫動(dòng)作”,而是讓模型真正理解動(dòng)作在三維空間中的變化。


以上是可靈 AI 團(tuán)隊(duì)入選 CVPR 2026 的論文解讀。未來,可靈將繼續(xù)深耕視覺智能與生成式內(nèi)容技術(shù),以持續(xù)創(chuàng)新拓展 AI 影像創(chuàng)作的邊界,讓前沿技術(shù)更快走向真實(shí)場(chǎng)景,釋放更大的產(chǎn)業(yè)價(jià)值!
本專題其他文章