0
| 本文作者: 小七 | 2026-07-31 19:58 |

作者丨吳海明
編輯丨李 娜 馬曉寧
今天,MiniMax 發(fā)布了視頻旗艦?zāi)P?H3。在模型效果得到一眾創(chuàng)作者認(rèn)可之余,引人注意的是價格:H3 的價格僅為 Seedance 2.0 的三分之一。
更關(guān)鍵的是:即將開源了。這是第一個做到這個水平的開源視頻模型。接下來的事,可能會改變整個行業(yè)的游戲規(guī)則。
當(dāng)一個旗艦?zāi)芰Φ囊曨l模型開始開放,視頻生成會不會復(fù)制 Stable Diffusion 曾經(jīng)在圖像生成領(lǐng)域掀起的生態(tài)擴(kuò)散?而 MiniMax,又能否借此在視頻生成賽道中,走出一條不同的路?
下面,我們從模型能力、行業(yè)位置和開源意義三個層面,拆解 H3 為什么值得關(guān)注。

01
H3 的重點(diǎn)不僅是視頻模型,而且是通用多模態(tài)。H3 把文本、圖片、音頻、視頻等素材納入同一個上下文,由模型統(tǒng)一理解創(chuàng)作意圖,并在此基礎(chǔ)上完成從腳本理解、分鏡生成、角色與場景保持、動作遷移、音畫同步,到字幕、品牌文字、轉(zhuǎn)場包裝和局部編輯等一系列任務(wù),最終一次性生成更接近商業(yè)成片的視頻內(nèi)容。

Artificial Analysis 最新榜單截圖
在 Artificial Analysis 最新的視頻編輯排行榜單中,MiniMax H3 以 1130 Elo 排名第一,領(lǐng)先 Google Gemini Omni、字節(jié) Seedance 2.0等模型。
榜單排名證明了 H3 的效果水平,但真正決定其商業(yè)價值的是它能否進(jìn)入真實的商業(yè)應(yīng)用場景。相比單純生成畫面,H3 更強(qiáng)調(diào)編輯、文字、聲音和素材參考的一體化能力。經(jīng)過實測,其差異化能力可以體現(xiàn)在下面三個方面:
1.全模態(tài)精準(zhǔn)編輯。H3 支持在已有視頻上進(jìn)行換人、換物、換背景、綠幕合成、改臺詞、調(diào)光影和視頻續(xù)寫等操作。
2.復(fù)雜文本的保持與視覺融合。視頻中的文字需要在連續(xù)幀中保持穩(wěn)定,不能變形或漂移。H3 在電影片頭字幕、產(chǎn)品 UI 文字、動態(tài)海報排版等場景中極具優(yōu)勢。
3.一站式成片。H3 將畫面生成、聲音生成、文字呈現(xiàn)和鏡頭節(jié)奏整合在同一模型中,讓用戶無需依賴額外后期處理流程即可獲得交付所需的完整視頻片段。
Prompt:兩位魔術(shù)師站在舞臺上面向觀眾表演互換魔術(shù):兩人同時揮動魔杖,一陣煙霧升起。煙霧散去后,兩人的西裝顏色互換——左邊的人穿白色西裝,右邊的人現(xiàn)在穿黑色西裝,但兩人手套顏色不變。兩人鞠躬致謝,身后的紅色幕布拉上,從深紅色漸變?yōu)樯钏{(lán)色。H3(上)抽卡成功率非常高,Seedance(下)略遜一籌。
此外,H3 的價格僅為 Seedance 2.0 的 1/3,H3 的競爭力并不只體現(xiàn)在模型效果上,也體現(xiàn)在性價比上。對于需要高頻生成和快速迭代的商業(yè)場景而言,其商業(yè)化吸引力有望進(jìn)一步放大。
整體來看,H3 的看點(diǎn)是 MiniMax 試圖把視頻生成、音頻生成、素材參考和視頻編輯等特定任務(wù)統(tǒng)一到一個模型框架中。

02
H3 如何統(tǒng)一多個模態(tài)的
創(chuàng)作鏈路,還能保持模型泛化?
根據(jù) MiniMax 官方公眾號分享,H3 的技術(shù)目標(biāo)是實現(xiàn)任務(wù)的統(tǒng)一和泛化。
多模態(tài)模型面臨多種能力要求:圖像生成中有文生圖、圖像編輯、主體參考等任務(wù);聲音生成中有人聲、音效、音樂等不同模型;視頻生成則進(jìn)一步細(xì)分為文生視頻、圖生視頻、視頻編輯、動作參考等能力。

H3 生成的技術(shù)路線圖
與現(xiàn)有多模態(tài)生成模型由多個專家模型組成不同,H3 以語言作為泛化的橋梁,將這些能力納入同一個預(yù)訓(xùn)練范式:文生視頻可以同時生成畫面和音頻,聲音不再區(qū)分人聲、音效和音樂,參考與編輯關(guān)系也通過自然語言描述,不用依賴固定功能入口,并構(gòu)建四項核心技術(shù):
1.Contextual Omni Representation:增強(qiáng)多模態(tài) Caption 能力,使模型在描述目標(biāo)視頻的同時,還能理解素材之間、素材與目標(biāo)視頻之間,以及畫面與聲音之間的關(guān)系。
2.H3-VAE:升級視頻 tokenizer,在重建質(zhì)量和壓縮效率上提升。官方稱其帶來 4 倍序列長度收益,是 H3 支持原生 2K 輸出的關(guān)鍵。
3.H3-Omni Transformer:采用理解與生成異構(gòu)的訓(xùn)練架構(gòu),并通過樣本間負(fù)載均衡,將端到端訓(xùn)練吞吐提升近 30%。
4.In-context Regeneration:與傳統(tǒng)專用超分模塊不同,H3 讓基模基于低分辨率結(jié)果和上下文信息重新生成 2K 細(xì)節(jié),以提升小文字、紋理和畫面細(xì)節(jié)的還原能力。

03
要理解 H3 的位置,得先回顧一下視覺內(nèi)容生產(chǎn)工具這些年的演進(jìn)歷程。過去十多年,視覺生產(chǎn)經(jīng)歷了從專業(yè)軟件、AI 輔助工具、圖像生成模型,再到視頻生成模型的連續(xù)躍遷。H3 所處的節(jié)點(diǎn),正是視頻模型從素材生成走向商業(yè)級成片級交付的關(guān)鍵階段。
在生成式 AI 出現(xiàn)之前,視覺內(nèi)容生產(chǎn)主要依賴專業(yè)軟件完成。修圖靠 Photoshop,動效包裝靠 After Effects,剪輯靠 Premiere,調(diào)色靠 DaVinci Resolve,導(dǎo)致一條十幾秒的廣告短片,往往需要設(shè)計、剪輯、后期、動畫師等多個角色協(xié)同完成。在這一時期,雖然專業(yè)軟件提供了足夠強(qiáng)的創(chuàng)作能力,但也抬高了內(nèi)容生產(chǎn)的技術(shù)門檻和協(xié)作成本,導(dǎo)致視頻的制作成本極其昂貴。
緊接著,在 2016 年前后 AI 開始以輔助工具的形態(tài)進(jìn)入這條生產(chǎn)流水線。自動摳圖、智能修圖、視頻補(bǔ)幀、內(nèi)容識別填充等功能逐漸普及,幫助創(chuàng)作者減少重復(fù)勞動。但在這一階段,AI 工具更多是嵌入既有軟件體系中的效率插件,承擔(dān)輔助工作。
2021 到 2023 年,Midjourney、Stable Diffusion讓AI內(nèi)容生成成為現(xiàn)實,其中 Stable Diffusion 的開源尤其關(guān)鍵,圍繞開源模型催生出了LoRA、ControlNet、ComfyUI等完整生態(tài),形成了“開發(fā)者做插件,創(chuàng)作者搭工作流,企業(yè)訓(xùn)行業(yè)模型,云廠商做推理優(yōu)化”的新型產(chǎn)業(yè)格局。由此證明了一件事:一個足夠強(qiáng)的開源模型,往往會成為整個生態(tài)的底座。
早期視頻模型只能生成幾秒鐘片段,人物容易變形,物體邊界閃爍,動作連續(xù)性差,更像會動的圖片。2023 年下半年之后,Runway、Pika、可靈、海螺、Vidu 等產(chǎn)品把 AI 視頻從幾秒 Demo推向可用素材:分辨率提升,時長變長,運(yùn)動穩(wěn)定性也更好。越來越多的社媒短片、電商素材、廣告創(chuàng)意開始真正使用 AI 生成內(nèi)容。
但這一階段的大部分視頻模型仍然停留在素材級。創(chuàng)作者可以用模型生成一段畫面,但要變成能交付的廣告、短劇片頭、游戲預(yù)告或產(chǎn)品視頻,還需要回到剪映、Premiere、After Effects 里做剪輯、包裝、字幕、調(diào)色、合成和音效。這也是為什么 2024 年之后,視頻模型的競爭標(biāo)準(zhǔn)發(fā)生了變化,行業(yè)開始看誰更接近真實生產(chǎn)流程。
OpenAI 的 Sora 曾經(jīng)被視為視頻生成賽道正式進(jìn)入加速期的標(biāo)志性事件,Google Veo 系列繼續(xù)以高畫質(zhì)、原生音頻和復(fù)雜場景生成維持質(zhì)量標(biāo)桿,字節(jié) Seedance 則把視頻模型推向更高可用性,尤其在鏡頭一致性、動作表現(xiàn)和商業(yè)素材生成上獲得大量關(guān)注。一些創(chuàng)作者已經(jīng)開始用 Seedance 替代部分實拍環(huán)節(jié),尤其是在廣告創(chuàng)意預(yù)演、短片概念片、電商展示和社交媒體素材中。已經(jīng)開始替代一部分為了驗證創(chuàng)意而拍的低成本實拍需求。
過去線性的視頻生產(chǎn)流程正在被 AI 模型壓縮:從素材生成、剪輯包裝到調(diào)色配音,越來越多原本需要后期完成的執(zhí)行環(huán)節(jié),開始被模型直接吸收進(jìn)生成過程。創(chuàng)作者仍負(fù)責(zé)節(jié)奏、審美和商業(yè)判斷,但單位內(nèi)容的生產(chǎn)成本、交付周期和試錯速度正在被改寫,而 H3 正是卡在這一轉(zhuǎn)折點(diǎn)上。
H3 的設(shè)計明顯是沖著真實生產(chǎn)場景去的,是沖著商業(yè)級成片交付去的。
這些任務(wù)考驗的更多是商業(yè)視頻生產(chǎn)中最核心的幾件事:文字能不能保持穩(wěn)定,品牌信息能不能準(zhǔn)確出現(xiàn),鏡頭之間有沒有節(jié)奏,聲音和畫面能不能同步,包裝是不是像一個完整交付物,而不是一段孤立素材。
比如,H3 把一部分后期包裝能力前置到模型內(nèi)部,實現(xiàn)了AI原生后期。
在海外開發(fā)者 @hasantoxr 的測試中,H3 可以給實拍視頻增加手繪發(fā)光動畫,通過自然語言描述即可指揮動畫路線,可以并匹配場景光線同時保留真實光影關(guān)系。過去,這類工作通常屬于 Adobe AE 和人工后期的領(lǐng)地;視頻模型更多只是提供原始素材,再由創(chuàng)作者拿回后期軟件精修。
如果 H3 的這些能力能夠在真實工作流中穩(wěn)定復(fù)現(xiàn),那 H3 代表的將多模態(tài)模型發(fā)展歷程上的一次新的突破:從生成素材,進(jìn)一步走向理解內(nèi)容、執(zhí)行包裝、完成編輯和接近交付。這也是 H3 在行業(yè)中的真正位置:它處在視頻模型從文娛工具轉(zhuǎn)向工業(yè)生產(chǎn)力工具的拐點(diǎn)上。過去 AI 視頻的主要價值是能不能生成,現(xiàn)在工業(yè)界真正關(guān)心的是能不能交付,H3 要回答的,正是后一個問題。

04
如果說 H3 的商業(yè)級成片交付能力是“本分”,那么開源才是它真正試圖撬動行業(yè)格局的地方:MiniMax 不僅是把一款視頻旗艦?zāi)P屯葡蚴袌觯€把它交給開發(fā)者、企業(yè)和創(chuàng)作工具鏈共同改造。
在大模型行業(yè),開源并不罕見,但在視頻生成領(lǐng)域,真正具備頭部能力的模型開放權(quán)重,仍是少數(shù)事件。原因在于,視頻模型的訓(xùn)練成本、推理成本、數(shù)據(jù)組織和工程復(fù)雜度都遠(yuǎn)高于文本與圖像模型,越接近旗艦?zāi)芰ΓP蛷S商越傾向于用閉源產(chǎn)品和 API 回收成本。
此前,視頻生成的開源陣營中,阿里萬相、騰訊混元視頻、LTX 等模型較為活躍,但與 Seedance 這樣的閉源旗艦相比,行業(yè)普遍認(rèn)為仍存在能力差距。H3 的特殊之處不僅在于效果比肩 Seedance 2.0 和價格只有 Seedance 2.0 的 1/3,而且它是第一個業(yè)內(nèi)旗艦級別的開源多模態(tài)模型。
H3 發(fā)布后,開源消息迅速在開發(fā)者社區(qū)傳播,這種反應(yīng)也在一定程度上說明了:市場長期缺少一個足夠強(qiáng)、可部署、可定制的視頻模型底座。
▎企業(yè)側(cè):獲得部署、數(shù)據(jù)與工作流的控制權(quán)
H3 首先補(bǔ)上的是企業(yè)級部署的缺口,對大公司來說,數(shù)據(jù)本身就是護(hù)城河。廣告、影視、游戲、電商等行業(yè)的視頻生產(chǎn),往往涉及未公開產(chǎn)品、品牌資產(chǎn)、用戶畫像、人物形象、商業(yè)腳本和內(nèi)部創(chuàng)意方案。這些內(nèi)容一旦上傳到第三方閉源模型,就意味著企業(yè)要承擔(dān)數(shù)據(jù)外流、知識產(chǎn)權(quán)歸屬不清和商業(yè)機(jī)密泄露的風(fēng)險。
這種顧慮并非空穴來風(fēng)。此前,三星曾因員工將敏感代碼上傳至 ChatGPT 而限制內(nèi)部使用生成式 AI 工具;摩根大通也曾限制員工使用 ChatGPT,原因之一正是數(shù)據(jù)隱私和合規(guī)風(fēng)險。這說明,企業(yè)不敢輕易讓核心數(shù)據(jù)進(jìn)入外部黑箱,閉源 API 雖然方便,但企業(yè)無法完全掌握數(shù)據(jù)是否被留存、是否進(jìn)入訓(xùn)練集,以及生成內(nèi)容背后的權(quán)利邊界。
H3 開源后,企業(yè)可以選擇私有化部署,把模型放在自己的服務(wù)器或私有云中運(yùn)行。電商平臺的商品庫、游戲公司的角色資產(chǎn)、短劇公司的演員形象和場景素材,都可以留在企業(yè)內(nèi)部系統(tǒng)中完成調(diào)用。相比完全依賴第三方 API,這不僅有助于降低高頻生產(chǎn)下的邊際成本,更重要的是讓數(shù)據(jù)安全、知識產(chǎn)權(quán)和生產(chǎn)流程重新變得可控。
▎生態(tài)側(cè):H3能否成為視頻領(lǐng)域的開放底座?
私有部署只是第一層價值,對行業(yè)而言,H3 開源更大的意義是讓視頻模型具備被定制和擴(kuò)展的可能。
視頻生產(chǎn)本身并非標(biāo)準(zhǔn)化場景。電商關(guān)注商品準(zhǔn)確性和轉(zhuǎn)化效率,游戲關(guān)注角色一致性和動作風(fēng)格,影視短劇關(guān)注人物連續(xù)性和情緒節(jié)奏,廣告則強(qiáng)調(diào)品牌規(guī)范和視覺調(diào)性。閉源模型再強(qiáng),也很難用一個統(tǒng)一入口覆蓋所有細(xì)分需求。
開源后,企業(yè)和開發(fā)者可以基于 H3 微調(diào)、適配和二次開發(fā),訓(xùn)練更懂商品、角色、品牌資產(chǎn)或鏡頭語言的行業(yè)版本,也可以將其嵌入剪輯工具和創(chuàng)作平臺,形成從素材生成、鏡頭續(xù)寫、聲音合成到包裝交付的一體化工作流。
圖像生成領(lǐng)域已經(jīng)證明,強(qiáng)開源底座往往會催生插件、微調(diào)模型、工作流模板和行業(yè)應(yīng)用。若視頻領(lǐng)域也出現(xiàn)類似底座,圍繞 H3 的推理優(yōu)化、風(fēng)格模型、行業(yè)插件和創(chuàng)作工具鏈也可能隨之形成。
因此,H3 開源不僅是讓企業(yè)放心使用,更是視頻模型從一家公司的封閉產(chǎn)品,變成可以被企業(yè)部署、被行業(yè)微調(diào)、被開發(fā)者擴(kuò)展的開放基礎(chǔ)設(shè)施。視頻模型的競爭也會從單純比較畫質(zhì)和價格,轉(zhuǎn)向比較誰能形成更強(qiáng)的生態(tài)密度、定制能力和產(chǎn)業(yè)滲透率。因此,H3 開源釋放了一個明確信號:視頻生成的競爭,正在從閉源旗艦之間的單點(diǎn)能力比拼,進(jìn)入開放生態(tài)和產(chǎn)業(yè)落地能力的綜合競爭。