0

作者丨Rhea
編輯丨馬曉寧 李娜
7月18日,在2026世界人工智能大會(WAIC)現場,智象未來正式發布全球首個無限時長內容創作多模態智能體vivago R1,隨后,智象官宣已經完成了 C 輪融資,在近三個月完成超 20 億元人民幣的融資。

01
2026 年 6 月 23 日,伯克利哈斯商學院官網發過一篇專欄評論 Insight 文章,作者 Akash Rathi 是谷歌 Pixel 的產品經理,里面提到一個關鍵的判斷和論點(作者表示僅代表個人不代表谷歌):
模型和編排框架都在商品化;
純軟件的 Agent,包括編排層恰恰是護城河最弱的,類似"幾周就能被克隆""一鍵導入就能搬走"的質疑一直存在
所以護城河從大腦(模型)遷移到 Physical Experience(物理體驗)

圖注:《The AI Moat Is Migrating – And Most Leaders Are Looking in the Wrong Place》
另一邊在資本市場上,Cursor 在 2026-06 被 SpaceX 以 600 億美元收購,之前 Manus 差點以 20 億美金收購,最近 OpenRouter 也在和多家科技巨頭談收購機會。而就在幾天前,智象未來剛宣布完成 15 億元 C 輪融資,近三個月累計融資超 21 億元,正式躋身獨角獸行列。
Manus 已經證實了聚合是手段,編排出來的體驗才是人們真正需要的產品。現在面對這大把的開源模型,誰都能做微調,但是看著用戶需求在自己的沙箱里一步步完成的成就感才是產品人最 aha 的時刻。所以在面對平臺型的 AI 產品時,我們更應該關注的是在人人都能聚合的前提下,它在上面多做的那層 Agent 編排,有沒有做出別人做不出的、能驗證的東西 。
這個問題的區別就是我們做這個測評的核心。想清楚了就知道 vivago R1 這類產品該怎么看;想不清楚,就會永遠卡在又一個套殼的條件反射里,既高估了它也低估了它。vivago R1 只是這個更大問題的一個切片。這款產品于 2026 年 WAIC 大會期間剛剛發布,號稱全球首個具備無限時長視頻生成與編輯能力的多模態創作智能體,核心賣點是“長、長、穩”——無限時長、長任務思考、高穩定生成,也正是這次實測要驗證的東西。

vivago.ai 官網

02
vivago的母公司是智象未來(HiDream.ai),2023 年 3 月成立在北京,創始人兼 CEO 是梅濤。這個名字在計算機視覺圈不算陌生,他之前是微軟亞洲研究院的高級研究員,后來是京東的高級副總裁,2025 年當選 ACM Fellow。
智象未來的定位是「全球唯一同時支持文本、圖像、視頻、3D 四個模態的基礎模型廠商」,此前開源過文生圖模型 HiDream-I1。vivago 是智象面向專業創作者的那個智能體平臺。

vivago R1 是目前最新的模型
但要理解 vivago R1 到底新在哪,也許得看看它的前身——就在兩個月前,2026 年 5 月,智象在 Product Hunt 上發過一個叫 Vivago Video Agent 的產品,靠一群 AI 導演幫你編角色、寫敘事、做故事板,還能在渲染前先看關鍵幀。當時它拿了當日產品榜第一。但那個版本的輸出時長封頂就是3分鐘,無法再長了。

Vivago Video Agent 評測:R1 的前身五個月前登上 Product Hunt 當日第一,當時單條視頻還封頂在 3分鐘
兩個月后,vivago R1 的目標是做到 無限時長 視頻創作。
這是全球首個具備無限時長視頻生成與編輯能力的多模態創作智能體,標志著AI在創意生產領域的一次范式轉移:從輔助生成單點素材,進化為能夠自主規劃、調度并完成長鏈路創作任務的“智能搭子”。vivago R1的核心優勢可以概括為“長、長、穩”三大特質,精準回應了行業長期存在的時長受限、邏輯混亂、效果不穩三大痛點:
▎一是無限時長,全場景無限制適配。
當前行業主流AI視頻產品僅支持15-30秒短鏡頭生成,vivago R1徹底打破行業時長壁壘,支持長時長視頻連續、連貫生成,全面適配短劇、專題片、品牌宣傳片、影視成片等不同品類長周期創作場景,填補了行業長視頻創作的市場空白。
▎二是長任務思考,保障創作邏輯連貫統一。
vivago R1 具備長任務推理能力,可自主完成精細化邏輯構思、鏡頭排布與風格校準等,有效解決AI生成視頻的畫面跳變、人設崩塌、敘事斷層、風格割裂的行業難題,保障全片創作的完整性與專業性。
▎三是高穩定生成,賦能商業規模化交付。
依托 AgentOS 全流程調度與治理能力,vivago R1 實現創作全鏈路可控可校準,將內容有效可用成功率提升至85% 左右,遠高于行業平均水平,極大降低反復修改調試的時間與人力成本,生成內容可直接應用于商業制作、品牌傳播與市場化交付。

03
▎第一,編排是這條賽道的正路,不是偷懶。
很多人一聽 它自己編排別人的模型 ,就覺得沒技術含量。但這恰恰是長視頻生成領域現在的主流解法。2026 年有一批做長片生成的論文,比如那套 ScripterAgent 寫腳本、DirectorAgent 去編排多個 SOTA 視頻模型、再用 CriticAgent 校驗的框架,走的都是 編排現有模型 + 保長程一致 這條路,而不是從零訓一個能一口氣生成十分鐘的巨型模型。

騰訊團隊的長視頻 Agent 研究顯示,主流做法都是"編排現有 SOTA 模型 + 跨鏡頭縫合",因為單段模型一次只能生成約 8–12 秒
因為單個視頻模型受物理限制,一次能穩定生成的時長就是有限的;要出長片,編排幾乎是唯一現實的路。 所以 vivago R1 選擇做編排層本來在方向上就是被行業已經證實的。
▎第二,長片生成確實是苦天下久矣。
今天主流的 AI 視頻,絕大多數還卡在秒級到兩分鐘:谷歌 Veo 3.1 單段大約 8 秒、多鏡頭拼到一兩分鐘,OpenAI Sora 2 大約 60 秒(而且消費端在 2026 年 4 月已經關停了),快手可靈 3.0 號稱 導演級 、能到兩分鐘。換句話說,如果 vivago R1 真能穩定產出五分鐘以上、還連貫不崩的成片,那它踩中的絕對是一塊真實的市場空白和需求
▎第三,野心的方向是對的。
Sora 2 很早都到 60 秒了,它和 vivago R1 都想解決的問題是短鏡頭再好看,也拼不出一部能敘事、有人物、風格統一的片子。 長視頻不是短視頻的簡單拼接——這句官方自己都承認的話,恰恰是這件事最難的地方。所以從以上調研的情況來看,R1 的產品決策是想清楚過的,不是蹭熱點。 但 決策對 不等于 做得好 。方向選對了,能不能在一條五分鐘的片子里真把活干成是另一回事——接下來我們就通過實測看看真實表現

04
現在聲稱自研的團隊太多了,也許很多人同樣也好奇 vivago 究竟有哪些創新和自研?
1.底層那個真正生成畫面的視頻模型,是自研的嗎?
2.還是說上面那層做規劃、編排、保一致性的 Agent 是自研的?
這兩件事的含金量完全不同,也對應完全不同的故事。現有的公開證據指向一個比 純自研 或 純套殼 都更微妙的答案:
聚合側:上文有提到 vivago 自己的 llms.txt 列了 Sora 2 / 可靈 v2.6 Pro / Veo 3 / Veo 3.1 + 自研 Vivago 2.0,并自稱 多模型平臺而非單一模型工具 。

vivago llms.txt:vivago 官網給 AI 看的說明文件里描述了自己是聚合 Sora 2、可靈、Veo 加自研 Vivago 2.0 的多模型平臺。
自研側:智象確實有自己的HiDream-O1-image 系列以及 video系列的自研模型——Vivago 2.0/2.1(圖像+視頻)在第三方評測站被獨立測過(該視頻模型現在已經改名叫 HiDream 2.0);公司也確有多模態自研底座的積累。

第三方模型庫把 Vivago 2.1 列為智象自研的圖像生成模型
也就是說 vivago 是一個 自研模型+ 聚合第三方視頻模型 + 上層 Agent 編排 的混合體。
R1 的獨家價值,大概率不在 底層畫面全是自研模型畫的 ,而在編排 + 長程一致性 + 長片能力這個領域。
后來生成視頻的過程我通過逆向發現了一些有意思的信息:
首先請求的域名都在 vivago 自己家,沒有任何第三方模型域名,說明模型調用全在服務端完成,前端只跟 vivago 網關對話。這是編排型平臺的典型架構,也意味著底層調誰無法從域名層看出來。
vivago R1 是一個技能驅動的編排 Agent(同 Kimi Work / Anthropic Skills 譜系),17 個功能技能,覆蓋視頻/圖像/電商/社媒等垂類。其中 cinematic-story-director 是最成熟的旗艦,后面實測我也發現效果最好的就是這個skill
模型被功能和技能抽象了,前端全程看不到模型名。比如用戶看到的是 text-to-video、reference-to-video、cinematic-story-director,沒有一個按模型命名。也就是說模型路由完全在服務端、被技能層封裝。用戶(乃至客戶端層面的技術觀察者)選的是"能力"(拍個電影故事/參考圖生視頻),而不是某個模型
技能參數里 duration 枚舉 = 4,5,…,15 秒(默認 5)。→ 把之前"10s 封頂"細化為單段 ≤15秒;后面測試發現每段用了 10s。長視頻仍是多段拼接。另外 generate_audio 默認 true(會配音頻)。
這些分析證明 vivago 的產品定義非常清晰,用戶不需要去選擇模型供應商,就像我們不會問水電來源于哪家公司,面包里的面粉來源于那個牧場。大部分用戶需要的永遠是某個能力,而不是模型本身。說實話這讓視頻生成變的非常簡單和純粹,用戶只需要關心我到底想要什么樣的視頻,而不需要再去糾結哪個模型什么更好,哪個更經濟實惠,這些都由 vivago 的路由做了。

05
和自研一樣, 無限這個詞也得拆解開看。時長可以無限 和 一致性可以維持的有效時長 是兩件完全不同的事。
一個視頻能不能一直生成下去(時長無限),這在工程上不難,分段生成、首尾相接就行。
生成出來的東西能不能一直連貫、人不崩臉、風格不跳、故事不斷——這才是真正難的地方,也是官方點名要解決的四個問題:畫面跳變、人設崩塌、敘事斷層、風格割裂。
▎案例一 葉什爾查姆風格的荒誕科幻爛片
因此我沒有用生成一條美食 vlog 這種誰都會測的題。而是設計了一個既有意思,又能能符合vivago 核心賣點的測試題:一部葉什爾查姆風格的荒誕科幻爛片。
葉什爾查姆是土耳其上世紀六到八十年代那批超低成本邪典片,最出名的就是 土耳其星戰 那種——真人套著硬紙板噴銀漆的怪獸服、泡沫塑料石頭、手繪的外星球背景、演員綁著石頭在蹦床上 飛 、把真實爆炸鏡頭直接剪進去。它的精髓是廉價,假得好笑 。
這道測試題有幾個特點:
1.夠荒誕、夠好笑,天然是文章和視頻的傳播爆點;
2.多鏡頭、多機位、劇烈動作,把人設、道具、風格、敘事的一致性全壓上;
3.跨場景的長敘事,正好測無限時長 ;
4.還有最有意思的一點:AI 的美化本能 與刻意的廉價之間會有博弈 。AI 的默認傾向是把畫面往精致、真實里渲染,所以我們經常看到很多審美坍縮的 AI臉。而這部片子要求它維持廉價感的美學。比如對于那個硬紙板怪獸 R1 會不會忍不住把它偷偷渲染成一個光滑精致的 CGI 機器人? 如果會,那就是底層大模型的審美預設壓過了 Agent 的指令,也就是常見的編排失控、風格漂移等問題。
從結論上來看成片可以說非常驚艷。
一分十一秒的成片,敘事、鏡頭、切換都很順,場景、人物、道具從頭到尾幾乎不崩——那個八字胡紅緊身衣的阿里隊長、那個漏勺當頭盔的紙板怪獸,從頭到尾都是一個形象。廉價美學也守住了,沒被偷偷渲染成精致 CGI。
如果非要挑毛病的話,41 秒左右有三四秒畫面突然發黏、細節垮掉,風格和前后對不上,略微有點出戲;還有一分鐘處背景從天臺悄悄漂到了影棚,不過第一遍幾乎看不出來,我回放了三四次才發現。這質量放在今天的 AI 視頻里完成度打 95 分都不過分。

從 Agent 的過程日志來看,它跑的是一個叫 cinematic-story-director 的 skill,是一條 Node0→Node9 的流水線:
理解任務(N0) → 故事初稿(N1) → 視聽劇本(N2) → 拆分場景(N3) → 美術指導(N4) → 生成角色/場景/道具的"鎖定參考圖"(N5) → 文字分鏡(N6) → 視頻提示詞(N7) → 逐場景生成視頻(N8) → 拼接成片(N9)。也就是說它先把我的構思寫成故事、改成劇本、拆成一個個場景、定好統一的美術風格,然后單獨生成"阿里隊長""外星后院""機器暴君"這三張鎖定的參考圖,再讓每一個鏡頭都對著這同一套參考圖去生成,最后縫合成整片。從日志上來看短片 41 秒處突然發粘的畫面應該就是某一段模型輸出質量有偏移導致的。
從這個案例來看,幾個問題都有了答案:
1.無限時長還是無限拼接 —— 工程上是拼接,體驗上是時長,畫面之間的轉換縫的特別好。日志能看出它把片子拆成 7 個場景、各自獨立生成、最后 Node9 采取拼接。

最后一步,7 段分鏡被嚴絲合縫地拼成一部完整短片
2.驚艷的一致性靠的是工程編排。這個機制在 Node5 出現,它先單獨生成了 A01 阿里隊長、A02 外星后院、A03 機器暴君的鎖定參考圖,然后 Node8 給每一個分鏡都用同一套參考圖做"參考圖生視頻"。一致性來自"鎖參考圖 + 逐段參考圖生視頻",而不是來自某個模型的長程記憶。

開拍前,R1 先給主角出了一張三視圖定妝照,之后每個鏡頭都照著它生成,這就是全片人物從頭到尾不崩的秘密。
3.長任務思考是真的規劃。它不是調個 API 直接出片,而是走了"故事→劇本→拆場景→美術→參考圖→分鏡→提示詞"這么一整套結構化規劃。這是真正的長任務思考,并不是用固定模板填空。而且它是 skill 驅動的(和 Kimi Work 的 SKILL.md、Anthropic Agent Skills 同源)。

沒急著出片,先寫好一集完整劇本、鎖定角色/場景/道具清單
最最有意思的是,官方所說的無限時長肯定不能簡單的理解為一次能生成一部兩小時的電影,這不科學也不符合第一性原理。我理解這應該是指在長時間的制作中,具體的形象、道具、場景都能被固化為資產可復用,因此就能一直接著生成,每次都能順著故事講下去。我試著把土耳其隊長的故事繼續往下寫了一個,沒想到的是一致性真的非常好,人物、機器人形象高度統一,該換的換了,不該換的沒換。
接下來請欣賞土耳其隊長第二集:

06
上面這一個案例講透,應該足夠讓大家認識 vivago 了。不過一部荒誕短片,主要測的是它「長片一致性 + 編排」這一面;而創作者在真實工作里會撞上的坑,遠不止這一個。
所以后面這幾條,我沒挑它最擅長的去秀肌肉,而是每一條都對準一個「創作者天天會遇到、又剛好能驗證某項具體能力」的場景,來把對它的認識補全——一條打形象可控(我要的是我自己的那個形象,不是 AI 瞎編的近似版),一條打理解力(給它一個現實里根本不存在的產品,看它是不是真能看懂),一條打批量生產(能不能一口氣把一整個系列出完,而不用我一條條手動拼)。三個方向,正好是長片之外,創作者最容易翻車、也最想讓 AI 替自己扛下來的三件事。
▎案例二《狗狗特工隊》
這是一個無厘頭默劇短片,主要想驗證一下在復雜的人類動作上,是否能保證狗狗的身上不會長出人手人腳,并且在跨時間的視頻生成中能否保證寵物形象的一致性。從生成結果上來看狗狗的肢體沒出現任何漂移,哈士奇段落稍微有些假,并且車廂煙花和整個片子的風格不太像,可能是因為服務端切換模型有漂移。但瑕不掩瑜,總體質量很高,而且依舊是嚴格按照提示詞來走的。
▎案例三 一個不存在的產品宣傳片
官方一直說它"能理解任務"。那就給它一個現實里根本不存在的產品。我編了一個腦洞智能硬件:"裝在廚房吊柜下、把菜譜步驟直接投到料理臺上、說一聲下一步就翻頁、全程不用手碰"的投影模塊,讓它做一條發小紅書的豎版宣傳片。用不存在的產品,就是因為它沒有現成素材可抄,必須真"看懂"這個東西是什么、怎么用,才拍得對。
總體來看在產品演示這種很復雜的場景里面,vivago 的表現就相對其他案例稍遜一籌,因為不管是模型還是編排都很難去理解這個不存在的產品是怎么用的,這涉及到世界模型的范疇了,用大語言/多模態模型來做確實有點難,因此視頻中出現幾個空間位置不符合產品邏輯的也能理解。總體完成度還是很高,這是毋容置疑的。
▎案例四 十二星座安全屋和戰場魔法果實
不知道大家有沒在社交媒體刷過這種視頻,創作者的痛點是如果我要做十二星座,我必須生成十二個視頻剪輯起來,觀眾的痛點是你標題寫著十二星座,實際上我進去只能看三分之一,根本就沒后續。這都是因為創作者使用多個短視頻手動搓成一個長視頻的。所以我想不如試試 vivago 能否一口氣把成品都出了。

結果真的非常驚喜,我在提示詞里面其實沒把十二星座枚舉出來,說實話跑之前還是挺擔心成品出問題,但我沒想到的是在規劃階段 vivago 真的把十二星座全部生成圖片并進流程了(甚至還多了一個,不知道是什么隱藏星座),這真的讓我大松一口氣,我原本已經準備重新跑了(主要是花費時間和積分成本)。
從生成結果來看確實能把很多個場景串起來,不需要用戶手動拼接,這真的太棒了。至于視頻內容里面的穿幫、細節、運鏡,是和提示詞相關的,如果經過良好的提示詞打磨必定能生成質量非常不錯的內容。
戰場魔法果實的成片也非常驚喜,場景、音效都很棒,要知道這只是簡單幾句提示詞出來的效果,如果提示詞上下點功夫去好好定義需求,完全可以用到生產級別的場景中。

07
把鏡頭從 vivago R1 這一個產品拉回整個行業會看到個越來越確定的趨勢。
視頻生成的模型能力正在變成水電一樣的基礎設施。
兩年前誰的模型畫得更清晰、更連貫就是絕對的勝負手。但到了 2026 年,Sora、可靈、Veo、海螺、即夢……第一梯隊的畫質差距在收窄,而且大多開放了 API——任何一個平臺,都能把這些最強的模型接進來。 模型本身越來越像一種隨時能采購的原材料。
當原材料變成標準供應商品的時候,稀缺性就會發生轉移:從誰的模型更強,轉移到誰能把一堆模型,編排成一個真正能干活、能交付的系統。這正是 vivago R1 這類創作 Agent 押注的地方——它不跟你比底層模型畫得好不好,它跟你比"從你腦子里一個'我想拍條片'的念頭,到一條能直接發出去的成片"之間,那段最臟、最累、最需要懂鏡頭語言和敘事的活,它替你干掉了多少。
這事兒其實特別像去超市買東西。可樂、伊利、金龍魚這些成熟商品早就在大潤發有、盒馬有、山姆也有,貨都一樣。可人們為什么還是喜歡往某一家跑?可能正是因為它幫你把品選好了、動線理順了、該配的服務配齊了,甚至有自己的招牌自有品牌(山姆的 Member's Mark)讓你非它不可。咱們買的從來不只是貨,買的是這家店把"逛—選—買—用"打通的整條體驗。
這就是為什么"它是不是聚合了別人的模型"從來不是重點。聚合是手段,編排才是產品,或者說穿了最終體驗才是兵家必爭之地。 一個創作 Agent 的價值,在于它替你把"想法"到"成片"那段路鋪平了多少。
回到這次實測——那部土耳其爛片的完成度、那條把一個個鏡頭縫成連貫長片的流水線,足夠說明它在這段路上已經鋪得相當遠了。


雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。