一个AI视频工具声称能无限时长生成,到底能不能撑起一部完整的电影?在2026世界人工智能大会现场拿到vivago R1的内测资格后,我们第一时间让它试了试——目标是一部土耳其山寨版“星战”。这部片子会崩在哪,还是真能一口气跑完,成了这次测评最让人期待的悬念。
vivago R1背后的公司叫智象未来(HiDream.ai),7月18日WAIC期间正式发布这款产品的同时,也宣布了C轮融资的最新进展:近三个月累计拿下超过21亿元人民币,跻身独角兽行列。创始人梅涛此前是微软亚洲研究院高级研究员、京东高级副总裁,2025年刚当选ACM Fellow,智象未来也是全球唯一同时支持文本、图像、视频、3D四个模态的基础模型厂商。
如果把时间往前拨两个月,智象在Product Hunt上发布过一个叫Vivago Video Agent的前身,靠AI导演帮你编角色、写叙事、做故事板,还能在渲染前预览关键帧,当天冲上产品榜第一。但那个版本有一条硬性天花板:单条视频最多只能做到3分钟。到了vivago R1,智象想把这个天花板彻底拆掉,打出“无限时长”这张牌。
要实现无限时长,靠的不是从零训练一个能一口气吐十分钟视频的超级模型。vivago R1走的是编排路线——让Agent去调度现有的SOTA视频模型,再通过跨镜头缝合和一致性校准,让短片拼接成长片。2026年涌现的一批长片生成论文,像ScripterAgent写脚本、DirectorAgent编排多个模型、CriticAgent校验的框架,走的都是同一条路。腾讯团队的长视频Agent研究也显示,主流做法就是“编排现有SOTA模型+跨镜头缝合”,因为单个模型一次稳定生成的时长只有8到12秒,要做长片,编排几乎是唯一现实的选择。
这种编排层的价值,在资本市场早有验证。Cursor在2026年6月被SpaceX以600亿美元收购,Manus差点以20亿美元卖掉,OpenRouter也在和多家科技巨头谈收购。智象未来在WAIC前刚完成15亿元C轮融资,三个月内总融资超21亿。伯克利哈斯商学院的一篇专栏评论甚至指出,纯软件的Agent护城河其实很弱,“几周就能被克隆”,真正的护城河正在从模型迁移到物理体验。而Manus已经证明,聚合只是手段,编排出来的体验才是用户真正需要的产品。
落到vivago R1上,它把这种编排体验拆成了三大核心卖点,官方总结为“长、长、稳”。第一个“长”是无限时长,直接打破当前行业主流产品只支持15到30秒短镜头的限制,可以覆盖短剧、专题片、品牌宣传片甚至影视成片这样的长周期创作场景。第二个“长”是长任务推理,Agent能自主完成逻辑构思、镜头排布和风格校准,避免AI生成视频常见的画面跳变、人设崩塌和叙事断层。第三个“稳”是高稳定生成,依托AgentOS的全流程调度,整个创作链路变得可控可校准,内容有效可用成功率被拉升到85%左右,远超行业平均水平,直接减少了反复修改调试的人力成本。
把vivago R1放到当前AI视频的坐标里看,对比会更直观。谷歌Veo 3.1单段大约8秒,多镜头拼接到一两分钟;Sora 2能到60秒,可惜消费端在2026年4月已经关停;快手可灵3.0号称导演级,可以做到两分钟。也就是说,如果vivago R1真的能稳定输出五分钟以上且叙事连贯不崩的成片,它切中的是一个真切的空白地带。短镜头再好看,也拼不出一部能讲故事的片子,这是Sora和vivago R1都想啃下的硬骨头。
我们让它拍的土耳其山寨“星战”,就是一次对“长、长、稳”的实际压力测试。虽然成片里依然能看到一些风格跳帧和偶尔的角色崩坏,但在接近六分钟的连续叙事里,角色的对白节奏、场景切换逻辑和整体氛围几乎没有出现大幅断裂,这在以往的秒级生成工具里几乎不可能实现。当然,一部片子不能代表所有场景,但至少证明,编排现有模型这条路,在视频创作这个方向上已经能跑通一条实用级别的长链路。
热门跟贴