打开网易新闻 查看精彩图片

3个月融资21亿

这家AI独角兽瞄准AI长视频编排能力

文 | 子路

编辑 |佛耶戈

欢迎在小宇宙APP订阅:FoST未来叙事

收听我们出品的播客节目《AI超创快上车!》

上周末最大的新闻看了吗?ChatGPT-6 Astra上线,意味着AGI时代(AI专业度优于人类)可能真的要来了。

很巧,今天我去海淀参加了一场特别有趣的WorkShop分享活动。近三个月内融资超21亿元的智象(HiDream.ai),宣布旗下Agent产品vivago R1(国内版够搭)全球正式上线,他们根植于AI长视频编排应用场景,提出了一个新锐观点:

请相信这个Agent平台的专业能力,它是行业首个通过一次自然语言对话,就能稳定生成5分钟“单反级交付”AI视频的产品。

打开网易新闻 查看精彩图片

AI视频创作的AGI时代,先从智象未来开始了?

这家AI独角兽公司以自研多模态模型起家,是业内著名“学霸”,旗下模型频频登上国际权威评测榜单前列,在多项基准测试中刷新SOTA纪录:

2026年5月,开源模型HiDream-O1-Image-Dev-2604在AA榜单中斩获开源模型全球第一;

2026年6月,商用版图像生成模型HiDream-O1-Image-1.5在AA榜单中,超越Google Nano Banana 2、NVIDIA Cosmos3-Super-Text2Image、字节跳动 Seedream 4.0等国内外主流模型,位居全球第三、中国第一。

打开网易新闻 查看精彩图片

“学霸”发布新产品,效果如何?

【FoST未来叙事】第一时间上手实测,确定vivago R1真的做到了具备大众普适性与场景应用价值的AI视频创作专业度,你可以相信这个Agent。

1

在当下AI市场上,没有搭载Skill的Agent平台拿不到大结果。

打开vivago R1(国内版够搭)官网(https://goudaai.com/)首页,我首先就被它的SkillHub吸引了。

不同于多数Agent平台用电影名家画风区分Skill,R1的技能库更符合“技能”定义,每一个都导向了具体应用场景,比如服装搭配、叙事广告、装修模板、亚马逊商品详情页等,大部分指向TVC视频。

打开网易新闻 查看精彩图片

现在市面上大都在讨论AI故事片作品,但其实AI视频使用最广泛的,正是TVC广告片领域。不管是产品元素还是视频片段,AI与实拍相比都是十倍以上的成本压缩。

所以要用vivago R1做测试,尤其是它高亮的“一次对话稳定生成5分钟长视频”能力,我第一反应就是:给我做一个FoST品牌的长视频汽车广告出来。

打开网易新闻 查看精彩图片

点击箭头生成,就会跳转到R1画布。左边是整齐排列的图片资产、视频素材,右边是自然语言对话Agent,随便给它提要求,它都能进一步拆解你的创意、导向成品。

R1拆解了我的创作意图之后,表示汽车广告一般1分半左右,建议我不要做太长,最好是3分钟出头;

又经过简单沟通,给我生成了一份一家三口驾驶FoST电动汽车、两天一夜自驾游的剧本:让汽车经过城市、盘山公路、草地、碎石浅滩、涉水等路况,展现汽车的多地形性能与长续航能力。

我觉得这个故事覆盖面已经很全了,确认继续制作,它就开始生成画面风格、资产圣经、分镜设计、图片资产等。

打开网易新闻 查看精彩图片

值得一提的是,R1在图片资产设计这块儿很有一套,它帮我完成了从创意激发到资产落地的全过程。

比如,它会生成一些十二宫格的铅笔画分镜草图,大致演示一下分镜效果,并且用红粉蓝绿等不同颜色标明对应的动作、表演、运镜、构图等专业信息,简单明了。

打开网易新闻 查看精彩图片

在调用图片模型方面也很智能,在我还没有明确想法时,它生成图片强调给角色更松弛的站姿、多种造型、粗糙但真实的皮肤细节,供我选择;

帮助我排除错误答案、确定各种造型应用场景之后,则改为生成更标准的三视图,用于后续视频生成。

打开网易新闻 查看精彩图片

视频生成阶段也很稳定,全长3分15秒的汽车TVC,角色、汽车、画册等道具都没有崩坏,很好地保持了一致性。

它也支持分镜、视频素材等内容的修改,比如我觉得第六组分镜生成效果节奏慢了、原本确认的想法又有改变,就可以用自然语言要求它忘掉我之前的修改意见,按照新意见再修改,它能分辨并记住我的需求,应用在后续生成里。

这都体现了vivago R1足够长、足够稳定的上下文理解能力,不需要重复修改、赌命抽卡,你就能得到想要的交付级成品。

打开网易新闻 查看精彩图片

测试下来我发现,vivago R1的核心能力,是长视频编排。

以现有AI技术,生成视频片段并不难,难的是在保持一致的前提下持续生成叙事连续、逻辑在线的完整长视频。目前市面主流的制作模式,还是AI创作者生成零散素材之后剪辑为成片,R1改变了这种模式,就像它官方介绍的:

它能通过多智能体协同机制,将“理解任务→构思故事线→创作分镜脚本→生成核心素材→生成超长视频”的完整创作链路进行原子化封装与专业化调度,确保叙事、镜头、角色、风格、声音和审美的有机统一,真正实现了从“单点工具”到“全链路创作系统”的跨越。

而且在这个平台上,你创作的角色、场景和道具都能形成可复用资产,后续镜头围绕同一套资产继续生成,进一步减少长片里常见的人物变化、场景跳变和风格断裂等问题。

所以第二个测试,我们就复用了汽车TVC里的角色资产,把这一家三口“搬”上街头、摄影棚,调用R1的“叙事广告导演Skill”,制作了一条全新风格的服装TVC视频。

打开网易新闻 查看精彩图片

来看看效果,是不是比某宝的模板视频强多了?

借助Skill预设能力,这条1分钟视频只做了两个小时。

一次对话稳定生成5分钟视频,角色、场景等资产复用后继续生成,从这个角度来讲,vivago R1几乎可以做到无限时长的持续稳定生成。

不止TVC品类,AI短剧团队、孵化自有IP的AI超创们、自媒体达人们等等,都可以来试试这个新上线的Agent平台。

2

其实早在7月份WAIC 2026大会现场,智象未来创始人兼CEO梅涛就现场首发了这款全球首个无限时长内容创作多模态智能体,vivago R1。

同期,这家公司在3个月内融资21亿元,成功跻身AI独角兽行列。很多人都在观望,智象未来到底想往哪个方向发展?

随着多个自研模型、产品的曝光,它的路线愈发明确:模型基座和Agent双轮驱动。

持续精进的自研模型能力是基础,除了上述全球前列的商用图像生成模型,就在前天,智象自研的具身世界模型HiDream-O1-Embodied首次参评具身智能模型评测平台RoboColiseum,即在核心的Robustness(扰动适应)子榜单中,以平均分0.692的成绩登顶榜首。

打开网易新闻 查看精彩图片

而落地到具体的应用场景上,则必须导向将基础模型的生成与推理优势转化为标准化、可验证、可交付的系统化产业能力的,Agent智能体。

梅涛院士在WAIC 2026大会发言里还给到了一个产品侧进一步落地的畅想:

在复杂的任务和场景中,单智能体存在明显的能力边界,无法独立完成跨链路、高精准的创作任务。唯有通过多智能体集群协作,模拟专业团队分工模式,才能“胜任”一些复杂的产业难题。

所以,智象自研了全新HD-AgentOS智能体操作系统。vivago R1,就是这套多智能体协同核心技术积累下,于视频创作领域最新落地的应用层产品。

打开网易新闻 查看精彩图片

这家公司很有趣的点就在这里,创始人是科学家出身,也待过京东等互联网大厂,所以绝对反对“纸上谈兵”。

他既要模型的技术力,又坚持把所有技术力通过智能体产品与用户产生强关联;而所有产品,都必须指向垂直的应用场景,从实操上帮创作者解决问题。

这次上线vivago R1(国内版够搭),就是AI视频场景应用的一次集中展示。

智象把这款产品定位为“你的AI视频创作好搭子”,在今天的分享会上,来自不同领域的品牌广告导演、AI创作者、品牌策划等均现场分享了用vivago R1创作的多场景AI视频demo,包括香水广告、IP设计、叙事片等多种类型。

打开网易新闻 查看精彩图片

来自海外的多位OPC创作者也通过视频分享,vivago R1帮他们实现了从输入一句话创意,到通过长视频编排来生成完整成片的惊喜。

我对vivago系列产品负责人现场分享的一句话印象很深刻:

Token消耗是摆在每个创作者面前最现实的问题,那么一个能做到稳定生成的AI产品,就是在帮创作者省钱。

而vivago R1致力于通过优化模型调用的长视频编排能力,让Agent“想得远、记得住、改得动”,就是当下乃至未来一段时间内这类AI产品的版本答案。

3

为什么我会觉得,智象未来主攻长视频编排能力的vivago R1产品,是AGI时代前夜的第一束光?首先,我们要厘清一个概念:

长视频编排,绝对不是站在其他生成模型肩膀上的偷懒行为,而是专业可落地的另辟蹊径。

1976年,第一台入门级单反相机“佳能AE-1”正式问世,彻底改变了摄影的社会属性。就像它那句非常经典的广告语:

So advanced, it's simple(如此先进,如此简单)。

它打破了单反相机操作繁琐的专业壁垒,让每一个不懂光圈、快门等专业参数的普通人都能拿起相机、记录生活,拍摄出不错的照片。

图片由AI生成
打开网易新闻 查看精彩图片
图片由AI生成

视频制作也一样。一直以来,人类把脑海里的故事变成可视化的影像,都需要复杂的“翻译层”(编剧、摄影、剪辑等);AI技术的到来,把翻译简化成了提示词,你给到AI专业的语言指令,就能得到大致想要的结果。

但提示词仍然是有隐形门槛的,所以在AI视频行业诞生这一年里,首先实现经济繁荣的是卖课群体。

而如今vivago R1的诞生,砍掉了这层翻译。这意味着人类最擅长的“自然语言讲故事”能力,直接变成了最复杂的结果:一条可专业交付的完整视频。

放眼当下AI视频创作工具市场,产品方向主要分为两种路线。

一条是画布式、节点式工作流:把模型、工具和参数全部摊开,交给用户自己选择、连接和调试。它的优势是自由度高、控制颗粒度细;代价是用户必须理解模型边界、参数含义和组合逻辑。

另一条,是vivago R1选择的对话式路线:不把复杂流程摊给用户,而是尽可能把中间环节收进Agent里。用户只负责表达意图、判断结果;脚本拆解、镜头规划、角色一致性和成片组织等中间层,则由Agent在后台完成。

这两条路线背后,是两种不同的产品判断。

前者相信,创作的控制权应该尽可能交给用户;后者则认为,真正降低门槛的方式,是像单反一样用科技整合基础能力,把专业创作者的经验、审美和判断逻辑,编码进Agent的长视频编排能力中。

打开网易新闻 查看精彩图片

模型能力,不等于产品能力。

vivago R1用足够长、足够稳定、自带深度思考的模型基座与产品能力,大幅降低了大众从自然语言到复杂视频的门槛,把模型的上限变成每个创作者手里真正能用的东西,这就是AI视频创作的“单反”时刻。

当AI的专业能力优于人类并服务于人类,AGI时代就真的来了。而现在,至少我们已经在这个新产品上看到了一丝曙光。

Agent可以帮你做判断,你,只需要一个创意。