过去两年,视频生成行业最剧烈的变化几乎都发生在内容端。
从几秒钟的动态画面,到能完成运镜、人物表演和连续叙事,模型不断逼近传统影视的制作效果。围绕它最早形成的应用也顺理成章地集中在广告、创意短片和电商等行业。
但一股新的流向正在浮现。
7月31日,字节跳动发布Seedance 2.5。相比此前版本,新模型将单次生成视频时长拉升至30秒,可一次性承载最多50个图片、视频、音频等多模态参考素材,并新增视频局部编辑能力,同时原生支持10余种语言并强化了复杂指令控制。目前,Seedance 2.5已上线豆包、即梦、扣子、小云雀等产品,并将通过火山引擎向企业开放。
更值得关注的是,它正越过内容产业的边界,向制造、汽车、具身智能、自动驾驶等实体产业渗透。徐工集团、小鹏汽车、穹彻智能、微分智飞、灵初智能等企业,已围绕Seedance 系列能力展开合作。它们分布在工程机械、新能源车、机器人与飞行智能等赛道,与视频生成过去所熟悉的娱乐和营销语境相去甚远。
这并不是视频生成对传统内容产业的一次简单外延。更准确地说,视频生成正在更深入地触碰一类长期存在、却受制于制作与采集成本的需求:工厂需要用动态影像把复杂操作讲清楚,自动驾驶需要合成大量的极限场景视频,机器人训练需要海量符合物理规律的交互数据。
而当单次生成时长、多模态参考容量、局部编辑精度这些技术能力集中落地时,视频生成便开始沿着产业的价值链延伸。
能力迁移的背后,是视频生成从服务内容产业走向渗透实体产业的结构性转折。
从工业培训到产品出海,视频生成的边界持续扩张
制造业可能是动态信息最密集,却也是视频化程度最低的领域。
一台设备如何启动,一道工序先后经过哪些步骤,一个零部件应该安装在什么位置,违规操作可能引发什么后果,这些知识都包含连续动作。相比几十页操作手册,视频往往更容易说明问题。
但在传统生产模式下,工业视频并不便宜。
进入工厂实拍,需要协调设备状态、操作人员、生产场地和安全管理;制作三维动画,则要经过建模、动画、材质和渲染等环节。设备型号一旦变化,工艺步骤一旦调整,原有内容还可能需要重新拍摄或制作。
因此,很多工业企业只会为关键设备和高风险工序制作视频,大量长尾知识仍然留在说明书、培训课件和师傅的现场示范中。
Seedance 2.5的几项能力,恰好对应了工业内容生产中的这些难点。
30秒单段生成和高保真时序延长,使模型可以覆盖更完整的操作过程。工业演示不同于短视频中的单个视觉片段,它往往需要呈现动作的先后关系。设备、人物和空间位置能否在更长时间里保持一致,直接影响一段视频有没有培训价值。
最多50个多模态参考素材,则使企业可以同时输入产品图片、三维模型、操作示范、场景素材和音频说明。对于工业企业而言,模型并不是从一句文字描述开始凭空创作,而是要尽量承接已经存在的产品结构和技术资料。
目前,徐工集团已经将Seedance系列模型用于工业操作培训和工序SOP视频生成,以降低传统实拍和三维动画的制作成本。
局部编辑进一步降低了更新难度。
工厂里的设备和流程并非一成不变。当某个零部件更换、操作环境调整或者安全要求更新时,企业需要修改的往往只是视频中的一小部分。传统制作方式下,即使变化有限,也可能牵动重新拍摄、重新渲染和重新剪辑。局部编辑允许在保留原有镜头、动作和节奏的情况下替换背景、商品或人物,使一条视频可以继续衍生出不同版本。
类似的逻辑正在更广阔的工业场景中展开。在能源和化工等场景中,Seedance系列能力还可用于HSE标准化作业培训、违章警示教育、应急演练预演和事故动态复盘。例如,根据事故起因、演化和处置过程生成动态演示,能够为传统文字材料提供更直观的补充。原本沉淀在文档里的长尾知识,有了被批量“动态化”的可能。
同样的能力也在向零售和产品出海延伸。
一件商品进入不同市场,需要对应语言的安装说明、使用演示和安全提示。产品包装、SKU和销售地区发生变化,内容也要同步调整。而现在,制造和零售客户已经在使用Seedance制作多语言产品说明、售后服务和培训内容,面向不同国家和人群进行沟通。
当30秒的连贯演示、50个参考素材的工业化承接能力与精准编辑相结合,视频开始像文档和图片一样,成为企业日常业务中可规模化输出的信息载体。
从生产末端到研发前端,多模态参考让视频进入决策链
如果说制造业的变化在于视频生产成本下降和便利性提升,那么汽车行业正在发生的,是视频在企业流程中位置的迁移:它不再只是产品的宣传物料,而是开始进入研发和设计决策本身。
过去,视频通常位于产品开发链条的末端。
例如一辆汽车完成设计、制造并准备上市后,市场部门再围绕成品制作宣传片、功能演示和用户说明。视频承担的是展示和传播功能,很少直接参与产品形成过程。
如今,这个链路正在发生变化。
小鹏汽车已经将Seedance系列能力接入其内部一站式 AI 设计平台,应用于车型设计参考、设计测试等视觉内容生成。
汽车设计本身早已高度数字化。从草图、效果图到三维建模和数字样车,设计团队拥有大量视觉资产。但静态方案与动态展示之间,仍然存在一道制作门槛。
一辆车停在设计软件里是一回事,让它出现在城市道路、雨夜、高速公路和不同光线环境中,又是另一回事。传统流程中,高质量的动态演示通常出现在设计相对成熟之后。早期方案数量多、变化快,为每一种可能性制作完整的视频并不经济。
多模态参考改变了这种关系。
设计团队可以把车型图片、三维白模、场景参考、镜头运动和既有视频同时交给模型,使生成结果尽量遵循已有设计,而不是重新创造一辆看似相似的汽车。Seedance 2.5还提升了对白模、产品包装和品牌视觉资产的保持能力,使企业前期投入的设计资产可以在视频中继续使用。
设计团队可以更早观察车辆在不同道路、环境和光线中的表现,也可以在进入实体样车阶段之前,对更多设计方向进行视觉比较。
工具渗透位置的改变,最终会重塑决策发生的节点。
走向训练数据,Seedance开始触碰产业更深处
无论是工业培训还是汽车设计,视频最终的接收者依然是人。而机器人与自动驾驶场景,改变了这个终点,视频可以被直接“投喂”给算法,从信息载体变成了一组需要被机器学习的参数。
这是视频生成向实体产业渗透过程中,角色发生最深刻变化的一步。
在具身智能和自动驾驶领域,数据获取一直是核心瓶颈。
语言模型可以从互联网获得大量文本,机器人却需要在现实空间中学习。例如机械臂如何抓起透明玻璃杯,移动机器人遇到突然出现的物体如何避让,这些能力都依赖具体的动作和环境数据。
真实机器人采集的数据最接近实际情况,但成本和效率存在天然限制。
Seedance 2.5在这一方向上的落地比外界感知到的更快。穹彻智能已利用Seedance系列模型扩充具身智能训练数据,以生成适配不同机型的操作数据,减少对实体机器人逐一采集的依赖。
穹彻智能则借助Seedance系列模型扩充具身智能训练数据,减少对实体机器人逐一采集的依赖,并生成适配不同机器人机型的操作数据,以提升模型跨本体的适配能力。
多素材参考和局部编辑有了与内容创作完全不同的用途。
研究人员可以尽量保留机器人动作,只调整场景、材质或者物体;也可以保持环境不变,观察不同机器人本体完成同一任务的情况。每一次局部变化,都可能成为新的训练样本。
微分智飞则把这一能力用于飞行机器人。
飞行机器人面对的空间更加复杂,一些任务也更难通过真实飞行反复采集。障碍物闪避、室内自主寻路、目标锁定乃至复杂镜头运动,都需要大量不同环境和变量组合。目前,微分智飞正在将Seedance融入飞行机器人应用,探索建立标准化、高难度的数据生成流程。
自动驾驶面临着相似、但规模更大的问题。
例如真实道路每天都能产生大量数据,但研发最需要的,往往不是最常见的晴天直路,而是暴雨、大雾、降雪、强烈反光、罕见路况和长尾事故。
这些场景发生概率低,却可能决定系统在极端情况下的表现。企业很难为了采集数据主动制造危险事故。
而Seedance可以用于合成部分极端天气、罕见路况和事故场景,补充真实道路采集难以覆盖的训练盲区。
在内容行业,一条优秀视频可以独立体现模型价值;在工业和研发场景中,生成结果必须能够接入后续流程。它需要与企业的产品资料、设计平台、数据系统和评测体系共同工作。
从工业培训到汽车设计,再到机器人和自动驾驶,Seedance 2.5所呈现的,是一条逐步深入的技术路径。
30秒直出和高保真时序延长,让完整工序和连续动作更容易被准确表达;最多50个多模态参考素材,让企业已有的产品图纸、三维模型和设计规范能够被模型承接并复用;局部编辑能力降低了版本迭代、场景替换和变量扩展的门槛;多语言原生支持则让一套产品内容资产能够高效覆盖全球市场。
这些能力进入不同产业后,被赋予了不同用途。视频生成由此跨过的不只是内容行业的边界,它正在从一种服务创意表达的工具,演进为能够嵌入产业流程、被企业反复调用的生产力工具。
Seedance 2.5的意义,也不只在于视频能够生成得更长、更可控,更在于它让视频生成模型开始真正成为实体产业生产体系中一个可交付、可迭代的组成部分。
热门跟贴