字节跳动最新一代视频生成模型Seedance 2.5正式发布,以单次生成时长翻倍、多模态参考扩容及精准编辑能力为核心突破,将视频生成从内容创作工具推向可工业化交付的生产力基础设施。

7月31日,Seedance 2.5正式上线豆包、即梦、扣子等字节旗下产品,并将通过火山引擎向企业用户开放API服务。相较年初发布的Seedance 2.0,新版本在生成时长、多模态理解、编辑精度及语言适配四个维度全面升级,将视频生成推进至"可修改、可迭代、可交付"的新阶段。

发布当日,徐工集团、小鹏汽车、灵初智能、微分智飞、穹彻智能等多家企业确认合作,率先将该模型引入工业培训、产品设计、具身智能训练数据生成等具体生产环节。香港科技大学副教授王帅表示,视频生成模型正在经历从"生成内容"走向"理解世界"、从"辅助创意"走向"提升生产力"的关键转变,Seedance 2.5代表的是生成式AI向真实产业生产流程深入融合的重要信号。

四项核心能力全面升级

Seedance 2.5在生成时长上实现最直接的跃升:单次生成视频时长从15秒提升至30秒,并支持多轮延长,可在更长时间内保持人物、场景与镜头的一致性,使创作者能够完成具有完整叙事节奏的内容,无需反复拆分镜头和处理衔接。

多模态参考能力大幅扩容。用户单次可输入最多30张图片、10段视频、10段音频作为参考素材,同时新增白模参考与绿幕参考能力。白模参考允许创作者以无纹理3D模型预先规划空间结构、主体姿态和镜头机位,再由模型生成符合物理光照规律的最终画面;绿幕参考则支持在保持主体不变的前提下,依据不同场景的物理规则渲染服装飘动、步态节奏、光影等细节。

R2V prompt:延长视频,衔接 @视频1 画面内容和主体继续生成一个 30 秒的视频,保持人物主体、场景、画面风格、声音音效一致。小男孩抱着足球沿车厢跑,地铁停稳后侧边门打开,他立刻冲出,男主紧追。两人一路穿过站台跑到街上,惊动街边路人,男主最终追上并抓住他,小男孩委屈抬头,男主慢慢消气,摸摸他的头,露出无奈笑容。

编辑精度方面,Seedance 2.5新增视频局部编辑能力,支持通过时间戳对指定片段内的角色、动作、声音或剧情进行定向修改,同时保持修改前后的连贯性。这一能力配合绿幕编辑、视角编辑、参考编辑,可适配影视和广告等对精度要求较高的专业场景。

此外,该模型原生支持10余种语言,并加强了复杂指令控制,为面向多语言、多版本的工业化内容生产提供基础支撑。

有网友评论称:“电影级水准。”

还有网友称,“感觉AIGC发展太快了”、“很难相信都是AI生成的”。

企业落地:从制造业到具身智能

Seedance 2.5发布当日公布的合作企业,覆盖工业制造、汽车设计、具身智能、飞行机器人等多个垂直领域,显示出字节跳动在商业化落地上的布局方向。

徐工集团将Seedance应用于工业操作培训与工序SOP视频生成,以降低传统实拍与3D动画的制作成本。小鹏汽车则将其集成至内部一站式AI设计平台,辅助产品设计环节的可视化创作。

在具身智能领域,穹彻智能借助视频生成扩充了具身智能大模型的训练数据——无需依赖实体机器人逐一采集,即可生成适配不同机型的操作数据,提升模型的多机型适配能力与通用性。微分智飞则将Seedance融入飞行机器人应用,构建出标准化的数据集生成流程,用于模拟障碍物闪避、室内自主寻路、智能目标锁定等高难度场景,产出高质量训练数据。灵初智能也已在具身智能方向推进应用探索。

R2V prompt:16:9 宽幅电影级质感,一镜到底,丝滑运镜,无剪辑。场景参考 @图片4。0-5 秒:@图片2 霸王近景开场,镜头缓慢环绕上半身并过渡至中景;霸王旋身翻转,随后身体与靠旗从镜头前快速掠过,形成自然遮挡,镜头顺势绕至 @图片1 虞姬身侧。6-10 秒:镜头稳定环绕 @图片1 虞姬中景,跟随水袖动作完成环绕运镜虞姬抬臂、挑腕、展袖、半转身。最后收袖定格,侧身看向霸王。11-20 秒:@图片3 武生出场完成后空翻腾动作,随后霸王居中,武生在对侧进退攻防。虞姬位于霸王侧后方以水袖配合,形成刚柔对比。镜头从武生中近景缓慢后拉至舞台大景,结尾三人面向观众同步京剧落幕亮相。

物理世界理解能力是关键

王帅指出,具身智能、机器人仿真、自动驾驶、工业设计验证等场景的共同需求,在于模型能够理解"一个动作会带来什么后果"以及"一个场景会如何演化"。这意味着视频生成模型的产业价值,最终取决于其对物理世界规律的建模能力,而非单纯的画面质量。

Seedance 2.5在发布声明中亦承认,在复杂运动的物理合理性、极多主体交互场景的稳定性上仍有提升空间。字节跳动表示,未来将继续探索更长的连贯叙事与更强的物理世界理解能力。

在自动驾驶领域,Seedance 2.5已可模拟极端天气、复杂路况等低频场景,为系统测试和训练提供更多样本;在教育领域,模型可将历史背景、实验过程等抽象内容转化为动态演示视频,降低教学物料制作门槛。这些场景共同指向一个方向:视频生成的核心竞争力,正从创意侧的内容产出,向产业侧的数据生产与流程替代延伸。