当大多数 AI 视频模型还在 10 秒左右的片段里打转时,字节跳动直接把单次生成的时长拉到了 30 秒,而且要让这 30 秒讲一个完整的故事。7 月 31 日,字节跳动正式发布 Seedance 2.5 视频生成模型,将单次视频生成时长从 15 秒翻倍至 30 秒,并首次在视频 AI 中落地了“多镜头叙事”能力。
按官方给出的定位,Seedance 2.5 延续了 Seedance 2.0 统一的多模态音视频联合生成架构,重点强化了长叙事、多模态参考和编辑三大方向。模型内部不再只是按顺序生成画面帧,而是能够在 30 秒内组织起数个逻辑关联的镜头,让视频按照铺垫、推进、转折、收尾的结构展开,而不是随机拼接的动图合集。
最直观的展示来自一段一镜到底的歌手登台视频:镜头从红色厚重幕布缝隙推进,穿过暖色后台化妆间,年轻女歌手正在整理耳机;工作人员提醒登台,她穿过通道与舞伴互动,接过麦克风,随后走上光芒四射的舞台。镜头最终拉远至体育馆全景,台下是灯牌、荧光棒和欢呼的观众。整个片段在 30 秒内自然完成了一个从后台到台前、从准备到高潮的完整叙事,人物、光影和声音连续度都保持稳定。
Seedance 2.5 还支持“多轮延长”,允许用户在已有视频基础上继续生成,最长可再延长 30 秒,并且保持人物主体、场景、画面风格、声音和音效的一致性。官方给出的示例中,第一段视频里小男孩抱着足球沿地铁车厢跑动,延长生成的 30 秒里,地铁停稳后小男孩冲出车门,男主追赶并最终抓住了他——动作连贯,人物形象和车厢场景没有出现明显的跳变或崩坏。
多模态参考输入的提升同样是这次升级的重点。Seedance 2.5 单次最多可输入 30 张图片、10 段视频和 10 段音频作为参考素材,模型会综合理解不同素材中的画面构图、场景、风格、人物、道具等元素,并按指令生成目标视频。这意味着创作者可以用一组静帧、一个运动参考片段和一段背景音乐,让模型直接产出一段风格统一的视频,而不再需要反复试错。
在群像和多人同框的控制上,Seedance 2.5 被要求同时还原多个人物形象与声音,并保持主体特征稳定。官方展示的一段 30 秒音乐会片段采用 16:9 横屏电影感写实风格,参考素材覆盖了场景图、钢琴家、大提琴、小提琴、主唱、管弦乐队、合唱团和观众席。生成画面中不同乐手的面部、演奏动作和声部之间的配合,都保持了较高的一致性。
从产品落地上看,Seedance 2.5 将陆续上线即梦 AI 与豆包专业版,API 服务近期接入火山方舟。官方划定的应用场景横跨影视、广告、教育、工业制造、具身智能和自动驾驶等多个领域,目标是把视频生成从“生成一个片段”推向“完成一段创作”。当 AI 能够自主组织镜头语言、控制节奏和音视频同步,视频内容生产的门槛和成本将被重新定义。
热门跟贴