IT时代网7月31日消息,字节跳动今天发布公告,正式推出视频生成模型Seedance 2.5。这一版本最直观的变化是单次生成时长翻了一倍,从15秒提升到30秒,并且支持多轮延长。模型会陆续上线即梦AI与豆包专业版,API服务也将在近期接入火山方舟。
按照官方说法,Seedance 2.5延续了Seedance 2.0统一的多模态音视频联合生成架构,这次重点补的是长叙事、多模态参考和编辑三块能力。目标说得很直白——让视频生成从"生成一个片段"变成"完成一段创作"。面向的场景不止影视和广告,还包括教育、工业制造、具身智能以及自动驾驶。
30秒意味着什么?官方称模型可以在这个时长内组织多个具备逻辑关联的镜头,让故事按照铺垫、推进、转折、收尾的节奏展开。演示里有一段歌手一镜到底登台的片段:镜头从红色厚重幕布的缝隙推进,进入暖色调的后台化妆间,年轻女歌手正在整理耳机,工作人员提醒她该上场了;她穿过后台通道,与舞伴互动并接过麦克风;最后登上舞台,镜头拉远至体育馆全景,观众、灯牌、荧光棒和欢呼声一并入画。
多轮延长是另一个看点。官方示例要求模型在已有视频的基础上继续生成30秒,同时保持人物主体、场景、画面风格、声音和音效的一致性。那段剧情是小男孩抱着足球沿车厢奔跑,地铁停稳后冲出车门,男主追赶并最终抓住他——一串连续动作没有断裂感。
素材输入这一环也放宽了。单次最多可以塞进30张图片、10段视频、10段音频作为参考。官方称模型能综合理解不同素材里的画面构图、场景、风格、人物、道具等元素,再按指令组织进生成结果。
多人同框和群像叙事一向是视频生成的难点,人一多容易串脸串声。Seedance 2.5给出的方案是同时还原多个人物的形象与声音,并保持主体特征稳定。官方展示的那段30秒音乐会片段用了16:9横屏、电影感写实风格,参考素材覆盖了场景图、钢琴家、大提琴、小提琴、主唱、管弦乐队、合唱团直到观众席。
注:本文中包含AI辅助创作的内容。
热门跟贴