字节又发视频模型了
本文内容,来自 Seedance 官方
刚刚,字节 Seed 团队正式发布新一代视频创作模型 Seedance 2.5。Seedance 2.0 发布后,团队观察到,用户对视频创作模型的期待正在从"生成一个片段"走向"完成一段创作"。Seedance 2.5 延续了 Seedance 2.0 统一的多模态音视频联合生成架构,重点突破长叙事能力、多模态参考能力和编辑能力
单次生成时长达 30 秒,支持多轮延长:Seedance 2.5 可单次生成 30 秒高质量视频片段,并支持多轮延长。模型优化了镜头衔接和场景过渡,让长视频保持更好的连贯性。模型还大幅优化了画质、音质以及运动质量,并有效弱化了视频生成中常见的"油腻感"。用户可以生产数分钟具有统一视听语言、高质量的连贯内容
多模态参考能力全面升级:Seedance 2.5 支持用户单次输入最多 30 张图片、10 段视频、10 段音频作为参考素材。模型还提升了白模参考、运动参考、创意参考等各类参考能力,使模型能更好地理解创作意图,实现多主体、多场景、多镜头变化的复杂创意
更精准、稳定的编辑能力:Seedance 2.5 支持精准的时间戳控制,可定向编辑视频内容,提升创作的效率和可控性。同时,模型强化了绿幕编辑、视角编辑、参考编辑等多种编辑能力,满足影视、广告等更多专业、复杂场景的创作需求
凭借长叙事、多模态参考、编辑能力的提升,模型不只能单次生成更长的视频,也能更好地理解创作意图、更可控地完成从想法到视频落地的全过程。下面是一段由 Seedance 2.5 独立生成的创意短片
Seedance 2.5 创意短片
目前 Seedance 2.5 正在陆续上线即梦 AI、豆包专业版等平台,API 服务也将在近期上线火山方舟
30 秒长叙事
Seedance 2.5 将单次视频生成时长从 15 秒提升至 30 秒,同时进一步提升长视频中的叙事能力。模型可以在 30 秒内组织多个有逻辑关联的镜头,让故事从铺垫、推进、转折到收尾逐步展开,而不是简单延续一个画面。比如创作一段歌手一镜到底上台演出的片段,模型演绎了歌手在化妆间与工作人员互动后,穿过后台走廊与伴舞相遇并一起登台演出的完整故事
一镜到底演唱会片段
T2V prompt
一镜到底手持稳定器跟拍,镜头从红色厚重幕布缝隙缓缓推进,进入暖色后台化妆间。年轻女歌手背对镜头整理耳机,工作人员提醒她准备登台。她回头看向镜头,开始唱起 City Pop。镜头后退跟拍,歌手穿过幕布进后台通道,与舞伴自然互动,一位工作人员把麦克风递给她。随后歌手与舞伴登上舞台,镜头绕至背面,红黑舞美、LED 屏、追光、烟雾与反光地板逐渐展开。镜头最终拉远至体育馆全景,呈现满场观众、灯牌、荧光棒与欢呼声,营造年轻自由的演唱会高潮氛围
凭借多轮延长能力,用户能在已有的视频结果上自然衔接后续镜头,并在延长过程中保持主体特征、场景环境和叙事节奏的连贯,最终生成数分钟具有统一视听语言的连贯内容,减少拆分镜头、反复拼接和处理衔接的成本
多轮延长片段
R2V prompt
延长视频,衔接 @视频 1 画面内容和主体继续生成一个 30 秒的视频,保持人物主体、场景、画面风格、声音音效一致。小男孩抱着足球沿车厢跑,地铁停稳后侧边门打开,他立刻冲出,男主紧追。两人一路穿过站台跑到街上,惊动街边路人,男主最终追上并抓住他,小男孩委屈抬头,男主慢慢消气,摸摸他的头,露出无奈笑容
在画面呈现上,模型能更好地做到自然的运镜衔接,主体在多次切镜中仍保持稳定,音画始终对齐,使长视频生成结果更连贯。比如在一段京剧表演中,镜头伴随主角旋转水袖甩动完成一次优雅的环绕运镜,主体和背景的呈现始终保持一致。水袖在空中的摆动形成自然的弧线,更遵循物理规律
京剧水袖环绕运镜
R2V prompt
16:9 宽幅电影级质感,一镜到底,丝滑运镜,无剪辑。场景参考 @图片 4。0-5 秒:@图片 2 霸王近景开场,镜头缓慢环绕上半身并过渡至中景;霸王旋身翻转,随后身体与靠旗从镜头前快速掠过,形成自然遮挡,镜头顺势绕至 @图片 1 虞姬身侧。6-10 秒:镜头稳定环绕 @图片 1 虞姬中景,跟随水袖动作完成环绕运镜虞姬抬臂、挑腕、展袖、半转身。最后收袖定格,侧身看向霸王。11-20 秒:@图片 3 武生出场完成后空翻腾动作,随后霸王居中,武生在对侧进退攻防。虞姬位于霸王侧后方以水袖配合,形成刚柔对比。镜头从武生中近景缓慢后拉至舞台大景,结尾三人面向观众同步京剧落幕亮相
针对视频生成中常见的"油腻感"问题,Seedance 2.5 对物体材质、人物肤质与眼神、光影、画面饱和度等细节进行系统优化。模型还减少了字幕与背景音乐不受控的情况,使成片更接近实拍的影视质感
多模态参考
Seedance 2.5 进一步强化多模态参考能力,支持用户单次输入最多 30 张图片、10 段视频和 10 段音频 作为参考素材。更多数量、不同类型的参考素材,能更好地还原用户脑海中的创意,生成主体更多、场景更丰富、镜头变化更灵活的复杂视频内容
模型能综合理解不同素材中的画面构图、场景、风格、人物、道具等元素,并按指令将这些参考素材用于视频生成。在多人同框、群像叙事等复杂场景中,也能同时还原多个人物的形象与声音,保持各主体特征稳定
音乐会多主体同框
R2V prompt
30 秒音乐会片段,16:9 横屏,电影感写实,真实音乐厅光影,暖金色舞台灯,正式古典音乐会氛围。场景 @图一,钢琴家参考 @图二,大提琴参考 @图三,小提琴参考 @图四,主唱参考 @图五,管弦等其他乐队参考 @图六到图十,合唱团参考图十一到图十四,观众席参考 @图十五到图十八。主唱舞台中央走向前沿,钢琴家在钢琴旁,乐队分布两侧与后方,合唱团在舞台后方。开场高位俯拍音乐厅全景,钢琴家落键,主唱进入追光演唱,镜头自然带过小提琴、大提琴与管弦乐队,小提琴明亮,大提琴温暖。后段合唱团加入,主唱与第一排观众短暂眼神交流,观众微笑点头。结尾镜头后移,演唱结束,观众跟随鼓掌
模型还提升了白模参考、运动参考、创意参考等各类参考能力,让画面中的主体、动作、运镜更可控。用户可以用无纹理 3D 模型搭出画面的空间结构、主体姿态、运动轨迹和镜头机位,再让模型参考这套结构生成视频,使复杂镜头的构图和调度更接近预期。同时,模型增强了光照控制能力,通过白模的空间信息,生成符合真实物理规律的光照效果,包括光源方向、色温、强度、阴影投射等
白模参考成片
R2V prompt
参考 @白模 1 的运镜、镜头节奏、景别变化、主体轨迹和镜头调度。参考 @图片 2 的角色外形、场景、材质、光照、色彩和童话氛围,将白模渲染为梦幻温暖、儿童幻想感、3D 动画短片。剧情依次为:幻想天空飞行→云海神兽伴飞→俯冲入海→鳐鱼海底穿梭→镜面时空裂缝→宇宙摘星→幻化回房间→爸爸盖被→合上绘本定格
编辑能力
在视频生成创作中,用户通常需要控制生成时的节奏,并在生成后持续打磨细节。某个动作在第几秒出现、镜头在什么时间切换,或某片段里的角色、动作是否需要调整,都关系到最终成片的效果
Seedance 2.5 支持通过 时间戳 精准编辑音视频内容。生成时,用户通过 prompt 控制某个时间段发生的故事、画面视角、运镜和整体节奏。生成后,用户还能针对指定片段里的角色、动作、声音或剧情进行定向修改,同时保持修改前后的连贯性和真实感
模型还进一步提升了绿幕编辑、视角与运镜编辑、参考编辑等多种编辑能力。在绿幕编辑方面,模型不仅能在保持主体不变的情况下替换不同场景、讲述不同故事,还能更好地基于不同场景的物理规则渲染人物身上的物理效果,包括衣服飘动方向、头发状态、步态节奏、光影等,使主体和场景更加和谐
绿幕编辑
R2V prompt
把 @视频 1 绿幕背景渲染场景、障碍、服装和配角:0-4 秒:户外训练,障碍换石头、砖块、轮胎、木箱;4-10 秒:休息室,朋友鼓励;10-15 秒:国际赛场,训练杆换原创防守球员和门将,主角进球。整体写实电影级
运镜编辑
R2V prompt
编辑 @视频 1,保持人物、动作及画风不变,仅调整运镜。15 秒分段运镜设计:0-4 秒,微型 FPV 贴锅穿行,跟随弹起的吐司后横甩至咖啡;4-7 秒,推近并沿锅边横移,跟随煎蛋翻起落回;7-11 秒,急速升至顶视角,匀速下压扫过餐盘和钥匙;11-15 秒,手持近镜跟随双手快速横甩,最后推近早餐,再拉回双人中景。全程连贯稳定
产业场景
随着模型能力的提升,Seedance 2.5 也在深入教育、工业等更广泛的产业场景
在教育领域,Seedance 2.5 可以将课文背后的历史背景、人物和情节转化为视频内容,把学习内容从静态讲解转化成更生动、更有沉浸感的画面。同时,模型可以帮助老师更高效地制作教学视频,将科学原理、历史事件、实验过程等抽象内容转化为动态演示。豆包爱学 App「豆包课堂」已经在使用
豆包课堂场景示例
R2V prompt
东方写意风格。南宋临安街景,热闹的街上几个孩子边跑边闹,孩子们嘴里张嘴念着"蓦然回首,那人却在,灯火阑珊处"。镜头始终跟随孩子们奔跑,带过热闹的街景。镜头上摇,此人正是 @图片 1 辛弃疾。辛弃疾回头,远处是在灯火阑珊中的男子,镜头连贯
在工业制造、具身智能和自动驾驶等领域,模型可以生成高质量合成视频数据,帮助训练机器人的感知和操作能力,也可以用于工业仿真、流程培训和设备演示。在自动驾驶场景中,模型还可以模拟极端天气、复杂路况等低频场景,为系统测试和训练提供更多样本
汽车拼装白模渲染
R2V prompt
参考 @白模 1 的运镜、构图、景别、空间关系、零件位置、模型结构、装配顺序和运动轨迹。参考 @图片 1 的材质、光照、色彩、反射和氛围,将白模渲染为高端真实汽车拼装片段
Seed 团队也提到,在复杂运动的物理合理性、极多主体交互场景的稳定性上,模型仍有提升空间。未来将继续探索更长的连贯叙事、更好的生成与编辑体验,以及更强的物理世界规律理解能力
项目主页
→ 项目主页:seed.bytedance.com/seedance2_5
→ 即梦网页端:视频生成,选择 Seedance 2.5
→ 豆包专业版:视频生成,选择 Seedance 2.5
热门跟贴