作者 | 懒人
编辑 | 张洁
千呼万唤,Seedance2.5终于来了。
7月31日,即梦AI正式上线了Seedance2.5视频模型,会员可用。
这也是自今年2月Seedance2.0之后,字节视频模型的一次重大升级。早在6月底的火山引擎大会,字节就放出预告,当时还展示了Seedance2.5做的一些视频,30秒原生4K,可以说吊足了胃口。
大家望眼欲穿到什么程度呢,我们潜水的一些社群,几乎每日一问:
一直到今天,终于等到了。
综合官方信息和创作者反馈,我们把Seedance2.5最值得测的能力归纳成四项:首先,真人视频里人物神态更逼真了;其次,长镜头的空间一致性和连续性很突出,同时单次生成的时长上限被拉高,这也减少了画面拼接带来的跳跃感。此外,Seedance2.5还进一步加强了视频编辑的能力。
不过,即梦AI上的Seedance2.5目前只有480P、720P两种分辨率,此前说的最多50个多模态参考输入也变成了30个。另外还有智能编辑和超长视频功能,后者支持单次生成180秒。
考虑到Seedance2.5正式对所有用户开放之前,已经有一批创作者拿到了体验资格,而且他们的测试视频已经在社媒上积累了相当多的讨论,所以话不多说,在分享我们的最新实测结果之前,先来看看社媒上大家已经围绕Seedance2.5创作出哪些热门案例:
首先最火的,可能要属火山引擎国际版官方账号“BytePlus”在7月15日发布的欧文故事短片,这条视频用Seedance2.5重现了1998年世界杯那个18岁少年的经典进球。
视频时长约1分45秒,全程用Seedance2.5制作,回顾了1998年世界杯上迈克尔·欧文对阵阿根廷的那个精彩进球。同时,视频画面穿插了小时候的欧文在街头踢球,整个过程有多次丝滑转场,完全感觉不到AI拼接的痕迹。
这条视频发出后,在X上获得了1320万的浏览量,发布方“BytePlus”也是毫不谦虚地写道——Seedance2.5彻底突破了AI视频创作所能达到的界限。
AI动画创作者“nachos2d”也在6月23日发布了多个用Seedance2.5制作的动画短片,成片质量非常高。
无论是画面风格的一致性,还是镜头的连续性上,表现都很好。就连作者自己也反复看了很多遍,试图“找茬”,但又表示“说实话找不到任何瑕疵”。
再看今天Seedance2.5正式发布后我们最新看到的一些案例,比如博主“赵伯祚”,这也是一位导演,他在迅速尝鲜Seedance2.5 180秒的超长视频能力后,发布了一条俩人俩猫送星星回家的童话故事。
他在视频描述中表示,自己是用四张角色图和文字脚本,一键直出了这条三分钟的动画片。
在这条视频的评论区,大家也纷纷感慨,“行业要被改变了”。
不过,“AI新榜”注意到,根据积分预估,即便有折扣,180秒的视频也要耗费5220积分。要知道,订阅即梦AI 499元的高级月会员,一个月总共才6160积分。
另外我们发现,Seedance2.5生成30秒、720P分辨率的视频需要780积分,折合单秒价格是2.1元;超长视频(180秒)的单秒价格更贵,差不多是2.35元/秒。此前,Seedance2.0 1080P分辨率的单秒价格是1.38元。
Seedance2.5更贵,但也更强了。
此前Seedance2.0最多支持单任务上传 9 张参考图,而Seedance2.5直接把这个数值拉到 30。而且,30个参考物可以是图片、视频或音频,也可以是3D白模。
“3D白模”,这个值得单独说一下。
我们找了一个官方的case演示,先上传一段白模预演视频,
再配上角色参考图,
在提示词里写清楚哪个模型对应哪个角色、剧情怎么推进、整体什么风格,就可以实现用白模画分镜。同时,还支持上传建好的模型动画,告诉模型按什么材质和色调,就能一键渲染。
实测Seedance2.5四大亮点能力
我们也针对开头提到的Seedance2.5四大大亮点进行了实测。
首先是多人动态场景,来测试真人的生成效果。
提示词:
集市人群,数十人同时走动、交谈、摊贩挥手,猫狗穿梭,大量独立运动个体
Seedance2.5对这段市集群像的处理,真实感拉满,属于不看水印以为是实拍的水平。
随后,我们进一步升级难度,从真人升级到长镜头打斗场景。我们准备了两张人物的参考图,一张西装男和一张皮衣男子的照片。提示词如下:
黄昏时分,两名男子在天台打斗。皮衣男子率先出拳,西装男子侧身闪避后反击。两人撞碎一面玻璃隔断,碎玻璃在逆光中飞散,随后在水泥地面上翻滚扭打,一路打到天台边缘。镜头从侧面横向跟拍,保持中景,浅景深,背景是城市天际线和暖色落日。打斗过程中穿插喘息声、拳头击打声、玻璃碎裂声和碎片落地声。30秒连续画面,不切镜。
这是Seedance2.5的生成结果:
可以看到,提示词里要求的黄昏、打斗动作、玻璃碎裂的音效等,都实现得比较逼真,两人翻滚扭打中的光影和衣角等小细节也照顾到了,整体成片质感几乎没有AI感。
不过,可能因为打斗动作比较简单,且时长要求30秒,导致中间翻滚扭打到天台边缘那段有些单调,就是两个人一直在滚。但整体空间一致性和连续性都做得比较好。
而且,Seedance2.5还会根据提示词自动补齐合理的细节,比如我们上传了两只猫的照片,想做一个泰国旅游Vlog。输入以下提示词:
以参考图中的两只猫(图1、图2)为短片主人公,保持外观一致,生成真实日常vog画风短片。剧情为:两只猫早上起床,在被窝里伸个懒腰,起床后橘猫煎荷包蛋,两只猫坐在桌前一边看动画片一边吃早餐,饭后白猫收拾行李,两只猫一起出发,两只猫各戴一个小帽子、背一个小书包,坐飞机到达泰国市集,一起开心拍合照打卡、画面治愈温馨,然后开始泰国一日游:逛集市、购买小礼物、穿泰国服装拍照、跟当地人学习双手合十说“萨瓦迪卡”、去海边喝椰汁
成片相当完整,不仅准确完成了提示词要求的所有动作,还填充了生动的细节:收拾洗漱用品、坐飞机时拍了窗外风景等。
然后,我们又试了试电影级长镜头运镜。这里我们用了文字生成,提示词:
雨夜,霓虹灯闪烁的夜市街道。0-8秒:中景跟拍。一位穿红色大衣的女性撑着透明雨伞,在人群中快步走过。她在一家馄饨摊前停下,收起伞,对摊主说:老样子,多放辣。8-16秒:切到摊位正面,中近景。摊主是个五十多岁的男人,围裙上沾着面粉。他抬头笑了一下,用带着西安方言的口语回了一句:“今天这么晚?”手上没停,舀汤、撒葱花。蒸汽从碗里升起来,被霓虹灯染成粉红色。16-24秒:切到女性侧面特写。她接过碗,低头吹了吹,轻声说:“等一个人。”雨滴落在她肩膀上。24-30秒:前景是她在摊位上低头吃着馄饨,远处可见巷子尽头站着一个撑黑伞的人影。人影刚抬脚想走过来,迟疑了一下又转身离去。人影在雨雾中越走越远。
在不抽卡、一次生成的情况下,我们拿到的视频前20秒表现几乎没什么问题。人物刻画、镜头推进、背景音效,以及摊主的方言对白,都和提示词要求的一致,街道的夜景也很有生活气息。但是细看的话,招牌上的汉字还是出现了扭曲变形。
更严重的问题在最后10秒,尤其是镜头三。我们希望实现的效果是她回复摊主说“在等一个人”,实际变成了她坐在座位上说了这句话,就会显得很奇怪。
于是我们就想顺便测试一下Seedance2.5的视频编辑能力。对很多创作者来说,做局部的精细化编辑这个能力很重要,因为它意味着你不用整个重跑,只需要调整不满意的那个点。
然而,我们发现,用Seedance2.5去编辑一个视频,不论你的改动是什么,都需要消耗960积分(折后),但重新生成一个30秒的视频只需要780积分。
看来,挽救一个镜头还是赌上运气重新抽卡,对创作者来说,This is a question。
AI视频赛道,又要变天了?
非常巧的是,MiniMax也在今天发布了他们的新一代AI视频模型H3。
同一天,两个视频模型向王座上的Seedance2.0发起挑战。不过,这两个模型切入的方向不太相同。
我们实测的感受是,Seedance2.5正在把“虚拟摄影机”的能力继续往上推。突破了15秒的生成上限、30个参考输入、音画同步生成,这些参数都指向的是一件事:前期拍摄。它要让你凭空创造一个世界,然后用电影级的方式把它拍下来。
从社交媒体上的创作者反馈来看,MiniMax-H3走的是另一条路,视觉包装和后期特效。综艺花字、MV歌词动画、logo演绎、电商产品宣传片、活动片头,这些以前需要设计师手动拉关键帧、套模板、在剪辑软件里一帧一帧磨的活儿,H3试图用一个Prompt搞定。它想成为的是“后期之王”。
如果确实如此,两者倒是相辅相成,补全了视频制作的全流程,也给火热的AI影视赛道再添了一把柴。
还有一个细节值得一提:H3宣布将开源。AI视频模型走到开源这一步,意味着后面会有人继续做推理优化、微调特定风格,长出无数垂直领域的特化版本。
Seedance2.0统治了半年之久的AI视频,真要变天了。
欢迎分享、点赞、推荐
一起研究AI
热门跟贴