模型越来越像,阿里怎么继续赛马?
AIX财经(AIXcaijing)原创
作者 | 雷晶
编辑 | 金玙璠
8月24日,阿里最新一代视频生成模型Wan3.0结束十余天的公测后正式上线。
相比上一代,这次最明显的变化是视频更长、能接收的资料类型也更多。单次视频生成时长提升至30秒,同时新增文档、表格、网页等输入方式,并继续强化人物真实感、主体一致性和音画生成能力。在Artificial Analysis平台上,Wan3.0目前在文生视频和视频剪辑两个子榜上均排名第一。
Artificial Analysis文生视频榜单
阿里手里还有另一匹“马”。4月,HappyHorse以匿名模型的身份出现在Artificial Analysis平台,随后被阿里认领。6月22日,HappyHorse 1.1发布,重点升级动态表现、主体一致性、复杂指令、真人质感和音画同步等能力。目前,HappyHorse 1.1在Artificial Analysis文生视频榜单排名第七。
一个是刚刚升级的Wan3.0,一个是几个月前跑出来的HappyHorse,两款模型来自同一家公司,支持的任务和瞄准的场景也开始重合。
那么谁才是阿里的最强视频生成模型呢?它们在具体创作中还有多大差别?我们用人物、广告和动画等任务,对两款模型进行了同题测试。
01.人物:Wan3.0更会演,HappyHorse 1.1不够入戏
先来看人物场景。我们设计了单人特写和多人打斗两道题,一道看人物够不够真实、情绪能不能演出来,另一道则看多人复杂场景还能不能稳住。
第一题,我们要求它们制作一段单人特写,让人物完成从怀疑、发现被骗,到压住愤怒的一连串情绪变化。
Wan3.0的表现更好。它的人物更写实,脸不会有明显的塑料感,能看出皮肤纹理、毛孔等细节。情绪的变化也比较真实自然,整体看上去更像真人在表演。它还额外加入了台词和背景音乐,增强了整体氛围,让这一段更像影视片段。
HappyHorse 1.1的人物质感也不差,没有明显“蜡像感”,整体比较接近真人。但表情变化就弱了一些,我们要求的是比较克制的表演,它确实没有夸张瞪眼或皱眉,可几个情绪之间的切换不够明显,看上去有点像演技不太好的演员。尤其是最后要求的“冷笑”,实际更接近普通微笑,放在发现对方撒谎的情境里显得有些突兀。
第二题,我们把难度迅速拉高,要求参考电影《奥德赛》的史诗战争场景,至少要有二十名士兵分成两个阵营,在古希腊城邦外展开混战,还安排了盾阵推进、近身格挡、兵器碰撞等连续动作。
Wan3.0这一轮整体表现比较稳。古希腊战场的环境基本搭出来了,城墙、海岸、战船都在,两边阵营也没有打着打着混到一起。多人同时打斗时,也没有出现特别明显的穿模或突然位移,打斗、冲撞基本能接得上。
HappyHorse 1.1的问题主要出在开场。按设定,两军应该先正面对阵再迅速冲撞,但它生成的第一个镜头更像同一阵营的人围成一圈,随后一个类似主帅的人物突然出现在中间,战局关系显得有些莫名其妙。好在后续场景和打斗基本符合要求,战争氛围、多人混战和整体视觉方向都没有跑偏。
综合来看,Wan3.0的优势更集中在表演细节和复杂场面的稳定性上,单人特写更会演,多人战争也更稳;HappyHorse 1.1的人物也足够自然,大场面也能做出来,但在情绪递进,以及多人场景的调度和动作逻辑上都还差一点。
需要说明的是,Wan3.0的代价是速度明显更慢。从几轮测试的生成速度来看,HappyHorse 1.1做完三个视频的时间,Wan3.0大致才完成一个,效率差距比较明显。
02.广告:Wan3.0会拍产品,HappyHorse 1.1会打造氛围
广告、电商、社交媒体这些需要持续产出素材的场景,是AI视频比较容易落地的地方。一条广告既要把产品拍得好看,也要把卖点说清楚,实际生产中还要考虑生成效率和成本。
所以第二轮,我们把两款模型拉进商业场景,分别做一支产品广告和一支真人美妆广告。
我们先给了一张桌面胶囊咖啡机的产品图,让它们做新品宣传片。要求不能擅自改外观、颜色、比例,还要完成整体亮相、细节展示和真实使用。
Wan3.0的表现更成熟。它的整体画面比较写实,没有明显的CG塑料感。它的镜头顺序也比较清晰,在展示产品细节时,基本按照“做一杯咖啡”的过程往前推进,看起来更像一支完整的产品广告。
HappyHorse 1.1显得中规中矩,构图和整体调性没有明显问题,但质感差了一点,机身看上去偏塑料质感。细节展示的镜头也略显杂乱,更像把该有的元素依次拼接在一起。
接着,我们改做真人口红广告。要求女生依次完成拿起口红、打开口红、涂抹上唇和展示产品,全程保持同一支口红。这里有一个隐含的要求,口红既然涂上去了,最后总得看得出妆效。
Wan3.0的人物依旧更写实,近景下能看到皮肤纹理,没有明显过度磨皮。口红涂抹之后,唇色也能看出变化。不过它的背景音乐选得不太对,整支片子的音乐偏动感,和精致的美妆广告不太搭,削弱了画面的高级感。
HappyHorse 1.1的成品更有氛围感,人物也比较自然写实。但在卖点展示上掉链子,涂完口红后,嘴唇颜色却几乎没有变化。
这一轮,Wan3.0在产品质感、使用过程和效果展示上更完整;HappyHorse 1.1能营造广告氛围,但对产品细节和卖点的保持还不够稳定。
03.动画:Wan3.0更会讲故事,HappyHorse 1.1剧情跑偏
接着看动画场景。我们让它们还原“沉香劈山救母”的神话故事,人物造型、服装和故事走向都已经交代清楚。
Wan3.0更会讲故事。它没有完全按照我们要求的景别执行,更偏爱人物近景,大场面的美感弱于HappyHorse 1.1。但它基本抓住了故事的主线,几个关键情节衔接得比较自然。最后母子见面时,重逢的情绪也传达出来了。音效也是加分项,雷声、斧头劈开山体的声音都比较写实。
不过,它会“好心办坏事”,自己加了字幕,而且字幕内容还是错的。原本没有文字需求,反而多制造了一个明显瑕疵。
HappyHorse 1.1正好相反,它最稳的是风格,最乱的是故事。它对东方奇幻、仙侠动画电影的风格把握更好,华山山体、机关、云雾和整体色彩都更有东方奇幻大片的感觉,远景构图也比Wan3.0更完整。
它有点喜欢自作主张。它在华山加了一排彩色小旗,和我们要求的设定明显不是一个视觉风格,看着有点出戏。我们原本设计的是三圣母被封印在山中,沉香听到母亲微弱呼唤,由此更加坚定救母的决心。但HappyHorse 1.1直接把“母亲的呼唤”具象成了三圣母突然出现在沉香面前。人还没被救出来,却先自己走了出来,前后逻辑被打乱了。
到了结尾,它又临时“改戏”。我们要求的是两人手臂相握,成品却变成男主直接把母亲举了起来,放在母子关系里显得有点违和,也削弱了原本应该有的重逢情绪。
整体来看,Wan3.0更擅长把既定剧情讲顺,音效和情绪也能跟着故事走;HappyHorse 1.1在美术风格和大场面营造上更有优势,但很容易“自作主张”改剧情。如果只看单个镜头,HappyHorse 1.1可能更漂亮;如果要在十几秒内真正讲成一个完整故事,Wan3.0更稳。
04.Wan3.0独特功能:视频更长了,文档也会读
Wan3.0这次还有两项比较特别的能力:单次生成时长从15秒拉到了30秒,同时支持直接读取DOC、PDF、PPT等文档生成视频。
我们干脆把两项能力放在同一道题里测试,直接给它一份30秒的重生复仇短剧剧本,让它按照文档内容出片。原剧本包含重生、调换毒酒、证据反杀和结尾反转等多个情节。
30秒确实能装下更多故事。Wan3.0基本把几个主要情节都串了起来,场景连续切换时,女主的外形也保持得比较稳定,没有明显“换人”。不过人物表演稍微有些“用力”,尤其在震惊、愤怒等情绪比较强的场景中。
不过,具体到细节,文档理解还没有完全落到画面里。按照剧本设定,女主提前开启了直播,观众已经通过直播看到男主下毒,后面她再举起手机展示直播画面。Wan3.0虽然理解了手机是关键证据,真正生成时,手机屏幕没有把直播画面呈现出来。文档转视频目前更擅长抓住剧情主线,但对文档里的具体信息,还原得还不够细。
30秒和文档输入,分别解决了两个具体问题:前者减少多段生成后再拼接的次数,后者省去把完整脚本或方案拆成多段提示词的步骤。对短剧和广告创作者来说,输入单位开始从一句提示词变成一份脚本,输出也从单个镜头延长为一小段连续内容。
但这次测试也说明,视频变长不等于叙事一定完整,能读取文档也不等于能准确还原其中每个细节。现阶段,Wan3.0更擅长搭出故事框架;涉及屏幕文字、关键道具和严密因果关系时,仍需要人工检查和后续修改。
05.结语
Wan系列和HappyHorse系列最开始走的是两条不同的路。
Wan系列来自通义体系,早期承担的更多是基础模型和开发者生态的任务,强调通用能力、API和开源。HappyHorse系列则最早脱胎于淘天体系,更靠近广告、电商和创作者场景,从一开始就在强调人物、原生音频、多图参考和商业内容生产。
在视频生成还没有跑出明确技术路线的时候,阿里同时押注两套模型并不难理解。一边从基础模型出发,继续往能力上限走;另一边直接进入广告、电商这些真实场景,寻找用户到底愿意为什么买单。
但今年以来,阿里开始逐步收拢两支团队。6月,通义大模型事业部与未来生活实验室合并为Token Foundry事业部,HappyHorse团队一并归入;7月,通义万相团队又进一步并入未来生活实验室。调整之后,Wan、HappyHorse被归拢到同一个团队。据媒体报道,阿里内部也已经讨论过Wan与HappyHorse进一步整合的可能性。
组织距离变近的同时,产品路线也开始靠拢。到了Wan3.0,Wan开始补齐长视频、参考生成、视频编辑等能力,并进一步进入短剧、广告和企业内容这些过去更接近HappyHorse的应用场景。技术能力越来越接近,目标用户也越来越重合。
这次实测也能看到这种变化。它们确实还有各自的特点,Wan在人物表演、剧情理解和指令遵循上更稳,HappyHorse生成更快,环境和视觉风格也有优势。但这些差异还不足以形成非常清楚的产品分工。用户很难简单判断,什么任务更适合HappyHorse,什么任务更适合Wan。
尤其视频生成还是一门非常烧资源的生意。同时维护两套模型,需要持续投入训练、后训练、推理优化,还要分别维护API和定价体系,并建立各自的用户认知。两款模型还在探索不同方向时,这些投入可以换来更多可能性。但现在两边的能力和目标用户越来越重合,怎样避免重复投入、让两套模型形成更清楚的分工,就会变成一个更现实的问题。
阿里的竞争对手也不少。字节的Seedance已经在长视频、连续叙事和复杂运动上形成较强的市场认知;快手的可灵背靠成熟的创作者生态,持续往影视制作、镜头控制和专业创作工具延伸;MiniMax也在用MiniMax Design把模型能力组织成完整创作流程。阿里手里虽然同时有Wan和HappyHorse两张牌,但两张牌越来越像之后,怎样打出差异就变得更重要。
如果继续并行,就需要形成更清楚的能力和场景分工;如果整合,也要把两边已经积累的模型能力、产品经验和用户场景真正合到一起。无论选择哪条路,阿里最终都需要解决的是怎么让用户在做视频的时候优先想到自己。
*题图由AI生成。
热门跟贴