昨晚快12点,我盯着屏幕上一段刚生成的视频。
女娲站在不周山下,五彩石在掌心流转,天穹的裂痕正在一寸寸愈合。
这是AI生成的。但那一刻我激动的感觉,跟四年前第一次通过文字搓出图片一样。
从打开软件到出片,24分钟,一分钱没花。按MiniMax的官方定价折算,这视频成本大概35块。
下面分享一下我的创作思路与感悟。
先说我为什么突然想试这个。
我之前写过一些神话故事(),女娲补天、嫦娥奔月脑洞科幻这类的。虽然断更了很长时间,但这些文字在脑子里始终有着画面,我一直念念不忘想把它实现。
之前没做的原因也很简单,我觉得视频流的搭建太复杂了,无论硬件还是精力,我都要额外付出不少,尤其是现在还用着14年前装的曾祖父级别老电脑。
7月的最后一天,MiniMax发了新一代视频模型H3,原生2K分辨率,一段最长15秒,24帧,可以免费试用3次,这大手笔的豪横劲儿一下子就击中了我。
而促成我动手去干的最后一根稻草,在于MiniMax Design的客户端,有了它,我就可以跟用codex一样,只靠自然语言就开干了,完全不用再操心搭什么工作流。
不过,我毕竟还是一个搓视频的新手,3次的免费机会我可不想浪费掉,所以在正式开工之前,我先用GPT做了一些准备工作,主要是三件事:
一是抽取历史记忆,把故事改编成视频脚本,每个镜头写清楚画面、镜头怎么动、时长、什么情绪。
二是设计女娲的人设,不是影视剧那种cosplay感,是要有上古神话的厚重,并且融入史前文明的高科技脑洞,面部、服饰、发饰、气质全写清楚。
三是场景设定,不周山崩塌什么样、天裂什么色调、五彩石什么质感、整个世界是怎么样的架构,每个场景给一个明确的美术方向。
这步花了大概五分钟,因为之前已经来回调过几轮了,整体上算是比较快的。这些准备工作最重要的意义在于稳定画面表现,否则一旦MiniMax开始放飞自我的话,一百匹马都拉不回来。
接下来就是打开MiniMax Design,登录,选H3模型,把人设稿、场景设定稿、视频脚本一股脑全部灌进去。为了稳妥起见,我把任务模式调整成了“询问”,避免大模型手脚太麻烦一下子给我整太多花活。
接着就是等待与中途的确认了。MiniMax会搭建起视频工作流,并与我确认视频比例、风格,在最终确认后开搓。
24分钟后,出片了。
说实话,总体上讲效果是略超我预期的,比较完整地再现了我的构想。虽然还有不少细节能看出瑕疵与优化空间,但如果把目标做成一个简单易懂又有临场感的神话故事,我觉得已经可以接受了。
最满意的地方应该是人物一致性与动作的自然连贯,这块也得益于我输入的参考图相对比较全面。
最不满的地方,是在画面后半段,视角拉远至世界设定全景时,不太连贯,有几帧有一些贴图感。
还有一些场景设定的一致性比较差,不过在我目前看到的AI短片中,算是比较常见的通病。后续要解决这些问题,还得多提供一些参考图。
另外BGM这块后期还是得自己配一下。搓视频的时候同时会生成音频,但效果整体上中规中矩,我这版的声音并不多。
Anyway,对于我这次吃螃蟹、薅羊毛之旅来说,已经是很成功的结果了。
只是如果细算账的话,对我来说也没那么乐观。
按照H3官方API定价,2K是0.80元一秒。我这次三段试用的视频加起来44秒,按这个价就是35块出头。实际上我最后只留下了一段15的视频,成本就相当于1.6元1秒了。
这个价格跟曾经的CG动画制作相比,那绝对是地板中的地板价了,但对我这个还没踏进视频行业的新新人来说,还是有点让人心里打鼓:
做一段3分钟的视频,可能我需要积累10分钟的素材,这10分钟的视频生成,就要消耗掉480块了。这480能回本吗?
但无论如何,这都是一个很棒的尝试,并且指出了未来的趋势:
文字表达是一切内容创作的基石,而想象力则是决定其上限的天花板。
我很期待下一次视频成本的历史性跳水,如果成本能打到现在的1/100,5块钱以内的成本搞定一段3分钟的视频,整个业态将被全面改写,迎来真正的内容为王的时代。
热门跟贴