15个人,14天,不到50万美元,做出一部90分钟AI长片,还在戛纳首映,《华尔街日报》、BBC等各大媒体争相报道。

打开网易新闻 查看精彩图片

这是Higgsfield用AI制作的电影《Hell Grind》,如果通过传统拍摄方式,5000万美元都打不住。

打开网易新闻 查看精彩图片

现在他们已经把项目全部开源了。我扒了一圈,发现几个具体技巧非常值得做AI长视频的创作者借鉴:角色怎么不变脸,场景细节怎么固定,复杂镜头怎么不乱。

先给角色建个档

做过AI视频的人多半都栽过这个坑:第一镜角色还挺稳,第二镜脸开始飘,第三镜像换了个人。大部分人的本能反应是把描述写得再细一点。可文字越长,模型不一定越听话,反而更容易抓错重点。

打开网易新闻 查看精彩图片

Hell Grind的思路是:与其每次重新描述,不如直接把角色做成资产。一段固定文字+一张参考图,这就是一个资产。一次搞定,反复调用。

打开网易新闻 查看精彩图片

以主角Roko为例,他的形象其实是一组资产,正常状态的、湿透的、战损的,每一个都有独立的描述、独立的参考图,用到哪个就直接调哪个。

打开网易新闻 查看精彩图片

甚至每个手部动作都是一个固定资产。

打开网易新闻 查看精彩图片

为了让角色稳定,他们的角色参考图故意做得很无聊:中性背景,平光,皮肤是真实的皮肤,姿势也普通,像证件照。

打开网易新闻 查看精彩图片

因为这张图就不是给观众看的,它是给模型认人用的。你把光影搞得太花哨,模型就会连着光影一起学,下一镜换个环境,人就跟着崩了。在他们的流程里,角色表不负责好看,只负责稳定,电影感应该放到具体的镜头和场景里,不要放进角色设定里。

甚至他们的全身参考图,有时候把脑袋都去了

打开网易新闻 查看精彩图片

全身图里的脸本来就小,模型从这么点像素里采样,五官很容易采崩。与其让AI拿一张糊脸的参考去生成人物,不如干脆告诉它:这张图你只需要看身材比例、看服装、看轮廓,脸的事你去看另一张高清近景。一张图只干一件事。

给模型一张片场地图

现在的视频模型生成时长有限,做长视频,很困扰的一点就是:把两条单看都不错的镜头放到一起,突然发现物件跑到画面另一边去了,主角衣服上的图案左右调了个个儿,远处那片红色的天,第二个镜头里居然变成了远山。每一条都漂亮,拼起来就是一堆碎片,各是各的世界。

这是因为模型压根没有一个稳定的空间概念,它每一次都是重新搭一个景。

打开网易新闻 查看精彩图片

Hell Grind里给这件事起了个名字,叫GEO SPATIAL LAYOUT,可以理解成一张写给模型看的空间地图。这张地图在整支片子里是锁死的,每一条镜头prompt都要带上它,一个字都不改。

打开网易新闻 查看精彩图片

我翻了他们的提示词,发现这部分写得特别细,比如这一幕人物和祭坛之间的距离,提示词里固定了3米。甚至连摄影机的位置都写死了。

打开网易新闻 查看精彩图片

另外一个很有意思的点是,他们每个场景开头会先留1秒宽镜头

打开网易新闻 查看精彩图片

这1秒没有台词,也没有动作,只是把整个空间摆出来。文档里的说法很形象:让模型先“拍下”这个安排,谁站在哪,什么东西放在哪,光从哪里来。

打开网易新闻 查看精彩图片

它有点像开拍前先让模型认一遍片场。门在哪,角色在哪,道具在哪,光源在哪,先看清楚。后面镜头再切进去,人物和道具就不那么容易乱跑。只需要花这一秒钟的时长,就能省下几个小时的重复抽卡

复杂场面拆成一张调度表

Hell Grind是一部动作奇幻片,里面有小孩、怪物、神器、武器、群演、爆炸、光效。越是这种镜头,AI越容易乱来。

打开网易新闻 查看精彩图片

人数不对、武器变形、道具忽大忽小、背景里突然冒出一个不该在这的人...... 如果这时候你还只写"史诗级大战,场面震撼",那基本就是把方向盘交给模型,然后开始祈祷。

打开网易新闻 查看精彩图片

他们的处理方式是:先把一个镜头拆成层来写。角色层写清楚画面里到底有几个人;空间层写清楚每个人站在哪;道具层写清楚每样东西是什么状态;镜头层写清楚摄影机怎么运动;风格层写清楚最终画面要收在哪种质感上。每一层各管一件事,不要糊在一起。

打开网易新闻 查看精彩图片

还有一个容易被忽略的点:每张参考图都要标清楚"用来干嘛"

这张只看角色,不要继承构图;那张只看场景,不要新增人物;道具图只继承物体状态,不要连位置一起搬过来。模型是真的会手欠,你给它场景参考,它可能把参考里的路人也带进来;你给它道具参考,它可能连光线一起模仿。

打开网易新闻 查看精彩图片

所以复杂镜头,最好当成一张调度表来写。信息越分层,模型越不容易糊成一锅粥。做到这个份上,AI视频已经不太像魔法了,更像制片管理:每个角色、每件道具、每种状态先归档,用的时候再点名调用。

AI不是一键成片,但它正在改写门槛

当然,Hell Grind不是一个“一句话生成电影”的神话。他们也生成了很多次,写了大量提示词,做了大量参考图和资产管理。背后依然有很重的人力、算力和流程设计。

AI没有把电影制作变成魔法,但它确实把门槛打下来了。

过去要拍一部90多分钟的动作奇幻片,15个人、14天、50万美元,几乎不可能完成

但现在,很多环节开始被AI重新组织。不是大团队才能做电影,也不是只有几千万预算才能验证一个创意。过去只有大团队、大预算才能承担的复杂流程,现在可以被一支小团队重新拆开、压缩、重组。

打开网易新闻 查看精彩图片

电影是最重的内容工业之一,都已经开始被AI改写生产方式了。那企业里的很多流程,就更不该只停留在“让员工用几个AI工具”这个层面。

真正的问题会变成:哪些工作可以先资产化?哪些流程可以被AI接管一部分?哪些岗位之间的协作方式,要因为AI重新设计?

所以AI Native不是买工具,也不是办几场培训,而是一次组织方式的重构。

如果你也是企业一把手,想用AI提升效率,但还不知道从哪里开始,8月15号的猎豹AI实战派,我们会把自己三年来做AI Native组织变革的经验,全部讲给你听,感兴趣的朋友欢迎扫码报名

打开网易新闻 查看精彩图片