好莱坞演员本·阿弗莱克最近在一段分享里,聊的不是剧本,而是开源视频模型怎么微调。他说得很具体:先冻结基础权重,学习率设成 2e-4,然后只训练最后一层"电影感"相关的参数。

这套说法来自 Thomas Wolf 在 X 上的一条帖子。帖子里还带了一句调侃——Karpathy 从 X 上消失了,阿弗莱克倒是接上了话,招呼大家"围过来"听他讲参数怎么调。

打开网易新闻 查看精彩图片

他到底在调什么

按阿弗莱克的说法,做法是解冻权重,但只训练最后一层"cinematic layer"(电影质感层)。目标不是让模型生成随便一段视频,而是让成片能达到真实剧组的生产标准。

换句话说,他关心的不是模型能不能跑通,而是输出能不能直接进片场用。这个诉求和大多数开发者调模型时的关注点不太一样——后者往往先看指标,他先看能不能过拍摄这一关。

他为什么有资格聊这个

阿弗莱克的身份不只是演员,他还是 Artists Equity 的 CEO。这家公司是他参与创办的影视制作公司。

更早一点,他在 2022 年创办了 InterPositive,一家 16 人规模的公司。从时间线看,他对视频模型微调的关注不是临时起意,而是有一条自己的业务线索在支撑。

一个 16 人的团队,加上一个演员兼 CEO 的身份,去碰开源视频模型的微调——这件事本身就有反差。通常这类工作出现在实验室或大厂内部,现在被一个好莱坞团队拿来做,而且谈的是学习率这种具体参数。

值得留意的信号

他提到的"冻结基础权重、只训最后一层",是微调里比较常见的省算力思路。把它用在视频模型上,指向的是一种现实需求:剧组要的是可控、可复现的画面质感,而不是每次生成都开盲盒。

阿弗莱克把学习率 2e-4 这种细节摆到台面上讲,说明这套流程在他那边已经跑过,不是概念层面的讨论。至于效果能不能真的达到"production standards",他没有给出更多数据。

从 InterPositive 的 16 人规模,到 Artists Equity 的 CEO 身份,再到公开聊开源视频模型微调——这条线索串起来看,影视行业对生成式视频的介入,正在从"试用工具"往"自己调模型"走。