粗糙的建模,癫上天的台词。听说《牛来》是一部由两个人历时五年制作而成的院线电影之后,谁不想急头白脸地用AI 做一个属于自己的《牛来》?
我也没忍住。
先看成片。下面这条,是《牛来》最著名的“喊妈”片段。
事先声明,咱确实技术水平一般,各位观众老爷忍忍。
做这个视频,Seedance当然是最容易想到的选择,效果能打,但是价格不太能打。所以理想情况是找一个比较经济的手段,毕竟牛来本身也并不需要极强的视频能力。而对于我这样的新手来说,一个好用的工具会更有效。
恰好MiniMax 在7 月底开放不久的MiniMax Design 工作台,又把图片、视频、声音模型和简单剪辑塞进了同一张画布,适合我们这种临时起意拿出来玩一下的。用户不用先研究一排模型,只要说自己想干什么,Agent 会自己挑工具。
这听起来很适合《牛来》:没有电影级毛发,也没有十几个人满场乱跑,几个低多边形角色,几句十秒钟的小段子,讲究的是便宜、快速、能癫。于是,本着“能用 AI 解决的事情,就先不要惊动第二个人”的低成本原则,来试试手感。
第一步不是先做脚本,而是先告诉模型,牛到底长什么样。我去找了网上的素材,虽然盗摄确实不对,但咱还是先试试吧。
工作台的第一个好处,素材不会越做越散。每次只处理一个角色,先挑5 张最能说明身份的参考,让 Agent 生成五视图;等到做视频,再把角色五视图和场景图一起引用。新结果会主动连接到相关素材,最后长成一张颇为壮观的节点地图。
Agent 这次先后调用了G Image 2和四次香蕉Pro,合计只用了MiniMax design的450积分,折合约3.15元。把几个看到过的主要角色的基础建模做出来了,便宜是真便宜:牛妈妈的五个角度基本统一,但最有辨识度的鼻部环状结构却被磨平了,变成一张标准牛脸。
五视图的问题,不是它画得丑,而是它太爱把角色画“正常”。检查时要先看轮廓和头身比,再看口鼻、角和手脚,最后才看材质。不过因为手头确实也找不到更好的参考素材了,所以人物设定就先基本定型。
先做角色是为了保持后续视频产出的人物一致性,不然做着做着就容易变形。事实证明MiniMax Design 在标准化操作制作流程时,人物的一致性保持的确实不错。没有在多个视频之中有人物的大面积变形。然后随手塞了几个小段子,让模型开始跑内容。
工作台的第二个好处,是可以没有阻碍的快速启动。保持模型选择的“自动”即可,Agent 会视需求调用 MiniMax H3 或 Seedance 2.0 Fast,再把视频接回角色图和场景图。生成后的时间线还可以裁切、变速、分离音频和直接导出。只做粗剪,不必再开剪映或 Premiere。
但它和文本类的Agent 有个很大的不同:任务基本是单线程。一条10 秒视频大概要跑 15 分钟,其他项目就只能排队,这是整个App 段的问题。Codex 和 Claude code 都可以夸 session 多线程同时操作,他们也都具备多模态能力,但MiniMax design只要有一个视频在产出过程中,创作者就只能在电脑前面等着。
对于视频制作这样的工作流而言,单线程确实影响效率。即便在模型能力优秀的情况之下,视频制作也需要不断“抽卡”才能满足产出的质量,所以单线程会把整体制作时间极大程度拉长。
成片的画面一致性倒比预想中好,牛来还是红色小个子,妈妈也保住了棕黄色身体和双角。
真正让我觉得肉疼的,是修改。
我只想把《牛来跳河》中的“中国人能飞”改成“中国牛能飞”。Agent 调用 Seedance 视频编辑后报错:seedance task failed [cloud.upstream_200],随后自动换用Speech-2.8-HD 补了一段音频。
Agent自己换模型的策略很聪明,但是实际产出效果却不够好。画面一帧没变,中间突然插进了另一把嗓子,音色和音量一起断层。对Agent 来说任务已经完成,对观众来说,这头牛只是半路换了配音演员。
开头那条“喊妈”名场面的调整也不太成功,主要出在声音准确性上。
调整音频的话,几乎只能通过提示词整体修改视频的声音,但是产出只修改声音的视频最终和视频本身的契合度就非常糟糕,几乎是不可用的状态,只能考虑重新做一个完整的视频,这样其实还是很费token 的。
声音调整不好,但是MiniMax 的画面调整能力其实不错,在“迷宫问路”这个段子里,最初版本的视频根本看不出牛来和蛇是在一个迷宫里,整个视频的逻辑就不成立。
针对性修改两次之后,“迷宫”的感觉做出来了,画面就可用了。
算算账单
什么?你想看完整AI 牛来?做这几个片段我都燃尽了,完整版真做不出来。
但到这里,我们就可以翻账单了,估算下AI 制作牛来的成本是多少。
MiniMax 中国官网显示,30 元可买 4,285 积分,150 元买 21,430 积分,500 元买 71,435 积分,三档均约 0.007 元一分。官网同时提醒,Agent 无法事先预估具体消耗,应以实际调用为准。
这次一共留下72 笔扣费,合计 12,826 积分,约值 89.78 元。其中视频模型用了 11,680 分,占 91.1%。排除一次收费 1,680 分的失败编辑,10 次完整视频生成共 10,000 分,平均按一次按钮约 7 元。
这里没法硬编一个适合所有题材的“抽卡率”。只按这次的账单看,五条视频如果一次即中,加上图片和 Agent,大约 43 元;平均两抽约 78 元;平均三抽约 113 元。这次五个目标场景做了 10 次完整生成,恰好落在两抽档;再算失败编辑,最后接近 90 元。
当然,这次实际操作我充了一个最基础的65 元就够用了,因为免费额度在做到第四版视频时才用完。如果从零购买积分,三份30 元入门包共 12,855 分,刚好覆盖整个实验。
这次实测做出5个目标片段、约50秒成片,共消耗12,826积分,资源价值89.78元。按相同消耗机械外推:
一次生成就能用:约4440元。
平均每段抽两次:约8052元。
完全照搬本次实测,包括失败编辑和声音返工:约132.36万积分,折合9266元;从零购买积分,实际至少约9270元。
平均每段抽三次:约1.17万元。
如果你真的打算AI 一版《牛来》,考虑长片对角色、动作和声音一致性的要求更高,1万—1.2万元更接近可执行预算。如果要求统一配音、精细剪辑、配乐和人工逐镜验收,建议准备1.5万元左右。
这还没算人工。按本次每个10秒任务约15分钟、平均2.2次调用计算,单线程生成需要约284小时,也就是连续排队接近12天。其实实际成本已经远超媒体报道的牛来成本了。
这一趟下来,我对MiniMax design 的使用体验其实还不错:素材、脚本、视频和粗剪待在一个地方,Agent 会自己选模型,角色画面也有不错的一致性。
但反观这个产品的缺点,却处处要命:任务的单线程;声音的不一致;内容修改仍像重新抽卡。至于动作和台词能不能碰巧踩在同一个点上,也得每条重新验收。
所以,用MiniMaxdesign做出牛来应该不难,但是成本未必比现有手搓版低。就现在而言,人工智能可能还没有人工省钱。
热门跟贴