假期到这个时候,有人已经回家瘫着了,有人还在返程路上。
出去一趟,手机、相机、存储卡塞得满满当当。想着做个假期总结发发小红书,或者剪个短片秀翻朋友圈,结果一看大几百GB甚至上TB的素材,被自己随手一丢乱七八糟放在电脑里。点开文件夹两眼一黑,瞬间力竭了。
别急!2026年了,剪视频这件事,不妨试试让AI来?
我这里有一份之前在新疆冬天拍摄的素材(国庆长假没出门玩,哭泣),拖延症一直到现在还没动。1.5TB乱七八糟各种规格,拿来让AI试着剪一下,死马当活马医玩玩看。
考虑到素材量实在巨大,GPT-6、Kimi K3这种级别的模型我舍不得用,这不DeepSeek-v4.1-flash整合升级了多模态和文本理解,而且还便宜!奔着又想要便宜、又想要快、又想要好、又不用费劲的“我全都要”的目标,我组合了Codex+DeepSeek这个配置来剪辑视频。
选用Codex是因为它能直接操作电脑桌面,模拟人类用软件工作。剪辑软件我用的也是人人可用的免费版剪映,主打绝不多花一分钱。
简单来说,用AI剪辑视频的过程和人工剪辑是一样的。“整理素材”->“编写分镜”->“剪辑执行”->"包装输出"这个流程,交给AI来做就行。
我原以为,难点大概在怎么把剪辑风格说清楚。但整个工作搞到后面才发现,要求已经说得相当细了:不要人物正脸,颜色自然,声音分层,镜头别重复,结尾利落,最后还要留一份能继续改的剪映工程。
视频也确实做出来了。只是,离我预期还有点远,甚至一度在翻车的边缘疯狂试探。
素材整理先交给AI
素材量确实有点壮观:1076个视频,约1.5TB,加起来约23小时。尼康Z9、索尼FX3、运动相机、无人机,各拍各的,雪山、城市、人物、市井、风光甚至还追着鸟拍,全都堆到同一块盘里。
别说这1000多个长视频了,就是手机里有100张照片你都不一定想动。放在古法时代,整理这一大堆素材堪比搬了个家,既费时又费力还没有什么实际收获感。
AI的作用这个时候就极大体现出来了!
把混乱无序的素材都丢给它,让它自己根据画面内容(多模态的作用!)、拍摄时间、素材参数信息、甚至部分有GPS地理信息综合整理分类,顺带整理的时候还能构思混剪片子用什么片段,以及如何构建分镜等等等等。
效率远超人工一条一条去看,极大解放双手。1000多条视频,喝一杯咖啡时间就完成了,又快又准,爽飞!
强烈推荐每一个人都用AI去做素材/文件整理,真的是谁用谁知道。
成本问题不用担心,一条长视频,AI不会每一帧都看一遍。以本文为例,它会有选择的从视频里抽一帧,拼成了36张带编号的接触表。
“接触表”听着有点陌生,打开就懂了:一页排满小图,图下带着编号。雪山、湖面、公路、街道终于能放在同一个视野里看。看到想用的画面,记下编号,再回到对应文件。
当然,部分非常长的车拍视频沿途的景物会变,只靠接触表可能不够。
于是,500条至少30秒长的视频又做了一轮抽样:每条在接近开头、结尾,以及中间几个位置抽8帧,共4000张图,排成50张时间条。每张图下面都有时间,候选片段还能继续加密抽样。
比如编号765的一条视频,足足27分多钟。镜头定位记录把它分成了几段:前面有夜间公路,15分10秒到19分46秒被标成城市街道的候选区间,后面另记了一段固定机位的霓虹。想要城市段落,就可以从那几分钟里继续挑几秒,省去从头拖一遍的工夫。
让AI自己写分镜
从人工剪辑的角度看,素材整理完后,接下来就是设计和准备分镜脚本。以往要自己反复在素材里挑三拣四,但是有了AI,我们可以让它来组织设计。
这也是我最期待的部分:让AI帮忙想,这些画面该怎么连起来。
考虑到我的拍摄素材以风光为主,所以这个短片的剪辑风格示意上,我给它发了一些我喜欢的8KRaw、Links等各个摄影师的风光短片链接,让它自己提炼重点、学习参考。甚至还有以前我自己古法剪辑的混剪小片,预期是它能比较好的吸收理解这些风格做视频创作。
在Codex里我用了“目标”模式,要求DeepSeek在设计分镜的时候同时把音效、BGM、包装花字都设计到位。音乐考虑到版权问题,我还给它开放了直接使用Epidemic Sound版权曲库的权限。
早期分镜排了约2分45秒。星空、飞机、街景先把出发的感觉带出来,再往湖面、天鹅、雪山和峡谷走。每个镜头都写了素材编号和入出点,声音也跟着写在旁边。
这一点值得直接学。只写“接一个漂亮的雪山镜头”,执行时还得重新猜。写成“用哪条素材,从哪秒到哪秒,为什么接在这里,底下留什么声音”,下一步才有具体的东西可做。
可惜,文档里的片子看起来挺顺,初稿出来,我就傻眼了。
第一版给的音乐“太史诗感了”,白色标题混进高光里看不清,结尾拖沓;音效设计也没有章法,我决定先细化一下需求,强制要求把开头改成相机快门、胶卷过片的声音。
模型对声音的理解
明显欠缺
视频剪辑,是视听的艺术。只是我好像有点高估了现阶段模型对声音的理解能力。
目前绝大多数模型聚焦的都是“语音转文字”这一个细分领域。而对音乐、音效的分析和鉴赏能力就欠缺了很多。而音频的设计好坏直接影响了一条视频的质感。甚至一些难以量化的情绪和氛围也会影响到整个分镜的设计。
我跟AI说得很清楚:不用旁白,不要只铺一首歌,音乐、音效、环境和现场声音都要考虑。
后期文件里,也确实留下了四条独立音轨。音乐单独一条,快门、撞击、转场等音效单独一条,风、水、街市之类的环境声单独一条,再留一条从原视频取出的现场声。
按这个结构搭好之后,调整会方便很多。比如快门太弱,就单独改音效轨;音乐盖住了环境,只需在对应区间压低音乐。改到某个位置时,把播放头放到切点前面一点,连着前后镜头一起听,声音有没有突然闯进来,很容易发现。
理想情况下这样是没问题的。但偏偏,现在的AI在处理声音的时候,会先用一些机械的数理方式,把各个频率、波形、振幅、相位等等拆解为可以量化的数据,然后基于这些数据去做所谓“合适”的设计与操作。
在一些重鼓点的快闪音乐下,这种方式是有效的,但如果稍微带一点点氛围感,这个方式立马跑偏。
开头原本放了一个入场音效,执行记录却发现,音效的标志点比画面晚了约一秒。回头检查文件,真正的点位在音效文件的开头约1.3秒之后,前面还有一些小的起伏和铺垫。文件虽然按计划放进了时间线,响的那一下却没落在切点上。
于是重新找位置,改入点,再调音量。换一首音乐、换一个音效,反复在计算和照抄数字里重复试错。
我翻到这里,已经不太敢只看“混音完成”四个字了。
DeepSeek多模态理解
还需要提升
选完镜头、排好声音,接下来轮到调色和包装。也正是在这里,原本省下来的操作,开始一项一项补回来。
多台设备拍的画面接在一起,有的灰,有的浓,白雪的颜色也对不上。
我要求AI逐镜调整,但看它自己在电脑屏幕上点点按按,突然意识到一件事,DeepSeek能选到指定片段,也能选择合适的调色滤镜,但它在需要回看的时候,看不到调色后的效果。
原因是剪映的播放头,需要再手动点到对应的片段位置,才能看到片段调整后的样子。古法剪辑里,这是一个非常自然的操作,但是在AI这里,DeepSeek不知道,我需要非常清楚地告诉它怎么用这个软件。
这句提醒很细节,但也让我开始泄气了。AI已经写了非常多的调色计划,实际操作时,选中的片段和正在看的画面,却还没对上。
甚至出现过这种状态:片段选中了,播放头还停在零秒,预览是一片黑。
然后调色也有一点麻烦。
DeepSeek可以理解图像内容、可以制作调色方案,但面对大批量规格和内容不一的素材,整体统一性实在难以保证,而且总感觉它一直在想办法偷懒。调色在反复返工,前前后后改了快10版,峡谷上方的天空甚至还多出一道彩虹色带。
后来我一条一条让AI调整,它才终于给出了一个比较好的结果。
成片比想象中折腾
在这些返工之间,会话还断了几次。
整个剪辑过程接力了8个会话,其中6次遇到异常被强制中断。
从第一条记录到最后一条,跨了约 49 小时,包含等待和间隔。它并非连续剪了两天两夜,但我最初设想的“洗个澡回来看看初稿”,显然装不下后面这一连串事。
这些中断发生在这次模型接入和工具调用的过程中,最开始奔着省时省力,结果给自己搞来一堆麻烦。
好在DeepSeek反应速度是真的快,升级后的模型反应快、输出也快。不像以前发一句话要等五分钟,这次制作,基本上不超过一分钟就能蹲到反馈(即便它的反馈结果可能不是那么让人满意)。
如果再来一次,我会先剪一小段。
不过真让我从头做,我还是会把素材整理交给它。上千个文件变成索引和缩略图,长视频先找出候选区间,再把选中的几秒写进分镜,这些环节已经相当实用。
往后我会走得慢一点。先确认十几秒样片,画面、音乐、字幕、颜色一起看;认可之后再铺全片。防抖先处理画面,文字留在上层,声音分轨。改完一轮,就把确认过的内容和下一步写进进度文件,中断后从这张清单继续。
写到这里不如看看这个有点翻车的片子吧。
这1.5TB的素材,反复迭代修改,两天的时间累计消耗11.5亿Token,折合人民币51元,剪了一个粗糙的视频。你觉得性价比如何?
当然,如果想要把AI接入到目前的视频工作流中,“全依托”模式还不太够。更多情况下,我们会选择AI为辅、人类为主。特别是一些镜头细节的挑选和搭配上,要么手动去安排,要么让AI只聚焦在一些细节上。而不是直接一整个大片段直接全丢给它就不管了。
不过这是现在的AI,再过一段时间等AI补齐对声音的理解能力,配套工具也足够稳定。很难说这个行业又会发生什么翻天覆地的变化。
最后假期尾声,提前祝大家并不情愿上的班,复工快乐。
撰文|逸轩
热门跟贴