这项由中国电信人工智能研究院(TeleAI)与哈尔滨工业大学联合开展的研究,以预印本形式发布于2026年7月20日,论文编号为arXiv:2607.17675,有兴趣深入了解的读者可通过该编号查询完整论文。
你有没有注意过,一部好看的电影或电视剧,它的节奏感是怎么来的?答案藏在那些你几乎感觉不到的"切镜头"里。当镜头从女主角的特写切换到远景的城市街道,再切回两人对话的中景——正是这种镜头的组合与切换,让观众的注意力被牢牢抓住,故事才有了呼吸感。现在,AI已经能生成相当不错的短视频,但一旦涉及"多个镜头拼接成一段有叙事逻辑的影片",它就开始力不从心了。这正是ShotPlan这项研究想要解决的问题。
以一个导演拍摄场景作为贯穿全文的比喻来理解这项研究:一个导演脑子里有完整的分镜脚本,知道第21帧要切到另一个场景,知道第46帧要来一次硬切,知道哪里应该是渐变淡入。过去的AI像一个只会拍单镜头的摄影师,拍完一条就交差了。ShotPlan则是在尝试训练出一个真正懂得分镜规划、能一次性拍出整段多镜头影片的AI导演。
一、单镜头时代的局限:AI导演只会拍一条
近年来,以Diffusion Transformer(扩散变换器,一种能从随机噪声中逐步"洗"出高质量内容的AI架构)为核心的视频生成模型取得了令人印象深刻的进展。这类模型能够根据一段文字描述,生成几秒到十几秒的流畅视频片段,画面质量相当高。然而,这些模型有一个共同的"盲区":它们擅长在一个连续的时间段内生成视觉内容平滑过渡的单镜头视频,却无法原生支持像电影那样的多镜头结构——也就是在同一段视频中,于特定时刻发生视角、场景或构图的跳跃性切换。
解决这个问题,过去主要有两条思路。第一条思路是"先画分镜,再逐条拍摄":先用文字生成图像的AI模型生成一系列关键帧(类似于导演手绘的分镜草图),然后以每一张关键帧为起点,分别生成对应的短视频片段,最后拼接起来。这种方法的问题很明显——每段视频是独立生成的,镜头与镜头之间缺乏互动,同一个角色在不同镜头里可能长得不太一样,场景的光线和细节也可能出现矛盾。而且当关键帧数量有限时,很多过渡性的细节根本无法被覆盖到。
第二条思路是"改造AI的内部结构来区分镜头"。一些研究尝试在视频生成模型的内部加入"注意力遮罩"(一种让AI在处理信息时故意忽略某些内容的机制,就像在某些帧之间竖起一道墙)或者人为修改AI感知时间位置的方式,强行把不同镜头"隔开"。这种方法确实能在一定程度上产生镜头边界,但副作用也很明显:一旦AI在镜头之间竖起了"墙",跨镜头的信息流通就被切断了,同一个角色的外貌和同一个场景的布局就很难在多个镜头之间保持一致。此外,这些结构上的修改与模型在预训练阶段学到的知识之间存在落差,导致适应效果并不理想。
正是在这样的背景下,ShotPlan提出了一条全新的路径。
二、核心设计:给AI导演一个"分镜规划本"
ShotPlan的核心创意,可以用导演工作的方式来理解。一个优秀的导演在正式开拍之前,会先写好一本分镜脚本,上面标注着每一个镜头从第几秒开始、用什么类型的切换方式。ShotPlan的做法,就是给AI也配上这样一个"分镜规划本",而且这个规划本是以一种特殊的、可以被AI学习的"令牌"(token,AI处理信息的基本单元)形式存在的。
具体来说,视频在进入AI处理之前,会先被压缩成一串表示视觉内容的令牌序列,就好像把一部完整的影片拆解成一帧帧胶片。ShotPlan在这串胶片序列中,在每一个用户指定的镜头切换时间点位置,额外插入一个或几个特殊的"规划令牌"。这些规划令牌不代表任何画面内容,它们是纯粹的信号标记,像是在胶片带上夹入了几张标注着"这里切换"的便利贴。
对于硬切(两个镜头之间瞬间切换,没有过渡效果)的情况,研究团队为整个模型训练了一个单一的"硬切令牌"。当用户指定了三个硬切时间点,这个令牌就被复制三份,分别插入对应的位置,每一份都被赋予它自己的时间坐标来区分彼此。对于渐变切换(比如画面逐渐淡出再淡入的交叉溶解效果),则分别训练了一个"渐变开始令牌"和一个"渐变结束令牌",分别放在渐变区间的起点和终点。
这些规划令牌与原来的视觉令牌混合在一起,一同输入给AI的处理核心。AI在进行去噪(从噪声中还原视频内容)的过程中,规划令牌会通过标准的自注意力机制(AI处理序列信息的核心机制,让序列中每个元素都能"看到"其他所有元素)与视觉令牌自然地交互。这意味着规划令牌不会切断任何镜头之间的信息流通——整个视频序列的生成过程是一气呵成的,角色的外貌和场景的细节可以在不同镜头之间自由传递。视频生成完成后,规划令牌像便利贴一样被取下丢弃,只留下完整的视频内容。
三、解决时间精度难题:小数点级别的时间定位
上述设计听起来很直观,但实际操作中有一个棘手的工程问题。现代视频生成AI并不是直接在原始画面上工作的,而是在经过"时间压缩"处理之后的潜空间(latent space,一种把原始数据压缩成更紧凑表示的空间)中处理视频。以ShotPlan基于的Wan2.1-T2V-14B模型为例,它使用的时间压缩比率为4,意味着原始视频每4帧才对应潜空间中的1个时间步。
这就带来了一个精度问题:假如用户希望在第21帧处发生硬切,但潜空间中的时间步只有整数位,第21帧和第23帧会被归并到同一个潜时间步,AI根本无法区分这两者之间的差异,切换点的精度就被四舍五入掉了。
ShotPlan的解决方案是引入一种叫做"分数时序旋转位置编码"(Fractional Temporal Rotary Position Embedding,简称FRoPE)的技术。这里需要先了解位置编码是什么:在AI处理序列数据时,需要告诉每个元素"你在序列中的位置是多少",就好像给每帧胶片标上序号。旋转位置编码(RoPE)是一种用旋转角度来表示位置的方法,它的一个天然特性是可以接受小数坐标,不必局限于整数。
FRoPE就是利用了这个特性。研究团队为规划令牌设计了一个将物理帧编号映射到潜空间分数坐标的公式:当目标帧编号为0时,潜坐标为0;当目标帧编号大于0时,潜坐标为1加上(帧编号减1)除以压缩比。以第21帧为例,其对应的潜坐标不是整数5或6,而是精确的6.0,而第23帧则对应6.5。这样一来,不同物理帧位置对应的规划令牌就拥有了各自独特的小数坐标,AI可以在潜空间中精确地"感知"到切换点应该在哪里。与此同时,原有的视觉令牌继续使用整数位置编码,FRoPE只应用于规划令牌,完全不干扰模型已经学会的视觉时序知识。
四、数据从哪里来:专门为多镜头生成打造的训练素材
设计好了算法,还需要配套的训练数据。自然界中存在大量多镜头视频,但它们并不天然带有"哪里是镜头切换点"这样的精确标注,也不带有描述每个镜头内容的文字说明。研究团队因此搭建了一套完整的数据处理流水线。
起点是一个名为VideoEvent的开源视频数据集,这个数据集本身包含了大量经过剪辑、具有密集镜头切换的视频内容,天然具备多镜头结构。研究团队首先对这些视频做基础清洗,去除字幕和黑边等干扰,然后用一个专门做镜头检测的工具TransNet V2来自动识别每个视频中的镜头边界,把视频切分成若干单独的镜头片段。
接下来,研究团队用滑动窗口的方式从这些镜头片段中截取训练样本:每个样本长度为5秒,至少包含两个镜头,且每个镜头中的有效帧数不少于20帧。满足这些基本条件后,再用谷歌的多模态大模型Gemini 2.5做内容质量筛选,只保留那些在同一场景环境下展开、主体角色连贯、内容语义稳定的视频片段,排除掉那些场景混乱、内容跳跃过大的样本。
对每一个通过筛选的样本,研究团队进一步用Gemini生成两个层次的文字描述:一是全局描述,涵盖整段视频的场景类型、主要角色、环境光线等宏观信息;二是逐镜头描述,精细描述每个镜头中角色的动作、摄影机的视角和运动方式等细节。这种层次化的标注方式,有助于AI在训练中既学会保持跨镜头的整体一致性,也学会在每个镜头内部展现不同的视觉变化。最终,研究团队积累了超过7000个硬切训练样本和6000个渐变切换训练样本。
五、实验对比:ShotPlan在哪些方面表现更好
研究团队在一个包含100个提示词的测试集上,对ShotPlan与四个同类方法进行了系统比较。这四个对比方法分别是CineTrans、EchoShot、HoloCine和MultiShotMaster,均是近年来在多镜头视频生成领域有代表性的工作。测试集覆盖了三类场景:60个提示词专注于测试角色在多个镜头之间的外貌一致性,30个关注场景环境的跨镜头一致性,还有10个是不需要镜头切换的长镜头场景作为对照。
评估从四个维度进行。第一个维度是"切换时间偏差",通过TransNet V2自动检测生成视频中实际发生切换的帧位置,计算与用户指定位置之间的帧数差距。ShotPlan的平均偏差为0.64帧,而表现第二好的MultiShotMaster偏差为1.12帧,HoloCine为2.71帧,EchoShot甚至达到6.95帧,CineTrans为4.73帧。这说明ShotPlan在切换时间的精确控制上有显著优势,FRoPE的设计直接带来了可量化的精度提升。
第二个维度是"文本对齐度",用一个叫做ViCLIP的模型来衡量生成的每个镜头与对应文字描述之间的语义匹配程度。在这个指标上,ShotPlan与HoloCine相当,得分均在0.26至0.28之间,说明ShotPlan在精确控制切换时间的同时,并没有牺牲对文字描述的理解和呈现能力。
第三个维度是"跨镜头一致性",用DINOv2(一种强大的视觉特征提取模型)来比较同一个测试集中Gemini指定的一对镜头之间,角色外貌特征和场景视觉特征的相似程度。ShotPlan的角色一致性得分为0.46,场景一致性为0.37,均超过所有对比方法。与最强的对比方法HoloCine相比,角色一致性提升幅度达到约18%,场景一致性提升约16%。
第四个维度是"叙事连贯性",借助Gemini 2.5对生成视频的场景、角色、动作和空间关系做综合评判,给出一个整体叙事流畅度的分数。ShotPlan得分0.88,略高于HoloCine的0.85和MultiShotMaster的0.83,CineTrans仅得0.48,EchoShot为0.51。
六、消融实验:每个设计选择的价值是多少
为了验证ShotPlan中每个设计细节的必要性,研究团队做了一系列对照实验,逐项替换核心组件来观察性能变化,就像厨师做菜时逐一省略某种调料来判断它的作用。
首先是关于规划令牌是否需要"可学习"的问题。研究团队尝试用一个固定的语义令牌来替代可学习的规划令牌——具体做法是把"场景切换"这个短语通过文字编码器转换成一个固定向量,用这个向量代替可训练的规划令牌。结果显示,固定语义令牌的角色一致性从0.46下降到0.28,场景一致性从0.37下降到0.29,文本对齐度也大幅下滑。这说明语言模型对"场景切换"的理解方式与视频扩散模型内部的特征空间存在明显差距,固定令牌无法有效嵌入模型的生成逻辑中,而可学习的令牌通过与整个模型联合训练,能够自然地融入模型的工作方式。
其次是关于规划令牌注入方式的对比。研究团队测试了三种替代方案。第一种是直接把规划令牌的向量加到目标时间步的视觉令牌上,这破坏了位置编码的正常工作,切换时间偏差上升到1.76帧。第二种是用一个辅助网络把切换时间位置信息转换成全局的AdaLN调制参数(一种调整整个序列处理行为的机制),但这种全局调制无法实现局部定位,切换偏差高达5.64帧。第三种是只对目标时间步位置的令牌做局部AdaLN调制,偏差降低到4.39帧,但仍远不及ShotPlan的0.64帧。这三组对比共同证明了"以标准自注意力中的上下文令牌形式注入"这一设计选择的有效性。
关于FRoPE的必要性,研究团队用标准的整数位置坐标替换分数坐标,切换时间偏差从0.64帧上升到2.13帧,角色一致性和场景一致性也有所下滑。这确认了FRoPE在弥合物理帧精度与潜空间粗粒度之间差距方面的关键作用。
研究团队还通过可视化AI注意力权重的方式,直接观察了规划令牌"看"哪里。在对应三个切换点的三行热力图中,每个规划令牌的注意力响应都集中在其被分配的时间步附近,且峰值位置精确对应FRoPE计算出的分数坐标,而非最近的整数坐标。此外,注意力响应并不是一个尖锐的脉冲,而是平滑地向相邻帧扩散,说明切换效果是通过温和的时序调制实现的,而非强行在某帧位置切断信息流,这与ShotPlan不修改注意力掩码的设计理念相互印证。
七、意外之喜:同一套机制还能控制摄影机运动
在测试过程中,研究团队发现规划令牌这套机制有一个有趣的延伸能力。镜头切换是瞬间发生的离散事件,而摄影机运动(比如向左环绕、推进、平移)是从某个时刻开始、持续一段时间的连续过程。
理论上,这两种控制任务的结构是相通的:都需要AI在某个特定时间点之后改变其生成行为。于是研究团队尝试:在用户指定的摄影机运动开始时间点,插入一个与目标运动类型对应的规划令牌,并用对应的运动描述文字作为辅助条件。模型经过专门的摄影机运动数据训练后,能够学会从该时间点开始产生目标运动效果,而在该时间点之前保持静止。
为了获取这类训练数据,研究团队开发了一套数据合成流程:从已有视频中随机选取一个截断点,对截断点之前的部分保持不变,然后用一个经过摄影机运动控制微调的图像转视频模型,从截断点处的帧出发重新生成后半段视频,使其呈现出目标运动效果。两段视频拼接后,就得到了摄影机运动从指定帧开始的训练样本。经过人工筛选去除拼接处的视觉断层和场景不一致的样本后,每类运动(环绕左、环绕右、向左平移、向右平移、推进、拉远)各积累了约6000个训练样本。
研究团队邀请用户对ShotPlan与两个商业视频生成平台进行对比评测,评估两个维度:运动类型是否准确,以及运动开始时间是否精确。ShotPlan在运动开始时间精度上取得了最高分,在运动类型准确性上也与参照基准Wan2.1相当,超过了两个商业系统。
八、最后一个设计细节:规划令牌要不要加噪声
在深度学习的训练过程中,通常所有参与训练的内容都会被施加随机噪声并让模型学习恢复原状(这是扩散模型工作的基本方式)。但ShotPlan选择让规划令牌在训练时保持"干净",不加噪声,也不纳入训练损失的计算范围,让模型只针对视觉令牌的噪声去除结果进行优化。
这种选择有其内在逻辑:规划令牌的角色是"告诉模型该在哪里切换",是一个确定性的控制信号,本质上更接近于一种条件输入,而非需要被恢复的内容。这与图像条件视频生成中清洁的条件帧与含噪声的目标帧共存的做法类似。
研究团队也测试了另一种方案:让规划令牌跟视觉令牌一起加噪声,并以前一次迭代中的令牌值作为回归目标来训练。这种方案在概念上更对称,但实验结果显示,它需要大约11000步训练才能达到清洁令牌方案在3500步时就能达到的性能水平,训练效率差了三倍以上。因此,研究团队最终选择了简洁高效的清洁令牌设计。
说到底,ShotPlan做的这件事,用一个生活化的比喻来说,就像是给一个天赋很好但只会写文章、不知道怎么分段的作者,配上了一套便利贴系统——不改变他写作的方式,不限制他在段落之间的联想,只是在他动笔之前,帮他在稿纸上贴好分段提示,告诉他"第21行换段"、"第46行换段"。这个看似简单的动作,配合精确到小数点的时间标注,让AI视频生成模型第一次拥有了类似导演分镜意识的能力。
对于普通观众来说,这项研究最直接的影响可能要等上几年才能感受到,但其方向是清晰的:未来你用AI工具生成一段短片,可能只需要写好故事脚本,标注好每个镜头的时间范围,剩下的镜头构图、人物一致性和切换效果,都可以交给AI一次性完成。这与现在你需要多次生成、手动拼接的繁琐流程相比,是一个相当实质性的进步。
一个值得继续关注的问题是:当AI能够生成多镜头连贯影片的时候,"导演的创造力"究竟体现在哪里?ShotPlan目前还需要用户给出精确的时间戳和分镜描述,这意味着叙事结构的设计仍然依赖人类的判断。未来的研究可能会进一步探索如何让AI根据故事内容自动规划分镜,而不仅仅是执行人工指定的时间节点。完整论文可通过arXiv编号2607.17675查阅。
Q&A
Q1:ShotPlan的"规划令牌"和普通视频生成的令牌有什么区别?
A:普通视频生成的令牌对应实际的画面内容,每个令牌代表视频中某个位置的视觉信息。ShotPlan的规划令牌则不携带任何画面内容,它们是纯粹的时间控制信号,被插入到特定的切换时间点,作用是告知模型"这里需要发生镜头切换"。规划令牌通过与视觉令牌一起参与注意力计算来传递控制信号,视频生成完成后这些令牌会被丢弃,不出现在最终视频中。
Q2:FRoPE解决了视频生成中的什么具体问题?
A:现代视频生成AI会把原始视频帧压缩到潜空间中处理,压缩比通常是4,也就是每4帧对应一个潜时间步。这导致用户指定的切换帧位置无法被精确表示,精度只能达到4帧一格的粗粒度。FRoPE通过公式把物理帧编号转换成小数坐标(比如第21帧对应潜坐标6.0,第23帧对应6.5),让规划令牌可以携带帧级别的精确时间信息,从而把切换时间误差从多帧降低到不足一帧。
Q3:ShotPlan的训练数据是怎么获取的?
A:研究团队以开源的VideoEvent数据集为基础,用自动工具检测视频中的镜头切换边界,再用滑动窗口截取包含至少两个镜头的5秒片段,然后用Gemini 2.5筛选出场景连贯、主体稳定的样本,最终为每个样本生成全局描述和逐镜头描述两个层次的文字标注。硬切样本超过7000个,渐变切换样本超过6000个。摄影机运动控制的数据则通过合成方式产生,用图像转视频模型重新生成视频后半段并手动筛选,每类运动积累约6000个样本。
热门跟贴