本文刊发于《现代电影技术》2026年第7期
专家点评
史 萍
教授
中国传媒大学信息与通信工程学院博士生导师
当前,人工智能大模型技术正向电影全产业链加速渗透,成为推动影视生产效率革新与创作形态升级的核心驱动力。然而,当前大模型产品技术路线各异、能力参差不齐,现有主流评测体系多聚焦通用语言与基础多模态能力,难以适配电影行业对艺术表现力、专业技术参数、版权合规性与内容安全性的高标准要求,导致行业缺乏统一的专业化标尺,无法精准评估大模型在影视场景下的实际应用效能,也给影视制作机构的技术选型、产业落地带来了参考依据缺失的现实难题。《面向电影行业应用的人工智能大模型技术评测研究》一文针对这一行业痛点,构建了一套系统完整的面向电影行业的AI大模型技术评测方案。研究聚焦剧本生成、图像生成、视频生成三大影视核心生产任务,结合电影创作的专业需求设计了多维度评测指标体系,构建了提示词库,确定了评测指标计算方法等,为电影行业AI大模型技术评测提供了可落地、可复用的标准化评测方案。在此基础上,论文选取国内外十余款主流大模型开展技术评测,验证了当前大模型在影视创意辅助上的应用价值与技术进展,也指出了大模型在高级语义理解、复杂人物结构生成、物理规律模拟、专业影视格式支持与版权风险规避等方面的共性短板。整体而言,该研究填补了电影行业大模型专项评测的研究空白,可为影视机构的技术选型、大模型厂商的场景化定制优化以及行业评测技术标准的制定提供技术支撑与实践参考。
项目信息
中国电影科学技术研究所(中央宣传部电影技术质量检测所)基本科研业务费项目“AI大模型及其电影行业应用研究”(2024⁃DKS⁃1)。
作者简介
王 健
硕士,中国电影科学技术研究所 (中央宣传部电影技术质量检测所)影像制作技术研究处工程师,主要研究方向:电影制作技术。
刘知一
硕士,高级工程师,中国电影科学技术研究所(中央宣传部电影技术质量检测所)影像制作技术研究处副处长,主要研究方向:数字电影技术。
摘要
随着人工智能(AI)大模型和人工智能生成内容(AIGC)技术在电影行业持续深入应用,面向电影行业应用的AI大模型技术评测也成为重要研究内容。为评测AI大模型在电影行业的应用效能,本文从评测任务确定、评测指标设计、评测提示词构建、模型推理结果获取、评测指标计算等方面提出电影行业AI大模型技术评测方案,并对国内外主流AI大模型开展实际评测。本文提出的评测方案覆盖 AI大模型在电影行业的典型应用场景,能够满足电影行业对大模型综合能力的评测需求,可为电影行业大模型技术选型、大模型创新应用、大模型标准制定提供技术支撑与实践参考。
关键词
AI大模型;AIGC技术;大模型技术评测;大模型应用;电影行业
1
引言
人工智能(AI)大模型和人工智能生成内容(AIGC)成为当前技术发展的热点趋势,在推动各行各业高质量发展与智能化升级中具备强大赋能作用。然而,市面上AI大模型产品数量激增且类型多样,不同模型在技术路线、性能表现及适配场景等方面存在显著差异,需要建立统一的评测标准衡量不同模型的技术能力和应用能力,大模型评测也迅速成为学术界和产业界关注的重点。
在相关研究中,智源研究院推出天秤(FlagEval)大模型评测体系及开放平台[1],基于科学开放的评测基准、方法与工具集,实现了语言基础模型、跨模态基础模型的评测;上海人工智能实验室推出司南大模型评测体系[2],评测范围涉及通用大模型、科学智能、安全可信、金融与医疗垂类行业应用等领域,并开源了VBench[3]、MVBench[4]、MMBench⁃Video[5]等一系列评测基准;中国信息通信研究院发布“方升-全模态”大模型基准测试体系[6],涵盖测试指标、测试方法、测试数据集和测试工具4项关键要素,从通用能力、应用能力、行业能力、安全能力等维度评估大模型表现。在标准制定方面,中国信息通信研究院牵头制定《大规模预训练模型技术和应用评估方法》系列标准[7],包括模型开发、模型能力、模型应用、可信要求、模型运营5部分内容;中国电子技术标准化研究院牵头研制的国家标准《人工智能大模型第2部分:评测指标与方法》于2025年2月发布[8],对AI大模型评测体系进行了规范,包括评测任务、评测指标、评测方法、评测指标计算方法等内容。
上述研究更多聚焦于大模型通用任务和通用能力的技术测试,涉及电影垂类领域较少。目前电影行业生产制作流程复杂,涵盖剧本创作、角色设计、场景生成、后期制作、音频处理、宣发放映等多个技术环节[9],每个技术环节对AI大模型的技术能力要求也各不相同。此外,电影行业对视听内容安全、版权保护、艺术表现力以及电影技术参数(分辨率、帧速率、动态范围、色域等)均具有较高要求,现有大模型评测体系难以完全满足电影行业技术评测需求,导致行业内缺乏评测依据来衡量AI大模型在电影行业的应用效能。因此,构建一套科学合理的技术评测方案,明确评测任务、评测指标与评测方法,形成规范化评测流程,为电影行业大模型技术选型与应用以及标准制定提供技术支撑,对进一步推动AI大模型赋能电影产业创新发展具有重要意义。
2
面向电影行业应用的AI大模型技术评测方案
2.1 评测任务确定
评测任务确定是AI大模型技术评测方案设计的首要环节。当前,AI大模型在电影全产业链技术环节的应用持续深入[10],显著提升了电影剧本创作、概念设计、视觉预演(PreViz)、视效制作、剪辑调色等视听内容的生产效率。根据AI大模型在电影摄制流程中的应用以及主流AI大模型功能特性,本方案确定剧本生成、图像生成和视频生成这3项对电影艺术创作和生产制作具有重要支撑作用的评测任务。剧本生成评测任务主要评估测试AI大模型根据文本提示词描述,理解并生成符合电影叙事要求的目标剧本的能力;图像生成和视频生成评测任务主要评估测试AI大模型根据文本提示词描述,理解并生成符合电影艺术风格与技术要求的目标内容的能力。
2.2 评测指标设计
评测指标设计是衡量AI大模型在特定任务上性能表现的关键环节。通过调研国内外主流评测体系与大模型评测标准要求,结合电影行业应用需求,本方案设计并构建大模型在剧本生成、图像生成、视频生成3项任务的主客观评测指标,以此全面评估大模型在电影行业的应用效果。剧本生成任务评测指标和指标描述详见表1。
表1 剧本生成任务评测指标
图像生成任务客观评测指标分为图像属性与技术能力两类。图像属性主要统计生成图像的分辨率、位深度、色彩空间、格式、文件大小等基本技术参数;技术能力涵盖CLIPScore[11]、AestheticScore[12]、ImageReward[13]及Human Preference Score v2(HPS v2)[14]多项指标。其中,CLIPScore用于评估生成图像与提示词的语义相关性;AestheticScore用于评估生成图像的美学质量;ImageReward与HPS v2均用于评估人类对生成图像的偏好,后者具备更优的泛化能力。
图像生成任务主观评测指标分为语义一致性、图像视觉质量、安全伦理3个指标维度。其中,语义一致性包括主体元素、空间关系、行为动作、艺术风格、语义理解等指标分项。主体元素主要评估提示词描述的人物、场景等主体元素是否完整呈现;空间关系主要评估主体元素的比例、位置等是否符合提示词描述;行为动作主要评估主体元素呈现的行为、动作等是否与提示词要求一致;艺术风格主要评估图像色彩、光影、构图、镜头、情感表达等与提示词匹配程度;语义理解主要考察模型对高级语义的理解能力和抽象概念捕捉能力。
图像视觉质量包括清晰度、构图、光影、色彩、结构、现实物理逻辑、情感表达等指标分项。清晰度指标主要评估生成图像是否清晰,包括边缘锐度、是否存在伪影/噪点/模糊等问题、细节表现等;构图指标主要评估图像构图是否合理,包括主体位置、主体与环境比例、透视关系、视觉焦点、空间层次等;光影指标主要评估图像光影的真实自然性、层次表现、细节呈现以及是否存在曝光不足、曝光过度等问题;色彩指标主要评估图像的色彩准确度、丰富度、对比度、真实性以及是否存在过饱和、色相偏差、不自然的渐变等问题;结构指标主要评估现实场景下主体肢体的真实合理性(特别是手部/面部);现实物理逻辑主要评估图像是否存在物理规律与常识性错误;情感表达主要评估生成图像的色彩情感、构图情绪、光影氛围、人物情感与环境情感的表达是否精准、丰富。
安全伦理包括内容安全、版权风险、文化敏感、潜在违规等指标分项。内容安全主要评估生成的图像是否包含限制类内容;版权风险主要评估图像是否包含可能侵权的影视角色/人物肖像/商标等;文化敏感主要评估图像是否包含可能引发民族或文化误解的符号/禁忌等;潜在违规主要评估图像内容是否存在潜在违规风险。
视频生成任务客观评测指标主要统计生成视频的分辨率、帧速率、位深度、色彩空间、编码方式、动态范围、时长、格式、文件大小等基本技术参数,主观评测指标和指标描述详见表2。
表2 视频生成任务主观评测指标
2.3 评测提示词构建
本方案根据剧本生成、图像生成、视频生成任务的评测指标,结合AI大模型在电影行业的实际应用场景,通过人工构建、AI辅助生成的方式为每项评测指标构建相应数量的评测提示词,并在部分提示词中着重体现电影技术要求、电影艺术风格、电影画面质量等内容,涵盖电影剧本创作、概念设计、角色生成、视效制作等应用场景。
此外,为确保评测公平性和一致性,本方案未针对不同模型的特性对评测提示词或其他参数进行专门调整与优化,提示词均为通用的自然语言提示词。
剧本生成任务评测提示词主要涵盖喜剧、动作与冒险、悬疑与恐怖、爱情、科幻、灾难、卡通动画七类题材剧本生成;在安全伦理评测方面,提示词引导大模型生成涉政、暴力、色情、电影侵权等相关剧本。
图像生成任务评测提示词部分示例如表3所示,主要分为技术参数评测、图像视觉质量评测、电影行业应用场景评测、安全伦理评测等4类。
表3 图像生成任务评测提示词部分示例
视频生成任务评测提示词部分示例如表4所示,主要分为技术参数评测、视频视觉质量评测、物理规律模拟评测、电影行业应用场景评测、安全伦理评测等5类。
表4 视频生成任务评测提示词部分示例
2.4 模型推理结果获取
针对AI大模型开源与闭源、开放应用程序编程接口(API)与不开放API等情况,可选择如下3种方式将评测提示词输入到大模型,以获取大模型推理结果。
(1)API调用
针对开放API服务的大模型系统,可在官方开发者平台完成身份认证、权限申请、密钥获取等操作。在获得相应授权后,根据API接口文档与调用示例,编写API调用的脚本工具即可批量获取大模型推理结果。
(2)应用程序获取
随着AI大模型持续发展与广泛应用,各大服务商相继推出形式丰富的大模型应用程序,包括网页端、桌面客户端、移动端、小程序以及浏览器插件等。这些应用程序凭借直观的界面设计和良好的用户交互体验,显著降低了大模型使用门槛。对于未提供API服务的大模型系统,这是获取其推理结果最有效的方式。
(3)本地/云端部署
大模型代码与权重开源成为技术发展趋势。同时,大模型推理技术持续优化,在确保模型性能稳定的前提下,有效降低了计算资源需求。得益于开源模型的发展和计算要求的降低,大模型本地与云端私有化部署不仅成为大模型离线应用、低延迟响应、数据保护的首选方案,也是获取开源大模型推理结果的重要途径。
2.5 评测指标计算
在客观评测指标计算方面,对于分辨率、帧速率、色彩空间、位深度、文件格式等技术指标,可通过MediaInfo、ImageMagick、FFmpeg等工具进行查看或自动化获取;对于CLIPScore、AestheticScore、ImageReward、HPS v2等技术指标,可通过自动化脚本调用相应的预训练模型接口或开源工具库进行批量计算。
在主观评测指标计算方面,人工评分是最常用的计算方法。为确保人工评测的规范性与专业性,根据《人工智能大模型第2部分:评测指标与方法》[8]要求,在实施过程中需制定统一的评测指南,明确各评测指标定义、评分标准及操作流程,并选择具有相关领域专业知识和实践经验的评测人员进行培训。
此外,随着多模态大模型技术发展,采用裁判模型(Judge Model)[15-17]代替人工来对待测模型生成内容的质量进行评分已成为技术研究热点。在具体评测过程中,需设计高质量评分提示词,定义评测标准与评分规则,以充分激发裁判模型对生成内容的理解与评估能力。
3
评测结果与分析
3.1 评测实施
基于评测方案,我们选择国内外主流大模型进行实际评测。根据评测指标,总共构建180余项中英文评测提示词,并通过大模型API调用、应用程序获取与本地部署等方式获取120部剧本、520张图像、420个视频,以此作为大模型评测样本。
在图像生成评测任务中,计算图像与提示词语义相关性的 CLIPScore 指标时,对于英文提示词,我们采用CLIP[18]模型ViT⁃L/14 版本;对于中文提示词,采用Chinese⁃CLIP[19]模型ViT⁃L⁃14⁃336版本,减少中英文语义偏差问题。计算图像美学质量AestheticScore指标时,调用LAION⁃Aesthetics_Predictor V1模型的sa_0_4_vit_l_14_linear.pth权重进行计算。
为提高评测效率、减少人工评估偏差,我们采用GPT⁃4o模型作为裁判模型,并从角色定义、信息输入、评测维度、评分规则、输出要求等方面精心设计评分提示词,引导GPT⁃4o输出每一项主观评测指标的量化分值与定性评语。
此外,考虑到大模型系统会对评测提示词进行校验与过滤,同时还会对生成内容进行二次审核,获取的评测样本基本符合规范,未出现明显违法违规内容。因此,我们在计算各项评测任务综合评分时,对安全伦理这一指标维度赋予较低权重。
3.2 评测结果
本文所有评测对象均为截至2025年上半年发布的模型版本与权重。需要说明的是,由于大模型迭代更新速度较快,大部分模型在后续版本中可能已实现性能优化与功能升级,因此本文评测结果仅反映该时间节点下的模型能力。图1为GPT⁃4o对不同模型生成的剧本在语义一致性、剧本内容质量、安全伦理等3项指标的评分结果。
表5为不同模型生成的图像在技术参数方面的对比;表6为不同模型生成的图像在CLIPScore、AestheticScore、ImageReward、HPS v2这4项客观技术指标方面的对比;图2为GPT⁃4o对不同模型生成的图像在语义一致性、图像视觉质量、安全伦理等3项指标的评分结果。
图1 GPT⁃4o剧本评分结果,按综合评分由高到低排序①
表5 图像技术参数对比
表6 图像技术能力指标对比
图2 GPT⁃4o图像评分结果,按综合评分由高到低排序②
表7为不同模型生成的视频在技术参数方面的对比;图3为GPT⁃4o对不同模型生成的视频在语义一致性、单帧图像视觉质量、视频视觉质量、安全伦理等4项指标的评分结果。
表7 视频技术参数对比
图3 GPT⁃4o视频评分结果,按综合评分由高到低排序③
根据评测结果,由图1—图3可知,当前AI大模型在剧本生成与图像生成任务上的表现,显著优于视频生成任务。豆包、通义千问与Claude大模型在剧本生成任务上综合性能处于第一梯队;可灵、豆包大模型与即梦AI在图像生成任务上综合性能处于第一梯队;Luma AI、通义万相与可灵大模型在视频生成任务上综合性能处于第一梯队。
各大模型生成的图像/视频位深度、格式、色彩空间、动态范围等基本一致,并没有响应HDR、BT.2020色域、OpenEXR、MOV等技术格式。由表5和表7可知,在图像分辨率指标上,文心一格最大支持3840×2160,豆包大模型最大可支持7680×4320,相比其他模型具备一定优势;在视频帧速率方面,可灵、通义万相与Sora可支持30 FPS,视频画面相对流畅些。
由表6可知,可灵大模型CLIPScore数值最高,表明生成的图像与提示词的语义相关性更高;通义万相AestheticScore数值最高,表明图像美学质量更好;Stable Diffusion 3.5 Large的ImageReward和HPS v2数值最高,表明生成的图像更符合人类偏好。
综合来看,在语义一致性方面,大模型具备一定指令遵循能力,但高级语义理解能力还有所欠缺。以国内大模型为例,对于“1个不切实际、喜欢守株待兔的人在喝酒”这一提示词,部分模型生成了语义不符的图像(图4);对于“床前明月光,疑是地上霜”这一需要深刻理解古诗意境的提示词,各大模型生成的图像并没有营造出冷清与思乡氛围,只是简单元素组合(图5)。
图4 提示词“1个不切实际、喜欢守株待兔的人在喝酒”,各模型生成结果
图5 提示词“床前明月光,疑是地上霜”,各模型生成结果
在生成内容质量方面,大模型能够生成整体观感与视觉效果较好、风格多样的内容,但在人物肢体与复杂动作生成、文字生成、物理现实模拟、画面质量等方面仍存在一些明显缺陷与不足(图6)。
图6 部分存在缺陷的图像与视频帧
在安全伦理方面,未进行提示词注入攻击的前提下,各大模型生成的结果并没有出现涉黄、涉暴等大尺度违规图像,但规避侵权方面仍存在不足。如,在生成“小罗伯特·唐尼”形象、“复仇者联盟大战灭霸”等相关图像时,多数模型生成的图像存在一定程度的肖像权与著作权侵权风险。
综上,截止本文评测阶段,AI大模型在语义一致性、视觉呈现、安全伦理、输出格式等方面取得一定突破,能提供高效的内容创作与创意灵感支持,在电影产业各技术环节具备广泛的应用潜力;但在高级与复杂指令遵循、内容精细度、物理规律模拟、版权风险规避、高新技术格式内容生成等方面仍存在较大提升空间。
4
结语与展望
本文提出面向电影行业应用的AI大模型技术评测方案,并对国内外主流大模型开展实际评测,相关评测结果只是特定任务、特定评测维度以及特定模型版本下的性能表现,仅用于学术研究,不作为各大模型综合能力的最终评价。
随着AI大模型技术持续迭代优化,模型综合性能稳步提升,其在电影行业的应用深度与广度将不断拓展。电影行业AI大模型技术评测研究与实践也应紧跟技术发展与行业应用趋势,积极探索并创新大模型评测方法、工具与流程。展望未来,面向电影行业应用的AI大模型技术评测可围绕三个方向推进。
(1)结合AI大模型技术演进趋势与电影全产业链应用场景,进一步细化评测任务、优化评测指标、完善评测数据集,构建兼顾技术性能、艺术表现、安全伦理与产业应用的电影行业AI大模型技术评测体系,形成统一规范的评测标准。
(2)基于多模态大模型、多智能体协作与自动化测试等技术,构建电影行业AI大模型技术评测智能体,自主完成评测任务管理、评测数据集生成、待测模型调用、评测指标计算、评测结果可视化分析等工作,推动评测流程向自动化、智能化方向发展,提升评测效率。
(3)探索契合人类感知、电影创作规律与电影视听语言表达的AI大模型主观评测方法,建立能够模拟人工评价过程的自动化打分模型,提高评测结果与人类主观感知的一致性,解决传统人工评价成本高、评价尺度不统一等问题。
未来,通过持续完善评测体系、优化评测流程以及创新主观评测方法,有望进一步提升电影行业AI大模型技术评测的科学性、规范性与可靠性,有助于推动AI大模型技术发展及其与电影产业深度融合。
注释、参考文献
(向下滑动阅读)
注释
① 综合评分=语义一致性评分×40%+剧本内容质量评分×40%+安全伦理评分×20%。
② 综合评分=语义一致性评分×40%+图像视觉质量评分×40%+安全伦理评分×20%。
③ 综合评分=语义一致性评分×30% +单帧图像视觉质量评分×30%+视频视觉质量评分×30%+安全伦理评分×10%。
参考文献
[1] 北京智源人工智能研究院. FlagEval 大模型评测体系及开放平台[EB/OL].[2025⁃12⁃04]. https://flageval.baai.ac.cn/#/home.
[2] 上海人工智能实验室. OpenCompass 大模型评测平台[EB/OL]. [2025⁃12⁃04].https://opencompass.org.cn/home.
[3] Huang Z, He Y, Yu J, et al. VBench: Comprehensive benchmark suite for video generative models[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024: 21807⁃21818.
[4] Li K, Wang Y, He Y, et al. MVBench: A comprehensive multi⁃modal video understanding benchmark[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024: 22195⁃22206.
[5] Fang X, Mao K, Duan H, et al. MMBench⁃Video: A long⁃form multi⁃shot benchmark for holistic video understanding[C]. Advances in Neural Information Processing Systems, 2024, 37: 89098⁃89124.
[6] 新华网. 中国信通院发布“方升”大模型基准测试体系[EB/OL]. (2023⁃12⁃29) [2025⁃12⁃04]. https://www.news.cn/tech/20231229/bbd16b43103c4d49be2f636a6ecf815a/c.html.
[7] 中国通信标准化协会.大规模预训练模型技术和应用评估方法 第1部分:模型开发[EB/OL].(2025⁃08⁃19)[2025⁃12⁃01].https://std.samr.gov.cn/hb/search/stdHBDetailed?id=425776678D1EAC2FE06397BE0A0A4BB0.
[8] 全国信息技术标准化技术委员会(SAC/TC 28).人工智能大模型 第2部分:评测指标与方法:GB/T 45288.2—2025[S]. 中国标准出版社,2025.
[9] 陈军,赵建军,鲁梦河.AI与电影智能制作研究与展望[J].现代电影技术,2023(10):16⁃26.
[10] 常慧琴,曾真.人工智能大模型在电影行业的发展展望与应用思考[J].电影评介,2024(13):8⁃14.DOI:10.16583/j.cnki.52-1014/j.20240905.001.
[11] Hessel J, Holtzman A, Forbes M, et al. CLIPScore: A reference⁃free evaluation metric for image captioning[C]//Proceedings of the 2021 conference on empirical methods in natural language processing, 2021: 7514⁃7528.
[12] Schuhmann C. LAION⁃Aesthetics[EB/OL]. (2022⁃08⁃16) [2025⁃12⁃04]. https://laion.ai/blog/laion-aesthetics/.
[13] Xu J, Liu X, Wu Y, et al. ImageReward: Learning and evaluating human preferences for text⁃to⁃image generation[J]. Advances in Neural Information Processing Systems, 2023, 36: 15903⁃15935.
[14] Wu X, Hao Y, Sun K, et al. Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text⁃to⁃Image Synthesis[PP/OL]. arXiv (2023⁃06⁃15)[2025⁃12⁃04]. https://arxiv.org/abs/2306.09341.
[15] Li H, Dong Q, Chen J, et al. LLMs⁃as⁃Judges: A Comprehensive Survey on LLM⁃based Evaluation Methods[PP/OL]. arXiv(2024⁃12⁃10)[2025⁃12⁃04]. https://arxiv.org/abs/2412.05579.
[16] Li D, Jiang B, Huang L, et al. From generation to judgment: Opportunities and challenges of llm⁃as⁃a⁃judge[C]//Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, 2025: 2757⁃2791.
[17] Waheed A, Wu Z, Alharthi D, et al. VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM⁃as⁃a⁃Judge for Video Understanding[PP/OL]. arXiv(2025⁃09⁃25)[2025⁃12⁃04]. https://arxiv.org/abs/2509.21451.
[18] Radford A, Kim J W, Hallacy C, et al. Learning transferable visual models from natural language supervision[C]//International conference on machine learning. PmLR, 2021: 8748⁃8763.
[19] Yang A, Pan J, Lin J, et al. Chinese CLIP: Contrastive Vision⁃Language Pretraining in Chinese[PP/OL]. arXiv(2022⁃11⁃02)[2025⁃12⁃04]. https://arxiv.org/abs/2211.01335.
期刊导读 |《现代电影技术》2026年第7期
黄东晋等:面向电影前期视觉开发的图像智能生成框架研究
朱君:面向影视虚拟摄制的高保真数字资产管线研究
热门跟贴