过去两年,AI 生成图片、视频的能力不断刷新人们的认知。
今天,生成一张图片、一段视频,已经变得很容易。
但真正困难的,是另一件事情:让 AI 理解并按照创作者的真实意图完成创作。
比如:
- 修改一行文字,同时保留字体、排版和视觉风格。
- 消除图片和视频的冗余元素,但不能看出破绽。
- 自由变换发型、服饰、光线、场景,但要保持人物一致性。
- 修改视频中的局部内容、调整光影效果,不要影响整体连续性。
- 让模特试穿试戴,同时准确保留材质、纹理和光泽。
Prompt 的后半句都是为规避模型误差添加的限制,「保持一致、避免失真、不要改变」等等一长串的提示词,是 AI 创作流程中的「惯用套路」。但理想状态下,我们对 AI 的期望是需求能够被理解,并直接执行,而不是先要学习如何正确使用提示词。
AI 在视觉创作能力的进化,实则是视觉理解、空间建模、时序一致性、美学表达等多个方向的持续突破,这很难通过一次模型升级来实现,而是需要围绕视觉技术的长期积累。
过去几年,作为 AI 影像领域的「长期玩家」,美图影像研究院(MT Lab)围绕高频创作场景的真实痛点,持续展开研究。2026 年以来,美图影像研究院(MT Lab)共有 11 篇论文被 ICLR、CVPR、ICML、ECCV、ACM MM 等国际顶会接收,覆盖视频编辑、人像编辑、智能交互、视觉理解等多个方向。
更重要的是,这些研究成果不断通过产品落地,转化为服务真实创作场景的 AI 影像能力。
让 AI 实现更强大的编辑
在专业的创作中,生成其实只是起点,人们往往需要经过多次的尝试和调整,才能不断接近「理想效果」。因此,无论是视频中的背景、光线、人物身材、妆造,还是图片中的文字、服饰配饰,模型都需要同时兼顾一致性、真实性与可控性,这也是 AI 影像从「能生成」迈向「能创作」最关键的能力之一。
在 ICML 2026 上,美图影像研究院(MT Lab)提出了参考帧引导视频编辑统一框架 Multiscale Vision-language features for reference-guided video Editing(MiVE),核心由多层级视觉 - 语言上下文提取、参考帧感知潜空间编码和统一自注意力主干三大部分共同组成。MiVE 旨在以多尺度 VLM 条件与统一多模态融合,解决当前视频编辑在指令理解与空间精度上长期存在的结构性短板。
- 论文链接:https://arxiv.org/abs/2605.14664
- 项目主页:https://mivepaper.github.io/
MiVE 在大幅度运动、复杂遮挡、跨帧风格一致性等高难度场景下,能够保持原视频运动结构,并将参考帧的编辑信息自然扩展至整个视频;在身份特征、细节锐度、色彩一致性保持及新增遮挡区域外观恢复上,MiVE 也表现出更强的稳定性与更高的精细度。
结合 MiVE「改一帧即改全片」的 V2V 编辑工作流,和针对人像场景精细化的创意编辑能力,目前已经实现包括改变发型、变换服装、妆容造型、重新打光、更换背景、天气变换、局部优化等在内的视频编辑能力。
MiVE 在细腻发丝的处理、服饰的贴合度、材质光影层面都拥有良好表现力,能够精准还原对人物、发丝、衣服材质、光线等细节。
例如在视频打光场景中,相比主流模型,MiVE 在人物与环境一致性维度均有较为明显的优势,据悉该能力即将上线美图秀秀 APP 与 Wink APP 的「氛围光」功能。
对光影变化的控制能力同样延伸到了静态图片创作场景,在 ECCV 2026 中,美图影像研究院(MT Lab)提出了一致特征传输重打光新方案 Consistent Feature Transport(CFT)。
由于目前的 AI 重打光方案容易出现光照不稳定、阴影方向错乱,甚至把脸「修成另一个人」的问题,因此换光效作为常见的视频编辑需求,实现难度却很高。
CFT 通过将人像重打光表述为「光照一致的特征传输问题」,在 Rectified Flow 框架上显式学习源图与目标图分布之间的光照变换,并结合大规模人像重打光数据集,实现在复杂光照场景下,人物身份、姿态、背景的超强一致性。
- 论文链接:https://arxiv.org/abs/2607.17833
- 项目主页:https://github.com/Dixin-Lab/CFT
CFT 对光线的方向、角度、强弱具备更强的可控性,可以实现各种不同类型的打光效果。对比主流模型,CFT 在光照效果上有更佳的稳定性和合理性,即使是在复杂的场景下,也表现出高一致性的打光效果。例如在晨光场景中,CFT 能准确区别晨光与夕阳光,呈现更好的整体氛围感和光线真实性。
结合 CFT 方案,你不需要输入冗长的提示词,就可以玩转各种不同的光线效果。
全新的「图片打光」功能已经上线美图主打人像修图 Agent 与「学我修图」的全新 AI 产品 Picchi,海外可以通过 AirBrush 与 BeautyPlus 进行使用。
自去年推出「AI 闪光灯」全球爆火后,美图影像研究院(MT Lab)目前已经研发超过 50 种不同的打光效果,帮助「手残党」拯救废片。
图像编辑除了修改、增加内容,还有另一项至关重要的能力 —— 消除。无论是日常的拍摄,还是专业的创作,乱入的路人、被遮挡的背景、五花八门的杂物都很常见,「AI 消除」的关键是既要精准消除目标,又要合理补全原本被遮挡的区域,在动态的视频场景中,还必须保证连续帧之间的稳定性。
对此,美图影像研究院(MT Lab)在 ICML 2026 上提出了基于随机桥模型的新框架 ——BridgeRemoval,首次将「视频目标移除」定义为「视频到视频的翻译任务」,通过构建基于随机桥(VP-SDE Bridge)的直接生成路径,在背景保真度与生成灵活性之间取得更好的平衡,显著提升了视频目标移除的精准度及时序一致性,实现了从 AI 图像消除向 AI 视频消除的拓展。
- 论文链接:https://arxiv.org/pdf/2601.12066
- 项目主页:https://bridgeremoval.github.io/
不同于标准扩散模型从随机高斯噪声起步,BridgeRemoval 采用基于方差保持随机微分方程(VP-SDE)的桥模型,能够选择性地只对被遮罩区域进行变换,并实现对背景内容中未被遮挡区域最大程度的保真。
结合 BridgeRemoval 在目标移除、背景保真度、时序一致性的显著优势,Wink APP 推出了「视频身材美型保护」功能,解决了平常瘦脸、瘦身等视频美型任务中,容易出现的栏杆变弯、背景形变等尴尬问题。
基于 BridgeRemoval 的优势,也为视频消除能力带来了显著提升,相比主流模型的整体性能,缩短了约 80% 的处理时长,且区别于 10 秒的视频处理限制,BridgeRemoval 可以支持无限时长的视频消除。
尤其在文字场景,BridgeRemoval 对各类型文字均表现出极佳的消除效果,即使是特殊的发光字幕也能实现无痕消除。
目前该能力即将上线开拍 APP「智能全消」功能,能够自动识别与消除视频文字,支持最长 5 分钟视频输入,实现画面无损效果,相较主流模型最长 30 秒视频输入及 Token 消耗模式,使用成本更低。
对于图像中的文字,消除以后往往还需要替换成新的内容,这要求模型不仅要生成准确的目标字符,还不能破坏原有字体、排版、颜色与背景纹理。针对字符准确性与视觉风格难以兼顾的问题,美图影像研究院(MT Lab)在 ICML 2026 提出了基于 Self-Prompting 的图像文本编辑方法,实现多语种的「无痕改字」。
区别于依赖图像修补和依赖 OCR 或固定字表的建模方式,该方法通过直接从输入图像中提取风格信息,并结合目标文本生成高保真的字形提示,将两者与原图进行统一建模,无需额外引入专门的风格或字形编码器,就能实现端到端的编辑。
- 论文链接:https://arxiv.org/abs/2605.15523
- 项目主页:https://hongxiii.github.io/mstedit/
借助多模态扩散 Transformer 的上下文学习能力,该方法能够在保持原有字体风格、颜色和纹理的同时,实现跨语言、跨场景的高质量文本替换,为多语言场景文本编辑提供了一种统一且可扩展的解决方案,也为真实复杂环境中的风格一致性编辑奠定了重要基础。
相较主流模型,美图影像研究院(MT Lab)的无痕改字能力从编辑准确性到风格一致性,都实现了最优表现。尤其在繁体中文、泰语、日语甚至是特殊符号等复杂文字场景中,也展现了极强的稳定性。
目前该能力已通过「无痕改字」上线美图秀秀 PC 端,覆盖汉字、拉丁字母、阿拉伯字母、梵文、西里尔字母在内的全球五大主流文字书写形式,即使是非文字形式的特殊符号也能完成改写。
回到美图最为擅长的人像领域,造型作为人像的关键一环,难点在于需要同时理解材质、纹理、光照以及人与场景之间的关系。对此,美图影像研究院(MT Lab)在 ECCV 2026 上提出了面向原生 2K 多服饰试衣的新框架 ——WearWow。
- 论文地址:https://arxiv.org/abs/2607.19923
2K 分辨率是目前电商图片用于展示服饰鞋帽细节及质感的标配,但多件服饰鞋帽共同输入时,Virtual Try-On 的试衣方案容易导致显存消耗与耗时均显著增加,且试穿效果不佳。
而扩散模型在高分辨率下易出现纹理退化现象,羊毛、牛仔、针织等特殊材质会有明显的「塑料感」,虽然这些方案基本都已经能够「穿对衣服」,但距离真正商用还有较大的差距。
对此,WearWow 采用 Adaptive 2D Token Packing(ATP)解决了计算效率问题,实现端到端的多服饰生成,再利用 Multi-dimensional Try-on Reward(MTR)进一步调整模型生成方向。基于对穿戴关系的精准理解,WearWow 将试衣方案从「替换服装」升级为「真实穿戴」,即使是在 2K 高分辨率下,依旧能够保持羊毛、棉麻、粗针织等等服饰材质的真实质感。
在多件服饰、鞋帽等不同单品组合输入条件下,模特身着汉服、礼服等结构复杂的服饰,WearWow 也能够避免层叠关系混乱与穿戴错乱,提升复杂试装场景下的真实感与稳定性。
面对大面积遮挡、特殊姿态等复杂场景,WearWow 能够实现自然贴合的服装生成,真实还原服饰材质、纹理与质感。
对比主流的通用模型,WearWow 结合了智能场景识别能力,即使穿戴目标中存在干扰元素,比如穿戴图中包含鞋子,但模特是半身场景,WearWow 的试穿效果也不会错误改变人物姿态。
凭借 AI 试衣的玩法功能火遍全球之后,AI 试衣的能力也在进一步向商用场景扩展,目前该能力已经上线美颜相机 APP 的「AI 换装」功能和美图设计室「服饰穿戴」「换模特」与「AI 试衣」功能。
从视频编辑、光影调整、目标消除,到文字替换与 AI 试装,美图影像研究院(MT Lab)聚焦高频创作场景中的复杂任务,对模型能力进行深度优化。与此同时,美图也在针对不同属性编辑任务的共性需求,探索统一的控制方式。
在 CVPR 2026 上,美图影像研究院(MT Lab)提出All-in-One Slider,将「一项属性对应一个滑块」的 One-for-One 模式,拓展为统一的多属性控制框架,实现对年龄、笑容、妆容、发型等多种图像属性的连续控制,支持多属性间的自由组合以及针对模型训练中未见属性的零样本泛化,同时能够更好地保持人物身份、背景及其它非目标内容的一致性。
- 论文链接:https://www.alphaxiv.org/abs/2508.19195
All-in-One Slider 在统一、细粒度的属性控制,为更灵活的组合调度不同人像编辑能力提供新的技术基础,这也为 Picchi APP 提供助力,用户只需要像聊天一样给 AI 下指令,就能够精准实现修图创意,包括「氛围感」「好看」这类相对抽象的修图指令,Picchi 都能基于对人像照片的多维度分析,提供全方位的解决方案。
可以看到,美图影像研究院(MT Lab)对 AI 影像能力的推进,并不止于拓展能力的边界,还在于提供更高自由度和更极致、稳定的视觉效果。而当 AI 能力的边界越开放,对模型理解画面、约束变化的要求也越高,这也取决于模型的另一层能力 —— 理解与控制。
让 AI 实现更精准的理解与控制
如果说模型的编辑能力决定了 AI 能够处理哪些任务,那么模型的理解与控制能力,则影响 AI 能否按照创作者的意图完成。比如,很多时候我们只是「改了一点点」,但模型却需要先完成一次复杂的理解,「知道改哪里」「知道什么不能改」「知道画面真正表达什么」,有时候比生成本身更加困难。
落到具体的创作场景,这种理解与控制涉及多个层面,对此,美图影像研究院(MT Lab)从不同方向持续提升模型在理解与控制层面的准确性、真实性与可控性。
在 ICML 2026 上,美图影像研究院(MT Lab)针对「分割对了却选错了」的语义对齐失效问题,提出了基于双向语义流的条件分割方法 ——FlowSeg。
- 论文链接:https://arxiv.org/abs/2605.29461
- 项目主页:https://zkzhang98.github.io/FlowSeg_page
基于 LLM 的条件分割根据自然语言描述,目前已经能够精准地「抠」出目标区域,但主流的「提议 - 选择(propose-then-select)」框架全程几乎由视觉特征主导,语言条件只在最后一步才「介入」打分,因此正确的 Mask 往往已经被生成出来了,却没有被选中。这就导致模型在执行任务时很容易选错对象,尤其是针对指定对象的局部编辑。
FlowSeg 重新定义了「语言」在 LLM 条件分割中的角色,在每一解码层用语言条件引导查询特征的更新,使得生成过程中 Mask 始终与语言描述保持一致,同时不断吸收来自解码器的视觉证据,并随着 Mask 的逐渐清晰进行动态更新。
FlowSeg 让「语言」深入参与到 mask 生成的每一步动态过程中,并与视觉在解码过程中共同演化,形成真正的双向交互闭环,即使面向极度复杂的场景,FlowSeg 也能精准对齐画面对象与语言指令,准确判断编辑目标。
结合 AI 图像消除能力与 FlowSeg 在复杂场景下对丰富类别物品的语义对齐与分割,美图云修、美图秀秀 APP 上线「杂物消除」功能。
不需要手动选择,AI 就可以智能识别并消除包括电线杆、路牌、告示、应急出口、落叶、垃圾等等物品在内的所有杂物,并实现「无痕消除」。
局部编辑任务中,精准选中目标是一类问题;在视角变换、物体旋转等空间编辑任务中,处理好更复杂的空间变化,则是另一类问题。
在 ICLR 2026 上,美图影像研究院(MT Lab)提出了基于 DiT 的 3D 位置编码框架 ——Positional Encoding Field(PE-Field),基于对 DiT 中画面空间结构很大程度上由位置编码组织这一发现,将传统的 2D 位置编码扩展为带有深度信息的 3D 位置编码场,并通过多层级位置编码将空间控制从 Patch 进一步细化到更小的局部区域。
- 论文链接:https://arxiv.org/abs/2510.20385
- 项目主页: https://github.com/MTLab/PE-Field
这使得模型在单图新视角生成、物体旋转、空间位置调整与目标移除等任务中,能够更准确地处理视角变化、遮挡关系和空间结构,该方向的进一步拓展,也为多视角视觉素材生产和空间可控编辑提供了坚实的技术基础。
在空间生成之外,美图影像研究院(MT Lab)也在关注动态人像中的真实感问题。比如,动态视频中人物头发、衣物等柔性材质的运动,往往会对画面的可信度造成较大影响。
由于头发高自由度、细长结构、自碰撞和复杂光照交互的特性,导致它在视频生成中难以显式控制。但在现有的视频生成技术路线中,文本驱动很难让发丝按照具体的风向和力度描述摆动;姿态驱动中的骨骼信号则不包含发丝信息,头发只能依赖模型先验「自行发挥」。
对此,美图影像研究院(MT Lab)在 ECCV 2026 上提出动态毛发渲染框架 ControlHair,将物理模拟器与视频扩散模型进行级联,通过将物理仿真与画面生成解耦,实现了可控、真实的动态发丝渲染,让发丝效果从「看起来在动」变成「按照物理规律运动」。
- 论文链接:https://arxiv.org/abs/2509.21541
- 项目主页:https://linwk20.github.io/controlhair-web
与此同时,围绕在发丝结构、材质与视觉表现方向上的长期积累,美图影像研究院(MT Lab)持续将其转化为美发场景中的产品能力,目前已上线「发丝飞扬」「飘逸发光」等多款氛围感美发功能。
头发作为同时关联材质纹理、光照关系、运动规律、几何结构的复杂编辑任务,是考验 AI 精细化能力的一块「试金石」,仅 2026 年上半年,美图影像研究院(MT Lab)研发上线超过 50 款发型功能,覆盖高颅顶、补发等发量调整,以及染发、换发型、发质优化等不同需求。
进入视频场景,影响视觉表达的还有一项很关键能力 —— 镜头语言。比如在画面中逐渐被放大的人物,可能是来自于主体向镜头靠近、相机推近或者是镜头焦距发生变化,但它们所传递的空间感、叙事重点和情绪完全不同。随着 AI 视频迈向 MV、短剧、影视等更专业的创作场景,只是生成「会动的画面」还远远不够,模型还需要真正地理解镜头语言。
在过去,运镜理解往往被当作视频理解中的附属问题,美图影像研究院在(MT Lab)ECCV 2026 上首次将「自然语言镜头运动理解」确立为独立研究问题,系统梳理了视觉语言模型(VLM)在自然语言镜头运动理解上的五大失效模式,并构建了首个同时覆盖 17 类运镜、涵盖真实与合成视频的评测基准 ——ACaM(Atomic Camera Movement)。
在此基础上,美图影像研究院在(MT Lab)通过重采样和针对性数据增强,整理出 2.7 万条类别更均衡的训练数据对 VLM 进行微调,验证了其对模型运镜理解能力的显著提升。
- 论文链接:https://arxiv.org/abs/2607.03043
- 项目主页:https://1yuwen.github.io/ACaM-Project-Page/
ACaM 为视频模型「学习运镜」和「判断运镜正确性」建立了数据与评测基础,可以看到,从编辑目标的语义对齐、画面的空间组织,到局部动态与专业镜头语言,美图影像研究院在(MT Lab)正在持续从真实创作场景挖掘用户痛点,并通过数据构建、方法研究和评测体系,持续推动模型能力提升。
让 AI 实现更自由的交互
当模型理解、控制、生成的能力持续变强,单一的交互方式已经难以适配所有创作任务,很多时候复杂的需求甚至难以用文字清晰说明。
比如在许多创作场景中,会包含具体的位置、方向、形状与变化幅度,但纯文字指令很难清晰地描述这些精细的变化、且难以定位空间位置,容易产生空间歧义;而纯草图输入易造成编辑意图直指向不明确。
对此,美图影像研究院(MT Lab)在 ACM MM 2026 上,提出了协同式图像编辑框架 SI-Edit,将文本指令的语义信息与草图的空间结构约束协同融合,有效缓解了单一模态引导中的语义歧义和空间歧义,用户既可以通过语言说明「想怎么改」,也可以直接用笔画表达「在哪里改、向哪里延伸、最终形成什么形态」,实现了像素级的局部图像编辑。
为了让语言和草图真正协同工作,SI-Edit 引入了可学习的任务触发词,使模型主动建立文本动作与草图信号之间的联系;同时采用共享位置编码策略,让草图笔画与原图中的对应位置建立明确映射,减少局部形变中的空间漂移,还构建了约 6500 组「源图 — 目标图 — 草图 — 指令」四元组数据,为拉伸、弯曲、缩放与姿态调整等精细局部编辑提供训练基础。
通过 SI-Edit,可以将花朵任意放大缩小,将树枝向指定角度弯曲,将火焰按照想要的形状燃烧,让编辑过程更加自由,编辑结果更加精准。
随着生成能力进化为更通用的基础能力,AI 影像真正的较量也开始深入真实创作场景,美图影像研究院(MT Lab)将前沿研究、专业数据、模型评测、工程落地环环紧扣,为美图形成真正可落地的产品力,而长期深耕 AI 影像的价值,也在这些细节中显现 —— 在持续抬高模型能力上限的同时,让 AI 产品真正从「可用」走向「爱用」。
热门跟贴