打开网易新闻 查看精彩图片

在生成式 AI 时代,“克制”比“创造”更难。

作者丨刘洛麒

编辑丨岑 峰

在人像修图里,“光” 是让照片拥有灵魂的关键,也可能是最大的坑。

你可能遇到过这种情况:当你想把光线调成午后暖阳,想尝试霓虹灯下的赛博氛围,或者想把照片调成 “伦勃朗光”增加质感”,但现有的 AI 重打光方案往往把握不好尺度,在复杂光照场景下,常出现光照不稳定、阴影方向错乱,甚至把脸 “修成另一个人” ,修完连亲妈都不认识。

“能在实验室跑通”与“能让用户满意”之间,卡在了身份保真度这一环。

近日,美图影像研究院(MT Lab) 提出 Consistent Feature Transport(CFT,一致特征传输) 将人像重打光重新表述为 光照一致的特征传输问题 ,在 Rectified Flow 框架上显式学习源图与目标图分布之间的光照变换。该成果已被计算机视觉顶级会议 ECCV 2026 (European Conference on Computer Vision)录用,它的核心逻辑只有一句话:只搬运光影,不触碰灵魂。

打开网易新闻 查看精彩图片

项目主页 / 代码开源:Consistent Feature Transport for Image Relighting

01

为什么AI重打光容易“翻车”?

当前市面上基于扩散模型的人像重打光主流方法有三条路,但各有各的尴尬:

  • 控制信号驱动(Control-based)方案:可控性较好,但结果高度依赖控制信号的准确性和完整性,一旦参考图不准,光影就容易发生错乱;

  • 本征分解驱动(Decomposition-based)方案:复杂光照下容易出错,误差会传导至最终图像,导致阴影不一致、颜色偏移或细节丢失;

  • 直接图到图翻译(Image-to-image)方案:未显式建模 "光照专属" 的特征位移,光照编辑的精度与表达力不足。

此外,由于公开人像重打光数据集规模有限,且多在受控环境下采集,缺乏复杂光照效果(多色温、空间变化阴影、非均匀照明等),难以支撑真实场景下的可控重打光学习。

02

CFT像运送快递一样传输光影

CFT 在噪声、源图、目标图三个分布之间建立联合建模,训练目标由三部分组成:

打开网易新闻 查看精彩图片

1. 噪声→目标图(L₁)给定源图 (xsrc)、重打光目标图 (xtgt) 及文本条件 (ctgt),学习从先验噪声到目标 latent 的速度场,完成条件生成。

2. 噪声→源图(L₂)在同一先验噪声下,以中性条件 (csrc) 重建源图分布。这条重建路径强化了对非光照内容(身份、几何、场景结构)的保持能力。

3. 源图→目标图:光照一致的特征传输(L₃,CFT 核心)借鉴无反演编辑方法,利用 Rectified Flow 的线性性质,通过平行四边形法则构造源到目标的直接传输路径:ztdirect=zsrc+zttgt−ztsrc

对应速度场为:vtdirect=vθ(zttgt,t,xsrc,ctgt)−vθ(ztsrc,t,xsrc,csrc)

值得注意的是L₃的监督使用的是身份与场景内容不同,但光照变换相同的图像对作为真值(ground truth)。这样做的优势在于,如果监督来自同一对图像,模型容易拟合样本特有的内容差异,把光照变化与非光照变化混在一起;而换用“同光照变换、不同内容”的配对,可以让模型学习可跨实例复用的光照特征传输。 在生成稳定性与光照传输监督之间取得平衡。

此外,为了支撑复杂光照场景的学习,团队构建了包括室内、室外等主流场景的大规模人像重打光数据集,覆盖14类光照效果类别,该数据集强调空间结构化照明、多色温与复杂阴影,弥补了现有 portrait relighting 数据在复杂光效上的不足。

03

实验结果

在自建测试集上,CFT相比目前的方案, 在像素保真、感知相似度、分布真实感与光照专用指标上均表现更优。定性实验结果显示,CFT 在多光源交互、空间结构化照明、色温大幅偏移等困难场景下,一致性及稳定性方面均有明显优势。

根据30 名用户对 40 组随机样本打分结果显示,Flux-Kontext + CFT 在评估光照质量(IQ)、内容一致性(CC)、物理合理性(PP)、图像美学(IA)上表现最佳。此外,消融实验显示,单独增加 L₂不能提升重打光质量,但与 L₃联用时提供额外结构保持,完整 CFT 效果最优;L₃若用原始 (xsrc,xtgt) 或随机配对监督,性能反而下降甚至不如仅 L₁;传输速度场方差分析表明,完整 CFT 在训练集与测试集上均具有最低方差,能够学习到更一致、稳定的光照特征传输场。

打开网易新闻 查看精彩图片

04

CFT 在风格迁移方面的可泛化能力

CFT 的“一致特征传输”思想并不局限于光照编辑,通过在OmniStyle-150k上构建风格迁移数据集并将 CFT 应用于OmniStyle 与 Qwen-Image-Edit上发现,CFT 在内容结构与感知保真上实现持续提升,生成结果在风格化上取得了更好平衡,这表明 CFT还可迁移至风格迁移等多种属性的编辑任务。

打开网易新闻 查看精彩图片

在与目前的 SOTA方案对比中,CFT 在 SSIM(像素保真)、LPIPS(感知相似度)以及 FID(分布真实感)等硬指标上均获得最高分。

目前,图片打光能力已经上线美图旗下产品Picchi、AirBrush与BeautyPlus,不需要输入冗长的提示词,就可以实现各种不同的光线效果。

打开网易新闻 查看精彩图片

用户不再需要输入几百字的提示词,也不需要精通专业灯光,只需要点选一种风格,AI 就能在秒级时间内完成一次高精度的“现场布光”。

美图的这篇 ECCV 论文给行业提了个醒:在生成式 AI 时代,“克制”比“创造”更难。 能理解物理规律并精准控制特征的位移,才是让 AI 工具真正走向专业创作的“物理底座”。

为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。