很多人修图时卡在第一步:说不清照片到底哪里不对劲。vivo BlueImage Lab 提出的 SmartPhotoCrafter 把这件事交给模型自己完成,先分析、再决策、后优化,不需要用户给出明确指令。
这套框架的核心是双模块协同。Image Critic 负责审美诊断与编辑决策,Photographic Artist 负责高保真修复与美学增强。前者基于 Qwen2.5-VL-7B 微调,输出质量分析、编辑建议与 0-100 评分;后者基于 Qwen-Image-Edit-2509 的 DiT 架构,接收原始图像与 Critic 的推理潜在表征进行生成。
打开网易新闻 查看精彩图片
从“你说我改”到“模型先思考、再修图”
与现有指令驱动的修图助手不同,SmartPhotoCrafter 让模型先通过 Image Critic 进行链式推理,诊断图像问题并制定优化方案,再由 Photographic Artist 执行生成。文章指出,真正困难的往往不是执行修图,而是发现问题并制定合理的优化方案。
训练采用三阶段策略。第一阶段独立预训练,第二阶段推理条件适配,第三阶段联合强化学习。Critic 用 GRPO 优化,Artist 用 DiffusionNFT 优化,使两个模块在表征层对齐并协同提升审美优化能力。
属性级奖励把调色拆成可解释维度
为了让模型对细微色调变化更敏感,研究团队设计了属性级奖励机制。整体图像质量评价被分解为曝光、对比度、饱和度、色温等可解释属性维度,强化模型对微小色调变化的感知与稳定响应,从而提升调色精度。
文章还介绍了多任务数据集的构建方法,以及模型在自动增强、多属性组合编辑等场景下的表现。当前局限在于未覆盖构图级编辑,未来计划向理解构图并整体优化的方向扩展,实现更全面的后期优化。
热门跟贴