“把这几个字改下,其它的什么都别动。”这个需求看似简单,实则很难完成。文字抠不出来、找不到字体、背景留下修改痕迹——即使专业设计师,也很难做到“看不出来改过”。

目前基于扩散模型的图像修复技术,已经实现了“无需分层文件即可修改文字”。但文字修改只要有一点瑕疵,就容易暴露破绽。如何实现真正的“无痕”改字,一直是行业难题。

打开网易新闻 查看精彩图片

对此,美图影像研究院(MT Lab)提出了一种面向开放词汇的自提示(Self-Prompting)场景文本编辑方案。该方案直接从输入图像中提取风格信息,并结合目标文本生成高保真的字形提示,将二者与原图进行统一建模,实现无需额外编码器的端到端编辑。这项成果已被机器学习领域顶级会议之一ICML 2026录用。

打开网易新闻 查看精彩图片

两个主流方法的局限

当前主流方法主要有两条技术路线:一是依赖图像修补,二是依赖OCR或固定字表建模。前者容易丢失原始文本区域的关键信息,导致字体细节和风格一致性下降;后者则容易限制模型在多语言和开放词汇场景下的泛化能力。

美图影像研究院的方案,借助多模态扩散Transformer的上下文学习能力,能够在保持原有字体风格、颜色和纹理的同时,实现跨语言、跨场景的高质量文本替换。这为多语言场景文本编辑提供了一种统一且可扩展的解决方案。

两阶段训练:先学泛化,再保风格

在输入构建阶段,该方案首先通过渲染目标文本生成高保真的字形图(glyph prompt),用于提供精确的结构约束;同时从原始图像的目标文本区域中提取像素级风格信息(style prompt),编码字体的颜色、纹理和排版特征。随后,将字形提示、风格提示与完整输入图像在像素空间拼接,通过单次编码输入多模态扩散Transformer,使模型能够在统一表示下进行细粒度对齐与生成。

训练策略上,该方案采用两阶段训练范式,兼顾泛化能力与风格一致性。

自监督预训练阶段,模型基于大规模图文数据训练,学习文本生成与图像修复的基础能力。通过冻结编码器与解码器,仅优化Transformer主干,模型在统一的多模态表示空间中建立字形结构与视觉语义之间的对应关系。该阶段不引入特定风格约束,避免模型过拟合于有限的字体或语言分布,为开放词汇和多语言场景提供泛化基础。

打开网易新闻 查看精彩图片

冷却(cooldown)训练阶段,模型从预训练权重出发,使用约4000对人工筛选的高质量配对数据进行微调。每对数据包含原始图像及与其风格一致的编辑结果。该阶段将原始文本区域视为“元信息”,通过风格提示引入模型,同时设计面向目标区域的训练目标,仅在局部文本区域施加学习约束,显式解耦“内容生成”和“风格保持”。具体做法是在潜空间中对原图与目标图进行插值,学习从源表示到目标表示的变化方向,实现对文本内容的准确替换并保持原有视觉风格。

多语种与开放词汇表现

定量实验结果显示,在中英文基准AnyText上,该方案在编辑准确性和风格一致性的各项评估指标中均取得最优性能。

在包含阿拉伯语、法语、德语、韩语、日语、意大利语、孟加拉语、印地语、俄语、泰语、斯瓦希里语在内的多语种测试集MSTEdit中,该方案整体优于已有方法。

针对长尾字符、手动设计及现实中不存在的字符等OOV(Out-Of-Vocabulary)情况,该方案也表现出良好的鲁棒性。

消融实验进一步验证了不同自我提示策略及两阶段训练对文字准确性和风格一致性的影响。其中,预训练阶段和字形提示主要作用于提升文字准确率和泛化性,冷却阶段和风格提示主要作用于提升风格一致性。

目前,该方案已应用于美图秀秀“无痕改字”功能,突破了传统改字预设词表的限制,支持日、俄、韩、泰等小语种的文本编辑,并能保持字体风格与画面质感一致。