美团怎么解的?一点个人看法
你有没有发现一个怪现象:AI 生成图片已经强得离谱了,画风景、画人物、画二次元,随手一出的质感都能让设计师血压升高。但只要让它做一张带字的海报,立刻原形毕露——要么中文字缺胳膊少腿,要么"全场五折"写成了"全场五拆",要么字和背景糊成一团。
说白了,文生图模型天生就不擅长文字。这也解释了为什么市面上那么多 AI 绘图工具,真正敢拍胸脯说"能做商用海报"的没几个。海报这东西,文字是零容错的核心信息:价格错了、品牌名错了、活动日期错了,整张图直接报废,甚至要给商家惹麻烦。
今天咱就借美团智能创作团队开源的三项工作——PosterCraft、PosterOmni、PosterReward——把"AIGC 海报生成"这件事的原理拆开聊聊。这三篇论文分别中了 ICLR 2026 和 CVPR 2026,代码全部开源,而且已经在美团外卖套餐图、品牌 IP 袋鼠团团这些真实业务里跑起来了。
先看难点。普通文生图,大家看个氛围、看个意境,差不多就行。海报不行,它有三个绕不开的硬骨头。
第一,文字渲染。扩散模型对文字的理解本质上是"画"出来的,不是"排"出来的。多行文字、小字号、中文这种笔画密集的字符,都是重灾区。你让模型生成"开业大吉 全场八折",它可能给你拼出个"开业大古 全场八拆"。这在海报场景里是致命的。
第二,版式布局。一张好海报讲究对比、对齐、留白、视觉层次,这种"设计感"没法用几条规则写死,得靠模型从大量优秀作品里隐式学习。而且不同行业审美还不一样:餐饮要食欲感,美妆要精致感,科技要未来感。一个模型要通吃所有风格,难度翻倍。
第三,质量评估。这个最容易被忽略,但其实是整个闭环的地基。你拿 FID、IS 这些传统指标去评海报,根本评不出"文字有没有写错""排版乱不乱"。没有一把靠谱的尺子,模型优化就没有方向,线上质检也没法自动化。
针对这三个难点,美团的做法是分兵三路,最后合成一个"生成—编辑—评判"的闭环。
PosterCraft 负责"能生成"。它的核心思路是抛弃传统的模块化流水线——以前的做法是先让视觉语言模型规划布局,再把文字叠到背景上,各模块各干各的,拼出来总有一种割裂感。PosterCraft 改成端到端统一优化文字、视觉、版式三者,用四阶段训练把文字渲染准确率拉到了接近顶级闭源商业系统的水平。其中有个细节很有意思:区域感知校准,对非文字区域、主要文字区、次要文字区做差异化加权,既保证字没错,又不牺牲整体艺术性。
PosterOmni 负责"能编辑"。真实设计场景里,你很少从零画一张海报,更多是拿着一张旧海报说"帮我扩个图""换个比例""改个风格"。PosterOmni 用一个模型统一了扩图、补全、比例调整、风格迁移等六类任务。技术上走的是"先训练局部编辑和全局创作两个专家,再蒸馏成统一模型"的路线,避免任务之间互相打架。
PosterReward 负责"能评判"。这是第一个专门给海报质量打分的奖励模型,在专项评测基准上准确率 86%,把一众基线甩开一大截。它不只是当"质检员",还反过来当 RL 训练的信号源——生成模型练得对不对,靠它说了算。这就形成了闭环:评估驱动生成,生成反哺编辑,编辑又给评估提供新样本。
我个人觉得,这三项工作里最有价值的其实是 PosterReward 那个方向。为啥?因为 AIGC 落地最大的瓶颈从来不是"能不能生成",而是"生成的东西能不能被机器自动把关"。海报这种高频、批量、质量要求苛刻的场景,如果没有一把自动化的尺子,光靠人工一张张看,成本根本扛不住。
另外也提醒一句:这三项工作全部开源在 MeiGen-AI 仓库,想在自己业务里做海报生成的,可以直接拿来当底座,没必要从零造轮子。
你在项目里遇到过 AI 生成文字翻车的场景吗?评论区聊聊,看看谁的经历最离谱。
热门跟贴