训练一个顶级文生图模型,到底需要多少钱?
Qwen-Image、HunyuanImage 这些优秀的开源模型,预训练动辄用掉数十亿张图像;而 GPT-Image-2、Nano-Banana-Pro 等闭源系统虽然效果惊艳,其内部实践却始终不对外公开。对于绝大多数研究机构来说,这条赛道的入场券太贵了。
近日,华为香港莱布尼茨研究所小艺团队与港大、港科大、港中文等 6 校联合发布了Boogu-Image-0.1—— 一个仅用2.08 亿张独立图像、理论训练成本约40 万美元,就在多个基准上做到开源第一、逼近闭源水平的统一多模态模型家族。模型权重、代码与训练配方已全部以Apache 2.0 协议开源。Boogu 系列模型是最早支持原生 2K 的开源模型之一,并支持华为昇腾 Ascend NPU,vLLM-Omni 框架等, ModelScope 和 ComfyUI 均已上线。
- 论文标题:Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget
- arXiv 论文地址:https://arxiv.org/abs/2607.13125
- HuggingFace 论文地址:https://huggingface.co/papers/2607.13125
- 代码仓库:https://github.com/Boogu-Project/Boogu-Image
- 在线试用:https://boogu.org/
从「文生图」到「需求生图」
Boogu 团队的核心判断是:图像生成正在从 Text-to-Image 走向Requirement-to-Image。
用户早已不满足于给一句描述性 prompt—— 他们希望模型能理解复杂意图、隐含约束、多层指令,甚至跨模态上下文。而现实需求又极度多样:有的只想快速出图,有的需要精细排版的海报。单一模型配置很难同时服务好所有场景。
因此,Boogu 把「理解」提升为与数据质量、训练配方同等重要的一等公民,并将其拆解到系统的每一个环节:
- 更强的指令编码器。团队把文本编码器类比为文生图模型的「传感器」:它决定了整个系统能获得的信息上限。系统性实验证实,冻结编码器的规模从 1.7B 扩到 14B,生成质量单调提升且未见饱和。最终 Boogu 选用 Qwen3-VL-8B,在能力与开源社区可部署性之间取得平衡。
- Agentic 提示重写:做「翻译官」,不做「加戏者」。论文提出一个常被忽视的设计原则 —— 重写器应以恒等变换为下界:当用户 prompt 已经清晰完整时就原样保留,只在意图模糊时才介入。实验显示,重写模型越强,收益越大(0.8B 到 397B 呈近似对数线性提升),且在计数、推理、场景文字等维度上,能力定向的重写技能带来数倍优势。
- 模型路由:让合适的模型干合适的活。Turbo 与 Base 在很多简单请求上输出几乎无差异,推理成本却相差 50 倍。Boogu 用 Agent 估计请求难度并动态分发,把重型模型留给真正复杂的任务。
在 Boogu 自建的 Arena 盲测中(与公开 LMArena 排名的 Spearman 相关系数达 1.0, Pearson 相关系数 0.986),Boogu-Image-0.1-Turbo-Thinking 以 1048 的 Elo 位列开源第一,仅次于 GPT-Image-2 和 Nano-Banana-Pro。在新发布的 Qwen-Image-Bench 上,其 Base-Thinking 变体在中英文双语下均取得开源模型最佳总分;编辑模型 Boogu-Image-0.1-Edit-Thinking 更是在 ImgEdit-Bench 上拿下全场最高的 4.64 分。
敢说真话的技术报告
这份 71 页的技术报告有意思的地方,不只是结果,还有大量业内「靠试错才能学到」却很少被写进论文的细节。
公开基准正在失效。团队用 6 个近期模型对比了 LMArena 人类偏好排名与 GenEval、DPG-Bench 分数,发现明显的排名倒挂:人类偏好最强的 GPT-Image-2 在两个学术基准上只排中游。团队直接宣布不再把这些基准作为主要评估,并呼吁社区重新审视其适用性 —— 甚至坦率指出自家模型在 ImgEdit-Bench 上分数虽高,但人评中仍不如 Nano-Banana-Pro。
「“足够” 的数据」是不够的,但结构化的数据可以很省。团队用 1.87 亿开源数据训练的模型明显撞上性能天花板;而利用少量按人类先验组织的「Boogu Syllabus」教学大纲式数据(仅 2162 万独立样本)进行后训练反而能全面提升性能。原则很朴素:系统性细粒度拆解、能力全覆盖、每个类别数据量充足 ——「如果模型训练时没见过猫,就默认它画不出猫」—— 数据的精细的 “质” 大于朴素地堆砌 “量”。
几个可复用的量化结论。一个汉字要被稳定渲染,训练中至少需要约 300 次曝光;覆盖 3500 个现代常用字即可满足日常中文渲染需求。让模型记住一个从未见过的人物身份,需要约 4500 次语言匹配的曝光 —— 团队用一位志愿者(也是论文作者之一)的 170 张日常照片做了完整消融。
不要盲目过滤「坏数据」。水印、过曝、运动模糊的图片不必丢弃 —— 只要在 caption 里明确详细地描述缺陷,它们反而能让模型学会理解并可控地规避(或复现)这些视觉元素。
慎用 RL。重度美学 RL 会让输出分布坍缩:让模型画「一位六十岁的中国女性」,重 RL 模型倾向输出精致妆容的理想化形象。Boogu 选择把人类偏好放进理解系统而非烙进生成器,只在肢体结构、文字渲染等不损害多样性的问题上使用 RL。
此外,作为最早的原生 2K 训练的开源模型之一,团队发现标准的动态时间偏移策略在 2K 分辨率会产生「过度挤压」效应导致收敛变慢,并给出了简单有效的截断修正方案;附录还提出了免训练的推理增强方法 BOG(Boosted Orthogonal Guidance),把 DiT 预测视为二维矩阵做结构化归一化,强化垂直于 flow 流场的信息,一定程度提升照片摄影艺术质感。
Boogu-Image-0.1 当然有局限:世界知识仍落后于头部闭源系统,文字渲染只优化了中英双语,复杂多人交互场景仍会出现肢体畸变。但在 40 万美元的预算约束下,它给出了一条可复现、可验证的路径 —— 并把过去藏在工业团队内部的工程经验摊开在了论文里。
正如团队在结语中所说:希望 Boogu-Image-0.1 让图像生成向「真正理解用户想要什么」的系统迈进一步。
团队介绍
Boogu 团队来自华为香港小艺大模型应用实验室(莱布尼茨所),联合香港大学、香港科技大学、香港理工大学、香港城市大学、香港中文大学与南京大学共同完成。项目负责人为 Chenyang Lei,通讯作者包括 Chenyang Lei、Rui Liu 与 Chao Huang。团队致力于以理解驱动的统一智能体多模态生成研究,模型、代码与训练配方均以 Apache 2.0 协议开源。
热门跟贴