原标题:SuperCLUE 8月文生图榜单出炉:商汤日日新U1 Pro登顶,超越海外头部模型

8月最新一期中文原生文生图测评基准 SuperCLUE-Image 正式发布最新榜单。商汤日日新 SenseNova U1 Pro 以93.81分拿下总榜冠军,字节跳动 Seedream-5.0-pro 与阿里 Qwen-Image-3.0-pro 并列第二,商汤 SenseNova U1.5 Lite 以90.18分位列第三。

更值得关注的是,U1 Pro 在榜单上不仅位居国产第一,更实现对 OpenAI GPT-Image-2、xAI Grok Image 2.0、Microsoft MAI-Image-2.5等多款海外头部模型的排名反超。本期测评覆盖 14个主流模型(8个国内 + 6个海外),对每个模型生成的图片均进行三次独立评测并取平均值,以确保评分的一致性与公正性。

打开网易新闻 查看精彩图片

商汤U1 Pro 总榜登顶:六项能力四项第一

本期测评覆盖多款国内外主流文生图模型,包括商汤日日新 SenseNova 系列、字节跳动 Seedream-5.0-pro、阿里 Qwen-Image-3.0-pro,以及 OpenAI GPT-Image-2、xAI Grok Image 2.0、Microsoft MAI-Image-2.5等海外新一代模型。

从结果来看,总分90分以上的模型共8个,其中国内模型占4席。商汤成为本期测评中表现最为突出的企业。两款定位不同的模型同时进入总榜前列,形成了鲜明的梯队优势。旗舰级模型 SenseNova U1 Pro 以93.81分强势登顶;轻量级开源生图模型 SenseNova U1.5 Lite 也以90.18分位列第三。

测评总榜

打开网易新闻 查看精彩图片

值得一提的是,SenseNova U1 Pro 93.81分的冠军成绩并非来自单一指标的优势,而是全面领跑,其在六大维度测评中取得四项第一。其中,汉字生成、现实复现、创作与推理、复杂信息布局四项指标均突破95分大关。这意味着 SenseNova U1 Pro 不仅在传统图像生成质量上表现优异,更在中文语义理解、逻辑推理和视觉规划等高阶能力上建立了显著优势。

同时,本期测评新增“复杂信息布局”维度,成为了一大亮点。它下设信息密度、多面板结构、嵌套界面三个二级维度,专门考察模型在一张图中稳定组织大量异构信息的能力,覆盖信息图、分镜、UI界面等高频商业场景。在此维度上,最高分(SenseNova U1 Pro 95.80)与最低分相差高达74.2分。该维度参测模型平均分仅72.87分,在所有维度中成绩分化最为明显。

复杂信息布局榜单

打开网易新闻 查看精彩图片

这意味着“在一张图中稳定组织大量信息”的能力,已成为区分头部与中尾部模型的关键分水岭。SenseNova U1 Pro 以95.80分位列该维度第一,超越了 GPT-Image-2的94.04分;Qwen-Image-3.0-Pro(93.32)、MAI-Image-2.6-Preview(92.03)紧随其后,前四名得分均超过92分。

对阵海外头部:国产模型实现排名反超

本期榜单从最终排名看,SenseNova U1 Pro 不仅位居国产首位,更直接超越多款海外头部模型——以93.81分超过 GPT-Image-2(93.23分)0.58分,位列全球总榜第一。

此前,海外模型在全球文生图领域长期占据较强优势。随着国内厂商持续迭代,国产模型在中文理解、文字生成以及复杂视觉任务上的能力不断提升,差距正在进一步缩小。此次 SenseNova U1 Pro 直接登顶并超越多款海外头部模型,标志着国产文生图模型已进入从“追超者”到“领导者”关键阶段

打开网易新闻 查看精彩图片

以下选取本期测评中的典型案例,每个样本均经过三轮独立评测后取均值。

案例:复杂信息布局-信息密度

生成一张高密度医学科普信息图,主题为“人体心血管系统:血液如何完成一次全身循环”。

【回答模型】:SenseNova U1 Pro

打开网易新闻 查看精彩图片

结果显示:SenseNova U1 Pro 获得0.95分(接近满分),成功完成了全部四级字号体系的精准渲染,从主标题到最小号医学提示均清晰可读,流程箭头连续无断裂,数据图表完整准确。

性价比分水岭初露端倪

此次测评的另一个重要维度是性价比。测评报告显示,SenseNova U1 Pro 以93.81分、0.50元每题的组合成为“最高分、低价格”的模型代表。同时,OpenAI GPT-Image-2平均每题价格高达1.44元——约为 SenseNova U1 Pro 的2.9倍。这意味着在同等使用量下,选择 SenseNova U1 Pro 的成本不到 GPT-Image-2的三分之一。

打开网易新闻 查看精彩图片

商汤 SenseNova U1.5 Lite(90.18分、0.01元)、字节跳动 Seedream-5.0-pro(91.93分、0.60元)和阿里 Qwen-Image-3.0-Pro(91.60分、0.50元)同样处于高性价比区间。

海外头部模型则大多位于偏右上角的“高价区间”,如xAI 的 Grok Imagine Image 2.0(90.32分、0.54元)和Google 的 Nano Banana 2(90.14分、0.71元)等模型。而Recraft V4.1 Utility Pro(76.26分、1.41元)和 FLUX.2 [max](61.91分、1.08元)则呈现出“低分高价”的特征。

综合来看,不同模型在性价比上已经形成鲜明的分水岭,这也将直接体现在商业落地的优势上。

全球竞争进入深水区

一张商业海报可能要求模型同时生成大量中文文字、人物、产品和品牌元素;一张信息图需要处理多个层级的信息嵌套关系;一张产品示意图则要同时满足现实结构准确性、空间关系合理性和文字标注精确性。这些真实场景对模型的能力要求,早已超越了单纯的图像美学质量,延伸到了语义理解、逻辑推理、视觉规划和内容组织等综合能力层面。

回溯国产文生图模型的进化路径,已经从早期重点攻克中文文字生成能力,到如今在现实复现、创作推理、复杂信息布局等综合能力上持续突破,并在性价比上实现全面领先。

竞争维度正在从“单项冠军”向“全能选手”演进。本期榜单也印证了一个趋势:总分前两名(SenseNova U1 Pro 与 GPT-Image-2)在六大维度上均位列第一梯队;而中尾部模型普遍存在显著的能力短板——单一维度的优势已难以支撑总榜排名,综合能力的均衡性正成为决定性因素。