当你还在惊叹 AI 能生成一张精美写实人像的时候,阿里千问已经把目光投向了排版精确的数学试卷、公式复杂的学术论文,以及需要修复的破损古画。7 月 21 日,阿里正式推出 Qwen-Image-3.0,这是 Qwen-Image 系列的第三代图像生成基础模型。如果说前两代的关键词分别是“准”和“准多齐美真”,那么这一代的核心主线只有一个字:“实”。
这个“实”字从三个维度展开。首先是内容丰实,该模型支持最大 4.5k token 的超长文本输入。这意味着它可以理解和渲染极其复杂、信息密集的视觉版面。官方展示了一个典型例子:Qwen-Image-3.0 一次性生成了一个九宫格图片,其中每个格子都是一张复杂信息图。这九个格子分别刻画了隧道安全漫画、空间几何教学、《出师表》文体分析、物理抛体运动、生物寄生虫科普、右胸疼痛医学图解、群论 Sylow 定理、银行内控管理信息图以及细胞 DNA 结构对比。每一格都包含精确的中英文文字、公式、图表和漫画人物。官方强调,这张图是模型一次性生成的,而非多个图片拼接而成,完整描述它整整需要 3.7k 个 token。
除了横向在同一画布上摆放大量并列元素,Qwen-Image-3.0 在内容纵深上也展现了语义解构与逻辑嵌套的能力。一条指令就能在一幅图中从外到内依次展示 VSCode 编程界面、千问聊天界面、社交媒体聊天界面和手冲咖啡海报。每一层界面都保持了各自的 UI 真实风格与细节,形成了“画中画中画”的视觉纵深。这种能力使得模型可以从“画一张好看的图”真正走向“完成一项实际工作”,例如生成复杂的 UI 界面或多元素融合的知识图解。
细节真实是第二个维度。模型在微观细节上的渲染精度达到了新的高度:10px 的小字清晰可辨。在学术论文渲染这个极限测试场,模型完整生成了一整页代数几何领域的论文,包含多行复杂公式推导,上标、下标、花括号、分数线、多行对齐等 LaTeX 排版元素均准确呈现,小字号下依然保持了极高的可读性。在人像摄影中,毛孔与发丝纤毫毕现,肌肤质感逼近摄影级真实。模型还能在书页上叠加逼真的红色手写批注,下划线、波浪线、圈画、箭头和简短评语字迹自然流畅,模拟出高中生课堂笔记的风格。在古画修复场景下,模型以与原画一致的笔法完成了鹰搏图的修复,保持了水墨渐变、羽毛质感和构图平衡,同时去除了霉斑和破损痕迹。
第三个维度是知识厚实。Qwen-Image-3.0 拥有覆盖 12 国语言、多种字体、100 多种艺术风格以及主流网页、游戏、直播等界面的渲染能力。它能基于真实图像生成可直接用于学术发表的复杂信息图,在保留原始昆虫照片主体的同时,添加分类学信息、形态标注、放大细节视图和比例尺等专业元素。同时,模型支持西班牙语等多语种原生渲染,并能在多语言产品海报、影视和漫画分镜等“可读可用”的商业素材生产中大幅降低生产成本。
目前,阿里云百炼与千问 AI 平台已开放 API 邀测,Qwen Studio 和千问 APP 也即将上线供免费体验。阿里方面认为,随着图像生成模型能力从“好看”持续向“好用”演进,其将在设计、内容创作、教育、电商等领域释放真正的生产力价值。
热门跟贴