就今天,看到阿里发布了千问新一代图像生成模型Qwen-Image-3.0。
还记得之前的2.0版本,在文字处理上就很有惊喜。
这一次,据说模型在指令控制和生成画面上的表现,更进一步。
官方介绍说,升级后的Qwen-Image-3.0优势在于能精准把控生成文字,生成高质量图片、长信息图、复杂UI界面,服务真实生产力场景。
我自己用下来,感觉这是国内处理中文内容效果最好的,而且是信息密度最高、文字层次最丰富的图像模型。
带大家一起来看看质感。
01汉字效果最好,没有之一
使用方法非常简单,在阿里云百炼、千问AI平台上申请API通过后,或者打开千问APP都可以体验到。
我这里是从Qwen Studio上体验的。
这一代的Qwen-Image-3.0模型,支持最大 4.5k token 的输入,对长文本、复杂信息和多模块内容的理解能力明显长了不少。
当描述长度增加,我们能直接写出完整结构、排版要求、字体规范、颜色规则、布局逻辑甚至数据内容,这就让图像生成,逐渐接近了结构化的设计工具。
提示词:
瘦金体书法作品:包含下面所有文字:壬戌之秋,七月既望,苏子与客泛舟游于赤壁之下。清风徐来,水波不兴。举酒属客,诵明月之诗,歌窈窕之章。少焉,月出于东山之上,徘徊于斗牛之间。
像我截取的《赤壁赋》里的这一段,用“瘦金体”书法作品呈现出来,一笔一画都法度严谨,就是略显完美刻意了些。
到这里,可能有朋友觉得,似乎和2.0版本,或者跟最强海外模型比,差别没有很大,没什么惊喜。
那不妨看看下面这个,我让模仿米芾的,落款就是仿米芾。
这个提示词我打磨了很久,从做旧风格到气息生动到墨色浓淡,给了不少细节。
效果还是很有惊喜的:
提示词:
Negative prompt: unreadable pseudo-Chinese glyphs, malformed characters, missing characters, extra characters, wrong order, modern font look, logo-like calligraphy, perfect vector smoothness, repeated stroke templates, rubbery curves, mirrored stroke forms, decorative swirls, chaotic illegible cursive, graphic poster layout, wallpaper aesthetie, bright synthetic red seals, excessive seals, fake museum label, overdone antique distress, fantasy parchment, cartoon ink edges, flat digital brush texture, copied famous original composition, ornamental filler calligraphyte
提示词:
一幅中国传统书法横轴长卷作品。画面包含强劲有力的黑色毛笔书法字体,为行草书风格。文字在带有岁月沧桑感的浅褐色复古宣纸/羊皮纸上从右至左竖排书写,纸张带有老旧纹理、墨渍痕迹、微微的水渍和风化边缘。左下角有一枚小巧的红色传统中国篆刻印章。超宽全景视角,真实的历史古朴质感,极致细节,大师杰作
米芾的字体,飘逸俊秀,也不在话下。
应用的场景也很多,比如书法体展示、文学历史教程PPT等等。
以后我的社媒封面,也终于可以有好看的中文书法字体了。
我在想,有没有可能把书法汉字,和古风仙侠海报相结合呢?试了一下。
Final requirement: the first glance should give strong theme recognition and a memorable silhouette, the second glance should reveal a complete narrative world, and the third glance should still reward close inspection with depth and aftertaste. Avoid generic backgrounds, hard cut-and-paste compositions, templated fantasy assets, video-game promo art vibes, excessive cartooning, or realism that kills the artistic mood. If appropriate, subtle titles, numbering, signatures, or marks can be added as part of the poster design, but they must never overpower the image.
海报的画面层次,文字质地都挺不错,细节的渲染也到位。
排版、字体、留白,全靠AI一次到位,让我觉得这一次是有审美逻辑的,而且出图一次就到位,省去了反复抽卡的烦恼。
02复杂结构图,一次画明白
复杂信息图的生成,也没问题。
我想试一下,在提示词中定义模块标题、专题信息、图表类型、内容方向以及配色逻辑,看看模型能不能直接生成符合排版规则的成品视觉稿。
生成结果包含信息介绍、框图、表格、说明、统计符号等元素,并保持布局关系正确。
拿我自己《AI异类弗兰克的个人介绍》试了试,还挺惊喜的,密密麻麻都是关于我的信息。
因为我最了解自己的情况,所以这是个保留测试项目,能看出来对图片信息的处理逻辑和内容严谨性。
结果也是可以的,效果很真实,白板边缘还反光,内容和结构又是很严谨完整。
文本渲染一直是图像模型难点,因为字符属于高度结构化视觉元素,对笔画位置、比例关系、透视角度都有严格要求。
Qwen-Image-3.0在这一点上表现很突出,能生成大量文字并保持清晰度与排版逻辑一致。
即便文字处在斜面、曲面或不同材质上也能匹配透视关系,好比玻璃白板、衣服印刷、杂志封面等,不同介质中的文字都能保持真实视觉效果。
实际用下来能感觉到,长指令能力,减少了后处理需求,因为许多过去需要程序拼接的内容,已经在生成阶段完成了。
此外,一些图表和文字、数字相结合的,控制力也非常强。
完全是可以高质量PPT提示词直接出的水准。
结合大语言模型改写提示词的能力,只需输入简单需求,语言模型就能扩展为完整描述,再交给图像模型执行。
这种协同方式正在形成新的创作流程,提示词工程逐渐从技巧变成可自动化步骤。
我还发现,单张图中同时生成多个独立小图,并保证内容一致,也是可以的。
提示词:
创作一幅全页彩色漫画XX人物插图。采用正统漫画XX动作的页面构图,单页包含 5-7个动态连贯的分镜。
运用电影化的叙事手法、特写镜头以及强烈的视觉冲击力。
添加英文漫画风格的音效,粗犷的漫画草图线条以及涂鸦风格的笔触。
将鲜艳的色彩与漫画风格的阴影和强烈的对比相结合。呈现手绘风格,线条流畅,构图引人入胜,品质上乘。
比如在一个版面中展示同一角色的不同状态,或在信息图中嵌入多个界面示意图,这种画中画能力过去需要多轮生成加人工拼接,现在一次推理即可完成。
类似能力在产品设计领域很有价值。
像我们小团队,也能直接生成视觉组件、产品流程图、用户路径图等视觉资料,汇报或文档展示都很方便。
还尝试了一下比较好玩的,让诗人李白发小红书。
提示词:
Generate a screenshot of [historical figure name] on [platform name]
大家可以根据喜好填空,比如Generate a screenshot of [李白] on [小红书]
类似的,我还让苏轼发了一条小红书帖子。
教育行业也能利用此能力生成教学示意图,将知识结构可视化,减少老师制作课件时间。
还尝试了一个咖啡机的透视图,效果尤其让我惊喜。
输入了产品说明,直接给我生成了产品可视化的功能长图,透视、拆解、细节展示、信息说明,要素还挺齐全挺到位的。
提示词:
save_image(result, "infographic_coffee_machine_gpt-image-2.png")对内容平台来说,创作者可以直接生成漫画分镜或故事板草图,将脚本转换为视觉结构,创作流程明显缩短。
此外,Qwen-Image-3.0自带的编辑功能,还可将多张输入参考图融合成一张12宫格电影分镜图,或是漫画/短剧分镜,还可基于参考图扩展成全景照片,适合影视、广告、短剧、游戏、美术概念设计等场景。
03我的设计师,已经担心失业了
看到身边朋友,也已经测出来不少有意思的场景。
我自己团队的设计师,看到我生出来的图,就很羡慕嫉妒,隐隐还有点酸酸的焦虑。
比如我拿生成的下面这张《龙珠人物关系图谱》给设计师看,他当时眼镜就睁大了。
提示词:
- avoid cheap flowchart vibes, clutter, or information overload动漫画面中的角色属性文字面板,一次就生成好了,已经有点游戏UI的感觉了;下一步,结合Vibe Coding,凭借Qwen-Image-3.0画的图,已经能做出画质很精美的小游戏了。
还试了一下原创IP,人物三视图、不同表情、服饰装饰等等,一张图直出,要像IP画册一样有设计感。
实际生成的,还有小色卡、图标徽章等小细节,是很完善精致的。
提示词:
Organized grid layout, concept art style, high resolution. Aspect ratio 16:9.还试了一下我们的超级景点IP西游记,把九九八十一难,用一张信息图,完整呈现出来。
我给的提示词还特别简单,只有一句话:
提示词:西游记81难所遇妖怪的信息图,流水型时间轴配图标,竖版设计
虽然说有的小细节、小字还略有瑕疵,但整体的完成度已经非常高了。
我只觉得,之前所有你觉得惊喜的、惊艳的图片,Qwen-Image-3.0能让效果再更进一步。
真的都很值得试一试!
04简单说说视觉生产力
在我看来,Qwen-Image-3.0这次主打的,是生产力这张牌。
4.5k token的长输入、精准的文字渲染、复杂的信息图生成、多层UI界面模拟、生图编辑一体化……
这些能力都指向一个目标:让AI生图变成能解决综合场景的生产力工具。
之前绝大部分的AI图片模型,生图效果再好,但是层次性、信息密度一般,对中文的处理容易有问题。
但如果AI生图变得精准可控、还能理解长上下文,之前的很多问题就都有解了,比如做PPT、做网页前端设计、做动漫IP角色等等。
设计师可以直接用AI生成初稿,然后微调定稿;产品经理可以直接用AI生成产品说明图,不用等设计排期;运营可以直接用AI生成活动海报,不用求着设计帮忙。
这才是真正的效率革命。
我不喜欢用炸裂、颠覆这样的字眼,但时常还是会惊讶于AI带来的改变。
这一次,Qwen-Image-3.0,很务实,很让人有想用的欲望。
接下来我的公众号文章配图、小红书视频号封面等等,大概率会多一个主力生图模型了~
朋友们快去用起来吧!有喜欢的配图,随时找我要Prompt!
朋友圈会发一些具体的案例和商业化日常~
热门跟贴