阿里巴巴AI团队最近放出了Qwen-Image-3.0,这款图像生成模型号称能把AI画图从“看着好看”推向“真正能用”的水平。开发团队给出的三个看点很直接:最大支持4500个token的文本输入、能绘制小到10像素的精细文字、支持包括日语在内的12种语言渲染。
目前通过Qwen Studio注册账号就能免费使用,我上手跑了几组图,看看它到底能不能兑现这些承诺。
官方放出的样张里,有一张鲸鲨生态的科普图格外显眼。密密麻麻的标注和细小的说明文字排列整齐,不是后期拼贴的效果,而是一次生成直接输出的结果。另一组幻灯片风格的图像同样值得细看——九张卡片式的版式在同一张图里生成,数学公式的空间关系保持得很干净,没有出现元素错位或者符号乱飞的情况。把原图放大看,截图里的界面文字、按钮标签、窗口标题基本都扛住了像素级的审视,破损率比前代产品明显降低。
我自己上手做的第一个测试是游戏截图方向。给的提示词是:生成一张动画风格开放世界游戏的画面,角色是一名女仆,正在释放攻击技能“冥土の土産のメイドパンチ”(冥土的土产女仆拳),画面需要带上动作RPG式的HUD界面。生成结果出来,整体构图完全符合游戏截图的感觉,技能名称的排布也到位了。不过细看文字部分,“ド”被写成了半浊音,“クエスト”(任务)看起来更像“ケェスト”,小字的稳定性还有提升空间,但作为一次生成的结果,画面结构和角色姿态都没跑偏,指令跟随度相当高。
接着测材质表现。提示词是:写实风格、特写老人眼部、精细刻画皮肤皱纹和瞳孔质感。生成图里眼角的纹路走向自然,皮肤纹理不是简单的滤镜叠加,瞳孔的光泽层次分明,真实感拉满。这种对细节质感的处理能力,放在需要产品渲染或者人物特写的场景里,实用性确实比上一代提升了一截。
图像编辑功能我也顺手跑了一遍。上传了一张东京拉面街一家拉面店拍的照片,指令是“把这张拉面照片变成一篇拉面评论家博客文章的截图,加入日语写的拉面味道解说”。生成结果搭出了一个叫“麺ログ”的虚构网站页面,拉面图片嵌套在网页框架里,版式设计像模像样。但放大检查日文段落就发现问题了,“とろける”(融化的)被写成了“ととのける”,“とろりとした”(浓厚的)变成了“そろてとろりとしった”,语义完全断裂。这套模型对中英文字符的把控力显然比日文假名强出不少,日语长句的字符连贯性还是个有明显的短板。
综合跑下来的感受是,Qwen-Image-3.0在图文混排和版式还原上走出了实打实的一步,4500个token的指令容量意味着可以塞进更复杂的画面需求,10像素级别的小字渲染也让信息图、截图、海报这类实用性场景有了生成工具真正上场的可能性。但日语文字在大段连续渲染时依然会崩,这条线上离“直接出稿”还有距离。如果你需要快速产出带文字排版的视觉素材,这个免费入口值得先玩一遍,看看它在你自己的场景里卡在哪个环节。
热门跟贴