7B就把图画成这样?Qwen-Image-2.1来了
小模型、推理结构优化、直接嵌进生产线,三件齐活了。视觉生成部分仅7B,32层Single-Stream DiT,文生图与编辑合一。 值得看的不是参数量,是它怎么省的,混合粒度注意力,文本(系统前缀与编辑指令)走Token 级因果掩码,图像生成走Chunk级掩码,再把输入图与编辑指令当作静态上下文,首步预计算后 KV Cache 复用,直接压掉显存开销。这是把LLM推理那套优化,搬进了扩散模型。 于是,参考图越多,优势越明显,最多10张输入不是堆出来的卖点,是这套结构的副产品。 另一条线是原生透明。Qwen-Image-Layered的能力被放进统一模型,模型自己判断该输出 RGB还是RGBA,还能从真实照片里抠出透明图层。输出单位从"图"变成了"图层",整条抠图环节被吃掉了。
小模型、推理结构优化、直接嵌进生产线,三件齐活了。视觉生成部分仅7B,32层Single-Stream DiT,文生图与编辑合一。 值得看的不是参数量,是它怎么省的,混合粒度注意力,文本(系统前缀与编辑指令)走Token 级因果掩码,图像生成走Chunk级掩码,再把输入图与编辑指令当作静态上下文,首步预计算后 KV Cache 复用,直接压掉显存开销。这是把LLM推理那套优化,搬进了扩散模型。 于是,参考图越多,优势越明显,最多10张输入不是堆出来的卖点,是这套结构的副产品。 另一条线是原生透明。Qwen-Image-Layered的能力被放进统一模型,模型自己判断该输出 RGB还是RGBA,还能从真实照片里抠出透明图层。输出单位从"图"变成了"图层",整条抠图环节被吃掉了。


JPG
长图
JPG
长图
JPG
长图
PNG
长图
JPG
长图
JPG
长图
PNG
长图
PNG
长图
PNG
长图
PNG
长图
PNG
长图
PNG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
PNG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
PNG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
PNG
长图
PNG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
PNG
长图
PNG
长图
PNG
长图
PNG
长图
PNG
长图