2026年9月20日,阿里通义千问团队正式开源图像生成与编辑统一模型Qwen-Image-2.1。这款模型最引人注目之处在于,其视觉生成组件仅70亿参数,却在官方自设基准上超越了多数闭源模型。截至发稿,独立第三方评测尚未出炉,官方成绩单仍需进一步检验。
Qwen-Image-2.1由通义实验室研发,视觉生成组件采用7B参数规模的Single-Stream DiT架构(32层),但整套管线(含Qwen3-VL 8B文本编码器)总参数约16.22B。官方博客及多家科技媒体确认,该模型已在GitHub、HuggingFace、ModelScope三平台同步开源,免费开放。
“小模强效”是官方为这款模型提炼的核心标签。在阿里自设的Qwen-Image-Bench基准上,Qwen-Image-2.1得分60.28,登顶开源第一,并超过闭源模型Nano Banana 2.0(59.82)和GPT Image 1.5(59.65)。不过需要指出的是,该基准由官方自行设立,目前尚未有独立第三方评测对该结果进行验证。
硬件友好是另一项关键卖点。参考前代模型Qwen-Image-Edit最低需RTX 3090(24GB显存)、Qwen-Image需16GB显存,可以推断Qwen-Image-2.1对主流消费级显卡具备较好的适配性。虽然官方尚未公布2.1版本的直接硬件要求,但“不挑设备”的定位可以从前代产品中得到侧面印证。
Qwen-Image-2.1最突出的技术能力,是对透明图像的原生支持。模型生成的并非普通RGB图,而是带透明通道的RGBA格式图像。用户可以按提示词直接输出透明背景的物体,也能在透明图层上直接改写文字——官方示例中,模型将“BLOOM”字样改写为“Qwen-Image”,整个过程无需额外抠图或后期合成。
这一能力的源头可以追溯到2025年12月发布的专用模型Qwen-Image-Layered。2.1版本将该功能整合进统一模型,形成了更完整的编辑链路。
多图合成同样是官方重点展示的场景。模型支持最多10张参考图输入,可将不同人物的单独照片自然融合为一张群像合照。从官方演示来看,每张面孔都来自独立照片,模型像一位耐心的拼图师,将人物姿态、光线和透视关系一并缝合成观感自然的合影。
官方将Qwen-Image-2.1的升级概括为四个方向:小模强效、原生透明、全能编辑、真实质感。
在编辑能力方面,模型支持10张参考图输入、局部编辑以及人像/商品的保真处理。这意味着用户可在保持主体身份特征不变的前提下,对图像进行局部修改或内容替换。模型原生支持2K分辨率输出,并采用混合粒度注意力与KV Cache复用技术,优化多图推理效率。
从行业角度看,将生成与编辑统一到一个开源模型中,并以较低参数规模实现接近闭源模型的基准得分,这一技术路线值得持续关注——特别是考虑到通义千问同期还在推进通义点金、通义灵码等面向不同场景的AI工具矩阵建设。
前代模型Qwen-Image已具备16GB显存即可运行的低门槛特性,2.1版本延续了这一路线。官方将Qwen-Image-2.1定位为千问图像系列“最平衡、性价比最高”的开源生图模型,这一表述本身也透露出开源模型在性能与实用之间的取舍逻辑。
值得注意的是,虽然官方基准显示其超越了Nano Banana 2.0和GPT Image 1.5等闭源产品,但独立第三方的对比评测仍有待发布。在开源社区中,此类自设基准登顶的案例并不鲜见,实际表现仍需通过更多真实场景的验证。
目前,Qwen-Image-2.1已在GitHub、HuggingFace、ModelScope三平台开放权重下载,开发者可免费获取并商用。对于关注图像生成与编辑技术的团队而言,这一模型在透明通道支持、多图合成、低显存友好等方面的组合拳,或许值得上手一试。