阿里通义千问于2026年9月20日正式发布并开源Qwen-Image-2.1,这是一个视觉生成组件仅7B参数、同时支持文生图与图像编辑、并原生支持RGBA透明图的统一图像模型。模型已上架Hugging Face与ModelScope,官方博客同步披露了架构细节,当日即支持diffusers、ComfyUI、vLLM-Omni、SGLang等多种推理框架。该模型按Qwen Research License发布,仅限非商业研究用途,这一许可证变化与前代产品形成鲜明对比。
7B参数统一架构:视觉生成与理解能力整合
在模型设计上,Qwen-Image-2.1将文本到图像生成和图像编辑能力融合进单一权重框架。根据官方渠道公布的参数细节,其视觉生成组件为32层Single-Stream DiT架构,仅7B参数;全管线包含Qwen3-VL 8B文本编码器,总参数规模约16.22B。这种轻量化的设计使得本地推理门槛明显降低——有媒体报道称,使用RTX 3090等消费级显卡即可运行该模型。
与当前多数图像模型不同,Qwen-Image-2.1并未按“文生图”和“图生图”拆分不同模型入口,而是由一个统一模型承载两类任务。官方在技术博客中明确表示,该模型“在单一模型中统一了文生图与图像编辑能力”,并声称其性能超越多数闭源模型。
原生RGBA透明图与最多10张参考图编辑
Qwen-Image-2.1的另一项关键能力是原生支持RGBA透明通道。它既可以生成带透明图层的图像,也能从照片中提取主体生成透明背景素材,这属于Qwen-Image系列首次以原生方式支持该功能。此前,用户若需要透明图像,往往需要借助第三方工具进行后期抠图或合成,而此次模型直接将其纳入生成管线,对电商、UI设计、素材生产等场景具有实际意义。
在多参考图编辑方面,该模型支持最多10张参考图输入。这意味着用户可以提供多张人像照片进行多人合照生成,或输入多套服装、多角度家居图片进行穿搭参考、室内设计预览等操作。媒体评测中特别提到了这些使用场景,但截至本文发出时,官方尚未公布完整的基准测试榜单,第三方独立评测也尚未出现。
研究许可收紧:与Apache 2.0的显著差异
值得关注的是,Qwen-Image-2.1采用了Qwen Research License Agreement,明确限定为“仅研究/评估用途”,商业使用需另行申请。这与前代产品Qwen-Image-2.0(发布于2026年2月10日)采用的Apache 2.0宽松许可证相比,是明显的政策收紧。虽然官方对外以“open-weight”为口径进行宣传,但业界普遍关注其“开源”表述与商用限制之间的落差。
对于研究者和开发者而言,这种许可变化意味着:模型权重可以自由下载和实验,但若要将模型集成到商业产品、提供API服务或进行任何形式的商业部署,则需额外获得阿里方面授权。可以推测,阿里可能在后续通过企业版或云服务渠道提供商用途径,但官方目前尚未说明具体商业化安排。
从行业角度看,这种“模型开源、商用受限”的策略在头部厂商中并不罕见。分析认为,阿里此举一方面希望借助开源社区的力量加速模型迭代,另一方面则为云服务等商业化路径保留空间。对于依赖开源模型的开发者来说,Qwen-Image-2.1的模型能力能否便捷地通过
Qwen Cloud等平台接入生产环境,仍取决于阿里后续的许可政策调整。
截至9月21日,该模型在ModelScope上的下载量已接近9078次。若您希望上手体验,可通过Hugging Face或ModelScope获取权重;关于该模型的研究进展与后续版本动态,可关注
World Models Watch持续跟踪。
参考资料
- Qwen-Image-2.1 - 魔搭社区
- 7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图|Nano Banana 2|GPT Image 1|Qwen 3|Qwen3-VL|ChatGPT_手机新浪网 - 新浪财经
- Qwen-Image-2.1: 7B open weights for generation, editing and alpha layers, under a research-only license (2026) · Neodrop -
- Qwen-Image-2.1 — a 7B open image model on a research-only license — Alibaba (Qwen) | AI/TLDR -
- Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation - Qwen
- Qwen - Qwen
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。