近日,阿里巴巴 Qwen 团队正式对外发布了 Qwen-Image-2.1 模型。这是一款基于扩散 Transformer 架构的 7B 参数模型,标志着阿里巴巴在多模态 AI 领域的又一重要突破。与以往需要多个模型或插件才能实现的图像生成与编辑功能不同,Qwen-Image-2.1 试图通过单一模型框架解决从文生图到复杂图像编辑的全流程需求。
Qwen-Image-2.1 的核心亮点在于其“多参考编辑”能力。在传统的图像编辑流程中,用户往往需要借助 ControlNet 或 Inpainting 等辅助技术来指定编辑区域。而 Qwen-Image-2.1 允许用户直接提供多张参考图片,模型能够快速理解并融合这些参考特征,对目标图像进行精准的修改。为了解决多参考带来的计算开销问题,该模型引入了前缀 KV 缓存技术。这一技术优化使得模型在处理多达 10 张参考图片时,依然能够保持高效的推理速度,显著降低了用户的使用门槛。
此外,原生 RGBA 透明度支持是 Qwen-Image-2.1 的另一大特色。在生成式 AI 领域,处理透明背景一直是一个技术难点,通常需要复杂的后处理步骤。Qwen-Image-2.1 直接在模型层面支持 RGBA 通道,这意味着用户可以直接生成具有透明背景的图像,这对于网页设计、游戏素材制作以及电商图片处理等场景极具实用价值。
在开放性方面,Qwen 团队选择了开源权重,这符合当前 AI 社区推崇的“开放科学”精神。开发者可以免费下载并部署该模型,进行学术研究或二次开发。然而,值得注意的是,虽然权重开源,但商业使用需要单独申请许可证。这种“开源研究,商业付费”的模式,既保障了社区的创新活力,也为企业级应用提供了可持续的商业化路径。
总体而言,Qwen-Image-2.1 的发布为图像生成领域注入了新的活力。它不仅展示了扩散 Transformer 模型在端侧部署和特定功能上的潜力,也为企业和个人开发者提供了一个功能全面、性能优越的国产开源图像生成工具。
信息来源: MarkTechPost
原文链接: https://www.marktechpost.com/2026/09/21/alibaba-qwen-releases-qwen-image-2-1/
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/21/alibaba-qwen-releases-qwen-image-2-1/