← 返回AI工具

Qwen-Image-2.1 开源图像生成与编辑模型

阿里云通义千问团队开源,官方称 Qwen-Image-2.1 是 Qwen 系列中统一的文本生图与图像编辑模型:其视觉生成组件仅 7B 参数(32 层单流 DiT),在生成质量、推理效率与多用途之间取得平衡;它支持原生透明(RGBA)生成与编辑、可从照片中抽取主体、支持最多 10 张参考图与局部编辑,并改进排版、人像打光与细节,可在 Hugging Face 下载并配合 diffusers 的 QwenImage21Pipeline 使用

工具概览

功能、使用步骤与常见问题见下方

功能特点

  • ✓ 紧凑高效:官方称 Qwen-Image-2.1 视觉生成组件仅 7B 参数、由 32 层单流 DiT 组成,采用混合粒度注意力与前缀 KV 缓存复用,在较低算力成本下提供强图像质量
  • ✓ 原生透明与统一创作编辑:官方称可从文本生成普通或透明(RGBA)图像、编辑透明图层,并从照片中抽取主体,全部由同一个模型完成
  • ✓ 多用途编辑:官方称支持最多 10 张参考图,可通过圆圈、涂画标注或独立蒙版指定局部编辑,并保持人物与产品的身份一致性
  • ✓ 逼真质感与精致美学:官方称改进排版、人像打光与细节,带来更具视觉吸引力的结果;支持 1:1、4:3、3:4、3:2、2:3、16:9、9:16 等多种长宽比,最高可到 2048 像素级别
  • ✓ 开源与生态:官方称模型在 Hugging Face 与 ModelScope 开放权重(Qwen Research 许可),提供 Hugging Face Space 演示,并可通过 diffusers 的 QwenImage21Pipeline 或支持 CPU offload 的内存优化方式在本地运行

使用步骤

  1. 在 Hugging Face 或 ModelScope 下载 Qwen-Image-2.1 权重,并按官方说明安装 torch、transformers、diffusers 与 accelerate 等依赖
  2. 使用 diffusers 的 QwenImage21Pipeline 载入模型,编写提示词并设置尺寸与采样步数生成图像
  3. 做编辑时传入输入图像与编辑指令(例如更换背景),或按官方推荐的 RGBA 提示词格式生成透明背景图像
  4. 显存有限时可启用 enable_model_cpu_offload 等内存优化,或直接使用 Hugging Face Space 在线演示体验

常见问题

Qwen-Image-2.1 是什么?

官方称 Qwen-Image-2.1 是 Qwen 系列中统一的文本生图与图像编辑模型,视觉生成组件仅 7B 参数(32 层单流 DiT),在生成质量、推理效率与多用途之间取得平衡。

它有哪些关键改进?

官方称有四项关键改进:紧凑高效、原生透明与统一创作编辑、多用途编辑(支持最多 10 张参考图与局部编辑)以及更逼真的质感与精致的排版与人像打光。

它能生成透明背景的图片吗?

官方称可以。Qwen-Image-2.1 支持从文本生成透明(RGBA)图像、编辑透明图层,并能从照片中抽取主体;官方还给出推荐的 RGBA 提示词格式以获得透明背景。

如何使用这个模型?

官方称可在 Hugging Face 与 ModelScope 下载权重,并配合 diffusers 的 QwenImage21Pipeline 运行文本生图、图像编辑与透明图像生成;也可使用官方 Hugging Face Space 演示,显存有限时启用 CPU offload 等优化。

它的许可与尺寸支持如何?

官方称模型依 Qwen Research 许可发布,支持 1:1、4:3、3:4、3:2、2:3、16:9、9:16 等长宽比,分辨率最高可到 2048 像素级别。

官方来源

https://huggingface.co/Qwen/Qwen-Image-2.1