AI 快讯Qwen-Image-2.1开源:7B也能生成透明图
模型上新

Qwen-Image-2.1开源:7B也能生成透明图

2026-09-20T17:05:07.797Z
Qwen-Image-2.1开源:7B也能生成透明图

阿里千问于2026年9月20日开源Qwen-Image-2.1,视觉生成主干仅7B参数,原生支持RGBA透明图、2K输出、最多10张参考图和统一图像编辑。

Qwen-Image-2.1开源:7B也能生成透明图

2026年9月20日,阿里千问正式开源图像模型 Qwen-Image-2.1。它把文生图、图像编辑、透明图生成和主体提取放进同一个模型,视觉生成部分只有7B参数,同时支持原生2K输出和最多10张参考图。(github.com)

Qwen-Image-2.1 是一个统一式图像生成与编辑模型,指的是同一套推理链既能根据文字生成新图,也能基于一张或多张输入图像完成修改、重组和局部编辑,而不是把生成模型、抠图模型和编辑模型拆成三个独立环节。

这次更新最值得关注的地方,不是“又多了一个会画图的开源模型”,而是它开始把图像模型从展示型工具推向资产生产工具:输出可以直接带 Alpha 透明通道,多个参考对象可以被重新组合,局部修改也不必反复切换节点。对开发者和重度用户来说,这比单纯追求一张图的审美分数更有实际价值。

Qwen-Image-2.1透明图生成、十张参考图编辑与局部修改能力示意图

先说结论:这不是一次普通的小版本更新

Qwen-Image-2.1 的核心卖点是把“生成结果”变成可以继续进入设计流程的素材。过去,模型生成一张商品图,往往还要经过抠图、修边、改背景、重排文字和局部重绘;现在,这些动作至少在模型能力层面被压缩到同一套流程里。

透明图是带有 Alpha 通道的 RGBA 图像,除了红、绿、蓝三个颜色通道外,还额外记录每个像素的不透明程度。它和普通图片里用棋盘格模拟透明背景不是一回事,也不等于生成白底图片后再调用抠图工具。

Qwen-Image-2.1 可以根据文字直接生成带透明背景的图像,也可以编辑透明图层、从照片中提取主体。官方给出的推荐提示格式会明确告诉模型输出 RGBA 图像,并强调背景透明;模型输出后可以直接保存为透明 PNG。(github.com)

这个能力对电商素材、游戏道具、贴纸、表情包、PPT 插图、网页组件和商品主视觉都很实用。更重要的是,它减少了“先生成、再抠图、再修边”的中间步骤。对于批量制作内容的团队来说,少一次人工处理,往往比单张图片提升几个百分点的审美更能影响总成本。

不过,透明输出真正难的地方不在于能不能导出 RGBA 文件,而在于边缘质量。发丝、毛发、玻璃、半透明塑料、阴影和反光区域,才是 Alpha 通道最容易出问题的地方。官方目前展示的是模型能力和案例,不代表所有素材都能一次生成可交付结果,实际生产仍然需要检查边缘、阴影和半透明物体。

7B到底意味着什么

7B 是约70亿个可训练参数的模型规模单位,但它不等于完整推理流程只需要70亿参数,也不等于任何消费级显卡都可以轻松运行。

官方架构信息显示,Qwen-Image-2.1 的视觉生成主干是一个拥有32层的单流 DiT,参数规模为7B;同时,它使用 Qwen3-VL 8B 作为文本和图像条件编码器,并通过64通道 RGBA VAE 处理图像潜空间。换句话说,新闻标题里的“7B”主要指负责图像生成的核心主干,而不是整个推理栈的显存占用答案。(github.com)

DiT 是基于 Transformer 的扩散模型架构,可以理解为一个逐步修正噪声图像的视觉生成器。Qwen-Image-2.1 采用单流设计,把文字条件、参考图像和待生成图像放在同一条序列中处理,这让文生图和图像编辑不再需要两套完全割裂的模型逻辑。

Block-causal attention 是一种分块因果注意力机制,文本部分保持按顺序理解,图像块之间则允许更灵活的双向交互。简单说,模型既能像语言模型一样读懂指令,又能让不同区域的图像信息互相参考,从而服务于多图组合和局部编辑。

Prefix KV cache 是一种缓存机制,指模型在第一次去噪时计算出的文本和参考图像上下文,可以在后续去噪步骤中重复利用,而不必每一步从头处理。Qwen-Image-2.1 官方明确强调了 prefix KV cache reuse,这也是它试图用更轻生成主干换取推理效率的关键之一。(github.com)

官方模型页标注 Qwen-Image-2.1 为7B参数、BF16权重,并给出了 CPU offload 方案。但目前公开资料没有给出一个适用于所有显卡、所有分辨率和所有并发场景的最低显存数字,因此不应该简单把“7B”理解成低配置机器可以无压力运行。(huggingface.co)

透明图只是开始,真正有用的是编辑闭环

多参考图编辑是同时输入多张参考图片,并让模型按文字指令理解、保留或重新组合这些图片中的人物、商品、服装和场景元素。Qwen-Image-2.1 最多支持10张参考图,这让它从“改一张图”进一步靠近“组织一组视觉素材”。(github.com)

例如,用户可以分别提供人物、上衣、鞋子、包和帽子的图片,再要求模型生成一个完整造型;也可以输入多个人物头像,让模型把他们放进同一张合影里。官方展示中包含六张人物参考图生成合影,以及使用五张服装和配饰参考图完成穿搭组合的案例。(github.com)

这类能力解决的是一致性问题。传统文生图更擅长从零开始创作,但很难稳定保留某个具体商品的纹理、某个人物的脸部特征,或者一套服装的真实结构。多图参考的价值在于把“创意生成”变成“带约束的创意生成”。

Qwen-Image-2.1 还支持局部编辑,可以使用圈选、涂画标记或单独的蒙版来指定修改区域。局部编辑是只改变图像指定区域、尽量保持其余区域不变的编辑方式,也是设计工作流里比整图重生成更常见的动作。

这种方式尤其适合商品图和人物图。比如只替换背景、改变发色、移除手表、调整服装颜色,或者在保持人物脸部和姿态的前提下更换场景。模型不需要重新猜整张图的构图,编辑目标更明确,结果通常也更容易控制。

但“最多10张参考图”并不等于“10张图都能完美保真”。参考图越多,模型需要处理的约束越多,人物之间的身份、物体之间的比例、光照方向和空间关系也更容易互相干扰。它更像一个能同时查看10张素材的视觉导演,而不是可以逐像素复制粘贴的 Photoshop。

2K、文字和人物质感:补齐通用图像模型的短板

Qwen-Image-2.1 原生支持2K级输出,官方给出的推荐尺寸包括2048×2048、2400×1792、2528×1696和2752×1536等多种比例,默认推理步数为40步。(github.com)

原生2K的意义在于,模型不是先生成低分辨率图片,再依赖放大模型把细节“猜”出来。对于海报、商品详情页、横幅、分镜和人物立绘来说,更高的原生输出可以减少二次放大带来的纹理损失和文字变形。

文字渲染仍然是图像模型的关键指标,因为很多商业素材不是“画面好看”就够了,还需要标题、价格、按钮、品牌名和说明文字能被正确读出。官方将文字排版、人物光影和细节表现列为本次升级重点,并在仓库中单独展示文字渲染案例。(github.com)

不过,官方展示 Qwen-Image-Bench 对比图,并不等于已经给出完整、可复现的统一跑分表。对于不同模型谁更强,仍然要看测试集、提示词、分辨率、采样步数和人工偏好评测。更稳妥的判断是:Qwen-Image-2.1 在文字、透明素材、多参考编辑这些具体任务上补足了开源图像模型的工作流缺口,而不是简单宣布它在所有审美场景中都领先。

和传统图像工作流相比,它省在哪里

Qwen-Image-2.1 的优势不只是模型能力更集中,而是把多个步骤压缩到一套接口和一套权重里。可以把它和传统本地工作流做一个功能层面对比:

| 工作流 | 文生图 | 图像编辑 | 透明图输出 | 多图参考 | 主要成本 | |---|---|---|---|---|---| | Qwen-Image-2.1 | 支持 | 同一模型完成 | 原生 RGBA | 最多10张 | 需要本地算力和环境配置 | | 传统本地节点工作流 | 支持 | 通常需要多个模型或节点 | 常依赖抠图与后处理 | 取决于节点组合 | 配置复杂、调参成本高 | | 在线闭源图像工具 | 通常支持 | 通常支持 | 取决于产品能力 | 取决于产品限制 | 受平台规则、额度和数据流转约束 |

这张表里的关键不是“一个模型替代所有工具”,而是 Qwen-Image-2.1 把生成和编辑的上下文放在同一套模型里维护。用户不必先把结果导出,再切换到另一个编辑模型重新解释一遍素材。

对开发者来说,这意味着更容易搭建统一的图像资产流水线。对 ComfyUI 用户来说,透明图、局部编辑和多参考图可以在同一张工作流图里串起来。对服务端部署者来说,Diffusers、ComfyUI、vLLM-Omni、SGLang 和 LightX2V 都在发布当天提供了适配或支持,降低了等待第三方生态跟进的时间。(github.com)

其中,vLLM-Omni 的价值主要在高并发推理,包括 prefix KV 缓存、CUDA Graph、FP8量化和张量并行等优化;SGLang 则强调缓存、并行和组件卸载。它们不会改变模型本身的审美能力,但会影响同一块 GPU 能处理多少请求、每个请求的排队时间以及整体部署成本。

开发者现在应该怎么理解它

对于本地工作流用户,Qwen-Image-2.1 更适合用来测试透明素材生成、多图组合和局部修改,而不是只拿它和闭源产品比单张图的“第一眼好不好看”。

对于做电商、游戏、广告和内容工具的团队,模型最值得验证的指标包括商品主体保真、人物身份保持、透明边缘质量、文字可读性、多参考图之间的空间关系,以及同一提示词重复运行时的稳定性。

对于做推理服务的开发者,真正需要测量的是端到端延迟、峰值显存、2K输出吞吐、不同参考图数量下的缓存收益,以及 BF16、FP8和 CPU offload 对质量的影响。官方提供的默认配置是40步,但实际部署不应直接把默认参数当作最终生产配置。

对于只想偶尔生成海报的普通用户,Qwen-Image-2.1 未必是最省事的选择。它的优势建立在可控、可部署和可二次开发之上,如果用户只需要打开网页输入一句话,在线闭源工具可能仍然更快。

“开源”需要加一个限定词

Qwen-Image-2.1 的权重和代码已经公开,但它使用的是 Qwen Research License Agreement,而不是 Apache-2.0、MIT 这类允许广泛商业使用的宽松许可证。官方协议将 Non-Commercial 定义为研究或评估用途,并明确要求商业使用前取得单独的商业许可。(github.com)

这意味着“开源”在这里更准确的表达是开放权重,或者说研究许可下的开放模型。个人本地试用、论文实验和非商业评估通常属于协议重点覆盖的场景,但广告投放、商品素材交付、商业软件内置和批量内容生产则需要团队单独审查授权边界。

许可证还要求分发模型或衍生版本时保留协议和归属声明;如果使用模型或其输出去训练、微调或改进另一个公开提供的 AI 模型,还需要在相关产品文档中显示相应的 Qwen 归属说明。(github.com)

这不是小问题。对于研究者来说,许可证可能只是仓库里的一个文件;对于真正要把模型放进商业生产线的公司来说,许可证决定了模型能不能被部署、交付和长期维护。Qwen-Image-2.1 的技术能力很开放,但商业使用权限并没有同步开放。

OpenAI Hub判断

Qwen-Image-2.1 是目前开源图像模型里少数把透明图、图像编辑、多参考图和本地部署同时放到产品叙事中心的更新。它的价值不在于用7B参数击败所有闭源模型,而在于把过去分散在多个工具里的资产处理动作,收拢到一个更容易自动化的模型里。

如果你的工作涉及商品图、人物保持、透明贴纸、游戏素材或批量视觉内容,Qwen-Image-2.1 值得尽快测试。尤其是原生 RGBA 输出和最多10张参考图,这两项能力不是换一个提示词就能从普通文生图模型里自然获得的。

但如果你的目标是商业交付,许可证必须和技术评测同时进行。对研究和本地实验者来说,这是一个值得关注的开放权重模型;对企业团队来说,它目前更像一个需要先完成合规评估、再决定是否进入生产环境的候选方案。

一句话总结:Qwen-Image-2.1 把开源图像模型从“能不能生成一张图”推进到“能不能进入资产生产线”,但它的7B参数带来的是部署效率上的希望,不是对显存、质量和商业授权的全面豁免。

参考来源

相关推荐

查看全部