9 月 20 日,阿里 Qwen 团队把 Qwen-Image 2.1 的完整权重挂上了 Hugging Face:一个 7B 的 checkpoint,同时包办文生图、图像编辑和原生透明通道输出。参数规模不算惊人,真正让社区炸锅的是随权重一起更新的许可证——历代 Qwen-Image 的权重清一色 Apache 2.0,这一代首次换成 Qwen Research License Agreement,仅限研究与评估用途,想商用得单独向阿里申请授权。一句话概括这次发布:权重回来了,Apache 没回来。
截至 10 月 8 日发稿,模型页的生态热度还在涨,许可证的争议也没有等来官方回应。这篇文章把三件事讲清楚:33GB 权重里装了什么、这套架构能干什么活、许可证条款里埋了哪些需要注意的地方。Qwen 系模型的背景与最新动态,可以先看本站的 Qwen 智能系列拆解 补齐上下文。
33GB 里装的是三个模型
先拆结构。Qwen-Image 2.1 不是一颗单体模型,而是三个组件的合体,各干各的活。
主体是一颗 32 层的单流 DiT,7B 参数,官方架构说明里配了两项关键设计:混合粒度注意力,让不同尺度的图像特征在注意力层里各取所需;prefix KV cache 复用,条件部分的缓存可以跨去噪步骤重复利用,省下重复计算。文本编码器直接借用了 Qwen3-VL 8B,也就是 Qwen 自家的多模态模型,单个组件 17.5GB,而且身兼两职:既把提示词编码成条件向量,也负责参考图的编码,整个架构里没有独立的图像编码器。这个设计省掉了一个组件,代价是编码器偏重,后面讲压缩方案时还会再看到它。
第三个组件是一枚 64 通道的 RGBA VAE,1.35GB,做 16 倍空间压缩。它和常见文生图模型最大的不同在通道数:常规 VAE 处理 3 通道 RGB,这枚是 4 通道输入,多出来的正是 alpha 通道——透明度信息从压缩到解码全程原生进出,不靠后期抠图补。
体积账本是这样的:BF16 精度的全套权重约 33GB,其中 transformer 占 14.2GB,拆成两个分片发布。把这三个数字摊开看,占比最大的是文本编码器——17.5GB 比主模型本体还重,这是借多模态模型当编码器的直接代价。好处同样明显:Qwen3-VL 的视觉理解能力是现成的,参考图的理解质量有底子托着,不用从头训一枚图像编码器,也算是一笔划算的交换。
吃不下这个体量也有压缩版可选:Comfy-Org 重新打包的量化版本把 transformer 压到 INT8 的 7.3GB,文本编码器有 INT8 的 9.4GB 和更激进的 W4A8 的 6.3GB 两档,再加上 0.7GB 的 VAE,一套下来约 14GB,不到原版的一半。要提醒的是,量化省显存的代价出在生成质量上,编码器压得越狠,长提示词的语义还原越可能打折扣,对画质有要求的场景建议先从 INT8 起步,确认效果不够再回 BF16。
透明直出、十图参考、局部编辑
能力层面,2.1 的三个卖点都指向真实的生产场景。
第一个是透明直出。VAE 原生带 alpha 通道,模型可以直接生成带透明背景的图,省掉先生成再抠图的整个后处理环节。官方推荐的提示词句式里明确给了模板,包含 RGBA image with transparency 这个短语,想要透明底照着写就行。对做设计素材、贴纸、电商图这类工作流的团队,这是从两道工序变一道工序的差别。
第二个是参考图规模:单次调用最多塞 10 张参考图。角色一致性、多物体组合、跨风格迁移这类任务,参考图的容量上限直接决定了玩法上限。参考图的编码工作就交给前面提到的 Qwen3-VL 8B,视觉理解的底子是现成的,不用额外挂图像编码器。
第三个是局部编辑,支持圆圈、涂鸦、蒙版三种交互方式圈定区域重新生成,圈外部分保持不动。这个能力在图像编辑赛道属于标配,但此前通常要外挂专门的编辑管线,2.1 把它做进了基础模型本体。
分辨率与节奏:原生 2048×2048,提供七种比例,最宽拉到 2752×1536;标准推理 40 步。七种比例覆盖了从手机壁纸、社交方图到宽幅横图的常见出图需求,不用再靠裁切凑比例,这对批量出素材的团队是实打实的省事。另有两个 9B 参数的提示词重写器,PE-T2I 对应文生图、PE-I2I 对应图生图,各 18.8GB——属于可选组件,追求更稳的提示词扩写效果再挂载。它的作用是把一句随手的描述扩写成模型更吃得到的详细指令,尤其适合刚从别的模型迁移过来、还没摸清提示词手感的用户;代价是每张卡要多吞近 19GB,显存紧张的机器干脆直接手写提示词。
显存账本:两种口径先分清
实测数据目前以官方口径和早期用户报告为主,可信度分层,分开看。
官方给的下限说法是 3090 这张 24GB 的老卡,配合 offload 可以跑起来。更完整的一组数据来自 vLLM-Omni 的推理配方:1024×1024、40 步、BF16 精度,显存峰值 34GB,单张数据中心卡上出图耗时 3.3 到 4.5 秒。这组数字口径清晰,但它是数据中心卡的成绩,不能直接平移到消费级显卡上。
社区还在流传一条 16GB 显存卡跑出 13.9GB 峰值的报告,注意这是早期用户的单点数据,目前没有第二方复核,自己的卡能不能复现同样的数字,只能实测说话。
退路有两层。一是前面提到的 Comfy-Org 量化打包,14GB 的下载体积对应的显存压力比 BF16 小得多,是消费级卡的现实路线;二是 offload 分层加载,用内存换显存,把当前步骤用不到的组件临时挪回内存,慢一点但能跑起来。两条路可以叠加,24GB 级别的卡走量化加部分 offload,基本能进可用的出图节奏;再往下的卡,就要对出图速度放平预期了。本地部署的通用踩坑与配置思路,本站的 Qwen3.8 Flash 本地部署 SOP 是现成参照,框架层面的经验可以直接迁移;更大模型的完整自托管流程,也可以对照 HY4 预览版自托管指南。
许可证核真:这次真不是 Apache
最重要的信息放这篇开头讲过了,这里把条款展开。Qwen Research License Agreement,2026 年 9 月 20 日版,经多源核对一致,以下关键内容均有协议原文可查。
第一条,Section 2(a) 把使用范围限定在非商用:研究、评估可以放手用,任何商业用途都要单独发邮件向阿里申请授权,协议落款是杭州的通义实验室。批不批、按什么条件批,主动权完全在官方手里。
第二条,衍生模型继承限制。拿 2.1 微调出来的模型同样受协议约束,分发时必须标注 Built with Qwen,而且不得把 Qwen 用作衍生品的主名称。LoRA 也好,全量微调也好,一条都躲不开。
第三条,涉诉即终止。一旦围绕知识产权提起诉讼,授权随即终止。这类条款在自拟协议里不算罕见,但叠加前两条,违约的具体成本相当清楚。
第四条,争议解决适用中国法律,杭州管辖。
社区反应很直接。Hacker News 上有人把这组条款称作 license trap;Hugging Face 的讨论帖标题更狠,直接叫 License renders this model useless,意思是许可证让这个模型没法用。官方至今没有回应。这些声音未必全部公允,非商用场景的研究者几乎无感,但对把权重当生产资料的团队来说,这确实是一份要逐条读完的合同。
对比着看更直观。Apache 2.0 允许商用、允许闭源衍生、自带专利授权,拿去开公司卖服务都没有障碍;这份研究许可把三条全收走了,商用要申请、衍生必须继承限制、分发还要带标注。从最宽松到最严格之间,Qwen-Image 一代走完。至于商用授权怎么申请、批什么条件、收不收费,官方目前没有公开任何标准口径,能确定的信息只有协议里留的申请路径:邮件联系杭州通义实验室,其余一切以回复为准。对着急投产的团队,这个不确定性本身就是成本。
一个值得并排看的参照系:LTX-2 同样走自定义协议的路子,用收入门槛划商用线,本站在 LTX-2 开源拆解 里逐条过过它的条款。两个案例连起来说明同一件事:权重级别的旗舰模型,厂商正从无条件白送转向有条件开放。旁边再摆着前几代 Qwen-Image 全线 Apache 2.0 的历史,这个转向的分量就更清楚了。
生态热情与谱系断层的反差
有意思的地方在于,许可证收紧并没有浇灭生态热情。发布当天,Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V 全部零日支持,训练框架、推理引擎、工作流工具三个层面一次铺满;Hugging Face 上首日就出现 21 个 Space、14 个微调变体、18 个量化版本。微调和量化版本的密度尤其说明问题:前者意味着已经有人拿它在做风格定制,后者意味着消费级用户群体足够大,才养得出这么多压缩版。10 月 6 日起,transformers 的官方支持也已合入,覆盖统一的生成加编辑接口、多参考图、RGBA 输出和 LoRA 训练,一个模型从生成到微调的完整链路都被主流库接住了。上手门槛已经很低:diffusers 里用 QwenImagePipeline 从 Qwen/Qwen-Image-2.1-7B 加载权重,社区样例的常用配置是 28 步、guidance 5.0。
榜单数据要打个标再看:官方自设的 Qwen-Image-Bench 上,2.1 拿 60.28 排第七,榜首是 GPT Image 2.5 的 67.01。注意这是厂商自设自测的基准,没有独立复核,不同榜单之间更不能互比,看个相对位置就好。生态热度是一回事,成色如何,最终还是要自己的提示词上跑一遍才知道。
回头看谱系,这次的许可证转向其实早有伏笔:2025 年 8 月,初代 Qwen-Image 以 20B 参数、Apache 2.0 开源,一时风头无两;12 月的 2512 刷新版照旧 Apache;2026 年 7 月的 Qwen-Image 3.0 干脆只提供 API,权重根本不放;9 月的 2.1 把权重放回来了,许可证却换成了非商用的研究协议。四步棋连起来看,结论写在最后一代上:命名是分叉不是序列,权重回来了,Apache 没回来。
这条轨迹的读法可以更直白一点:全盛时期的 Apache 是拉生态的旗子,API 化是收商业价值的动作,如今放出非商用权重,更像是给研究社区递的一支橄榄枝——声望、影响力、学术引用都想要,直接卖图的钱一分不让。牌怎么打是厂商的自由,只是把四代产品摆在时间轴上,方向感就藏不住了。
对个人研究者和学生,这仍是一个值得下载的好模型;对打算接进生产线的团队,下单显卡之前,先想清楚那份协议里非商用三个字的边界,或者干脆先把申请商用授权的邮件发出去。
FAQ
Q1: Qwen-Image 2.1 可以商用吗?
A1: 默认不行。它采用 Qwen Research License Agreement,仅限研究与评估用途,商业使用需要单独向阿里通义实验室发邮件申请授权。注意历代 Qwen-Image 都是 Apache 2.0,这一代不是,别按老印象直接投产。
Q2: 显存不够怎么跑?
A2: 三条路。用 Comfy-Org 的量化重打包版,全套约 14GB;或者开 offload 用内存换显存,官方口径 3090 这张 24GB 的卡可以跑;至于 16GB 卡 13.9GB 峰值的说法,目前只是早期用户单点报告,参考即可,别当承诺。
Q3: 透明背景的图怎么生成?
A3: 模型原生带 alpha 通道,提示词里按官方推荐句式写上 RGBA image with transparency,就能直接输出带透明通道的图,不需要先生成再抠图。
Q4: 拿它微调出来的模型受什么限制?
A4: 衍生模型完整继承原协议的非商用限制,分发时必须标注 Built with Qwen,不得把 Qwen 用作衍生品主名称,争议适用中国法律、由杭州管辖。
Q5: 它和 Qwen-Image 3.0 是什么关系?
A5: 不是迭代关系。3.0 只提供 API、从未公开权重;2.1 是重新开放权重的新版本,但许可证从历代的 Apache 2.0 改成了非商用的研究协议。命名是分叉不是序列。
互动
你会为 33GB 的权重接受一份非商用协议吗?评论区聊聊你的立场:研究自用直接下载,还是等商用授权的口径明朗再上车。