开源项目
开源项目

Qwen-Image 2.1开源:权重回来了,Apache没回来

阿里 Qwen 团队 2026-09-20 开源 Qwen-Image-2.1:把文生图、图像编辑、原生 RGBA 透明输出塞进一个 7B checkpoint——32 层单流 DiT(混合粒度注意力+prefix KV 复用)+ Qwen3-VL 8B 文本编码器(兼任参考图编码)+ 64 通道 RGBA VAE,BF16 全套约 33GB,Comfy-Org 量化 repack 可压到约 14GB。能力:原生 2048×2048(七种比例至 2752×1536)、40 步推理、单次最多 10 张参考图、圆圈/蒙版局部编辑、透明 PNG 直出(官方给推荐提示词句式),另附两个 9B 提示词重写器。实测口径:vLLM-Omni 1024² 40 步 BF16 峰值 34GB、3.3-4.5 秒/图(单源);官方称 3090 可跑(offload)。零日生态:Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V,首日 14 个微调、18 个量化。核真重点(本篇主轴):历代 Qwen-Image 全是 Apache 2.0,2.1 首次改用 Qwen Research License——仅限非商用(research/evaluation),商用需单独向阿里申请,衍生微调继承限制且须标 "Built with Qwen";社区「license trap」争议与 HF 席「License renders this model useless」如实呈现。Qwen-Image-Bench 60.28 第七为厂商自设自测口径。谱系专节:3.0 是纯 API 分叉,2.1 才是可下载线——权重回来了,Apache 没回来。

发布于 2026年10月8日10 分钟阅读
<!-- qwen-image-2-1-open-source-resource | open-source | Qwen-Image 2.1开源:权重回来了,Apache没回来 -->

9 月 20 日,阿里 Qwen 团队把 Qwen-Image 2.1 的完整权重挂上了 Hugging Face:一个 7B 的 checkpoint,同时包办文生图、图像编辑和原生透明通道输出。参数规模不算惊人,真正让社区炸锅的是随权重一起更新的许可证——历代 Qwen-Image 的权重清一色 Apache 2.0,这一代首次换成 Qwen Research License Agreement,仅限研究与评估用途,想商用得单独向阿里申请授权。一句话概括这次发布:权重回来了,Apache 没回来。

截至 10 月 8 日发稿,模型页的生态热度还在涨,许可证的争议也没有等来官方回应。这篇文章把三件事讲清楚:33GB 权重里装了什么、这套架构能干什么活、许可证条款里埋了哪些需要注意的地方。Qwen 系模型的背景与最新动态,可以先看本站的 Qwen 智能系列拆解 补齐上下文。

33GB 里装的是三个模型

先拆结构。Qwen-Image 2.1 不是一颗单体模型,而是三个组件的合体,各干各的活。

主体是一颗 32 层的单流 DiT,7B 参数,官方架构说明里配了两项关键设计:混合粒度注意力,让不同尺度的图像特征在注意力层里各取所需;prefix KV cache 复用,条件部分的缓存可以跨去噪步骤重复利用,省下重复计算。文本编码器直接借用了 Qwen3-VL 8B,也就是 Qwen 自家的多模态模型,单个组件 17.5GB,而且身兼两职:既把提示词编码成条件向量,也负责参考图的编码,整个架构里没有独立的图像编码器。这个设计省掉了一个组件,代价是编码器偏重,后面讲压缩方案时还会再看到它。

第三个组件是一枚 64 通道的 RGBA VAE,1.35GB,做 16 倍空间压缩。它和常见文生图模型最大的不同在通道数:常规 VAE 处理 3 通道 RGB,这枚是 4 通道输入,多出来的正是 alpha 通道——透明度信息从压缩到解码全程原生进出,不靠后期抠图补。

体积账本是这样的:BF16 精度的全套权重约 33GB,其中 transformer 占 14.2GB,拆成两个分片发布。把这三个数字摊开看,占比最大的是文本编码器——17.5GB 比主模型本体还重,这是借多模态模型当编码器的直接代价。好处同样明显:Qwen3-VL 的视觉理解能力是现成的,参考图的理解质量有底子托着,不用从头训一枚图像编码器,也算是一笔划算的交换。

吃不下这个体量也有压缩版可选:Comfy-Org 重新打包的量化版本把 transformer 压到 INT8 的 7.3GB,文本编码器有 INT8 的 9.4GB 和更激进的 W4A8 的 6.3GB 两档,再加上 0.7GB 的 VAE,一套下来约 14GB,不到原版的一半。要提醒的是,量化省显存的代价出在生成质量上,编码器压得越狠,长提示词的语义还原越可能打折扣,对画质有要求的场景建议先从 INT8 起步,确认效果不够再回 BF16。

透明直出、十图参考、局部编辑

能力层面,2.1 的三个卖点都指向真实的生产场景。

第一个是透明直出。VAE 原生带 alpha 通道,模型可以直接生成带透明背景的图,省掉先生成再抠图的整个后处理环节。官方推荐的提示词句式里明确给了模板,包含 RGBA image with transparency 这个短语,想要透明底照着写就行。对做设计素材、贴纸、电商图这类工作流的团队,这是从两道工序变一道工序的差别。

第二个是参考图规模:单次调用最多塞 10 张参考图。角色一致性、多物体组合、跨风格迁移这类任务,参考图的容量上限直接决定了玩法上限。参考图的编码工作就交给前面提到的 Qwen3-VL 8B,视觉理解的底子是现成的,不用额外挂图像编码器。

第三个是局部编辑,支持圆圈、涂鸦、蒙版三种交互方式圈定区域重新生成,圈外部分保持不动。这个能力在图像编辑赛道属于标配,但此前通常要外挂专门的编辑管线,2.1 把它做进了基础模型本体。

分辨率与节奏:原生 2048×2048,提供七种比例,最宽拉到 2752×1536;标准推理 40 步。七种比例覆盖了从手机壁纸、社交方图到宽幅横图的常见出图需求,不用再靠裁切凑比例,这对批量出素材的团队是实打实的省事。另有两个 9B 参数的提示词重写器,PE-T2I 对应文生图、PE-I2I 对应图生图,各 18.8GB——属于可选组件,追求更稳的提示词扩写效果再挂载。它的作用是把一句随手的描述扩写成模型更吃得到的详细指令,尤其适合刚从别的模型迁移过来、还没摸清提示词手感的用户;代价是每张卡要多吞近 19GB,显存紧张的机器干脆直接手写提示词。

显存账本:两种口径先分清

实测数据目前以官方口径和早期用户报告为主,可信度分层,分开看。

官方给的下限说法是 3090 这张 24GB 的老卡,配合 offload 可以跑起来。更完整的一组数据来自 vLLM-Omni 的推理配方:1024×1024、40 步、BF16 精度,显存峰值 34GB,单张数据中心卡上出图耗时 3.3 到 4.5 秒。这组数字口径清晰,但它是数据中心卡的成绩,不能直接平移到消费级显卡上。

社区还在流传一条 16GB 显存卡跑出 13.9GB 峰值的报告,注意这是早期用户的单点数据,目前没有第二方复核,自己的卡能不能复现同样的数字,只能实测说话。

退路有两层。一是前面提到的 Comfy-Org 量化打包,14GB 的下载体积对应的显存压力比 BF16 小得多,是消费级卡的现实路线;二是 offload 分层加载,用内存换显存,把当前步骤用不到的组件临时挪回内存,慢一点但能跑起来。两条路可以叠加,24GB 级别的卡走量化加部分 offload,基本能进可用的出图节奏;再往下的卡,就要对出图速度放平预期了。本地部署的通用踩坑与配置思路,本站的 Qwen3.8 Flash 本地部署 SOP 是现成参照,框架层面的经验可以直接迁移;更大模型的完整自托管流程,也可以对照 HY4 预览版自托管指南。

许可证核真:这次真不是 Apache

最重要的信息放这篇开头讲过了,这里把条款展开。Qwen Research License Agreement,2026 年 9 月 20 日版,经多源核对一致,以下关键内容均有协议原文可查。

第一条,Section 2(a) 把使用范围限定在非商用:研究、评估可以放手用,任何商业用途都要单独发邮件向阿里申请授权,协议落款是杭州的通义实验室。批不批、按什么条件批,主动权完全在官方手里。

第二条,衍生模型继承限制。拿 2.1 微调出来的模型同样受协议约束,分发时必须标注 Built with Qwen,而且不得把 Qwen 用作衍生品的主名称。LoRA 也好,全量微调也好,一条都躲不开。

第三条,涉诉即终止。一旦围绕知识产权提起诉讼,授权随即终止。这类条款在自拟协议里不算罕见,但叠加前两条,违约的具体成本相当清楚。

第四条,争议解决适用中国法律,杭州管辖。

社区反应很直接。Hacker News 上有人把这组条款称作 license trap;Hugging Face 的讨论帖标题更狠,直接叫 License renders this model useless,意思是许可证让这个模型没法用。官方至今没有回应。这些声音未必全部公允,非商用场景的研究者几乎无感,但对把权重当生产资料的团队来说,这确实是一份要逐条读完的合同。

对比着看更直观。Apache 2.0 允许商用、允许闭源衍生、自带专利授权,拿去开公司卖服务都没有障碍;这份研究许可把三条全收走了,商用要申请、衍生必须继承限制、分发还要带标注。从最宽松到最严格之间,Qwen-Image 一代走完。至于商用授权怎么申请、批什么条件、收不收费,官方目前没有公开任何标准口径,能确定的信息只有协议里留的申请路径:邮件联系杭州通义实验室,其余一切以回复为准。对着急投产的团队,这个不确定性本身就是成本。

一个值得并排看的参照系:LTX-2 同样走自定义协议的路子,用收入门槛划商用线,本站在 LTX-2 开源拆解 里逐条过过它的条款。两个案例连起来说明同一件事:权重级别的旗舰模型,厂商正从无条件白送转向有条件开放。旁边再摆着前几代 Qwen-Image 全线 Apache 2.0 的历史,这个转向的分量就更清楚了。

生态热情与谱系断层的反差

有意思的地方在于,许可证收紧并没有浇灭生态热情。发布当天,Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V 全部零日支持,训练框架、推理引擎、工作流工具三个层面一次铺满;Hugging Face 上首日就出现 21 个 Space、14 个微调变体、18 个量化版本。微调和量化版本的密度尤其说明问题:前者意味着已经有人拿它在做风格定制,后者意味着消费级用户群体足够大,才养得出这么多压缩版。10 月 6 日起,transformers 的官方支持也已合入,覆盖统一的生成加编辑接口、多参考图、RGBA 输出和 LoRA 训练,一个模型从生成到微调的完整链路都被主流库接住了。上手门槛已经很低:diffusers 里用 QwenImagePipeline 从 Qwen/Qwen-Image-2.1-7B 加载权重,社区样例的常用配置是 28 步、guidance 5.0。

榜单数据要打个标再看:官方自设的 Qwen-Image-Bench 上,2.1 拿 60.28 排第七,榜首是 GPT Image 2.5 的 67.01。注意这是厂商自设自测的基准,没有独立复核,不同榜单之间更不能互比,看个相对位置就好。生态热度是一回事,成色如何,最终还是要自己的提示词上跑一遍才知道。

回头看谱系,这次的许可证转向其实早有伏笔:2025 年 8 月,初代 Qwen-Image 以 20B 参数、Apache 2.0 开源,一时风头无两;12 月的 2512 刷新版照旧 Apache;2026 年 7 月的 Qwen-Image 3.0 干脆只提供 API,权重根本不放;9 月的 2.1 把权重放回来了,许可证却换成了非商用的研究协议。四步棋连起来看,结论写在最后一代上:命名是分叉不是序列,权重回来了,Apache 没回来。

这条轨迹的读法可以更直白一点:全盛时期的 Apache 是拉生态的旗子,API 化是收商业价值的动作,如今放出非商用权重,更像是给研究社区递的一支橄榄枝——声望、影响力、学术引用都想要,直接卖图的钱一分不让。牌怎么打是厂商的自由,只是把四代产品摆在时间轴上,方向感就藏不住了。

对个人研究者和学生,这仍是一个值得下载的好模型;对打算接进生产线的团队,下单显卡之前,先想清楚那份协议里非商用三个字的边界,或者干脆先把申请商用授权的邮件发出去。

FAQ

Q1: Qwen-Image 2.1 可以商用吗?

A1: 默认不行。它采用 Qwen Research License Agreement,仅限研究与评估用途,商业使用需要单独向阿里通义实验室发邮件申请授权。注意历代 Qwen-Image 都是 Apache 2.0,这一代不是,别按老印象直接投产。

Q2: 显存不够怎么跑?

A2: 三条路。用 Comfy-Org 的量化重打包版,全套约 14GB;或者开 offload 用内存换显存,官方口径 3090 这张 24GB 的卡可以跑;至于 16GB 卡 13.9GB 峰值的说法,目前只是早期用户单点报告,参考即可,别当承诺。

Q3: 透明背景的图怎么生成?

A3: 模型原生带 alpha 通道,提示词里按官方推荐句式写上 RGBA image with transparency,就能直接输出带透明通道的图,不需要先生成再抠图。

Q4: 拿它微调出来的模型受什么限制?

A4: 衍生模型完整继承原协议的非商用限制,分发时必须标注 Built with Qwen,不得把 Qwen 用作衍生品主名称,争议适用中国法律、由杭州管辖。

Q5: 它和 Qwen-Image 3.0 是什么关系?

A5: 不是迭代关系。3.0 只提供 API、从未公开权重;2.1 是重新开放权重的新版本,但许可证从历代的 Apache 2.0 改成了非商用的研究协议。命名是分叉不是序列。

互动

你会为 33GB 的权重接受一份非商用协议吗?评论区聊聊你的立场:研究自用直接下载,还是等商用授权的口径明朗再上车。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-10-08

常见问题

Qwen-Image 2.1 可以商用吗?
默认不行。它采用 Qwen Research License Agreement,仅限研究与评估用途,商业使用需要单独向阿里通义实验室发邮件申请授权。注意历代 Qwen-Image 都是 Apache 2.0,这一代不是,别按老印象直接投产。
显存不够怎么跑?
三条路。用 Comfy-Org 的量化重打包版,全套约 14GB;或者开 offload 用内存换显存,官方口径 3090 这张 24GB 的卡可以跑;至于 16GB 卡 13.9GB 峰值的说法,目前只是早期用户单点报告,参考即可,别当承诺。
透明背景的图怎么生成?
模型原生带 alpha 通道,提示词里按官方推荐句式写上 RGBA image with transparency,就能直接输出带透明通道的图,不需要先生成再抠图。
拿它微调出来的模型受什么限制?
衍生模型完整继承原协议的非商用限制,分发时必须标注 Built with Qwen,不得把 Qwen 用作衍生品主名称,争议适用中国法律、由杭州管辖。
它和 Qwen-Image 3.0 是什么关系?
不是迭代关系。3.0 只提供 API、从未公开权重;2.1 是重新开放权重的新版本,但许可证从历代的 Apache 2.0 改成了非商用的研究协议。命名是分叉不是序列。

相关文章

开源项目

B站下场做翻译模型:150种语言,35B只激活3B

B站 Index LLM 团队 2026-09-30 开源 Index-Translate 翻译模型家族(HF/ModelScope 权重,Apache-2.0):2B/9B/35B-A3B-preview 三档文本模型,基于 Qwen3.5,覆盖 150 种语言(官方自报口径),35B 总参仅激活约 3B,262,144 token 上下文。三分支各管一摊:Index-Echo 配音保留说话人音色(中↔英/西/日);Index-Homura 音节数控制(9B 在 SandGlass 测试 81.92% 落在目标 ±10% 内,配音对轨用);Index-NativeLong(又称 Index-Nailong)长文档跨段一致(3.2 万 token 幻想文本中人名/王衔双关全程一致,逐块翻译会漂移)。受控翻译 instTrans:硬约束=术语表强制(如 碳纤维:carbon fiber)+ JSON/CSV/代码/占位符结构保留;软约束=语气/领域消歧(plant→工厂)/跨句一致/LaTeX 保留。本地部署一行命令:官方 GGUF(Q4_K_M 21.71GB)+ llama.cpp serve,另附浏览器扩展与视频配音 pipeline。诚实点:全部分数官方自报、暂无第三方独立复现(FLORES COMET-22 0.8794、WMT26 Judge 76.76、低资源 off-target 2.4%),且同一官方表里 DeepSeek-V4.1-Flash 的 WMT26 Judge 83.55 更高——不是全表第一。

2026年10月7日10 分钟阅读
开源项目

NVIDIA给AIagent上锁:运行时开源,看门狗进芯片

NVIDIA Open Agent Safety Platform 深拆(官方资料与多源报道,2026-10-05 口径):核心主张「agent 安全不能只靠模型自己听话」——当 agent 本身就是试图绕过护栏的软件时,应用层护栏失效;agent drift(因提示模糊/工具缺失/策略冲突渐进偏离意图)不触发任何告警。两层结构:OpenShell(Apache 2.0 开源,内核级沙箱安全运行时,策略覆盖文件/进程/凭证/工具/网络/数据库六域,执行前意图对齐+执行中 drift 监控,跑 Vera CPU 可扩展 Arm/Intel);NVIDIA Sentry(BlueField-4 DPU 带外看门狗,基于 DOCA 验身份/出可证明遥测/执行细粒度策略,agent 越界毫秒级隔离叫停,参考设计非开源硬件)。三层分离:应用/运行时/基础设施。100+ 组织参与(Anthropic 集成 Claude Managed Agents、Salesforce 用于 Slack、SpaceXAI 用于 Cursor agent),隶属 Linux Foundation 旗下 Open Secure AI Alliance。批评口径如实写入:Gartner 指出 OpenAI/Amazon/Google 缺席;IDC 估计覆盖企业 agentic 安全问题可能不到 25%;Control Risks 指出只管自家基础设施上的已知 agent(影子/SaaS 内嵌/攻击者投递三类管不到);供应商锁定讨论。与开放模型权重的 Kimi K3 恰为 agent 安全图谱两端。

2026年10月5日10 分钟阅读
开源项目

LTX-2开源:22B权重66GB,画面声音一个模型全包

LTX-2 开源深拆(2026-10-02 GitHub 实核):Lightricks/LTX-2 9,569 星、Python、推送停在 10 月 2 日;官方定位首个 DiT 架构的音视频一体基础模型,画面与同步音频一次生成。LTX-2.5 组成:22B 蒸馏 transformer(bf16)+ Gemma 4 12B 定制文本编码器(与 Google 原版不通用)+ 视频/音频双 VAE + 空间与时间上采样器,全套约 66GiB;DistilledPipeline 仅 8 个预设 sigma(阶段 1 八步 + 阶段 2 四步)最快出片,FP8 量化与 CPU/磁盘 offload 降显存,4K 为 3840x2176(README 特别注明非 2160);12 条管线含 DFR 生产级、DubIt 保口型换词配音、Retake 局部重生成、SDR 转 HDR(BT.2020/HLG + ACEScct EXR);ltx-trainer 支持 LoRA/全量微调/IC-LoRA,ComfyUI 有官方插件。许可证核真:GitHub License 栏 NOASSERTION,实为自定义 LTX Community License(2026-08-11 起 LTX-2.5 适用),非 OSI 开源——个人非商业免费,年收入 1000 万美元及以上实体任何商用须购买 Commercial Use Agreement,衍生品定义含蒸馏,分发须随附完整协议。自部署唯一解的价值:数据不出内网、批量边际成本趋近电费、LoRA 风格资产独占。

2026年10月3日10 分钟阅读