开源项目
开源项目

LLaDA-Image:蚂蚁全开源的 6B 统一生图编辑模型

蚂蚁 InclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image(GitHub 2026-09-09 快照 208 星 / Python / 创建 2026-08-31)。单一权重同时做文生图与指令编辑,backbone 与 DiT 都是扩散模型的统一框架,图像-only 预训练建视觉先验,Turbo 版用 Twin-DMD 蒸馏把 50 步压到 4 步;Qwen-Image-Bench 英文 53.53、中文 53.38 双料 SOTA;HF 与 ModelScope 提供 Base/Turbo 各含 FP8 四档权重,9-07 起有社区 ComfyUI。最重要避坑:仓库 license 字段为 null、无 LICENSE 文件,商用前须向官方确认,不可臆测为 Apache/MIT。

发布于 2026年9月9日10 分钟阅读
<!-- llada-image-resource | open-source | LLaDA-Image:蚂蚁全开源的 6B 统一生图编辑模型 -->

2026 年 8 月底,蚂蚁集团 InclusionAI 把一整套图像生成与编辑的训练配方推到了台前:不是只放一个 demo 或几张样图,而是连模型权重、推理代码和训练方法论一起开源。这个项目叫 LLaDA-Image,一个 6B 参数的统一图像生成与编辑模型家族,官宣即在 Qwen-Image-Bench 上拿下英文 53.53、中文 53.38 的双料第一。

GitHub API 实测(2026-09-09):208 星 / 10 fork,Python 主语言,创建于 2026-08-31,最近一次 push 为 2026-09-07。这个体量说明项目还很早期,但技术叙事相当完整。本文基于仓库 README 全文、GitHub API 数据与公开报道做逐字拆解,重点讲清它到底解决了什么、技术路线怎么走,以及——对工程落地最关键的那条避坑信息。

先说边界:星数与仓库状态为 API 快照(2026-09-09);本文属代表性拆解,非商业合作;所有技术细节与权重名均取自仓库 README,确保逐字准确。

一、项目是什么:把训练配方全开源的野心

LLaDA-Image 是蚂蚁 InclusionAI 推出的开源统一图像生成与编辑模型家族,核心定位是“竞争级 6B 参数、开源、统一架构”。它包含两条主线:

  • LLaDA-Image(Base):50 步采样的高保真文生图与指令式编辑基座模型。
  • LLaDA-Image-Turbo:经蒸馏的 4 步快速生成与编辑模型。

两者都由单一权重支撑,同时覆盖文生图、VQ 条件生成、参考图编辑,以及中英文文字渲染,无需额外的编辑专用 backbone。这一点是它和许多“生成一套、编辑另一套”方案的根本区别。

开源的诚意体现在权重与代码的双重开放。模型权重在 HuggingFace 与 ModelScope 同步放出四个同名版本:

权重说明采样步数HuggingFaceModelScope
LLaDA-ImageBase,高保真文生图与指令编辑50inclusionAI/LLaDA-Image(BF16)、LLaDA-Image-FP8同名四个版本
LLaDA-Image-Turbo蒸馏版,快速生成与编辑4inclusionAI/LLaDA-Image-Turbo(BF16)、LLaDA-Image-Turbo-FP8同名四个版本

值得注意的是,除了 BF16 权重,官方还提供了 FP8 版本(LLaDA-Image-FP8、LLaDA-Image-Turbo-FP8),这直接对应显存吃紧场景下的部署需求——FP8 能把显存占用显著压低,对本地部署是实打实的友好。推理代码基于 Diffusers,配套 arXiv 报告 2609.03796

但“全开源”也有边界。仓库的 Open-source Plan 明确写着:推理代码与模型权重已开放(已勾选),训练代码标注为 coming soon(未勾选)。也就是说,你能拿到配方思路、能跑通推理、能下载权重微调思路,但复现训练的完整代码还要等。这在当下开源图像模型里属于常见节奏,但务必如实记在账上。

把训练配方开源,背后的战略意图其实很清晰:蚂蚁想用“可复现、可审计、可本地化”的开放姿态,在图像生成这条闭源强势的赛道里卡住一个开源支点。对国内企业尤其敏感——数据不出域、模型能私有部署,是许多金融、政企场景的硬门槛,而闭源 API 天然过不了这道关。LLaDA-Image 把权重和代码同时放出,等于把这条路线的入门成本直接打到了零,也让“我能不能自己掌控一条生图链路”从一个技术问题变成了单纯的人力投入问题。

二、技术拆解:统一生成与编辑为什么难,统一扩散框架怎么解

统一生成+编辑为何是难题

传统图像模型里,文生图和图像编辑往往是两条独立的技术栈:文生图从噪声出图,编辑则在原图上做局部改写,二者对数据、损失、结构的要求都不同。要把“从零生成”和“保参考图改细节”塞进同一个权重,难点在于模型既要学会“无中生有”的分布,又要学会“在约束下精准改动”——前者鼓励创意发散,后者要求内容保真,二者在训练目标上天然拉扯。

LLaDA-Image 的解法是“统一扩散框架”:它的 backbone 与 DiT(Diffusion Transformer)都是扩散模型,并在同一个框架内训练。生成与编辑因此共用一套扩散动力学,区别只在于输入条件——编辑模式下送入参考图作为约束,生成模式下只给文本。统一框架的好处是参数不浪费、能力可迁移,编辑时也不需要再挂一个独立的编辑网络。

统一框架还带来一个常被忽视的工程红利:维护成本。生成与编辑共用同一套权重后,版本管理、量化、缓存、服务封装都只需要做一遍。对要同时上线“文生图”和“商品图编辑”两条业务线的团队,这意味着减半的运维向量,而不是两套并行系统各养一套。换句话说,统一架构省下的不只是显存,更是长期的人力与迭代摩擦。

图像-only 预训练建立的视觉先验

README 里最值得玩味的一条训练路线,是“先图像、后语言”的阶段性预训练。报告先通过 image-only 预训练(pre-training)与 mid-training 建立视觉先验(visual prior),也就是让模型先纯粹理解“图该怎么长”,再引入 paired language supervision(图文配对监督),最后做 joint generation-editing training(生成-编辑联合训练)

这个顺序很关键:很多多模态模型一上来就啃图文对,结果语言信号过早主导,视觉细节反而塌掉。LLaDA-Image 先把视觉地基打牢,再让语言来“指挥”生成,本质上是在解决“模型会不会画”与“模型听不听话”的先后矛盾。

Twin-DMD 蒸馏:50 步压到 4 步意味着什么

Base 模型需要 50 步采样才能出高质量图,这在实际应用中太慢。Turbo 版用 Twin-DMD 蒸馏把采样压到 2–4 步,推理速度量级提升,而质量尽量不掉。

这里有一处新闻口径分歧,必须如实标注:蚂蚁开源公众号(2026-09-08)在报道中把蒸馏技术称为「TwinFlow,50 步压缩至 2–4 步」,而 GitHub README 原文写的是「Twin-DMD distillation,2–4 sampling steps」。两者命名不一致。本文以仓库 README 为准,记为 Twin-DMD 蒸馏;若你看到「TwinFlow」的说法,指的是同一技术路径,但官方仓库并未使用该命名,引用时建议以 README 的 Twin-DMD 为准。

工程上,Turbo 推理还藏了一个小技巧:可在 scheduler/scheduler_config.json 中将 stochastic_sampling 设为 false,部分场景能得到更锐利的细节。

三种生成模式与尺寸约束

两个 checkpoint 都支持三类模式:

  • text(文生图):直接给 prompt 出图。
  • vq(VQ 条件生成):用 LLaDA2 模型从 prompt 产生 image VQ tokens,经 SigVQ 嵌入后再走扩散;VQ 模式下不要传输入图。
  • editing(参考图编辑):必须给一张参考图,模型按指令改写。

尺寸上有硬约束:text 与 vq 模式要求高、宽能被 16 整除;editing 模式要求能被 32 整除。官方常用 1024×1024。环境方面已验证组合为 Python 3.11、PyTorch 2.8、Transformers 4.57.6、Diffusers 0.39.0。

三、Qwen-Image-Bench 双料第一怎么读

LLaDA-Image 的最大招牌,是在 Qwen-Image-Bench 上拿下英文 53.53、中文 53.38 的双料 SOTA 总分。怎么读这个分数,决定了你对它实力的判断。

第一,看口径。53.53 与 53.38 是 overall(综合)分数,不是单维度。图像评测通常横跨质感、指令遵循、文字渲染、结构合理性等多个子项,综合第一说明它在“全方位不偏科”上做到了当前开源模型的顶端,而非靠某一单项刷分。

第二,看相对位置。据 ai-bot 等媒体转述,LLaDA-Image 的总分大致介于 GPT Image 1 与 Imagen 4.0 Ultra 之间(来源:ai-bot 公开转述,属二手口径,非官方基准文档,引用请注明)。也就是说,它已经摸到闭源第一梯队的门槛,但和最新闭源旗舰仍有距离——这个“介于两者之间”的定位,比单纯喊“开源第一”更有参考价值。

第三,看双语。中文 53.38 与英文 53.53 几乎持平,说明其中英文文字渲染与语义理解没有明显短腿。对中文技术从业者而言,这点比英文榜的单项第一更实用:做中文海报、中文 UI 截图、中文文案图时,它不会像部分海外模型那样在汉字上翻车。

需要提醒的是,Qwen-Image-Bench 是模型方自报的基准,评测集与权重由同一团队关联发布,横向对比闭源时以第三方独立复现为准更稳妥。同日 OpenAI 推出 ChatGPT Images 2.5(参见本站热点解读),闭源与开源在同周正面交锋,正是观察这条赛道分化的最好窗口。

四、冷思考:避坑与边界

热闹之外,有几条必须冷静记下的边界,尤其第一条,是本文最重要的避坑点。

其一,许可证未标注,是商用最大不确定性。 GitHub API 实测该仓库 license 字段为 null,仓库内也未见 LICENSE 文件。这意味着:你不能默认它是 Apache-2.0 或 MIT,更不能把它当“已授权开源”直接商用。正确做法是——在商用、二次分发、产品化之前,主动向 InclusionAI 官方确认许可条款。任何“应该能商用吧”的猜测,都是法律风险的来源。本站同批的开源 vs 闭源图像模型横评里也把“许可证透明度”列为选型的第一道闸门,LLaDA-Image 在这一项目前是扣分项。

其二,208 星说明它仍然非常早期。 对比同站收录的成熟开源项目(如 awesome-gpt-image-2 的 2 万星量级),LLaDA-Image 的社区体量还很小,文档、样例、踩坑帖都远未丰富。早期意味着机会,也意味着你要做好自己啃代码、自己排错的心理准备。

其三,生态目前只有社区 ComfyUI 支持。 2026-09-07 起,社区开发者 realrebelai 已提供 LLaDA-Image 与 LLaDA-Image-Turbo(含 FP8 版)的 ComfyUI 节点,这是目前最便捷的可视化入口。但官方主推仍是 Diffusers 推理代码,生产级 SDK、API 封装、企业集成都还在路上。

其四,训练代码未开源。 如第一节所述,你拿到的是推理与权重,复现训练还要等。对想“从数据到模型”全链路可控的团队,这是硬约束。

想本地跑起来的人,本站同批提供了本地部署 SOP,覆盖环境、依赖与四种权重的拉取;做图像模型横向选型的,可回到推理式图像模型横评GPT-Image 2 资源包做交叉对照。

一句话收尾:LLaDA-Image 用“统一扩散框架 + 图像先验 + Twin-DMD 蒸馏”把开源图像模型推到了闭源门槛前,但许可证的留白,是它在你把它写进生产系统之前必须堵上的那道缝。


常见问题

Q1:LLaDA-Image 和 LLaDA-Image-Turbo 有什么区别?

A1:Base 是 50 步采样的高保真基座,适合对画质要求高的场景;Turbo 经 Twin-DMD 蒸馏压到 2–4 步,速度量级提升,适合实时或批量出图。两者都是 6B 单一权重,能力覆盖一致,差别在采样步数与出图速度。

Q2:它支持哪些生成与编辑模式?

A2:两个 checkpoint 都支持 text(文生图)、vq(VQ 条件生成,由 LLaDA2 产出 image VQ tokens 经 SigVQ 嵌入后扩散,不传输入图)、editing(参考图编辑,必须给参考图)。尺寸上 text/vq 要求高宽整除 16,editing 要求整除 32,常用 1024×1024。

Q3:许可证是什么,能直接商用吗?

A3:GitHub API 实测该仓库 license 字段为 null,且未见 LICENSE 文件。因此不能默认其为 Apache-2.0 或 MIT,商用、二次分发、产品化之前须主动向 InclusionAI 官方确认许可条款,切忌凭猜测使用。这是本文最重要的避坑点。

Q4:模型权重在哪下载,有 FP8 版本吗?

A4:HuggingFace 与 ModelScope 各同步四个同名权重:LLaDA-Image(BF16)、LLaDA-Image-FP8、LLaDA-Image-Turbo(BF16)、LLaDA-Image-Turbo-FP8。FP8 版本用于降低显存占用,适合本地与显存受限部署。

Q5:和闭源模型比如何,与 ChatGPT Images 2.5 怎么选?

A5:据 ai-bot 转述,LLaDA-Image 总分介于 GPT Image 1 与 Imagen 4.0 Ultra 之间,已摸到闭源第一梯队门槛但仍有差距;中文榜 53.38 与英文 53.53 近乎持平,中文场景实用性强。若你要可审计、可本地部署、可定制的开源方案,它值得试;若追求极致画质与零运维,同周发布的 ChatGPT Images 2.5 仍是闭源优选。


参考来源

  • inclusionAI/LLaDA-Image(GitHub API 实测 2026-09-09):208 星 / 10 fork,Python,创建 2026-08-31,push 2026-09-07,license 字段为 null
  • 仓库 README 全文:6B 统一生成+编辑家族、Base/Turbo、统一扩散框架、image-only 预训练视觉先验、Twin-DMD 蒸馏 2–4 步、Qwen-Image-Bench 英文 53.53 / 中文 53.38、四权重清单、Diffusers 推理、Open-source Plan(训练代码 coming soon)
  • arXiv 2609.03796:LLaDA-Image 技术报告
  • 蚂蚁开源公众号(2026-09-08):蒸馏技术称「TwinFlow,50 步压缩至 2–4 步」(与 README 的 Twin-DMD 命名分歧,已标注)
  • 社区动态(2026-09-07):realrebelai 提供 LLaDA-Image 与 LLaDA-Image-Turbo(含 FP8)ComfyUI 节点
  • 关联阅读:本站 本地部署 SOP(同批)、ChatGPT Images 2.5 热点(同批)、开源 vs 闭源图像模型横评(同批)、推理式图像模型横评GPT-Image 2 资源包

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-09

常见问题

LLaDA-Image 和 LLaDA-Image-Turbo 有什么区别?
Base 是 50 步采样的高保真基座,适合对画质要求高的场景;Turbo 经 Twin-DMD 蒸馏压到 2–4 步,速度量级提升,适合实时或批量出图。两者都是 6B 单一权重,能力覆盖一致,差别在采样步数与出图速度。
它支持哪些生成与编辑模式?
两个 checkpoint 都支持 text(文生图)、vq(VQ 条件生成,由 LLaDA2 产出 image VQ tokens 经 SigVQ 嵌入后扩散,不传输入图)、editing(参考图编辑,必须给参考图)。尺寸上 text/vq 要求高宽整除 16,editing 要求整除 32,常用 1024×1024。
许可证是什么,能直接商用吗?
GitHub API 实测该仓库 `license` 字段为 null,且未见 LICENSE 文件。因此不能默认其为 Apache-2.0 或 MIT,**商用、二次分发、产品化之前须主动向 InclusionAI 官方确认许可条款**,切忌凭猜测使用。这是本文最重要的避坑点。
模型权重在哪下载,有 FP8 版本吗?
HuggingFace 与 ModelScope 各同步四个同名权重:LLaDA-Image(BF16)、LLaDA-Image-FP8、LLaDA-Image-Turbo(BF16)、LLaDA-Image-Turbo-FP8。FP8 版本用于降低显存占用,适合本地与显存受限部署。
和闭源模型比如何,与 ChatGPT Images 2.5 怎么选?
据 ai-bot 转述,LLaDA-Image 总分介于 GPT Image 1 与 Imagen 4.0 Ultra 之间,已摸到闭源第一梯队门槛但仍有差距;中文榜 53.38 与英文 53.53 近乎持平,中文场景实用性强。若你要可审计、可本地部署、可定制的开源方案,它值得试;若追求极致画质与零运维,同周发布的 ChatGPT Images 2.5 仍是闭源优选。

相关文章

开源项目

DeepSeek Harness 开源:万物皆插件的 Agent 框架

DeepSeek 官方开源 Agent 编排框架 DeepSeek Harness(命令行 dsh),GitHub MIT、TypeScript,基于 Cordis 运行时,以「万物皆插件」架构模块化拼装 AI 流水线。仓库 2026-08-13 创建,上线约三周 Star 突破 20 万;当前 0.1.3-alpha、开发者预览,官方声明会有破坏性变更、须先读 SAFETY.md。一键 `npx @deepseek-ai/dsh web` 启动 Web UI(http://127.0.0.1:3080)。

2026年9月5日10 分钟阅读
开源项目

埋水印的官方军开源了:Google SynthID-Text 参考实现拆解,Nature 论文级水印怎么长在文字里

google-deepmind/synthid-text(1,024★/96 fork,Apache-2.0,API 实测 8-17):SynthID 文本水印官方参考实现,对应 Nature 论文。水印织进采样分布(keys 配置+HF Transformers mix-in 挂 Gemma/GPT-2),双检测器(Weighted Mean 免训练/Bayesian 需训练),Colab 可跑(2B 需 T4/7B 需 A100)。官方明言非生产用途,生产版在 Hugging Face Transformers;accumulate_hash 无密码学保证。对抗/合规/工程三视角+5 注意点(密钥管理/误报标定/改写降检)。与 watermarks-remover Layer B 对位。

2026年8月17日8 分钟阅读