前沿热点
前沿热点

蚂蚁开源Ming-Image:AI 出图不再只会画图

2026 年 9 月中旬,蚂蚁 inclusionAI 把两个设计生成模型 Ming-Image-0.1-Design 与 Design-Layer 以 MIT 协议开源(GitHub 仓 9-17 创建,2026-09-24 快照 91 星、6 fork、Python)。两款均 6B 级:Design 端到端生成 UI、Dashboard、信息图、海报;Design-Layer 把扁平设计图拆成 2 到 9 个 RGBA 透明图层。核心看点:端到端整体生成、原生 RGBA VAE、8K 长结构化提示词,硬件门槛为单张 80 GiB 显存。本站写死的事实:MIT 经 GitHub API 等四源一致确认可商用;Qwen-Image 2.1 为 Qwen Research License 非商用,形成许可红线。基准与 Crello 数字(登顶 UI/UX 开源榜、快 4.3 倍等)一律标厂商或模型卡口径、未独立复测;定价额度未公布项一律不编。

发布于 2026年9月25日9 分钟阅读
<!-- ming-image-design-hotspot | hotspot | 蚂蚁开源Ming-Image:AI 出图不再只会画图 -->

上个月我们拆过一个端侧手机 Agent(omnimind-ai/OmniBot),重点在它的许可红线;这个月设计圈出了个更安静、但可能更值钱的开源动作:蚂蚁 inclusionAI 在 2026 年 9 月中旬,把两个设计生成模型 Ming-Image-0.1-Design 与 Ming-Image-0.1-Design-Layer 开源了,而且协议是 MIT、可商用、可自部署。 这次我们不谈「能不能画一张好看的图」,而是谈一个更扎心的拐点:AI 是不是终于开始碰「设计」这件事本身——文字要清楚、版式要稳、多个元素要放对位置、整张图风格要统一。下面先把仓库事实核一遍,再展开它为什么难、它怎么做的,以及它对你工作流意味着什么。

一、发布实核:MIT 开源、双 6B,9 月中旬就位

先把能确认的事实摆清楚。下面仓库数据来自 GitHub API,快照时间为 2026-09-24;星标、fork 每天都在变,请只当作当日截面,不要当成长期结论。

项目实测值(2026-09-24 GitHub API 快照)
仓库inclusionAI/Ming-Image(inference 代码仓)
星标91
Fork6
主语言Python
创建时间2026-09-17
最近一次 push2026-09-23
权重HuggingFace inclusionAI/Ming-Image-0.1-Design 与 …-Design-Layer;ModelScope 同步
license 字段MIT(spdx_id: mit)

许可是四源一致确认过的 MIT:GitHub API、datanorth.ai、bittide.aicompass.dev、orcarouter.ai 都明写 MIT,且注明「commercial use allowed」。这意味着开源篇可以放心写「MIT、可商用、可自部署、可二次开发」。项目规模仍极早期(9-17 才创建),91 星属于正常偏低,本站不拿星标数当实力指标吹,也建议你别被星标带节奏。

它一次放出两个模型,都是 6B 级:

  • Ming-Image-0.1-Design:文生设计。端到端生成 UI、Dashboard、信息图、海报等完整视觉设计,文字与版式稳定。
  • Ming-Image-0.1-Design-Layer:把一张已扁平化的设计图拆成 2–9 个语义独立的 RGBA 透明图层(文字、主体、背景可分别改、移、换)。

参数量上,设计 transformer 本体 6.15B;配套文本栈含 17.01B 多模态 LLM + 3.09B connector,总参数约 26.44B(orcarouter 标为厂商/评测口径,本站未独立复测,仅转述)。Design-Layer 参数为 6,154,908,736(orcarouter 口径)。

发布时间的口径有点散,这里如实列出冲突:GitHub 仓 9-17 创建、9-23 推更;HuggingFace 据 datanorth 称 9-22 上架;ai-bot 标 9-24。为避免精确日冲突,行文统一用「2026 年 9 月中旬开源(GitHub 仓 9-17 创建)」。

部署与硬件方面,官方给的框架是标准 diffusers、vLLM-Omni(官方 recipes/installation 指南)、ComfyUI;社区在数小时内出现了 INT4 / INT8 / FP8 / GGUF / ComfyUI 构建,属社区方案而非官方背书。硬件门槛(模型卡明确):默认且最小验证部署是单张 ≥80 GiB 显存 GPU、BF16,该配置端到端跑通两族模型。24 GiB 消费卡无官方指引;社区量化方案(INT4/GGUF)数小时内出现,属社区路线,非官方背书。仓库约 52.88 GB、权重约 49.25 GiB(orcarouter 口径)。想本地跑,官方命令长这样:

bash
export CUDA_VISIBLE_DEVICES=0
git clone https://github.com/inclusionAI/Ming-Image
cd Ming-Image && pip install -r requirements.txt
# 文生设计
python infer.py --model inclusionAI/Ming-Image-0.1-Design --task text-to-image \
  --prompt "your prompt" --resolution 2048 --output-dir outputs/t2i
# 图层拆解
python infer.py --model inclusionAI/Ming-Image-0.1-Design-Layer --task layer \
  --prompt "Decompose this image into N layers ..." --resolution 1024

采样默认(task 相关):Text-to-image 用 steps 12、CFG 1.0、分辨率 bucket 1024/2048,推荐 2048;Layer 用 steps 12、CFG 2.0、bucket 512/1024,推荐 1024。装了 FlashAttention2 时加 --attn-implementation flash_attention_2(便携 CLI 默认 eager)。上面的命令可直接引用,没有编造。

二、为什么「设计生成」比「画图」难

要理解这次开源的意义,得先说清一个被很多人混为一谈的区别:「画图」和「设计」是两件事。

「画图」产出一张艺术图像。主体可以是一个,文字可有可无,版式无所谓,风格越自由越好。Midjourney 这类工具在这条线上极强,但你可能也见过它最著名的翻车:让它写一句中文标语,出来的往往是笔画错乱、似是而非的「鬼画符」。这不是它笨,而是艺术图像模型的优化目标本就不把「精确可读的文字」放在第一位。

「设计」要的是另一套东西。一张信息图、一张海报、一个 Dashboard、一套 UI,必须满足四个硬约束:

  • 文字渲染清晰:标题、正文、按钮文案要准确可读,尤其是中文小字,差一个字就是事故。
  • 版式稳定:模块要对齐、间距要统一、留白要克制,不能元素漂在画布上。
  • 多元素组合:Logo、配图、数据卡、文案块要在同一张图里各就各位,而不是各画各的。
  • 风格统一:配色、字体、圆角、阴影要像出自同一个人之手,不能前半张冷淡风、后半张卡通风。

这四件事叠加起来,就是「设计生成」比「画图」难一个数量级的原因。它不是「生成得更漂亮」,而是「生成得更正确、更可控、更像人做的」。过去这类需求只能靠设计师在 Figma、PS 里手工搭;现在有人试图用模型一口气端到端吐出来,这本身就是拐点信号。

三、端到端整体生成 vs 拼装式生成

Ming-Image 的核心主张之一,是端到端整体生成,这正好对着行业里更常见的「拼装式」做法。

拼装式的典型流程是:先用模型出一张背景,再把 Logo 贴上去,再把文案用另一个工具叠上去,最后人工调对齐。问题在于,每一步都由不同模型或不同时间生成,风格必然割裂——背景是写实风,素材是扁平风,字体又换一套,拼完像三张图硬缝在一起。更麻烦的是对齐:手工贴的文案常常压到配图、盖住按钮,还得人回去修。

端到端整体生成反过来:一次统筹全局布局、配色、素材风格,把所有元素当作一张图的有机部分一起算出来,从源头避免拼接造成的风格断裂与错位。这听起来像一句口号,但对设计工作流来说,它省掉的是最贵的人力环节——反复对齐和统一风格。

支撑这件事的还有两个工程点。第一是原生 RGBA VAE:模型直接生成带 Alpha 通道的透明素材(人物、商品、图标、装饰),无需后处理抠图。这意味着你拿到的不是一张锁死的方图,而是可以单独拿出来用的透明 PNG 素材。第二是8K 长结构化提示词:模型把你的需求自动组织为「文案 / 模块 / 布局 / 视觉风格」四个维度的结构化输入,超长提示信息被完整理解,而不是被截断成一句话就开画。

四、Layer 拆解:把一张图拆成 2–9 个可编辑图层

如果说端到端生成解决的是「一次出整图」,那 Design-Layer 解决的就是「出了整图之后还能继续改」。

Design-Layer 的任务是:把一张已经扁平化的设计图,拆成 2–9 个语义独立的 RGBA 透明图层,并且文字、主体、背景可以分别改、移、换。它的实现里有几个值得记的名字:Type Token 显式约束每个图层的设计角色;Alpha-Aware Layer Optimization 专门处理透明边缘的锯齿与渗色;Composite-Layer Stack Consistency 约束叠加后尽可能还原原图。三者合起来,目标是「拆得开、也合得回去」。

这件事对实际工作流的价值被很多人低估。举几个场景:

  • 改一个字,不用重画整张图:海报标题写错一个字,传统生成式做法往往要重新生成一整张,版式还可能变;有了分层,你只动文字层。
  • 换背景不碰主体:同一款商品,换三套背景做 A/B,主体图层原样复用。
  • 做多语言版本只改文字层:中文海报出海,改文案层就能出英文版,不必重新生图。

也就是说,它把「生成」从一次性消费,变成了「可继续编辑的工程资产」。交付链路也往这个方向补:Design Skill(Text-to-Page,先出方案再写代码)、PPT Skill(设计图一键还原成可编辑 PPT),相关示例在 ling-cookbook 仓库里。顺带一提,官方还提供 Prompt Enhancement 预处理:用 Ling-3.0-flash-VL 或 qwen3.8-27B 把你的短描述重写成 Figma 式结构化 JSON/分层规范,再喂给 --prompt,系统提示词随仓发布于 assets/。这一步不是模型本体,但能显著提升成品质量。

资源门槛要再提醒一次:默认验证配置仍是单张 80 GiB 显存。分层拆解本身不便宜,想低门槛上消费卡,目前只有社区量化路线,没有官方背书。

五、对设计师与营销意味着什么;与闭源工具定位差异

把前面四节合起来,它对两类人意味着不同的事。

对设计师:最大的变化是「第一稿」成本骤降。过去一个活动要出主视觉、信息图、几张社交媒体图,第一稿就吃掉大半天;现在可以用模型先吐一版整体设计,再在图层上精修。多页、多模块的东西尤其受益。关键是它不把成品锁死在 PNG 里——Layer 让设计师拿到的是能继续改的东西,而不是「将就着用」的图。

对营销团队:受益的是「批量变体」。同一主视觉,换尺寸适配朋友圈、微博、公众号封面;换文案做 A/B;换背景做渠道差异化。规模产出第一次不必依赖反复找设计师排期。前提是你接受它的质量区间,以及你愿意投入工程把权重接进自己的管线。

那它和 Midjourney、即梦 AI、Canva 这些闭源工具或平台是什么关系?一句话:它不是来替代它们的,而是定位在「设计工作流里生成第一稿与可编辑素材的引擎」。对照看更清楚:

维度Ming-Image(开源)Midjourney(闭源)即梦 AI(闭源)Canva(平台)
许可MIT,可商用、可自部署订阅制,闭源闭源,字节系商业 SaaS
核心产出完整设计 + RGBA 透明素材 + 可编辑图层艺术图像消费级图文/视频模板驱动的成品设计
文字与版式设计目标之一(据模型卡)弱项,易乱中等人工保障
可继续编辑Layer 拆 2–9 层,可独立改无图层、无编辑非专业设计图层强(人工在编辑器里改)
部署形态权重自托管,嵌入自有管线云端服务云端服务云端平台

结论很直接:Midjourney 给你一张最终图,即梦给你消费级成品,Canva 给你模板和协作,而 Ming-Image 给你能继续改的工程资产,以及你能私有化部署的权重。它对需要把生成接进内部系统、在意数据不出域、又想要可编辑产出的团队,价值最明显。

不过,关于它「有多强」的数字,本站必须按红线写清楚:榜单与 Crello 成绩一律来自模型卡/厂商宣传,未独立复测。据模型卡/官方宣称,Ming-Image 登顶 Artificial Analysis 的 UI/UX 开源榜——但榜单在模型卡里只以图表图片呈现,文本无可引用数字、无命名对手、未提供可复现脚本,datanorth.ai 与 orcarouter.ai 均指出「无法独立验证」,因此本站不把它当硬事实。Crello-Test 12 项指标全部第一的说法,来自 ai-bot 的对比表(厂商口径),同样未独立复测。速度对比上,ai-bot 称 Ming-Image-Layer 6B 对 Qwen-Image-Layered 20B,单次推理 183s vs 795s、快约 4.3 倍;工程优化后约 20 秒出图;改字成本仅为 GPT-image2 的 1/7——以上均标「厂商/模型卡口径,非独立复测」,请勿当作已验证结论。

许可层面倒有一条可以写死的事实:Qwen-Image 2.1 的许可是 Qwen Research License Agreement(非商用),与 Ming-Image 的 MIT 形成许可红线对比——一个能商用自部署,一个仅研究用途,这是本批少数可放心陈述的差异之一。另一边,Nano Banana 2(即 Google Gemini 3.1 Flash Image)返回的是「一张图」、不带图层,定价约 $0.067/1024²(厂商口径),可作为闭源对照的价格参考。

最后,凡官方未公开的项,本站一律不编:定价、额度、API 限流、可用地域以官方公告为准;小语种小字渲染表现官方未测,写「待实测」。想对照上游模型与平台动向,可看本站的 阿里 Qwen Intelligence 发布热点。

一句话收尾:Ming-Image 证明的是「开源模型开始认真碰设计工作流」,而不是「设计岗明天就被替代」。前者是拐点已现,后者是过度演绎,中间还隔着一整套你自己的验收与工程接入。


参考来源

本文数字多来自模型卡/厂商宣传:Artificial Analysis UI/UX 开源榜与 Crello 成绩均以图表呈现、无可引用数字、未独立复测;4.3 倍、约 20 秒、1/7 成本等速度/成本对比均为厂商口径,未独立复测。MIT 许可、仓库存在、91 星 等为已核实事实。关联阅读:本站 阿里 Qwen Intelligence 发布热点。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-25

相关文章

前沿热点

腾讯云 Octop 1.0 GA:多用户隔离是自托管真需求

2026-09-17 腾讯云开源自托管多智能体助手 Octop 发布 1.0 GA,同步上线 Lighthouse 与 CVM 官方镜像市场一条命令部署。本文不堆参数,核心判断是"多用户隔离"才是自托管场景的真需求:市面多数自托管助手围绕单人设计,Octop 用 JWT 按成员隔离记忆、工作区与专家配置,配合单进程架构与 IM 直连,把"家庭/小团队共用一个 AI 助手"做成第一设计目标。同时如实标注边界:开源仅两个多月、3,198 星还在爬坡期,Connector 腾讯系占比高,且需要有人管服务器。

2026年9月17日7 分钟阅读
前沿热点

OpenAI 交出 Agent 的发动机:Codex Harness 全面开源,跑分翻三倍的秘诀根本不在模型里

OpenAI 2026-08-19 官宣 "Codex as a platform":Codex Harness 正式平台化,三个入口开放给第三方嵌入--codex exec(脚本/CI 一条命令)、Codex SDK(TS/Python 编程调用,npm @openai/codex-sdk / pip openai-codex)、codex app-server(JSON-RPC 2.0 产品级 Runtime,stdio/ws/unix 三传输)。openai/codex 仓库 Apache-2.0、111,646 星(GitHub API 实测 2026-08-22)。核心数据:ARC-AGI-3 特定设置下保留推理+上下文压缩让 GPT-5.6 Sol 从 13.3% 到 38.3%(约 2.88 倍)、输出 Token 降到约六分之一--模型没换,换的是 Harness。三个边界:IDE Extension 与 Codex Cloud 不开源、模型不免费、"代码在 GitHub"不等于"可作平台依赖"。信号:竞赛重心从模型层下移到执行层,对标 Claude Agent SDK,xAI/browser-use/phone-harness 同期动作,Harness 工程成品类。

2026年8月22日8 分钟阅读
前沿热点

DeepSeek Harness 开源两天 10 万星:「一切皆插件」,这次不开模型开执行层

DeepSeek 8-13 开源的不是模型是执行层:DeepSeek Harness(dsh)v0.1 开发者预览,MIT,一切皆插件(模型/工具/技能/会话/沙箱/循环/编排/UI 全可插拔,基于 Cordis 元框架),四种运行模式,append-only 轨迹可回放分叉,两天 101,905 星 GitHub API 实测。配套 V4-Pro-0813(1.6T MoE MIT 权重)。附三条冷水(预览版破坏性变更/插件无审核/体验门槛+涨价)。以官方为准。

2026年8月15日8 分钟阅读