2026-09-09,OpenAI 发布 ChatGPT Images 2.5,API 侧同步推出 Flare 与 Sunburst 两个档位;同一周,蚂蚁旗下的开源组织 inclusionAI 放出 6B 文生图模型 LLaDA-Image(Base 50 步、Turbo 4 步 Twin-DMD 蒸馏)。一件是闭源 API 越来越快、越来越强,一件是开源权重终于能体面地自部署。文生图正式进入「闭源 API 速度档 vs 开源权重可控性」的分野期。
先说和站内已有文章的分工,避免重复。本站 8-26 已有一篇推理式图像模型能力横评,那篇比的是 GPT Image 2、Nano Banana Pro、Seedream、Ideogram、FLUX.2 的「能力上限」——谁会思考、谁中文不乱码、谁编辑不洗牌。本篇不重复那场比武,我们换一本账:同一张图,闭源 API 按张付费 vs 开源权重自部署,到底谁更省、谁更可控、谁更适合你。顺带,本批同发的热点稿讲 ChatGPT Images 2.5 的能力与定位,资源稿盘点 LLaDA-Image 的权重与生态,部署 SOP给本地跑通的实操步骤,本文是那条「成本与可控性」的主线。
边界先讲清:以下为代表性对比,非亲自压测。成本按公开价格推算,并写明口径。第三方平台(Replicate / fal.ai)价格取官网 2026-09 快照;闭源 API 直营单价与国产云 API 单价官网未在本轮快照中给出具体数字,一律标「以官网为准」,绝不编造。显卡门槛、吞吐、电费为工程估算口径,并非官方数据,仅供量级参考。
一、同周两件事:文生图进入分野期
过去两年文生图的主叙事是「谁画得更好」。GPT Image 2 把推理式生图做成标配,Seedream 把中文小字拉到可用线,Nano Banana Pro 坐稳编辑口碑。但当能力差距被快速抹平,真正的分叉出现在另一个维度:这张图是怎么来的,以及它花了多少钱、受谁控制。
闭源阵营的打法是「API 越来越快」:你不用管显卡、不用管队列、不用管模型更新,发一条请求,最新最强的权重在厂商机房里跑完把图返给你。开源阵营的打法是「权重给你」:LLaDA-Image 6B、FLUX 系、Stable Diffusion 系把 checkpoint 开源,你自己找显卡、自己部署、自己微调。两条路不是谁取代谁,而是把用户按「量」和「控制权」切成了两半。
为什么是 2026 年才出现这个分野?前两年开源阵营的痛点不是「不能跑」,而是「跑出来不够好」——文字鬼画符、构图不稳、风格不可控,商用基本要返工。LLaDA-Image 这类 6B 开源模型的意义在于,它把质量拉到了闭源三年前的水准线以上,同时把显存门槛降到一张消费卡就能扛。当质量差可以被接受、而成本差和可控性差无法被忽略时,分野就发生了。对技术从业者来说,这正是把「该不该自己搭一套」提上日程的时机。
这个分野对技术从业者尤其重要,因为你们既不是纯玩票的用户,也不是有无限预算的大厂。你们要算的是:我这批图,到底该调 API,还是该买张卡自己跑。
二、五条路线:先看清账本长什么样
把市面上的选择摊开,其实是五条路线,成本结构完全不同:
| 路线 | 代表 | 计费方式 | 运维负担 | 可控性 |
|---|---|---|---|---|
| 闭源 API 直连 | OpenAI ChatGPT Images 2.5 / Google Imagen 系 / 即梦 Seedream 系 | 按张或按 token,单价以官网为准 | 零 | 低,不可微调 |
| 开源权重自部署 | 蚂蚁 LLaDA-Image 6B、FLUX 系、SD 系 | 显卡摊销 + 电费 + 运维(固定为主) | 高 | 高,可 LoRA/微调 |
| 第三方推理平台 | Replicate / fal.ai 托管的开源模型 | 按秒或按张,官网 2026-09 快照 | 低 | 中,可调参数不可改权 |
| 本地消费级硬件 | 单张 4090/5090 等 | 一次性显卡 + 电费,边际趋零 | 中 | 高 |
| 国产云 API | 阿里云百炼 / 腾讯云 / 火山方舟 | 按张或按 token,单价以官网为准 | 零 | 中,数据境内 |
第一条和第五条本质是同一种「租算力」逻辑,区别在数据与合规;第二条和第四条是同一种「买算力」逻辑,区别在是不是消费级;第三条是两者的折中——你不用养卡,但付的是平台托管费,且模型选择权受限。
理解这五条的关键,是看清成本曲线的形状:租算力是线性的(出一张付一张),买算力是固定的(卡先买了,出多少张边际成本趋零)。当你的量足够大,固定成本被摊薄,买算力的单位成本会一路下穿租算力。问题只是:你的量够不够大,以及你能不能忍受买算力背后的运维。
顺便纠正一个常见误解:自部署不等于「免费」。它把显性成本(按张付费)转成了隐性成本(硬件折旧、电费、显存优化、模型更新、故障排查)。算账时要把工程师的时间也算进去——一张卡省下的 API 账单,可能抵不过你花在调环境和救显存上的工时。这也是第三方平台和国产云存在的意义:它们把隐性成本重新打包成可以按量付的显性账单,只是单价里含了平台溢价。
三、一张图到底多少钱:两档量级推算
把账算清楚,分两档量级:低频的「100 张/天」(约 3000 张/月)和高频的「10000 张/天」(约 30 万张/月)。成本按公开价格推算,口径见表格下方说明。
| 路线 | 100 张/天(约 3000 张/月)月成本 | 10000 张/天(约 30 万张/月)月成本 | 成本结构 |
|---|---|---|---|
| 闭源 API 直连 | 约 $150(按 $0.05/张 推算,单价以官网为准) | 约 $15,000 | 纯线性,零运维 |
| 第三方平台托管开源 | 约 $75(flux-dev $0.025/张,官网 2026-09 快照) | 约 $7,500 | 按张/按秒,含冷启动 |
| 开源自部署(单张 4090) | 固定约 ¥600–1500/月(工程估算) | 固定约 ¥600–1500/月(Turbo 4 步吞吐可覆盖) | 固定成本为主 |
| 国产云 API | 与闭源直连同量级或略低,单价以官网为准 | 同左 | 线性,数据境内 |
| 本地消费级硬件 | 一次性显卡 + 电费,边际趋零 | 多卡或排队,工程估算 | 固定 + 时间 |
推算口径说明:闭源 API 直连按 $0.05/张做保守中值(实际单价以官网为准,不同档位与分辨率差异大);第三方平台取 Replicate 官网 2026-09 快照中 flux-dev 的 $0.025/输出图;自部署按单张 RTX 4090(约 ¥13000,三年摊销约 ¥360/月)+ 电费(400W、约 ¥60/月,工程估算)+ 轻量运维折算,月固定约 ¥600–1500;fal.ai 官网 2026-09 快照显示 H100 无服务器低至 $1.89/h,也可作为自托管托管价的参考。以上均为代表性对比,非亲自压测。
这张表最值得记住的结论只有一句:自部署是固定成本,闭源 API 是线性成本,日产百张上下就是分水岭。按 $0.05/张估,闭源 API 月成本在 2000 张(约 67 张/天)处就追上自部署的月固定开销;越过这个点,每多画一张,自部署都在「白赚」。反过来,如果你一个月只画几百张,养张卡的电费加摊销都回不了本,不如直接调 API。
四、大对比表与分场景选型
把五条路线在七个维度上摊开,方便直接对照:
| 维度 | 闭源 API | 开源自部署 | 第三方平台 | 本地消费级 | 国产云 API |
|---|---|---|---|---|---|
| 单张成本(规模化后) | 线性下降有限 | 趋零 | 中等 | 趋零 | 线性 |
| 出图延迟 | 低(厂商优化) | 取决于显卡 | 中(含排队) | 取决于显卡 | 低 |
| 可控性(LoRA/ControlNet) | 不可 | 完全可控 | 部分 | 完全可控 | 部分 |
| 合规与数据出境 | 有出境风险 | 数据不出门 | 视平台属地 | 数据不出门 | 数据境内 |
| 中文文字渲染 | 强(GPT/Seedream) | LLaDA 中英可用 | 看底层模型 | 看底层模型 | 强 |
| 迭代速度 | 厂商更新即最新 | 自己跟社区 | 平台更新 | 自己跟社区 | 厂商更新 |
| 适合人群 | 重时效轻运维 | 重可控重批量 | 折中 | 极客/隐私 | 合规敏感 |
落到具体场景,选型其实不复杂:
- 个人玩票 / 低频尝鲜:闭源 API 直连或第三方平台。零门槛、不养显卡,画几十张的成本还不够一杯咖啡。
- 电商批量出图(日万张级):开源自部署(LLaDA-Image Turbo / FLUX 量化)或国产云 API。越过线性成本拐点后,单位成本断崖式下降,这是自部署最舒服的区间。
- 数据敏感行业(医疗/金融/政务):自部署或国产云 API。闭源 API 数据可能出境,敏感素材优先数据不出门或数据境内的方案。
- 需要微调品牌风格:开源权重。闭源 API 不能改权,品牌色、固定版式、专属画风只能靠 LoRA 或微调在开源模型上实现。
- 追求最强画质与最新能力:闭源 API(ChatGPT Images 2.5 / Imagen / Seedream 系)。能力上限仍由闭源把持,且厂商更新即最新。
再补一张本地硬件对照,帮你判断「买什么卡」:
| 显卡 | 显存 | 可跑模型(工程估算口径) |
|---|---|---|
| RTX 4060 | 8GB | SD1.5 / SDXL 量化,6B 偏紧张 |
| RTX 4070 / 4080 | 16GB | SDXL / SD3、FLUX 量化版 |
| RTX 4090 / 5090 | 24GB | LLaDA-Image 6B BF16/FP8、FLUX-dev 量化,Turbo 流畅 |
| L40S / A6000 | 48GB | FLUX 全精度 + LLaDA 多实例并行 |
| A100 / H100 | 80GB | 批量化、微调训练、多模型并行 |
工程估算:LLaDA-Image 6B 的 BF16 权重约 12GB、FP8 约 6GB,单张 24GB 消费卡即可载入;Base 50 步较慢,Turbo 4 步 Twin-DMD 蒸馏吞吐更高,单卡覆盖日万张级在工程上可行。官方未给显存下限,以上为量级参考。选卡还有一个隐藏约束:功耗与噪音。24GB 卡里 4090 功耗高、机箱与电源都要跟上;5090 显存相同但能效更好;如果你在办公室而非机房跑,L40S 无风扇版本更适合长期开机。显存不是唯一指标,吞吐、功耗、驱动稳定性同样决定你每天能稳定出多少张。
五、四个避坑
坑一:许可证未标注。 这是本篇最想敲黑板的变量。LLaDA-Image 仓库在发布时的 license 字段为 null,即未标注许可证。这意味着你在商用前必须先确认授权范围——开源权重不等于可免费商用。FLUX 系、SD 系各有明确许可证,选型时要把「许可证是否允许我的用法」当成硬指标,而不是事后才想。具体到 LLaDA-Image,仓库 license 为 null 不代表「可以随便用」,也不代表「禁止商用」,而是「授权未声明、风险由使用者承担」。在把它接进生产链路前,建议先联系 inclusionAI 或等待官方补发许可证,或用 FLUX/SD 等许可证明确的模型做商业兜底。
坑二:按秒计费的冷启动。 Replicate 私有模型按实例在线时长计费,含启动与空闲时间(官网 2026-09 快照明确:私有模型计费覆盖 setup、idle、active 三段);fal.ai 无服务器按调用/输出计费,H100 低至 $1.89/h。差别在于:如果你用 Replicate 私有部署长期挂实例,哪怕没在出图也在烧钱。批量前务必压测真实延迟与账单,别只看单价。
坑三:中文渲染仍有梯度。 闭源 API(GPT Image 2 / Seedream 系)中文小字已接近可用线;LLaDA-Image 中英文字渲染均支持,Qwen-Image-Bench 英文 53.53、中文 53.38。但密集信息图、多语言海报与顶级闭源仍有差距,别直接批量下单,先小批量打样看错字率。
坑四:数据出境与合规。 闭源 API 的请求与图可能出境,医疗、金融、政务等敏感行业优先国产云 API(数据境内)或自部署(数据不出门)。国产云与闭源直营单价均以官网为准,本批资源稿与部署 SOP可配合使用。
一句话收尾:文生图的竞争已经不在「谁画得更好」,而在「同一张图,你愿意为速度付线性账单,还是为可控性付固定账单」。先把量算清楚,再决定调 API 还是买卡——这道题没有标准答案,只有适合你那档量的答案。
常见问题
Q1:闭源 API 和开源自部署,到底谁更省? A1:看量。按 $0.05/张(以官网为准)估算,闭源 API 月成本随量线性增长;自部署是固定成本(显卡摊销 + 电费 + 运维),约日产百张即越过拐点。低频用 API,批量来自部署。代表性对比,非亲自压测。
Q2:LLaDA-Image 6B 要什么显卡才能跑? A2:工程估算口径:6B BF16 权重约 12GB、FP8 约 6GB,单张 24GB 消费卡(4090/5090)可跑;Base 50 步较慢,Turbo 4 步 Twin-DMD 蒸馏吞吐更高,单卡覆盖日万张级可行。官方未给显存下限,以上为工程估算。另:仓库 license 为 null,商用须先确认授权。
Q3:第三方平台按秒/按张计费有什么坑? A3:Replicate 私有模型按实例在线时长计费,含启动与空闲(官网 2026-09 快照);fal 无服务器按调用/输出计费,H100 低至 $1.89/h。冷启动、预热、最小计费单位都要算进成本,批量前先压测延迟与单价。
Q4:中文文字渲染,闭源和开源差多少? A4:闭源 API(GPT Image 2 / Seedream 系)中文小字已接近可用;LLaDA-Image 支持中英文字渲染,Qwen-Image-Bench 中文 53.38、英文 53.53。密集信息图与多语言海报先小批量打样,别直接批量下单。
Q5:数据合规与出境怎么选? A5:闭源 API 数据可能出境,敏感行业(医疗/金融/政务)优先国产云 API(数据境内)或自部署(数据不出门)。国产云与闭源直营单价均以官网为准。自部署还要确认模型许可证——LLaDA-Image 未标注 license,商用前务必确权。