「一张海报 AI 生成要多少钱?」--这个问题在 GPT-Image 2 时代有了精确答案:官方 API 单张 0.006-0.211 美元(约 4 分到 1 块 5 人民币,按画质与分辨率浮动),Batch 通道半价。但把一张图做到「能发给客户」,成本只是最后一格:提示词怎么结构化、Instant 和 Thinking 怎么选、官方/聚合器渠道怎么挑、批量怎么控质量,才是一条完整的商用流水线。这篇 SOP 从零走完「需求到成片」全流程。
前置声明:本文基于 OpenAI 官方 API 文档、DataLearner 模型库(2026-08-22 更新)与第三方网关公开价目整理,价格为 2026-08-26 快照;模型标识符 gpt-image-2(快照版 2026-04-21),非官方合作推广。
第一步:把需求翻译成档位
GPT-Image 2 的参数面很窄,但每个选择都直接进成本:
| 决策项 | 选项 | 怎么选 |
|---|---|---|
| 生成模式 | Instant / Thinking | 快速草图用 Instant;精准排版、多图一致性、时事内容用 Thinking |
| 画质档 | low / medium / high | 抽卡一律 low,终稿 medium 起步,印刷品 high |
| 尺寸 | 宽高比 3:1 至 1:3 | 官方 API 尺寸档 1024x1024 / 1024x1536 / 1536x1024 |
| 分辨率 | 标准 2K / API Beta 4K | 官方按 token 计费;2K/4K 档走 Azure(4K+智能路由)或聚合网关按张计价 |
两条硬规则:Thinking 模式单条提示最多输出 8 张风格与对象高度一致的图像--做系列图、漫画分镜、A/B 测试素材时用一条提示出 8 张,比跑 8 次任务再对齐风格省得多;模型知识截止 2025-12--图里要出现 2026 年的信息(新品、新闻、汇率),必须开 Thinking 的实时联网,否则模型要么瞎编要么留白。
第二步:提示词结构化(别再写散文)
商用出图和随手玩的最大区别是提示词结构。参考本站拆过的 awesome-gpt-image-2 模板库 的原子化方法,一条生产级提示词拆五段:
[主体]:为跨境电商保温杯生成一张商品主图
[布局]:居中构图,杯身 45 度侧摆,背景厨房台面虚化
[风格]:商业摄影质感,晨间自然光,主色暖金
[文字]:图上文字仅一行"限时 5 折",字体无衬线,置于右下角
[约束]:文字必须准确显示指定的中文,禁止乱码和占位文本,比例 1:1给 agent 或批量脚本用,直接上 JSON 结构(type/layout/style/content/constraints 字段化),程序按字段组装、按场景换值。文字段必须显式锁定--「必须显示指定的中文,禁止乱码」这一句不能省,这是 GPT-Image 2 文字渲染 99% 能力被正确触发的前提,剩下 1% 的漏网靠第四步质检兜底。
第三步:API 调用
标准 /v1/images/generations 端点,OpenAI 兼容格式:
curl https://api.openai.com/v1/images/generations \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-image-2",
"prompt": "为跨境电商保温杯生成商品主图:居中构图,杯身45度侧摆,背景厨房台面虚化,商业摄影质感,晨间自然光,图上文字仅一行\"限时5折\"置于右下角,文字必须准确显示禁止乱码,比例1:1",
"size": "1024x1024"
}'from openai import OpenAI
client = OpenAI()
img = client.images.generate(
model="gpt-image-2",
prompt=PROMPT, # 第二步的结构化提示词
size="1024x1024", # 官方三档:1024x1024 / 1024x1536 / 1536x1024
quality="low", # 抽卡 low / 终稿 medium 或 high
n=1, # Thinking 模式最多 8,多图一致性
)
print(img.data[0].url if getattr(img.data[0], "url", None) else img.data[0].b64_json[:50])计费按 token:图像输入 $8/百万 token、输出 $30/百万 token(文本输入 $5/输出 $10)。这就是「单张成本是一个区间」的原因--输出 token 由尺寸和画质档决定,1024x1024 每张约 $0.006(low)、$0.053(medium)、$0.211(high)。
第四步:渠道选择与成本表
四个入口,按需选:
| 渠道 | 计价 | 1K 单张 | 适合 |
|---|---|---|---|
| OpenAI 官方(同步) | token | $0.006-0.211 | 标准路径,尺寸上限 1024x1536 |
| OpenAI Batch API | token 半价 | 约 $0.027(medium) | 不急的批量,最长等 24 小时 |
| Azure AI Foundry | token | 同官方量级 | 要 4K、要内容安全过滤、要企业合规 |
| 聚合网关 | 按张分档 | 1K 约 $0.025-0.03,2K $0.03-0.05,4K $0.05-0.08 | 要 2K/4K 按张计价、国内直连 |
1000 张活动海报的账(medium 画质):官方同步通道约 $53;全走 Batch 约 $27 但要等异步窗口;聚合网关按张约 $25-30 且 2K 加价极低。再叠加「low 抽卡 + medium 出片」两档打法(10 轮 low 试构图约 $0.06 + 1 轮 medium 终稿 $0.053,单素材总成本约 $0.11),1000 张素材的预算带在 $30-120 之间,取决于抽卡深度--这已经低于多数设计师一小时的时薪。
注意聚合网关的两个 trade-off:像素落在档位网格上(要「精确到像素」的承诺请走官方);第三方可靠性自评(本站实测口径的成功率与延迟数据可参考横评)。
第五步:批量与质检清单
批量生成走 Batch API 或脚本循环,质检按这张清单过:
- 文字:图内每一段文字逐字比对(99% 准确率意味着 1000 张里约 10 张有错字)
- 手与物理结构:手指、关节、反光镜面、重复纹理(沙粒毛发是已知盲区)
- 品牌要素:logo 形状、品牌色色号(用 hex 码写进提示词约束)
- 一致性:系列图的主体、光照、风格是否漂移(用同一条 Thinking 提示出 8 张可控)
- 合规:人物肖像、竞品元素、地标版权(商用必查)
六、七个踩坑实录
- 迭代编辑递减:同一张图改到第三轮效果停滞--研究者 Ethan Mollick 的解法是把图丢进新会话重置上下文再继续改。
- 输入图收费:参考图/图生图每张输入图都计费,批量带参考图前先算输入 token。
- 知识截止 2025-12:时事内容不开联网会瞎编。
- Instant/Thinking 错配:复杂排版用 Instant 反复抽卡,比一次 Thinking 更贵。
- 物理盲区:折纸步骤图、魔方、倾斜/反转物体仍表现欠佳,此类素材走摄影。
- low 档直接交付:low 是抽卡档,构图确认后必须升档重跑终稿。
- prompt 散文化:一段没有结构的描述让输出不可复现,团队协作时尤其致命--用第二步的五段结构。
常见问题
Q1:不想写代码,能用 GPT-Image 2 商用出图吗? A1:能。ChatGPT 全套餐(含免费档)都能访问 Images 2.0,网页上传参考图、自然语言描述即可出图;付费 Plus/Pro/Business 解锁 Thinking 等高级特性。小批量(一天几十张)网页操作完全够用;要批量化、自动化、进工作流,才需要走本文的 API 路线。
Q2:low/medium/high 画质档肉眼差别大吗? A2:构图和内容一致,差别在细节密度与输出 token(成本差 35 倍)。实操建议:low 确认构图与文字位置,medium 看细节与质感,high 只给最终印刷/交付稿。多数线上用途(社交媒体、电商详情页)medium 已足够。
Q3:按 token 计费怎么提前估算成本? A3:官方口径下 1024x1024 三档单张约 $0.006/$0.053/$0.211,按这个区间乘张数即可估总账;精确预算要按「尺寸 × 画质档」估输出 token。不想管 token 数学就选按张计价的聚合网关(1K 约 $0.025-0.03/张),可预算性更好。
Q4:图里的文字总是差点意思,怎么办? A4:三招:提示词里显式写「文字必须准确显示指定的中文,禁止乱码和占位文本」;把要渲染的文字用引号原文嵌入 prompt(而不是描述「写一句关于 XX 的话」);小字密集场景开 Thinking 模式。若追求极限文字精度(超小号字、特殊字体),补一刀 Ideogram 4.0(文字渲染专精)做终稿。
Q5:为什么我的图 4K 出来只有 1024? A5:官方 API 公布的尺寸上限是 1024x1536 / 1536x1024,原生 4K 要走 Azure AI Foundry 或聚合网关的 4K 档(按张计价)。另一个可能是把「尺寸 size」和「分辨率档」混了--官方参数里只有三档 size,聚合网关才提供 resolution tier 参数(2K/4K)。
参考来源
- OpenAI 官方 API:模型
gpt-image-2、端点/v1/images/generations、token 计价与 Batch 半价机制(2026-08 口径) - DataLearner 模型库(2026-08-22 更新):参数面(Instant/Thinking、3:1-1:3、8 张一致性、知识截止 2025-12)、单张 $0.006-0.211、Azure AI Foundry 4K 支持、Ethan Mollick 编辑递减观察
- 第三方网关价目(APIMODELS 等公开页,2026-08 快照):1K/2K/4K 按张价与像素网格说明
- 关联阅读:本站 GPT-Image 2 提示词库拆解(提示词原子化方法论)、会思考的生图模型横评(同批,选型依据)
本文基于公开文档整理(截至 2026-08-26),非官方合作推广;价格随官方调整,以实时页面为准。