实战 SOP
实战 SOP

GPT-Image 2 商用出图 SOP:从提示词结构化到成本控制,一张图 6 分到 1 块 5

「一张 AI 海报多少钱」在 GPT-Image 2 时代有了精确答案:官方 API 单张 0.006-0.211 美元,Batch 通道半价。这篇 SOP 从零走完「需求到成片」全流程:第一步把需求翻译成档位(Instant/Thinking、low/medium/high、3:1-1:3 比例、知识截止 2025-12 的联网坑);第二步提示词结构化(主体/布局/风格/文字锁定/约束五段原子法,文字必须显式锁定防乱码);第三步 API 调用(/v1/images/generations 的 curl 与 Python 示例、token 计价换算);第四步渠道选择(官方/Batch 半价/Azure 4K/聚合网关按张计价的成本表);第五步批量与五项质检清单;第六步七个踩坑实录(迭代编辑递减、输入图收费、low 档不能直接交付等)。含 1000 张海报 $30-120 的预算带算法。

发布于 2026年8月26日8 分钟阅读
<!-- gpt-image-2-commercial-image-sop | sop | GPT-Image 2 商用出图 SOP:从提示词结构化到成本控制,一张图 6 分到 1 块 5 -->

「一张海报 AI 生成要多少钱?」--这个问题在 GPT-Image 2 时代有了精确答案:官方 API 单张 0.006-0.211 美元(约 4 分到 1 块 5 人民币,按画质与分辨率浮动),Batch 通道半价。但把一张图做到「能发给客户」,成本只是最后一格:提示词怎么结构化、Instant 和 Thinking 怎么选、官方/聚合器渠道怎么挑、批量怎么控质量,才是一条完整的商用流水线。这篇 SOP 从零走完「需求到成片」全流程。

前置声明:本文基于 OpenAI 官方 API 文档、DataLearner 模型库(2026-08-22 更新)与第三方网关公开价目整理,价格为 2026-08-26 快照;模型标识符 gpt-image-2(快照版 2026-04-21),非官方合作推广。

第一步:把需求翻译成档位

GPT-Image 2 的参数面很窄,但每个选择都直接进成本:

决策项选项怎么选
生成模式Instant / Thinking快速草图用 Instant;精准排版、多图一致性、时事内容用 Thinking
画质档low / medium / high抽卡一律 low,终稿 medium 起步,印刷品 high
尺寸宽高比 3:1 至 1:3官方 API 尺寸档 1024x1024 / 1024x1536 / 1536x1024
分辨率标准 2K / API Beta 4K官方按 token 计费;2K/4K 档走 Azure(4K+智能路由)或聚合网关按张计价

两条硬规则:Thinking 模式单条提示最多输出 8 张风格与对象高度一致的图像--做系列图、漫画分镜、A/B 测试素材时用一条提示出 8 张,比跑 8 次任务再对齐风格省得多;模型知识截止 2025-12--图里要出现 2026 年的信息(新品、新闻、汇率),必须开 Thinking 的实时联网,否则模型要么瞎编要么留白。

第二步:提示词结构化(别再写散文)

商用出图和随手玩的最大区别是提示词结构。参考本站拆过的 awesome-gpt-image-2 模板库 的原子化方法,一条生产级提示词拆五段:

text
[主体]:为跨境电商保温杯生成一张商品主图
[布局]:居中构图,杯身 45 度侧摆,背景厨房台面虚化
[风格]:商业摄影质感,晨间自然光,主色暖金
[文字]:图上文字仅一行"限时 5 折",字体无衬线,置于右下角
[约束]:文字必须准确显示指定的中文,禁止乱码和占位文本,比例 1:1

给 agent 或批量脚本用,直接上 JSON 结构(type/layout/style/content/constraints 字段化),程序按字段组装、按场景换值。文字段必须显式锁定--「必须显示指定的中文,禁止乱码」这一句不能省,这是 GPT-Image 2 文字渲染 99% 能力被正确触发的前提,剩下 1% 的漏网靠第四步质检兜底。

第三步:API 调用

标准 /v1/images/generations 端点,OpenAI 兼容格式:

bash
curl https://api.openai.com/v1/images/generations \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-image-2",
    "prompt": "为跨境电商保温杯生成商品主图:居中构图,杯身45度侧摆,背景厨房台面虚化,商业摄影质感,晨间自然光,图上文字仅一行\"限时5折\"置于右下角,文字必须准确显示禁止乱码,比例1:1",
    "size": "1024x1024"
  }'
python
from openai import OpenAI
client = OpenAI()

img = client.images.generate(
    model="gpt-image-2",
    prompt=PROMPT,          # 第二步的结构化提示词
    size="1024x1024",        # 官方三档:1024x1024 / 1024x1536 / 1536x1024
    quality="low",          # 抽卡 low / 终稿 medium 或 high
    n=1,                     # Thinking 模式最多 8,多图一致性
)
print(img.data[0].url if getattr(img.data[0], "url", None) else img.data[0].b64_json[:50])

计费按 token:图像输入 $8/百万 token、输出 $30/百万 token(文本输入 $5/输出 $10)。这就是「单张成本是一个区间」的原因--输出 token 由尺寸和画质档决定,1024x1024 每张约 $0.006(low)、$0.053(medium)、$0.211(high)

第四步:渠道选择与成本表

四个入口,按需选:

渠道计价1K 单张适合
OpenAI 官方(同步)token$0.006-0.211标准路径,尺寸上限 1024x1536
OpenAI Batch APItoken 半价约 $0.027(medium)不急的批量,最长等 24 小时
Azure AI Foundrytoken同官方量级要 4K、要内容安全过滤、要企业合规
聚合网关按张分档1K 约 $0.025-0.03,2K $0.03-0.05,4K $0.05-0.08要 2K/4K 按张计价、国内直连

1000 张活动海报的账(medium 画质):官方同步通道约 $53;全走 Batch 约 $27 但要等异步窗口;聚合网关按张约 $25-30 且 2K 加价极低。再叠加「low 抽卡 + medium 出片」两档打法(10 轮 low 试构图约 $0.06 + 1 轮 medium 终稿 $0.053,单素材总成本约 $0.11),1000 张素材的预算带在 $30-120 之间,取决于抽卡深度--这已经低于多数设计师一小时的时薪。

注意聚合网关的两个 trade-off:像素落在档位网格上(要「精确到像素」的承诺请走官方);第三方可靠性自评(本站实测口径的成功率与延迟数据可参考横评)。

第五步:批量与质检清单

批量生成走 Batch API 或脚本循环,质检按这张清单过:

  1. 文字:图内每一段文字逐字比对(99% 准确率意味着 1000 张里约 10 张有错字)
  2. 手与物理结构:手指、关节、反光镜面、重复纹理(沙粒毛发是已知盲区)
  3. 品牌要素:logo 形状、品牌色色号(用 hex 码写进提示词约束)
  4. 一致性:系列图的主体、光照、风格是否漂移(用同一条 Thinking 提示出 8 张可控)
  5. 合规:人物肖像、竞品元素、地标版权(商用必查)

六、七个踩坑实录

  1. 迭代编辑递减:同一张图改到第三轮效果停滞--研究者 Ethan Mollick 的解法是把图丢进新会话重置上下文再继续改。
  2. 输入图收费:参考图/图生图每张输入图都计费,批量带参考图前先算输入 token。
  3. 知识截止 2025-12:时事内容不开联网会瞎编。
  4. Instant/Thinking 错配:复杂排版用 Instant 反复抽卡,比一次 Thinking 更贵。
  5. 物理盲区:折纸步骤图、魔方、倾斜/反转物体仍表现欠佳,此类素材走摄影。
  6. low 档直接交付:low 是抽卡档,构图确认后必须升档重跑终稿。
  7. prompt 散文化:一段没有结构的描述让输出不可复现,团队协作时尤其致命--用第二步的五段结构。

常见问题

Q1:不想写代码,能用 GPT-Image 2 商用出图吗? A1:能。ChatGPT 全套餐(含免费档)都能访问 Images 2.0,网页上传参考图、自然语言描述即可出图;付费 Plus/Pro/Business 解锁 Thinking 等高级特性。小批量(一天几十张)网页操作完全够用;要批量化、自动化、进工作流,才需要走本文的 API 路线。

Q2:low/medium/high 画质档肉眼差别大吗? A2:构图和内容一致,差别在细节密度与输出 token(成本差 35 倍)。实操建议:low 确认构图与文字位置,medium 看细节与质感,high 只给最终印刷/交付稿。多数线上用途(社交媒体、电商详情页)medium 已足够。

Q3:按 token 计费怎么提前估算成本? A3:官方口径下 1024x1024 三档单张约 $0.006/$0.053/$0.211,按这个区间乘张数即可估总账;精确预算要按「尺寸 × 画质档」估输出 token。不想管 token 数学就选按张计价的聚合网关(1K 约 $0.025-0.03/张),可预算性更好。

Q4:图里的文字总是差点意思,怎么办? A4:三招:提示词里显式写「文字必须准确显示指定的中文,禁止乱码和占位文本」;把要渲染的文字用引号原文嵌入 prompt(而不是描述「写一句关于 XX 的话」);小字密集场景开 Thinking 模式。若追求极限文字精度(超小号字、特殊字体),补一刀 Ideogram 4.0(文字渲染专精)做终稿。

Q5:为什么我的图 4K 出来只有 1024? A5:官方 API 公布的尺寸上限是 1024x1536 / 1536x1024,原生 4K 要走 Azure AI Foundry 或聚合网关的 4K 档(按张计价)。另一个可能是把「尺寸 size」和「分辨率档」混了--官方参数里只有三档 size,聚合网关才提供 resolution tier 参数(2K/4K)。


参考来源

  • OpenAI 官方 API:模型 gpt-image-2、端点 /v1/images/generations、token 计价与 Batch 半价机制(2026-08 口径)
  • DataLearner 模型库(2026-08-22 更新):参数面(Instant/Thinking、3:1-1:3、8 张一致性、知识截止 2025-12)、单张 $0.006-0.211、Azure AI Foundry 4K 支持、Ethan Mollick 编辑递减观察
  • 第三方网关价目(APIMODELS 等公开页,2026-08 快照):1K/2K/4K 按张价与像素网格说明
  • 关联阅读:本站 GPT-Image 2 提示词库拆解(提示词原子化方法论)、会思考的生图模型横评(同批,选型依据)

本文基于公开文档整理(截至 2026-08-26),非官方合作推广;价格随官方调整,以实时页面为准。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-26

常见问题

不想写代码,能用 GPT-Image 2 商用出图吗?
能。ChatGPT 全套餐(含免费档)都能访问 Images 2.0,网页上传参考图、自然语言描述即可出图;付费 Plus/Pro/Business 解锁 Thinking 等高级特性。小批量(一天几十张)网页操作完全够用;要批量化、自动化、进工作流,才需要走本文的 API 路线。
low/medium/high 画质档肉眼差别大吗?
构图和内容一致,差别在细节密度与输出 token(成本差 35 倍)。实操建议:low 确认构图与文字位置,medium 看细节与质感,high 只给最终印刷/交付稿。多数线上用途(社交媒体、电商详情页)medium 已足够。
按 token 计费怎么提前估算成本?
官方口径下 1024x1024 三档单张约 $0.006/$0.053/$0.211,按这个区间乘张数即可估总账;精确预算要按「尺寸 × 画质档」估输出 token。不想管 token 数学就选按张计价的聚合网关(1K 约 $0.025-0.03/张),可预算性更好。
图里的文字总是差点意思,怎么办?
三招:提示词里显式写「文字必须准确显示指定的中文,禁止乱码和占位文本」;把要渲染的文字用引号原文嵌入 prompt(而不是描述「写一句关于 XX 的话」);小字密集场景开 Thinking 模式。若追求极限文字精度(超小号字、特殊字体),补一刀 Ideogram 4.0(文字渲染专精)做终稿。
为什么我的图 4K 出来只有 1024?
官方 API 公布的尺寸上限是 1024x1536 / 1536x1024,原生 4K 要走 Azure AI Foundry 或聚合网关的 4K 档(按张计价)。另一个可能是把「尺寸 size」和「分辨率档」混了--官方参数里只有三档 size,聚合网关才提供 resolution tier 参数(2K/4K)。

相关文章

实战 SOP

用 GPT-6 Astra 搭建长任务智能体工作流

基于 GPT-6 Astra 真实能力(105 万上下文、12.8 万输出、对齐越权 0%)搭建长任务智能体的实战 SOP:先完成三项准备(OpenAI Python SDK 1.50+、OPENAI_API_KEY 环境变量、API 白名单),再按长上下文规划→定义工具(函数调用 + 计算机使用)→异步调用模式→中途纠偏→验收与成本控制的顺序落地。重点:开局只放任务目标、验收标准、工具清单与关键背景让模型先出计划;工具须写清 name/description/parameters;异步用流式事件 + 后台队列 + 任务 id 轮询;纠偏直接注入新指令无需重启;验收用独立脚本做断言、默认收小 max_output_tokens 并设日花费上限。

2026年9月4日11 分钟阅读
实战 SOP

模型下线迁移止血 SOP:4 步把涨价、替换与下线三类变更的账算清

2026 年 8 月 31 日集中发生三件事:Sonnet 5 的 API 费率从 2 与 10 美元恢复到 3 与 15 美元、GPT-5.4 与 GPT-5.4 mini 对 ChatGPT 登录的 Codex 用户停止提供、kimi-k2.5 与 moonshot-v1 同日下线。这三类变更的处理方式完全不同,但很多团队用同一套动作应对,结果要么过度反应要么反应不足。这篇给一套四步流程:第 0 步先分类,用公告里的关键词判断是下线(sunset / deprecated,当天必须处理)、替换(replace / default 变更,本周内,不报错但模型变了,需回归)还是涨价(只写 pricing,本月内,业务不中断但要重算成本);第 1 步依赖盘点,用一条 grep 把散落在各处的模型 ID 全扫出来,收敛到集中配置并接进 CI;第 2 步按类型执行迁移动作;第 3 步用分词放大系数、峰谷时段占比、缓存命中率三个系数重算月度成本。另附 11 条可复制检查清单、第 4 步的限额与告警与降级路径配置,以及七个踩坑点——最常见的一条是模型 ID 散落在代码里,改一处漏三处。

2026年8月31日12 分钟阅读
实战 SOP

Qwen3.8-Flash-Next 全栈部署 SOP:125B 主模型 + 51B N-gram 嵌入,从托管 API 到 Apple Silicon 的三层路线

把 Qwen3.8-Flash-Next 从「能跑起来」推到「跑得省」的三层路线。托管层零运维:QwenCloud API 兼容 OpenAI 与 Anthropic 规范,QwenWork 的 Standard 模式由它驱动。服务化自部署给四条逐字出自官方 README 的命令:transformers serve(--continuous-batching)、SGLang(--tp-size 4 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder)、vLLM(--tensor-parallel-size 4 --max-model-len 262144 --enable-auto-tool-choice)与 TokenSpeed,四者都在 localhost:8000/v1 提供 OpenAI 兼容 API。本地与端侧另有 llama.cpp 的 GGUF、Apple Silicon 的 mlx-vlm 与 Unsloth。工程上最值得记的一点是额外那 51B N-gram embeddings 可以卸载到主机内存,靠异步预取与模型计算重叠——README 未给官方显存基线,故不猜硬件门槛,标注以官方 recipe 与实测为准。含 YaRN 外推 1M 的取舍、微调框架选择(Unsloth / Swift / Llama-Factory)与 7 条踩坑,其中第一条就是:GitHub 仓库无 LICENSE 文件,商用前先去模型页核对协议。

2026年8月30日12 分钟阅读