2026 年 9 月下旬,OpenAI 发布 GPT-6 系两员新将:中高端的 Sol 与轻量的 Luna。官方口径下,Sol 定价输入 2 美元、输出 10 美元每百万 token,较上一代 GPT-5.6 Sol 降价 50%;Luna 定价 0.10 美元与 0.50 美元,同样便宜 50%,且固定价、无峰谷波动。再加上三件缓存省钱套件:默认缓存命中率提升、缓存输入读取享 90% 折扣、对话中途调 effort 档位不破坏缓存,对成本敏感的 agent 链路,这是一次收益足够明确的迁移。本文只管操作:先判断该不该迁,再给迁移前清单、五步迁移、价格对照、踩坑速查与上线前检查。能力与旗舰定位的讨论见 GPT-6 Astra Agent 工作流 SOP,价格战大盘见 AI 大模型价格战热点观察;跨模型迁移的通用纪律(破坏性变更自查、回滚演练)另见 Claude Fable 5.1 API 迁移 SOP。
一、该不该迁:三类适合,两类先缓
三类适合
第一类:已在 GPT-5.6 Sol 上跑生产 agent 工作流、对单价敏感的团队。 官方口径降价 50%,同时官方跑分显示能力不降反升:AutomationBench(跨应用企业工作流)xhigh 档 33.2%,超过 Claude Opus 5 的最高表现;事实性内部评测错误数约为 GPT-5.6 Sol 的一半。降价与提质同时发生,这类团队的迁移收益最确定,属于「早晚要迁,早迁早省钱」。
第二类:缓存重度用户。 长系统提示、多轮会话、大工具集的链路最吃这套定价:默认命中率提升加缓存读取 90% 折扣,两层收益叠加。官方跑分里「单任务成本约为竞品的 9%」这类数字,背后正是靠稳定的缓存前缀结构支撑的。命中率越高,折扣吃得越足;反过来,如果你的请求前缀每次都变,降价 50% 就是全部收益,三件套与你无关。缓存算法的系统讨论见 缓存优先架构下的 agentic 成本账横评。
第三类:大吞吐轻任务用 Luna 的团队。 分类、抽取、路由、结构化输出这类高频轻任务,Luna 的 0.10 与 0.50 美元固定价把「便宜模型」的边界再往下压了一档。官方口径 Luna 继承 Astra 多模态能力,多模态轻任务也覆盖。
两类先缓
第一类:没有评测基线的团队。 降价是官方口径,但你的业务质量变化只有自己的评测集能回答。没有基线就切模型,省下的钱可能被隐性返工吃掉。先花半天建基线——固定评测集加固定判分标准——再回来走迁移流程。
第二类:核心指标压在特定基准上的团队,先看对照数据再决定。 DeepSWE v1.1(编程)上,Grok 4.7 官方口径 71.0%,高于 Sol 的 68.8%(两家各自官方口径、不同 harness,不可横比下结论);超低成本侧,DeepSeek V4.1 Flash 同项 74.2% 高于 Luna 的 66.6%。最便宜的模型反而在该项跑分最高,说明「最便宜」与「最高分」不总在同一家。极端成本敏感的编码任务,值得把 DeepSeek V4.1 Flash 一并纳入对比,接入步骤见 DeepSeek V4.1 Flash 接入 SOP。
二、迁移前清单
五件事,做完再动手:
- 摸清调用点。 模型名分布在哪:硬编码、配置中心还是框架默认值;走自研 SDK、官方 SDK 还是 OpenAI 兼容框架与网关。第三方网关是否已上架
gpt-6-sol与gpt-6-luna要单独确认,这一步最容易漏。 - 建立双基线。 成本基线:抽样近期任务记录每任务 token 用量、缓存命中率、实际账单成本。质量基线:固定评测集、固定判分标准,留档作为第四步比对的参照。
- 盘点 effort 现状。 现有链路是否传推理强度、传了哪些档。新系列档位覆盖 low 至 xhigh/max,具体参数命名与取值以 OpenAI 官方文档为准,本文不虚构字段。
- 确认可用性口径。 官方口径 Free/Go 用户暂只能用 Luna,Sol 面向 Plus/Pro/Business/Enterprise/Edu。API 侧各账号档位的权益对应关系以官方文档为准,别等灰度时才发现没权限。
- 准备回滚预案。 模型 ID 进配置中心,回滚是改配置不是发版。
三、五步迁移
第一步:改模型名
最小改动就是把模型标识换成 gpt-6-sol 或 gpt-6-luna。接入方式保持 OpenAI 兼容,端点与鉴权不变;具体请求字段形态以 OpenAI 官方文档为准。唯一纪律:模型名只放配置中心,后续灰度、放量与回滚都靠这个开关。
第二步:最小验证
选一条非关键链路冒烟,验证六项:请求能通、输出形状对、结构化输出正常、工具调用正常、流式正常、多模态输入正常。然后把 effort 各档各打一发,确认档位被接受且不同档位的响应差异符合预期。这一步暴露的问题最便宜,拖到灰度再暴露就贵了。
第三步:缓存改造
这是本次迁移的核心工程量,三件套加一个关键特性:
- 重测默认命中率。 官方口径默认命中率提升,但你的命中率取决于提示结构,迁移后实测,别沿用旧模型的结论。
- 吃满 90% 折扣。 把稳定内容前置:系统提示、工具定义、few-shot 示例放在请求前缀,动态内容(会话历史、检索注入)放后面。缓存读取折扣按命中的前缀计算,前缀越稳定越值钱。
- 划对显式断点。 官方支持用显式断点控制缓存前缀边界。原则:断点之内只放完全不变的内容,断点之后才允许出现会话差异。断点划错位置——比如把带时间戳或用户状态的段落划进前缀——等于亲手打穿缓存,命中率高不了。
- 利用「中途调档不破坏缓存」。 这是 Sol 系列相对以往体验的关键差异:对话中途调整 effort 档位,已缓存的前缀依然命中。落地方案是按任务难度分档——路由、抽取这类简单轮次用低档,难推理用高档——同一会话中段需要更强推理时直接升档,不用为了保缓存而全程锁死一个档位。把「不敢调档怕废缓存」的旧包袱丢掉,这才是这套定价的完整用法。
第四步:回归比对
固定评测集,新旧模型同题并跑,比对四项:
- 输出质量:官方内部评测错误数约为 GPT-5.6 Sol 的一半,但那是官方口径加内部评测,你的业务分布要自己测。
- 工具调用序列:模型换了,同一任务的最优路径可能变化。轮次变多会吃掉降价收益,这是最容易被忽略的隐性回退。
- token 用量与实际成本:看账单,不只看 token 数。
- p95 延迟:与旧模型同口径对比。
第五步:灰度与观察
按请求维度从 1% 起步,逐档放量。看板盯四项指标:错误率、缓存命中率、每任务成本、p95 延迟。预先写死回滚阈值——比如成本涨幅或错误率超过设定值自动切回旧链路。灰度期新旧链路的会话历史保持隔离,不要混用。放量依据是看板数据,不是「跑通了一批 demo」。
四、价格对照表
| 模型 | 输入(美元/百万 token) | 输出(美元/百万 token) | 口径 |
|---|---|---|---|
GPT-6 Sol(gpt-6-sol) | 2 | 10 | OpenAI 官方,较 GPT-5.6 Sol 降价 50% |
| GPT-5.6 Sol | 4 | 20 | 由官方「降价 50%」口径反推,非官方直接公布,引用须注明推算 |
GPT-6 Luna(gpt-6-luna) | 0.10 | 0.50 | OpenAI 官方,固定价、无峰谷波动 |
| GPT-5.6 Luna | 0.20 | 1.00 | 由官方「便宜 50%」口径反推,引用须注明推算 |
| Claude Opus 5.5 | 4 | 20 | Anthropic 官方口径 |
| Grok 4.7 | 2 | 6 | x.ai 官方口径(机器之心转述) |
三点读法:
- 反推行要带口径。 表中 GPT-5.6 系两行是按官方「降价 50%」反推的,对外引用必须注明推算,别当成官方直接公布的数字传出去。
- 缓存折扣单独算账。 官方口径缓存输入读取享 90% 折扣,按 Sol 输入 2 美元推算,命中部分的输入成本约为一成量级(推算)。缓存命中率每提高一档,等效输入单价的降幅可能比模型本身降价 50% 还可观——先提命中率,再谈单价。
- Luna 与 DeepSeek 的对照要如实写。 DeepSeek 官方口径:V4.1 Flash 输入闲时 1 元、高峰 2 元,输出闲时 4 元、高峰 8 元;Luna 折合约 0.7 元与 3.5 元,更便宜且无峰谷波动。但 DeepSWE v1.1 上 DeepSeek 74.2% 高于 Luna 的 66.6%,价格更低不等于跑分更高,选型按任务定。
五、踩坑速查表
| 坑 | 现象 | 处理 |
|---|---|---|
| Free/Go 账号不能用 Sol | 官方口径 Free/Go 用户暂只能用 Luna,选 Sol 时无权限或不可用 | 升级账号档位,或该链路临时切 Luna;API 侧权益对应以官方文档为准 |
| 不敢中途调 effort,全程高档烧钱 | 简单轮次也用高档,成本虚高 | 中途调档不破坏缓存是官方口径的省钱关键:简单轮次低档、难任务高档,缓存照常命中 |
| 显式断点位置错误会打穿缓存 | 命中率迁移后不升反降,账单里缓存读取占比极低 | 断点只圈完全不变的内容;带时间戳、用户状态、随机注入的段落必须划在断点之外 |
| 拿横评跑分直接做选型结论 | 「Sol 超了谁」被当成采购依据 | 各家跑分出自不同 harness,不可横比下结论;Terminal-Bench 4.0 上 Sol/Luna 官方未公布,缺项如实写未公布 |
| 把反推价格当官方数字 | 引用 GPT-5.6 Sol 4 与 20 美元不标推算 | 一律带上「由降价 50% 反推」的口径标注 |
| 第三方兼容网关未跟上 | 网关报模型不存在,或静默回退旧模型 | 上线前确认网关已上架新模型 ID 且透传 effort;自建路由的把路由表更新纳入发版 |
| 迁移后没重测缓存命中率 | 沿用旧模型结论,90% 折扣没吃到 | 灰度看板单列缓存命中率,作为放量门槛之一 |
六、上线前 checklist
- 模型 ID 已配置化,回滚不需要发版
- 最小验证通过:结构化输出、工具调用、流式、多模态、effort 全档
- 缓存结构改造完成:稳定前缀加显式断点,命中率实测达标
- effort 分档策略落地:按任务难度路由档位,会话中段可升档
- 回归比对完成:质量、工具调用序列、成本、延迟四项有新旧对照数据
- 灰度看板就绪:错误率、缓存命中率、每任务成本、p95 延迟
- 回滚阈值写死,且演练过一次真实回滚
- 第三方网关与依赖方确认支持新模型 ID
参考来源
- OpenAI 官方发布(GPT-6 Sol 与 Luna,2026 年 9 月,经媒体与 AI 工具集转述):定价与降价 50% 口径、缓存三件套(默认命中率提升、缓存读取 90% 折扣、显式断点)、effort 分档与中途调档不破坏缓存、可用性分级(Free/Go 暂只能用 Luna)、官方跑分(AutomationBench、Agents' Last Exam、DeepSWE v1.1、OSWorld 2.0、FrontierCode、事实性错误数对比)均出自本条。
- Anthropic 官方口径(Claude Opus 5.5):4 与 20 美元定价。
- x.ai 官方口径(Grok 4.7):定价与 DeepSWE 跑分,经机器之心转述。
- DeepSeek 官方口径(V4.1 Flash):峰谷定价与 DeepSWE 跑分(转述)。
- effort 参数的具体命名与取值、API 请求字段形态、各账号档位的 API 权益:以 OpenAI 官方文档为准,本文未给出。
- 除上述条目外,本文的 GPT-5.6 系反推价格与缓存折扣等效单价为正文标注的推算值,其余实现建议属工程推断,不属于官方来源。
常见问题
Q1: 只把模型名从 GPT-5.6 换成 gpt-6-sol,其他都不动,能直接上线吗?
A1: 技术上大概率能跑通——OpenAI 兼容接入,改动就是模型标识本身。但不建议:请求字段与 effort 取值的兼容性要以 OpenAI 官方文档核实;更关键的是缓存结构与 effort 分档不做配套改造,90% 折扣与中途调档的收益一点吃不到,迁移只完成了一半。
Q2: 缓存读取 90% 折扣是自动生效的吗?要不要改代码?
A2: 官方口径为默认命中率提升、缓存读取享 90% 折扣,折扣计费本身无需特殊开关;但命中率高低完全取决于你的提示结构。要把折扣吃满,需要把稳定内容前置并用显式断点圈定前缀边界,这部分是实打实的提示工程与代码改造。
Q3: 对话中途把 effort 从低档调到高档,真的不破坏缓存吗?
A3: 官方口径明确「对话中途可调档且不破坏缓存」。这是本次迁移最值得利用的特性:按轮次难度分配档位,简单步骤低档、关键步骤高档,前缀缓存照常命中。调档的具体参数传递方式以官方文档为准。
Q4: 我们账号是 Free/Go 档位,能用 Sol 吗?
A4: 官方口径 Free/Go 用户暂只能用 Luna,Sol 面向 Plus/Pro/Business/Enterprise/Edu,API 侧对应权益以官方文档为准。如果场景是轻量高吞吐,Luna 的 0.10 与 0.50 美元固定价通常够用;确需 Sol,先解决账号档位再谈迁移。
Q5: Luna 这么便宜,能不能全量替换所有 GPT-5.6 调用?
A5: 分场景。分类、抽取、路由这类轻任务,官方跑分显示 Luna 部分指标已接近甚至超过 GPT-5.6 Sol 的中档强度,值得切。但复杂编码与推理要谨慎:DeepSWE v1.1 上 Luna 66.6%,低于 DeepSeek V4.1 Flash 的 74.2%,也低于 Sol 的 68.8%。价格更低不等于跑分更高,建议用第四步的回归比对划出 Luna 与 Sol 的任务分界线,而不是按价格一刀切。