实战 SOP
实战 SOP

一行改模型名省一半钱:GPT-6 Sol/Luna 迁移 SOP

把 GPT-5.6 存量调用迁到 GPT-6 Sol/Luna 的实操 SOP:OpenAI 兼容访问下改模型名(gpt-6-sol / gpt-6-luna)大概率就能跑通,但只换名字拿不到迁移价值的另一半——须重构缓存结构(稳定前缀前置、显式断点包住不变区)才能吃满 90% 缓存折扣,并按单轮难度分配推理强度(简单步骤 low、关键步骤 high),依托中途调档不破坏缓存的官方口径实现「能省则省、该花才花」。含回归对比压测步骤、Free/Go 账号只能用 Luna 的可用性红线、以及 Luna/Sol 按任务难度划界的决策方法。步骤中的请求字段与 effort 取值以官方文档为最终口径。

发布于 2026年9月27日10 分钟阅读
<!-- gpt-6-sol-luna-api-sop | sop | 一行改模型名省一半钱:GPT-6 Sol/Luna 迁移 SOP -->

2026 年 9 月下旬,OpenAI 发布 GPT-6 系两员新将:中高端的 Sol 与轻量的 Luna。官方口径下,Sol 定价输入 2 美元、输出 10 美元每百万 token,较上一代 GPT-5.6 Sol 降价 50%;Luna 定价 0.10 美元与 0.50 美元,同样便宜 50%,且固定价、无峰谷波动。再加上三件缓存省钱套件:默认缓存命中率提升、缓存输入读取享 90% 折扣、对话中途调 effort 档位不破坏缓存,对成本敏感的 agent 链路,这是一次收益足够明确的迁移。本文只管操作:先判断该不该迁,再给迁移前清单、五步迁移、价格对照、踩坑速查与上线前检查。能力与旗舰定位的讨论见 GPT-6 Astra Agent 工作流 SOP,价格战大盘见 AI 大模型价格战热点观察;跨模型迁移的通用纪律(破坏性变更自查、回滚演练)另见 Claude Fable 5.1 API 迁移 SOP。


一、该不该迁:三类适合,两类先缓

三类适合

第一类:已在 GPT-5.6 Sol 上跑生产 agent 工作流、对单价敏感的团队。 官方口径降价 50%,同时官方跑分显示能力不降反升:AutomationBench(跨应用企业工作流)xhigh 档 33.2%,超过 Claude Opus 5 的最高表现;事实性内部评测错误数约为 GPT-5.6 Sol 的一半。降价与提质同时发生,这类团队的迁移收益最确定,属于「早晚要迁,早迁早省钱」。

第二类:缓存重度用户。 长系统提示、多轮会话、大工具集的链路最吃这套定价:默认命中率提升加缓存读取 90% 折扣,两层收益叠加。官方跑分里「单任务成本约为竞品的 9%」这类数字,背后正是靠稳定的缓存前缀结构支撑的。命中率越高,折扣吃得越足;反过来,如果你的请求前缀每次都变,降价 50% 就是全部收益,三件套与你无关。缓存算法的系统讨论见 缓存优先架构下的 agentic 成本账横评。

第三类:大吞吐轻任务用 Luna 的团队。 分类、抽取、路由、结构化输出这类高频轻任务,Luna 的 0.10 与 0.50 美元固定价把「便宜模型」的边界再往下压了一档。官方口径 Luna 继承 Astra 多模态能力,多模态轻任务也覆盖。

两类先缓

第一类:没有评测基线的团队。 降价是官方口径,但你的业务质量变化只有自己的评测集能回答。没有基线就切模型,省下的钱可能被隐性返工吃掉。先花半天建基线——固定评测集加固定判分标准——再回来走迁移流程。

第二类:核心指标压在特定基准上的团队,先看对照数据再决定。 DeepSWE v1.1(编程)上,Grok 4.7 官方口径 71.0%,高于 Sol 的 68.8%(两家各自官方口径、不同 harness,不可横比下结论);超低成本侧,DeepSeek V4.1 Flash 同项 74.2% 高于 Luna 的 66.6%。最便宜的模型反而在该项跑分最高,说明「最便宜」与「最高分」不总在同一家。极端成本敏感的编码任务,值得把 DeepSeek V4.1 Flash 一并纳入对比,接入步骤见 DeepSeek V4.1 Flash 接入 SOP。


二、迁移前清单

五件事,做完再动手:

  1. 摸清调用点。 模型名分布在哪:硬编码、配置中心还是框架默认值;走自研 SDK、官方 SDK 还是 OpenAI 兼容框架与网关。第三方网关是否已上架 gpt-6-sol 与 gpt-6-luna 要单独确认,这一步最容易漏。
  2. 建立双基线。 成本基线:抽样近期任务记录每任务 token 用量、缓存命中率、实际账单成本。质量基线:固定评测集、固定判分标准,留档作为第四步比对的参照。
  3. 盘点 effort 现状。 现有链路是否传推理强度、传了哪些档。新系列档位覆盖 low 至 xhigh/max,具体参数命名与取值以 OpenAI 官方文档为准,本文不虚构字段。
  4. 确认可用性口径。 官方口径 Free/Go 用户暂只能用 Luna,Sol 面向 Plus/Pro/Business/Enterprise/Edu。API 侧各账号档位的权益对应关系以官方文档为准,别等灰度时才发现没权限。
  5. 准备回滚预案。 模型 ID 进配置中心,回滚是改配置不是发版。

三、五步迁移

第一步:改模型名

最小改动就是把模型标识换成 gpt-6-sol 或 gpt-6-luna。接入方式保持 OpenAI 兼容,端点与鉴权不变;具体请求字段形态以 OpenAI 官方文档为准。唯一纪律:模型名只放配置中心,后续灰度、放量与回滚都靠这个开关。

第二步:最小验证

选一条非关键链路冒烟,验证六项:请求能通、输出形状对、结构化输出正常、工具调用正常、流式正常、多模态输入正常。然后把 effort 各档各打一发,确认档位被接受且不同档位的响应差异符合预期。这一步暴露的问题最便宜,拖到灰度再暴露就贵了。

第三步:缓存改造

这是本次迁移的核心工程量,三件套加一个关键特性:

  1. 重测默认命中率。 官方口径默认命中率提升,但你的命中率取决于提示结构,迁移后实测,别沿用旧模型的结论。
  2. 吃满 90% 折扣。 把稳定内容前置:系统提示、工具定义、few-shot 示例放在请求前缀,动态内容(会话历史、检索注入)放后面。缓存读取折扣按命中的前缀计算,前缀越稳定越值钱。
  3. 划对显式断点。 官方支持用显式断点控制缓存前缀边界。原则:断点之内只放完全不变的内容,断点之后才允许出现会话差异。断点划错位置——比如把带时间戳或用户状态的段落划进前缀——等于亲手打穿缓存,命中率高不了。
  4. 利用「中途调档不破坏缓存」。 这是 Sol 系列相对以往体验的关键差异:对话中途调整 effort 档位,已缓存的前缀依然命中。落地方案是按任务难度分档——路由、抽取这类简单轮次用低档,难推理用高档——同一会话中段需要更强推理时直接升档,不用为了保缓存而全程锁死一个档位。把「不敢调档怕废缓存」的旧包袱丢掉,这才是这套定价的完整用法。

第四步:回归比对

固定评测集,新旧模型同题并跑,比对四项:

  • 输出质量:官方内部评测错误数约为 GPT-5.6 Sol 的一半,但那是官方口径加内部评测,你的业务分布要自己测。
  • 工具调用序列:模型换了,同一任务的最优路径可能变化。轮次变多会吃掉降价收益,这是最容易被忽略的隐性回退。
  • token 用量与实际成本:看账单,不只看 token 数。
  • p95 延迟:与旧模型同口径对比。

第五步:灰度与观察

按请求维度从 1% 起步,逐档放量。看板盯四项指标:错误率、缓存命中率、每任务成本、p95 延迟。预先写死回滚阈值——比如成本涨幅或错误率超过设定值自动切回旧链路。灰度期新旧链路的会话历史保持隔离,不要混用。放量依据是看板数据,不是「跑通了一批 demo」。


四、价格对照表

模型输入(美元/百万 token)输出(美元/百万 token)口径
GPT-6 Sol(gpt-6-sol)210OpenAI 官方,较 GPT-5.6 Sol 降价 50%
GPT-5.6 Sol420由官方「降价 50%」口径反推,非官方直接公布,引用须注明推算
GPT-6 Luna(gpt-6-luna)0.100.50OpenAI 官方,固定价、无峰谷波动
GPT-5.6 Luna0.201.00由官方「便宜 50%」口径反推,引用须注明推算
Claude Opus 5.5420Anthropic 官方口径
Grok 4.726x.ai 官方口径(机器之心转述)

三点读法:

  1. 反推行要带口径。 表中 GPT-5.6 系两行是按官方「降价 50%」反推的,对外引用必须注明推算,别当成官方直接公布的数字传出去。
  2. 缓存折扣单独算账。 官方口径缓存输入读取享 90% 折扣,按 Sol 输入 2 美元推算,命中部分的输入成本约为一成量级(推算)。缓存命中率每提高一档,等效输入单价的降幅可能比模型本身降价 50% 还可观——先提命中率,再谈单价。
  3. Luna 与 DeepSeek 的对照要如实写。 DeepSeek 官方口径:V4.1 Flash 输入闲时 1 元、高峰 2 元,输出闲时 4 元、高峰 8 元;Luna 折合约 0.7 元与 3.5 元,更便宜且无峰谷波动。但 DeepSWE v1.1 上 DeepSeek 74.2% 高于 Luna 的 66.6%,价格更低不等于跑分更高,选型按任务定。

五、踩坑速查表

坑现象处理
Free/Go 账号不能用 Sol官方口径 Free/Go 用户暂只能用 Luna,选 Sol 时无权限或不可用升级账号档位,或该链路临时切 Luna;API 侧权益对应以官方文档为准
不敢中途调 effort,全程高档烧钱简单轮次也用高档,成本虚高中途调档不破坏缓存是官方口径的省钱关键:简单轮次低档、难任务高档,缓存照常命中
显式断点位置错误会打穿缓存命中率迁移后不升反降,账单里缓存读取占比极低断点只圈完全不变的内容;带时间戳、用户状态、随机注入的段落必须划在断点之外
拿横评跑分直接做选型结论「Sol 超了谁」被当成采购依据各家跑分出自不同 harness,不可横比下结论;Terminal-Bench 4.0 上 Sol/Luna 官方未公布,缺项如实写未公布
把反推价格当官方数字引用 GPT-5.6 Sol 4 与 20 美元不标推算一律带上「由降价 50% 反推」的口径标注
第三方兼容网关未跟上网关报模型不存在,或静默回退旧模型上线前确认网关已上架新模型 ID 且透传 effort;自建路由的把路由表更新纳入发版
迁移后没重测缓存命中率沿用旧模型结论,90% 折扣没吃到灰度看板单列缓存命中率,作为放量门槛之一

六、上线前 checklist

  • 模型 ID 已配置化,回滚不需要发版
  • 最小验证通过:结构化输出、工具调用、流式、多模态、effort 全档
  • 缓存结构改造完成:稳定前缀加显式断点,命中率实测达标
  • effort 分档策略落地:按任务难度路由档位,会话中段可升档
  • 回归比对完成:质量、工具调用序列、成本、延迟四项有新旧对照数据
  • 灰度看板就绪:错误率、缓存命中率、每任务成本、p95 延迟
  • 回滚阈值写死,且演练过一次真实回滚
  • 第三方网关与依赖方确认支持新模型 ID

参考来源

  • OpenAI 官方发布(GPT-6 Sol 与 Luna,2026 年 9 月,经媒体与 AI 工具集转述):定价与降价 50% 口径、缓存三件套(默认命中率提升、缓存读取 90% 折扣、显式断点)、effort 分档与中途调档不破坏缓存、可用性分级(Free/Go 暂只能用 Luna)、官方跑分(AutomationBench、Agents' Last Exam、DeepSWE v1.1、OSWorld 2.0、FrontierCode、事实性错误数对比)均出自本条。
  • Anthropic 官方口径(Claude Opus 5.5):4 与 20 美元定价。
  • x.ai 官方口径(Grok 4.7):定价与 DeepSWE 跑分,经机器之心转述。
  • DeepSeek 官方口径(V4.1 Flash):峰谷定价与 DeepSWE 跑分(转述)。
  • effort 参数的具体命名与取值、API 请求字段形态、各账号档位的 API 权益:以 OpenAI 官方文档为准,本文未给出。
  • 除上述条目外,本文的 GPT-5.6 系反推价格与缓存折扣等效单价为正文标注的推算值,其余实现建议属工程推断,不属于官方来源。

常见问题

Q1: 只把模型名从 GPT-5.6 换成 gpt-6-sol,其他都不动,能直接上线吗?

A1: 技术上大概率能跑通——OpenAI 兼容接入,改动就是模型标识本身。但不建议:请求字段与 effort 取值的兼容性要以 OpenAI 官方文档核实;更关键的是缓存结构与 effort 分档不做配套改造,90% 折扣与中途调档的收益一点吃不到,迁移只完成了一半。

Q2: 缓存读取 90% 折扣是自动生效的吗?要不要改代码?

A2: 官方口径为默认命中率提升、缓存读取享 90% 折扣,折扣计费本身无需特殊开关;但命中率高低完全取决于你的提示结构。要把折扣吃满,需要把稳定内容前置并用显式断点圈定前缀边界,这部分是实打实的提示工程与代码改造。

Q3: 对话中途把 effort 从低档调到高档,真的不破坏缓存吗?

A3: 官方口径明确「对话中途可调档且不破坏缓存」。这是本次迁移最值得利用的特性:按轮次难度分配档位,简单步骤低档、关键步骤高档,前缀缓存照常命中。调档的具体参数传递方式以官方文档为准。

Q4: 我们账号是 Free/Go 档位,能用 Sol 吗?

A4: 官方口径 Free/Go 用户暂只能用 Luna,Sol 面向 Plus/Pro/Business/Enterprise/Edu,API 侧对应权益以官方文档为准。如果场景是轻量高吞吐,Luna 的 0.10 与 0.50 美元固定价通常够用;确需 Sol,先解决账号档位再谈迁移。

Q5: Luna 这么便宜,能不能全量替换所有 GPT-5.6 调用?

A5: 分场景。分类、抽取、路由这类轻任务,官方跑分显示 Luna 部分指标已接近甚至超过 GPT-5.6 Sol 的中档强度,值得切。但复杂编码与推理要谨慎:DeepSWE v1.1 上 Luna 66.6%,低于 DeepSeek V4.1 Flash 的 74.2%,也低于 Sol 的 68.8%。价格更低不等于跑分更高,建议用第四步的回归比对划出 Luna 与 Sol 的任务分界线,而不是按价格一刀切。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-27

常见问题

只把模型名从 GPT-5.6 换成 `gpt-6-sol`,其他都不动,能直接上线吗?
技术上大概率能跑通——OpenAI 兼容接入,改动就是模型标识本身。但不建议:请求字段与 effort 取值的兼容性要以 OpenAI 官方文档核实;更关键的是缓存结构与 effort 分档不做配套改造,90% 折扣与中途调档的收益一点吃不到,迁移只完成了一半。
缓存读取 90% 折扣是自动生效的吗?要不要改代码?
官方口径为默认命中率提升、缓存读取享 90% 折扣,折扣计费本身无需特殊开关;但命中率高低完全取决于你的提示结构。要把折扣吃满,需要把稳定内容前置并用显式断点圈定前缀边界,这部分是实打实的提示工程与代码改造。
对话中途把 effort 从低档调到高档,真的不破坏缓存吗?
官方口径明确「对话中途可调档且不破坏缓存」。这是本次迁移最值得利用的特性:按轮次难度分配档位,简单步骤低档、关键步骤高档,前缀缓存照常命中。调档的具体参数传递方式以官方文档为准。
我们账号是 Free/Go 档位,能用 Sol 吗?
官方口径 Free/Go 用户暂只能用 Luna,Sol 面向 Plus/Pro/Business/Enterprise/Edu,API 侧对应权益以官方文档为准。如果场景是轻量高吞吐,Luna 的 0.10 与 0.50 美元固定价通常够用;确需 Sol,先解决账号档位再谈迁移。
Luna 这么便宜,能不能全量替换所有 GPT-5.6 调用?
分场景。分类、抽取、路由这类轻任务,官方跑分显示 Luna 部分指标已接近甚至超过 GPT-5.6 Sol 的中档强度,值得切。但复杂编码与推理要谨慎:DeepSWE v1.1 上 Luna 66.6%,低于 DeepSeek V4.1 Flash 的 74.2%,也低于 Sol 的 68.8%。价格更低不等于跑分更高,建议用第四步的回归比对划出 Luna 与 Sol 的任务分界线,而不是按价格一刀切。

相关文章

实战 SOP

Qwen3.8-Omni-Flash API 实战 SOP:三大多模态场景

Qwen3.8-Omni-Flash API 实操 SOP:从开通阿里云百炼与申请 DashScope API Key(北京与国际端点 Key 不互通)、openai SDK 兼容调用环境准备,到三大场景逐步跑通——一小时会议音视频转纪要与待办、Video2Note 长视频转带时间戳图文笔记、可控 Caption 按需提问(指定对象/时间范围/粒度/格式的 prompt 模板),再给成本控制(全模态同价 0.8 元/百万输入、Agentic 取证省约 45.7% token、分段与按需提问策略)与踩坑速查(媒体只放 user 消息、SDK 版本下限、时长与文件限制以控制台为准)。含 5 个示例代码块,未验证细节均标注以官方文档为准。

2026年9月19日8 分钟阅读
实战 SOP

Qoder 双福利领取与用量管理实操 SOP

Qoder 双福利领取与用量管理实操 SOP:从下载安装(国际版 qoder.com / 国内版 qoder.cn,桌面端、移动端、IDE、JetBrains 插件、CLI 五种形态)、注册登录(两版账号与额度互不互通)、确认限免生效(模型选择器选中 Qwen3.8-Flash 即按 0 倍系数计费,无需领取),到每日 100 Credits 领取节奏(每天 10:00 开放、每轮一次、错过不补、每笔 30 天有效可叠加)、用量管理(先用量面板查消耗、Qwen3.8-Flash 打底把 Credits 留给难任务)、扣减规则(优先消耗最早到期额度、同日到期先套餐内后资源包),最后给 9 月 30 日窗口期结束前的收尾规划。UI 细节以客户端实际界面为准。

2026年9月18日8 分钟阅读
实战 SOP

LLaDA-Image 本地部署 SOP:五步跑通 6B 生图模型

把蚂蚁开源 6B 生图模型 LLaDA-Image 跑起来的五步 SOP:①环境准备(依赖与国内镜像加速下载);②四档权重怎么选(Base 50 步 / Turbo 4 步 × BF16 / FP8,国内走 ModelScope);③跑通第一张图(Base 与 Turbo 最小可用命令);④进阶(参考图编辑、文字渲染、ComfyUI 接入、显存不足时的降级策略);⑤生产化(批量队列、并发容量规划、成本监控、结果入库与故障降级)。含 6 条踩坑与 10 项上线自检清单,命令逐字取自官方 README;仓库 license 为 null,商用前须确权。

2026年9月9日11 分钟阅读