一、双子星降临:一张价目表的冲击波
2026 年 9 月 23 日前后,OpenAI 在官网低调上线了两款新模型:GPT-6 Sol 与 GPT-6 Luna(OpenAI 官方口径,经 AI工具集、量子位等媒体转述)。与此前 GPT-6 Astra 旗舰发布时的群星预热不同,这一次没有铺天盖地的宣传造势,只有一张足以让全行业重新算账的价目表:Sol 输入 2 美元、输出 10 美元每百万 token,较上一代 GPT-5.6 Sol 直降 50%;Luna 输入 0.1 美元、输出 0.5 美元每百万 token,同样比上一代便宜一半。
先看清两个名字。Sol(太阳)与 Luna(月亮)延续了 OpenAI 以天体命名的传统,Astra 是星辰,双子星一个主昼、一个主夜。定位上,Sol 是 GPT-6 Astra 底座的能力下放版本,官方说法是蒸馏,主打「单位智能成本」;Luna 则是轻量档,继承 Astra 的多模态能力,面向高频调用、大规模部署、对单价极其敏感的场景。模型名分别为 gpt-6-sol 与 gpt-6-luna,入口覆盖 ChatGPT Work、Codex 与 API。参数量官方未公布。
可用性安排也耐人寻味:Sol 面向 Plus、Pro、Business、Enterprise、Edu 订阅用户开放,Free 与 Go 用户暂时只能使用 Luna。换句话说,免费用户拿到的是降价幅度最大的那一款,付费能力更强的人群则被引导进入 Sol 的生态。
还有一点容易被忽略:这次发布几乎没有讲故事,全部信息量都压在价格与成本结构上。模型行业过去习惯用发布会定义「下一代应该是什么样」,而当头部玩家开始用价目表代替叙事,往往说明市场进入了一个新阶段,能力叙事越来越难拉开差距,成本叙事开始接管用户的决策权重。对于关注前沿技术的从业者而言,这次发布的主角不是某个极限跑分,而是一个更朴素的问题:当旗舰能力被下放、价格被腰斩,模型市场的竞争逻辑正在发生什么变化。此前我们在 GPT-6 Astra 发布报道中分析过「能力上限」层面的竞争,这一篇要谈的是它的另一面,「单位成本」层面的竞争。
二、价格腰斩的账本
先把账算清楚。按 OpenAI 官方口径(经 AI工具集、量子位等媒体转述),GPT-6 Sol 的 API 定价为每百万输入 token 2 美元、每百万输出 token 10 美元,对比上一代 GPT-5.6 Sol 的 4 美元与 20 美元,整整砍掉一半。GPT-6 Luna 定价每百万输入 token 0.1 美元、输出 0.5 美元,同样较上代下降 50%,并且是固定价,没有峰谷时段的波动。
对照同日前后发布的其他产品,这次降价的锋利程度更加直观(各家均为其官方口径)。Anthropic 的 Claude Opus 5.5 定价输入 4 美元、输出 20 美元,恰好是 Sol 的两倍;尽管它同样降价 20%、缓存读取降 60%(从 0.5 美元降至 0.2 美元)、典型任务总成本较 Opus 5 节省约 40%,但绝对价位仍高出一截,Opus 5 的发布情况可参见我们的 Claude Opus 5 报道。xAI 的 Grok 4.7 维持输入 2 美元、输出 6 美元,与前代持平。把价目表摆在一起:
| 模型 | 输入(每百万 token) | 输出(每百万 token) | 相对上一代 |
|---|---|---|---|
| GPT-6 Sol | 2 美元 | 10 美元 | 降价 50% |
| GPT-6 Luna | 0.1 美元 | 0.5 美元 | 降价 50%,固定价 |
| Claude Opus 5.5 | 4 美元 | 20 美元 | 降价 20%,缓存读取降 60% |
| Grok 4.7 | 2 美元 | 6 美元 | 持平 |
从这张表能读出两层意图。第一层,Sol 用不到 Opus 5.5 一半的输出单价去抢中高端企业工作流市场,配合缓存与推理强度调节,把「按效果付费」进一步推向「按效率付费」。第二层,Luna 的 0.1 美元输入价不再只是「比上代便宜」,而是直接把战火从旗舰之间烧到了轻量档与国产模型的主场。如果对大模型价格战的整体脉络感兴趣,可以参考我们此前的 AI 大模型价格战专题:每一次降价,都重新划定了「够用且便宜」的边界。
三、跑分真相:便宜不等于全面领先
降价叙事最容易被扭曲成「又强又便宜」,但逐项核对官方口径,图景要复杂得多。OpenAI 官方口径(经 AI工具集、量子位等媒体转述)给出的成绩单如下。
GPT-6 Sol 方面:AutomationBench(跨应用企业工作流)xhigh 档 33.2%,高于 Claude Opus 5 的最高表现 26.9%,单任务成本约为其 9%;Agents' Last Exam(覆盖 55 个行业)max 档 56.4%,超过 Opus 5 最高表现,成本低约 60%;DeepSWE v1.1(编程)max 档 68.8%,仅落后 Claude Fable 5 最高成绩 1.1 个百分点,成本约为其五分之一;OSWorld 2.0(电脑操作,离线)xhigh 档 60.5%,与 Opus 5 中等强度相当,成本约下降 80%;FrontierCode 上以更低成本追平 Claude Fable 5.1 的 xhigh 表现。事实性方面,内部评测错误数约为 GPT-5.6 Sol 的一半。
GPT-6 Luna 方面:DeepSWE v1.1 max 档 66.6%,接近 Opus 5 中等强度而成本低 93%;OSWorld 2.0 超过 GPT-5.6 Sol 的 medium 档,成本仅约十分之一;AutomationBench 高强度档较 GPT-5.6 Luna 提升 5.4 个百分点、成本下降 58%;事实性方面以约 1% 的成本达到 GPT-5.6 Sol 的水平。
但有两处必须如实说清。先说一个前提:本节所有成绩均为各家官方发布口径,测试框架与评分设置并不相同,任何跨厂商的横向对比都只能作为线索,不能直接得出谁更强的结论。在这个前提下,仍有两处值得特别指出。其一,在 DeepSWE v1.1 上,xAI 官方口径(经机器之心转述)的 Grok 4.7 以 71.0% 高于 Sol 的 68.8% 与 Luna 的 66.6%——在这项编程基准上,定价更低的 Grok 反而成绩最高。至少可以说明,「Luna 编程能力登顶」的说法不成立。其二,也是更重要的一处:DeepSeek V4.1 Flash 的 DeepSWE 成绩为 74.2%,高于 Luna 的 66.6%。Luna 赢的是价格与固定定价,而不是跑分。任何「Luna 能力全面碾压国产模型」的说法,都与官方披露的数字不符。
另外还有一个空白项:参数量与 Terminal-Bench 4.0 成绩,官方均未公布。同一组横评里,Opus 5.5 的 Terminal-Bench 4.0 为 66.4%(Anthropic 官方口径),Grok 4.7 为 38.0%(xAI 官方口径,经机器之心转述),而 Sol 与 Luna 一栏只能写「未公布」。这个空白本身就是信号:OpenAI 这一次的叙事重心根本不在极限能力,而在性价比。如果企业正考虑从其他模型迁移换算成本,思路可以参考我们的 Claude Fable 5.1 API 迁移指南:先算账,再动手。
四、腰斩 50% 的底气:缓存与蒸馏的基础设施故事
价格砍半,靠什么撑住毛利与口碑?官方披露的信息指向两件事:缓存与蒸馏下放。这才是这次发布真正值得从业者琢磨的部分——降价的来源是推理基础设施效率,而不是砍掉模型能力。
先看缓存。Sol 与 Luna 共享同一套缓存机制:默认缓存命中率提升,缓存输入读取享受 90% 折扣,并且支持「显式断点」来控制缓存前缀的边界。对智能体工作流来说,这是实打实的成本杠杆:长系统提示词、知识库文档、多轮对话历史在每次请求中反复进入输入端,命中缓存的部分只需原价的十分之一,累积下来足以大幅摊薄账单。所谓显式断点,就是把「哪些内容属于稳定前缀、哪些属于每次变化的部分」交给开发者自己声明,例如把固定的系统指令与知识库内容划进缓存区,把动态插入的用户数据排除在外。前缀边界控制得越精细,命中率就越高,折扣也就吃得越满。我们在此前的智能体缓存成本对比中专门分析过缓存策略对账单的影响,这里的 90% 折扣属于力度最大的一档。
再看推理强度调档。Sol 支持从 low 到 xhigh、max 的推理强度分级,并且允许在对话中途调档而不破坏缓存。这个细节的价值容易被低估:过去在不同强度之间切换,往往意味着前缀失效、缓存重算,等于变相涨价;现在可以把简单问题停在低档省钱,遇到难题中途升档,已经建立起来的缓存前缀继续有效。效率与灵活性第一次不必二选一。
然后是蒸馏下放。Sol 的定位是 Astra 底座的能力下放版,也就是把旗舰模型的能力用蒸馏的方式装进更小、更便宜的模型。这在商业上意味着 OpenAI 不必为 Sol 单独训练一套顶级模型,而是复用 Astra 的能力资产,以同源分层的方式覆盖不同价位。腰斩的 50%,一部分来自缓存命中摊薄的真实推理成本,一部分来自蒸馏让单位能力的训练与推理成本下降。换句话说,这不是「阉割版换低价」,而是「效率提升传导为定价下移」。这也是为什么官方敢同时强调:Sol 在编码欺骗、绕过审查等对齐指标上优于 GPT-5.6 系列(OpenAI 官方口径)——便宜与安全退步,并不是绑定关系。
五、0.1 美元穿过国境线:国产价格锚点被摸进腹地
Luna 最具杀伤力的不是跑分,而是价格落点。按 DeepSeek 官方口径(经媒体转述),DeepSeek V4.1 Flash 的 API 价格为输入闲时每百万 token 1 元、高峰 2 元,输出闲时 4 元、高峰 8 元;而 Luna 折算后输入约 0.7 元、输出约 3.5 元(OpenAI 官方口径转述),不仅更便宜,而且没有峰谷波动,全天固定价。
这个对比的象征意义大于数字本身。过去两年,国产模型尤其是 DeepSeek 系列长期扮演「价格锚点」的角色:每当海外模型提价或固守高位,DeepSeek 就用足够低的定价提醒市场,智能可以很便宜,相关分析见我们的 DeepSeek V4.1 Flash 开源报道。而 Luna 这次等于反向操作:把闭源 API 的价格压到 DeepSeek 的腹地,甚至更低。价格锚点第一次由海外闭源模型出面重新定义。
但这里必须保持克制。价格更低不等于综合更优:DeepSWE v1.1 上 DeepSeek V4.1 Flash 的 74.2% 高于 Luna 的 66.6%(两家官方口径、测试框架不同,仅作参考);DeepSeek 还有开源权重、可私有化部署的护城河,这是闭源 API 无法替代的。对数据敏感、必须把模型放进自己机房的企业来说,闭源 API 再便宜也进不了采购清单;而 Luna 的真实威胁在于「无峰谷固定价」叠加 OpenAI 的企业信任背书:对大量只求稳定、便宜、开箱即用的长尾应用来说,切换成本第一次低到几乎没有理由犹豫。锚点之争的下一步,取决于国产模型能否在保持开源优势的同时跟进价格与稳定性,以及缓存与调档这类基础设施层面的效率竞争,会不会成为新的比拼维度。
六、结语:价格战的下一次回合
把这次发布压缩成一句话:OpenAI 用双子星证明,降价 50% 的故事可以不靠牺牲能力,而靠缓存、蒸馏与分层定价的基础设施效率。Sol 以一半价格接近旗舰的实用表现,Luna 以 0.1 美元的输入价摸进 DeepSeek 的腹地,尽管后者在 DeepSWE 上仍落后 7.6 个百分点,胜负要在价格与能力的天平上分别称量。
对开发者的建议是朴素的:先梳理自己业务的 token 结构,再估算缓存命中率能省多少,最后决定谁更适合。对行业观察者而言,值得追踪的是 Opus 5.5 与价格持平的 Grok 4.7 将如何回应,以及这轮降价会不会触发国产模型的又一轮跟进。价格战没有终局,只有回合;而下一回合的看点,大概率在效率,而不在榜单。