先声明分工。站内那篇 GPT-6 Astra 旗舰横评(/zh/posts/gpt-6-astra-flagship-review)解决的是"谁更强"的问题,本文与它严格分工:只算钱,不排能力座次。谁更聪明、谁的 Agent 更稳,请看那篇;本文只回答一个问题——同样的活儿,用不同的旗舰模型干,账单差多少。所有价格与跑分均为各家官方发布口径(多数经媒体与 AI工具集 转述),本站未复测,下文逐处标注。
为什么"只算钱"也值得一篇横评?因为这一轮旗舰降价的信息密度极高:OpenAI 一口气发了 Sol 和 Luna 两个价位段,Anthropic 给 Opus 5.5 同时降了单价和缓存价,xAI 的 Grok 4.7 价格持平但输出单价最低,DeepSeek V4.1 Flash 则坚持分时定价。单看任何一个数字都会误判,必须把账面价、缓存折扣、跑分成本三个维度叠在一起看。
一、单位能力的钱:比单价更诚实的比法
裸单价是最容易骗人的数字。输入 $2 的模型如果缓存命中率高达八成,实付可能比输入 $1 但无缓存折扣的模型更便宜。所以本文的核心指标不是"每百万 token 多少钱",而是"单位能力的钱"——每一分钱买到的工作流完成度。
这个比法有两个前提必须先立住。
第一,"能力"在不同任务里含义不同。编程智能体任务、跨应用工作流、电脑操作任务,考察的是模型的不同侧面,同一个模型在不同基准上的相对位置会翻转。所以本文不把跑分压成一个总分,而是分基准、分场景地摆在价格旁边。
第二,"钱"也不只是单价。对 Agent 场景来说,实际账单 = 输入费 + 输出费 + 缓存策略带来的折扣 + 失败重试的重复支出。其中缓存折扣是这一轮发布里变动最大、也最容易被忽略的一块。
二、账面价总表:先把单价摆齐
| 模型 | 输入($/百万token) | 输出($/百万token) | 缓存读取价 | 相对上一代 |
|---|---|---|---|---|
| GPT-6 Sol | 2 | 10 | 90% 折扣(约 $0.20) | 降价 50% |
| GPT-6 Luna | 0.10 | 0.50 | 90% 折扣(约 $0.01) | 便宜 50% |
| Claude Opus 5.5 | 4 | 20 | 降 60%($0.50 降至 $0.20) | 单价降 20% |
| Grok 4.7 | 2 | 6 | 无公开折扣数据 | 持平 |
| DeepSeek V4.1 Flash | 闲时 1 元 / 高峰 2 元 | 闲时 4 元 / 高峰 8 元 | 本素材口径未给出 | — |
几个一眼能看出来的结构:
一,Opus 5.5 的输入输出恰为 Sol 的 2 倍。这个倍数关系是官方发布里直接给出的对照,不是我们算出来的。它还有个 Fast 模式,$8/$40,官方口径是 2.5 倍速,本文不展开。
二,Grok 4.7 的输出 $6 是四家美元定价里最低的输出单价。对输出 token 占大头的任务(长文生成、大段代码产出),这个数字权重很高。
三,Luna 的 $0.10/$0.50 已经不是"轻量旗舰"的价位,而是直接踏进了 DeepSeek 的腹地。官方转述口径里有一个直白对比:DeepSeek V4.1 Flash 输入闲时 1 元、高峰 2 元,输出闲时 4 元、高峰 8 元;Luna 输入约 0.7 元、输出约 3.5 元(按 $0.10≈0.7 元换算,该换算口径为 AI工具集 转述口径,人民币与美元计价体系不同,此换算仅作量级参考,不可直接横比)。 Luna 更便宜且无峰谷波动——但注意,DeepSeek 的 DeepSWE 跑分 74.2% 高于 Luna 的 66.6%,价格更低不等于跑分更高,这笔账后面细算。
四,DeepSeek 是四家半里唯一坚持分时定价的。闲时低价对能调度任务时间的批处理用户是真金白银,对实时对话用户则等于常年高峰价。
三、缓存折扣后的实际账:账面价之外的第二层
这一轮发布里,缓存定价的变化比单价变化更激进。Sol 和 Luna 的缓存输入读取享 90% 折扣,Opus 5.5 的缓存读取从 $0.50 降到 $0.20(降 60%),Grok 4.7 则没有公开的缓存折扣数据。这里单独列一张"实际账"表。
测算口径如下,全部为按官方单价折算的示例口径,不代表任何实测:假设一个 Agent 任务累计消耗 100 万输入 token,其中 80% 命中缓存(系统提示与轨迹前缀重复计费是 Agent 场景的常态),另产出 20 万输出 token。
| 模型 | 新鲜输入费 | 缓存输入费 | 输出费 | 实际合计 | 相对账面价节省 |
|---|---|---|---|---|---|
| GPT-6 Sol | $0.40 | $0.16 | $2.00 | $2.56 | 约 12% |
| GPT-6 Luna | $0.02 | $0.008 | $0.10 | $0.128 | 约 11% |
| Claude Opus 5.5 | $0.80 | $0.16 | $4.00 | $4.96 | 约 17% |
| Grok 4.7 | $0.40 | $1.60(无折扣) | $1.20 | $3.20 | 0%(无公开折扣) |
这张表暴露了三个反直觉的事实。
第一,账面输入价相同的 Sol 和 Grok 4.7(都是 $2),在高缓存命中率场景下实际输入成本差了 10 倍:Sol 的缓存部分只付 $0.16,Grok 要按全价付 $1.60。当然这个对比对 Grok 不完全公平——它没有公开缓存折扣数据,不代表没有,只是无法入账。对 Grok 公平的说法是:缓存收益未知,按保守口径估算。
第二,Opus 5.5 虽然单价是 Sol 的 2 倍,但因为缓存降价力度大($0.20 的缓存读取价与 Sol 打平),缓存部分的绝对支出两家完全一样。差距全部集中在输出端:$20 对 $10。
第三,Luna 的实际合计 $0.128,约为 Sol 的 1/20、Opus 5.5 的 1/39。如果你的任务 Luna 能干,价格上没有悬念。
还要提醒一点:上表的 80% 命中率是假设值,实际账单对命中率极其敏感。Agent 场景里缓存失效的常见原因包括系统提示被改动、两次请求间隔超过缓存有效期、多实例负载均衡打散了请求落点。命中率从八成掉到五成,Sol 的缓存输入费会从 $0.16 涨到 $0.40,账单结构随之改变。所以上线前值得用真实流量回放一遍,量出自己的实际命中率,再把这张表重算一次——同样一张价格表,命中率不同,结论可能完全不同。
还有一个不在表里、但同样值钱的工程细节:Sol 和 Luna 支持对话中途调整推理强度分档且不破坏缓存,并支持"显式断点"控制缓存前缀边界。传统做法里,改推理档位往往意味着缓存失效、前缀全价重算;中途可调档且不破坏缓存,等于把"该省的省、该花的花"从架构层面打通了。缓存策略的完整方法论,站内另有一篇 Agent 缓存成本横评(/zh/posts/agentic-cache-cost-comparison-review)展开,本文不重复。
四、把跑分放在价格旁边:能看什么,不能看什么
先立规矩:以下跑分全部是各家官方发布口径,各家用的 harness 不同,任务集不同,本站未复测。不同基准之间、不同厂商之间,都不可横比下结论。本文只做两件事:把同一基准上多家都公布了的数字并排放,把只有一家公布的位置标"未公布"。
| 模型 | DeepSWE v1.1 | Terminal-Bench 4.0 | AutomationBench | OSWorld 2.0 |
|---|---|---|---|---|
| GPT-6 Sol | 68.8%(max) | 未公布 | 33.2%(xhigh) | 60.5%(xhigh) |
| GPT-6 Luna | 66.6%(max) | 未公布 | 未公布绝对值 | 未公布绝对值 |
| Claude Opus 5.5 | 未公布 | 66.4% | 40.0% | 81.8% |
| Grok 4.7 | 71.0% | 38.0% | 未公布 | 未公布 |
这张表里有两个必须如实说的位置。
第一处,Terminal-Bench 4.0:只有 Opus 5.5(66.4%,官方口径称领先 GPT-6 Astra 8.5 个百分点)和 Grok 4.7(38.0%)公布了成绩,Sol 和 Luna 未公布。我们不做任何补位推测——没公布就是没公布,任何"估计 Sol 也能跑到 60%+"的说法都是编造。
第二处,DeepSWE v1.1:Grok 71.0% > Sol 68.8% > Luna 66.6%,最贵的 Opus 反而没公布此项,便宜的 Grok 在三方对比中最高(各家官方口径)。这个排序值得琢磨:如果按"单位能力的钱"折算,Grok 的 DeepSWE 单位分成本是最低的——$2/$6 的定价配上 71.0% 的编程基准成绩,每一分钱买到的 DeepSWE 百分点比 Sol 和 Luna 都多。但同样的逻辑到 Terminal-Bench 4.0 上就反过来了,Grok 38.0% 明显低于 Opus 5.5 的 66.4%。同一个模型,两个基准,两种故事——这正是"不同基准不同 harness 不可横比下结论"的具体含义。
Opus 5.5 官方口径里还有几个值得记录的数字:GDPval-AA v2.1 1846 Elo,OSWorld 2.0 81.8%,HLE 带工具 67.7%,FrontierCode 54.4%;官方称典型任务总成本较 Opus 5 省 40%,输出快 30% 以上。Sol 那边的官方口径:AutomationBench xhigh 33.2%,超过 Claude Opus 5 的最高表现(max 26.9%),单任务成本约为其 9%;Agents' Last Exam(55 行业)max 56.4%,成本约低 60%;DeepSWE 68.8% 仅落后 Claude Fable 5 最高 1.1 个百分点而成本约 1/5;OSWorld 2.0 60.5% 与 Opus 5 中强度相当、成本约 1/5。Luna:DeepSWE 66.6% 接近 Opus 5 中等强度而成本低 93%;AutomationBench 高强度较上一代 Luna 加 5.4 个百分点、成本降 58%。
把价格和跑分叠起来,"单位能力的钱"的格局大致是:Opus 5.5 用两倍于 Sol 的价格买到了多项基准的明显领先,它的账要按"峰值能力刚需"来算;Sol 是典型的"次旗舰甜点位",能力下放叠加五折定价加九折缓存,单位成本曲线很陡;Luna 把旗舰级能力的入门价打到了一毛钱输入;Grok 4.7 在编程基准上打出了全场最低的单位分成本,但 Terminal-Bench 上的落差提醒你它不是全能选手;DeepSeek V4.1 Flash 的 DeepSWE 74.2% 是本文出现过的最高编程基准成绩,配合分时定价,在能调度时间的批量任务里单位成本极低。
五、按场景给结论:四种预算,四笔账
结论不排座次,只按场景对号入座。
峰值能力刚需、预算充足:Opus 5.5。$4/$20 不便宜,但相比 Opus 5 已经省了 40% 的典型任务总成本,缓存读取价 $0.20 也和 Sol 打平。如果你的任务是"差一个百分点就成败",两倍价格买的是确定性。
主力工作流、要控成本:Sol。$2/$10 加九折缓存,官方口径下多项 Agent 基准用约 1/5 的成本追平或超过上一代旗舰。对大多数团队,这是"单位能力的钱"最均衡的一档。
海量轻任务、成本绝对优先:Luna。$0.10/$0.50 的定价让"每百万 token"这个单位都显得大了,九折缓存让它更适合高频重复前缀的流水线。唯一要做的功课是确认你的任务难度在它的能力圈内——它在 DeepSWE 66.6%,接近但不是 Opus 5 的中高强度水平。
输出密集型与编程智能体:Grok 4.7 值得入账。$6 的输出单价是四家最低,DeepSWE 71.0% 是三方对比最高,但要接受 Terminal-Bench 38.0% 的落差,并把缓存收益按未知处理。
可调度的批量任务:DeepSeek V4.1 Flash 的分时定价是独特优势。闲时跑批,输入 1 元、输出 4 元,按 $0.10≈0.7 元的换算口径(AI工具集 转述口径)折合约 $0.14/$0.57,比 Luna 的固定价还低——前提是你真的能把任务挪到闲时,且接受其 74.2% 的 DeepSWE 成绩对应的能力边界。
最后重复一遍边界:以上全部为各家官方发布口径,本站未复测;价格随时可能调整,下单前以各家官方定价页为准。想看"这些模型到底谁更强",回到站内 GPT-6 Astra 旗舰横评(/zh/posts/gpt-6-astra-flagship-review);想看更大盘子的成本性能对比,有 AI 大模型成本性能横评(/zh/posts/ai-llm-cost-performance-comparison-review)和 Agent 长上下文成本账(/zh/posts/agent-long-context-cost-review);Opus 5.5 的发布背景可读 Claude Opus 5 热点(/zh/posts/claude-opus-5-hotspot)。
常见问题
Q1: Sol 和 Luna 的缓存 90% 折扣是什么意思?
A1: 指缓存输入读取按原输入价的 10% 计费:Sol 缓存读取约 $0.20/百万 token,Luna 约 $0.01/百万 token。只折扣"读取",首次写入与未命中的新鲜输入仍按全价。两者还支持中途调推理档位不破坏缓存、显式断点控制缓存前缀边界。
Q2: Opus 5.5 单价是 Sol 的 2 倍,实际账单也是 2 倍吗?
A2: 不一定。按本文示例口径(80% 缓存命中),Opus 5.5 实际合计 $4.96 对 Sol 的 $2.56,约 1.9 倍;缓存部分两家打平(都是 $0.16),差距几乎全在输出端。缓存命中率越高,两者实际差距越接近 2 倍;命中率低时输入端差距会缩小。
Q3: Grok 4.7 真的没有缓存折扣吗?
A3: 准确说法是"无公开缓存折扣数据"。本文素材口径下没有它的缓存定价信息,因此实际账表里缓存部分按全价保守估算。这不代表它没有缓存机制,只是无法入账比较。
Q4: DeepSeek V4.1 Flash 的分时定价怎么和美元定价比?
A4: 直接横比不严谨。DeepSeek 输入闲时 1 元/高峰 2 元、输出闲时 4 元/高峰 8 元;按 $0.10≈0.7 元的换算(AI工具集 转述口径)折合约 $0.14/$0.57 至 $0.29/$1.14。人民币与美元计价体系不同,该换算仅作量级参考。
Q5: DeepSWE 上最便宜的 Grok 反而最高,是不是说明它性价比最好?
A5: 在 DeepSWE v1.1 这一个基准上(Grok 71.0% > Sol 68.8% > Luna 66.6%,各家官方口径),Grok 的单位分成本确实最低。但同一模型在 Terminal-Bench 4.0 上只有 38.0%,明显低于 Opus 5.5 的 66.4%。不同基准不同 harness 不可横比下结论,选型要看你的任务更接近哪个基准。