硬核横评
硬核横评

旗舰价格账横评:Sol 两块、Luna 一毛、Opus 四块

四家旗舰只算钱不比智商:GPT-6 Sol($2/$10,缓存读取 90% 折扣)、GPT-6 Luna($0.10/$0.50)、Claude Opus 5.5($4/$20,恰为 Sol 两倍、缓存 $0.20 打平 Sol)、Grok 4.7($2/$6,缓存折扣未公布)、DeepSeek V4.1 Flash(峰谷计时定价)。按 80% 缓存命中率算实际账单:Opus 纸面 2 倍、实际约 1.9 倍且差距全在输出侧;Grok 输出价最低但缓存省钱无法入账。跑分对价格:DeepSWE 上 Grok 71.0% 每分成本最低,Terminal-Bench 4.0 却只有 38.0%——一个模型两个故事。三条红线:货币不可直接横比、未公布项不编、各家 harness 不可横比下结论。

发布于 2026年9月27日10 分钟阅读
<!-- flagship-price-comparison-review | review | 旗舰价格账横评:Sol 两块、Luna 一毛、Opus 四块 -->

先声明分工。站内那篇 GPT-6 Astra 旗舰横评(/zh/posts/gpt-6-astra-flagship-review)解决的是"谁更强"的问题,本文与它严格分工:只算钱,不排能力座次。谁更聪明、谁的 Agent 更稳,请看那篇;本文只回答一个问题——同样的活儿,用不同的旗舰模型干,账单差多少。所有价格与跑分均为各家官方发布口径(多数经媒体与 AI工具集 转述),本站未复测,下文逐处标注。

为什么"只算钱"也值得一篇横评?因为这一轮旗舰降价的信息密度极高:OpenAI 一口气发了 Sol 和 Luna 两个价位段,Anthropic 给 Opus 5.5 同时降了单价和缓存价,xAI 的 Grok 4.7 价格持平但输出单价最低,DeepSeek V4.1 Flash 则坚持分时定价。单看任何一个数字都会误判,必须把账面价、缓存折扣、跑分成本三个维度叠在一起看。

一、单位能力的钱:比单价更诚实的比法

裸单价是最容易骗人的数字。输入 $2 的模型如果缓存命中率高达八成,实付可能比输入 $1 但无缓存折扣的模型更便宜。所以本文的核心指标不是"每百万 token 多少钱",而是"单位能力的钱"——每一分钱买到的工作流完成度。

这个比法有两个前提必须先立住。

第一,"能力"在不同任务里含义不同。编程智能体任务、跨应用工作流、电脑操作任务,考察的是模型的不同侧面,同一个模型在不同基准上的相对位置会翻转。所以本文不把跑分压成一个总分,而是分基准、分场景地摆在价格旁边。

第二,"钱"也不只是单价。对 Agent 场景来说,实际账单 = 输入费 + 输出费 + 缓存策略带来的折扣 + 失败重试的重复支出。其中缓存折扣是这一轮发布里变动最大、也最容易被忽略的一块。

二、账面价总表:先把单价摆齐

模型输入($/百万token)输出($/百万token)缓存读取价相对上一代
GPT-6 Sol21090% 折扣(约 $0.20)降价 50%
GPT-6 Luna0.100.5090% 折扣(约 $0.01)便宜 50%
Claude Opus 5.5420降 60%($0.50 降至 $0.20)单价降 20%
Grok 4.726无公开折扣数据持平
DeepSeek V4.1 Flash闲时 1 元 / 高峰 2 元闲时 4 元 / 高峰 8 元本素材口径未给出—

几个一眼能看出来的结构:

一,Opus 5.5 的输入输出恰为 Sol 的 2 倍。这个倍数关系是官方发布里直接给出的对照,不是我们算出来的。它还有个 Fast 模式,$8/$40,官方口径是 2.5 倍速,本文不展开。

二,Grok 4.7 的输出 $6 是四家美元定价里最低的输出单价。对输出 token 占大头的任务(长文生成、大段代码产出),这个数字权重很高。

三,Luna 的 $0.10/$0.50 已经不是"轻量旗舰"的价位,而是直接踏进了 DeepSeek 的腹地。官方转述口径里有一个直白对比:DeepSeek V4.1 Flash 输入闲时 1 元、高峰 2 元,输出闲时 4 元、高峰 8 元;Luna 输入约 0.7 元、输出约 3.5 元(按 $0.10≈0.7 元换算,该换算口径为 AI工具集 转述口径,人民币与美元计价体系不同,此换算仅作量级参考,不可直接横比)。 Luna 更便宜且无峰谷波动——但注意,DeepSeek 的 DeepSWE 跑分 74.2% 高于 Luna 的 66.6%,价格更低不等于跑分更高,这笔账后面细算。

四,DeepSeek 是四家半里唯一坚持分时定价的。闲时低价对能调度任务时间的批处理用户是真金白银,对实时对话用户则等于常年高峰价。

三、缓存折扣后的实际账:账面价之外的第二层

这一轮发布里,缓存定价的变化比单价变化更激进。Sol 和 Luna 的缓存输入读取享 90% 折扣,Opus 5.5 的缓存读取从 $0.50 降到 $0.20(降 60%),Grok 4.7 则没有公开的缓存折扣数据。这里单独列一张"实际账"表。

测算口径如下,全部为按官方单价折算的示例口径,不代表任何实测:假设一个 Agent 任务累计消耗 100 万输入 token,其中 80% 命中缓存(系统提示与轨迹前缀重复计费是 Agent 场景的常态),另产出 20 万输出 token。

模型新鲜输入费缓存输入费输出费实际合计相对账面价节省
GPT-6 Sol$0.40$0.16$2.00$2.56约 12%
GPT-6 Luna$0.02$0.008$0.10$0.128约 11%
Claude Opus 5.5$0.80$0.16$4.00$4.96约 17%
Grok 4.7$0.40$1.60(无折扣)$1.20$3.200%(无公开折扣)

这张表暴露了三个反直觉的事实。

第一,账面输入价相同的 Sol 和 Grok 4.7(都是 $2),在高缓存命中率场景下实际输入成本差了 10 倍:Sol 的缓存部分只付 $0.16,Grok 要按全价付 $1.60。当然这个对比对 Grok 不完全公平——它没有公开缓存折扣数据,不代表没有,只是无法入账。对 Grok 公平的说法是:缓存收益未知,按保守口径估算。

第二,Opus 5.5 虽然单价是 Sol 的 2 倍,但因为缓存降价力度大($0.20 的缓存读取价与 Sol 打平),缓存部分的绝对支出两家完全一样。差距全部集中在输出端:$20 对 $10。

第三,Luna 的实际合计 $0.128,约为 Sol 的 1/20、Opus 5.5 的 1/39。如果你的任务 Luna 能干,价格上没有悬念。

还要提醒一点:上表的 80% 命中率是假设值,实际账单对命中率极其敏感。Agent 场景里缓存失效的常见原因包括系统提示被改动、两次请求间隔超过缓存有效期、多实例负载均衡打散了请求落点。命中率从八成掉到五成,Sol 的缓存输入费会从 $0.16 涨到 $0.40,账单结构随之改变。所以上线前值得用真实流量回放一遍,量出自己的实际命中率,再把这张表重算一次——同样一张价格表,命中率不同,结论可能完全不同。

还有一个不在表里、但同样值钱的工程细节:Sol 和 Luna 支持对话中途调整推理强度分档且不破坏缓存,并支持"显式断点"控制缓存前缀边界。传统做法里,改推理档位往往意味着缓存失效、前缀全价重算;中途可调档且不破坏缓存,等于把"该省的省、该花的花"从架构层面打通了。缓存策略的完整方法论,站内另有一篇 Agent 缓存成本横评(/zh/posts/agentic-cache-cost-comparison-review)展开,本文不重复。

四、把跑分放在价格旁边:能看什么,不能看什么

先立规矩:以下跑分全部是各家官方发布口径,各家用的 harness 不同,任务集不同,本站未复测。不同基准之间、不同厂商之间,都不可横比下结论。本文只做两件事:把同一基准上多家都公布了的数字并排放,把只有一家公布的位置标"未公布"。

模型DeepSWE v1.1Terminal-Bench 4.0AutomationBenchOSWorld 2.0
GPT-6 Sol68.8%(max)未公布33.2%(xhigh)60.5%(xhigh)
GPT-6 Luna66.6%(max)未公布未公布绝对值未公布绝对值
Claude Opus 5.5未公布66.4%40.0%81.8%
Grok 4.771.0%38.0%未公布未公布

这张表里有两个必须如实说的位置。

第一处,Terminal-Bench 4.0:只有 Opus 5.5(66.4%,官方口径称领先 GPT-6 Astra 8.5 个百分点)和 Grok 4.7(38.0%)公布了成绩,Sol 和 Luna 未公布。我们不做任何补位推测——没公布就是没公布,任何"估计 Sol 也能跑到 60%+"的说法都是编造。

第二处,DeepSWE v1.1:Grok 71.0% > Sol 68.8% > Luna 66.6%,最贵的 Opus 反而没公布此项,便宜的 Grok 在三方对比中最高(各家官方口径)。这个排序值得琢磨:如果按"单位能力的钱"折算,Grok 的 DeepSWE 单位分成本是最低的——$2/$6 的定价配上 71.0% 的编程基准成绩,每一分钱买到的 DeepSWE 百分点比 Sol 和 Luna 都多。但同样的逻辑到 Terminal-Bench 4.0 上就反过来了,Grok 38.0% 明显低于 Opus 5.5 的 66.4%。同一个模型,两个基准,两种故事——这正是"不同基准不同 harness 不可横比下结论"的具体含义。

Opus 5.5 官方口径里还有几个值得记录的数字:GDPval-AA v2.1 1846 Elo,OSWorld 2.0 81.8%,HLE 带工具 67.7%,FrontierCode 54.4%;官方称典型任务总成本较 Opus 5 省 40%,输出快 30% 以上。Sol 那边的官方口径:AutomationBench xhigh 33.2%,超过 Claude Opus 5 的最高表现(max 26.9%),单任务成本约为其 9%;Agents' Last Exam(55 行业)max 56.4%,成本约低 60%;DeepSWE 68.8% 仅落后 Claude Fable 5 最高 1.1 个百分点而成本约 1/5;OSWorld 2.0 60.5% 与 Opus 5 中强度相当、成本约 1/5。Luna:DeepSWE 66.6% 接近 Opus 5 中等强度而成本低 93%;AutomationBench 高强度较上一代 Luna 加 5.4 个百分点、成本降 58%。

把价格和跑分叠起来,"单位能力的钱"的格局大致是:Opus 5.5 用两倍于 Sol 的价格买到了多项基准的明显领先,它的账要按"峰值能力刚需"来算;Sol 是典型的"次旗舰甜点位",能力下放叠加五折定价加九折缓存,单位成本曲线很陡;Luna 把旗舰级能力的入门价打到了一毛钱输入;Grok 4.7 在编程基准上打出了全场最低的单位分成本,但 Terminal-Bench 上的落差提醒你它不是全能选手;DeepSeek V4.1 Flash 的 DeepSWE 74.2% 是本文出现过的最高编程基准成绩,配合分时定价,在能调度时间的批量任务里单位成本极低。

五、按场景给结论:四种预算,四笔账

结论不排座次,只按场景对号入座。

峰值能力刚需、预算充足:Opus 5.5。$4/$20 不便宜,但相比 Opus 5 已经省了 40% 的典型任务总成本,缓存读取价 $0.20 也和 Sol 打平。如果你的任务是"差一个百分点就成败",两倍价格买的是确定性。

主力工作流、要控成本:Sol。$2/$10 加九折缓存,官方口径下多项 Agent 基准用约 1/5 的成本追平或超过上一代旗舰。对大多数团队,这是"单位能力的钱"最均衡的一档。

海量轻任务、成本绝对优先:Luna。$0.10/$0.50 的定价让"每百万 token"这个单位都显得大了,九折缓存让它更适合高频重复前缀的流水线。唯一要做的功课是确认你的任务难度在它的能力圈内——它在 DeepSWE 66.6%,接近但不是 Opus 5 的中高强度水平。

输出密集型与编程智能体:Grok 4.7 值得入账。$6 的输出单价是四家最低,DeepSWE 71.0% 是三方对比最高,但要接受 Terminal-Bench 38.0% 的落差,并把缓存收益按未知处理。

可调度的批量任务:DeepSeek V4.1 Flash 的分时定价是独特优势。闲时跑批,输入 1 元、输出 4 元,按 $0.10≈0.7 元的换算口径(AI工具集 转述口径)折合约 $0.14/$0.57,比 Luna 的固定价还低——前提是你真的能把任务挪到闲时,且接受其 74.2% 的 DeepSWE 成绩对应的能力边界。

最后重复一遍边界:以上全部为各家官方发布口径,本站未复测;价格随时可能调整,下单前以各家官方定价页为准。想看"这些模型到底谁更强",回到站内 GPT-6 Astra 旗舰横评(/zh/posts/gpt-6-astra-flagship-review);想看更大盘子的成本性能对比,有 AI 大模型成本性能横评(/zh/posts/ai-llm-cost-performance-comparison-review)和 Agent 长上下文成本账(/zh/posts/agent-long-context-cost-review);Opus 5.5 的发布背景可读 Claude Opus 5 热点(/zh/posts/claude-opus-5-hotspot)。

常见问题

Q1: Sol 和 Luna 的缓存 90% 折扣是什么意思?

A1: 指缓存输入读取按原输入价的 10% 计费:Sol 缓存读取约 $0.20/百万 token,Luna 约 $0.01/百万 token。只折扣"读取",首次写入与未命中的新鲜输入仍按全价。两者还支持中途调推理档位不破坏缓存、显式断点控制缓存前缀边界。

Q2: Opus 5.5 单价是 Sol 的 2 倍,实际账单也是 2 倍吗?

A2: 不一定。按本文示例口径(80% 缓存命中),Opus 5.5 实际合计 $4.96 对 Sol 的 $2.56,约 1.9 倍;缓存部分两家打平(都是 $0.16),差距几乎全在输出端。缓存命中率越高,两者实际差距越接近 2 倍;命中率低时输入端差距会缩小。

Q3: Grok 4.7 真的没有缓存折扣吗?

A3: 准确说法是"无公开缓存折扣数据"。本文素材口径下没有它的缓存定价信息,因此实际账表里缓存部分按全价保守估算。这不代表它没有缓存机制,只是无法入账比较。

Q4: DeepSeek V4.1 Flash 的分时定价怎么和美元定价比?

A4: 直接横比不严谨。DeepSeek 输入闲时 1 元/高峰 2 元、输出闲时 4 元/高峰 8 元;按 $0.10≈0.7 元的换算(AI工具集 转述口径)折合约 $0.14/$0.57 至 $0.29/$1.14。人民币与美元计价体系不同,该换算仅作量级参考。

Q5: DeepSWE 上最便宜的 Grok 反而最高,是不是说明它性价比最好?

A5: 在 DeepSWE v1.1 这一个基准上(Grok 71.0% > Sol 68.8% > Luna 66.6%,各家官方口径),Grok 的单位分成本确实最低。但同一模型在 Terminal-Bench 4.0 上只有 38.0%,明显低于 Opus 5.5 的 66.4%。不同基准不同 harness 不可横比下结论,选型要看你的任务更接近哪个基准。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-27

常见问题

Sol 和 Luna 的缓存 90% 折扣是什么意思?
指缓存输入读取按原输入价的 10% 计费:Sol 缓存读取约 $0.20/百万 token,Luna 约 $0.01/百万 token。只折扣"读取",首次写入与未命中的新鲜输入仍按全价。两者还支持中途调推理档位不破坏缓存、显式断点控制缓存前缀边界。
Opus 5.5 单价是 Sol 的 2 倍,实际账单也是 2 倍吗?
不一定。按本文示例口径(80% 缓存命中),Opus 5.5 实际合计 $4.96 对 Sol 的 $2.56,约 1.9 倍;缓存部分两家打平(都是 $0.16),差距几乎全在输出端。缓存命中率越高,两者实际差距越接近 2 倍;命中率低时输入端差距会缩小。
Grok 4.7 真的没有缓存折扣吗?
准确说法是"无公开缓存折扣数据"。本文素材口径下没有它的缓存定价信息,因此实际账表里缓存部分按全价保守估算。这不代表它没有缓存机制,只是无法入账比较。
DeepSeek V4.1 Flash 的分时定价怎么和美元定价比?
直接横比不严谨。DeepSeek 输入闲时 1 元/高峰 2 元、输出闲时 4 元/高峰 8 元;按 $0.10≈0.7 元的换算(AI工具集 转述口径)折合约 $0.14/$0.57 至 $0.29/$1.14。人民币与美元计价体系不同,该换算仅作量级参考。
DeepSWE 上最便宜的 Grok 反而最高,是不是说明它性价比最好?
在 DeepSWE v1.1 这一个基准上(Grok 71.0% > Sol 68.8% > Luna 66.6%,各家官方口径),Grok 的单位分成本确实最低。但同一模型在 Terminal-Bench 4.0 上只有 38.0%,明显低于 Opus 5.5 的 66.4%。不同基准不同 harness 不可横比下结论,选型要看你的任务更接近哪个基准。

相关文章

硬核横评

云端 vs 本地语音 AI 成本与可控性横评

本篇不比能力、只算账,主题是语音 AI 的**云端实时语音 API 与本地开源工具**两条路线的成本结构与可控性(与站内 8-26 图像模型能力横评、批次 22 图像成本账、批次 23 Agent 长上下文成本账明确分工)。开篇指出语音成本比文本/图像更难建模:实时性、并发路数、音频时长分布、语言/方言覆盖、隐私合规五个维度叠加。随后用五维对照(单价与计费、延迟与实时、隐私合规、可控性定制、语言覆盖)逐维比较云端代表 GPT-Live-1(闭源、按量、开箱实时)与本地代表 VoiceStudio(开源、一次性算力、数据不出机、引擎可换),配五维评分表与五类场景选型表,并按个人/小团队/批量三量级给结论。所有单价一律符号化(P_cloud / C_local)或标「以官方定价页为准」,量级判断标工程估算口径。冷思考点名厂商「按需付费更省」只覆盖落在甜区内的那一个工作负载,真正决定账单的是并发 N、时长分布 T 与是否强制实时,建议自建度量。

2026年9月13日9 分钟阅读
硬核横评

闭源 API 与开源权重:一张图到底谁更省

ChatGPT Images 2.5 与蚂蚁开源 LLaDA-Image 同周撞车,文生图进入闭源 API 与开源自部署的分野期。本篇不算画质、只算成本与可控性账:闭源 API、开源权重自部署、第三方按秒计费平台、本地消费级硬件、国产云 API 五条路线,按 100 张/天与 10000 张/天两档量级推算单张成本,配对比表与分场景选型(个人玩票/电商批量/数据敏感/需微调品牌风格/追求最强画质),并点名许可证未标注、按秒计费冷启动、中文渲染、数据出境四类坑。与站内 8-26 推理式图像模型能力横评明确分工,代表性对比非亲自压测,价格以官网为准。

2026年9月9日9 分钟阅读
硬核横评

DeepSeek 提价 350% 九天后,智谱半价杀入:轻量旗舰 API 五强横评,编程党先别急着换模型

DeepSeek 8 月 17 日把 V4-Flash 高峰输出提价 350%(2 元到 9 元/百万 token)并首推峰谷定价,九天后智谱上线 GLM-5.3-Flash(输出 2.8 元)正面接招。本篇把账拆到场景算:零缓存的对话/RAG/长文档场景 GLM 便宜近半(优惠期 27%-31%);但缓存命中率超九成的编程 Agent 场景,V4-Flash 闲时按 90 万/百万走缓存算反而便宜约 32%(推算口径)--提价的那家在它最重的用户群里可能还是更便宜的。高峰时段(9-12、14-18 点)GLM 无峰谷差价优势最大;Kimi K3 输出 100 元/M 是能力溢价不是性价比;行业账本揭示提价是集体动作(DeepSeek 净亏 7.15 亿、智谱定价 +83% 调用量反 +400%)。附五条按场景选型结论。

2026年8月27日9 分钟阅读