2026 年 8 月 31 日这天之后,很多人第一次发现"模型单价"这个数字不太够用。Claude Sonnet 5 的费率从 2 美元与 10 美元恢复到 3 美元与 15 美元,同一天它还换过一次分词器,相同输入映射出的 token 数变成原来的 1.0 到 1.35 倍。也就是说,账单上的涨幅不是费率表上写的那个数。更麻烦的是,国内厂商的定价里还有峰谷时段与缓存命中这两层变量,让"谁更便宜"这件事变得没法靠一行价格回答。这篇做的就是把口径摊平,把一个可比的真实成本算出来。
先说边界:国内模型价格来自一份逐页复核各厂商官方定价页的速查表(2026-08-24 复核,8-28 再次复核确认无调整),海外模型价格来自 aitoolsrecap 于 2026-08-31 的汇总,另有 TheRouter.ai 于 2026-08-24 检索的各平台定价作为交叉参照。价格为 2026-08-31 快照,随时可能变动,实际请以自己账户所在区域的官方定价页为准。存在口径冲突的项目已在文中逐条标注,不取单一数字蒙混。本文未做实际调用压测,所有数字为公开定价的算术折算,不含并发、限流、失败重试等工程成本。非投资建议。
一、标价是最不可信的那个数
模型定价至少套着三层衣服,只看标价等于只看最外面那层。
第一层是时段。DeepSeek 从 8 月 17 日起实行峰谷计价,工作日 9:00–12:00 与 14:00–18:00 是高峰价,闲时减半,周末全天按闲时计。这意味着同一个模型,你把它跑在下午三点还是晚上十点,单价差一倍。对可以异步调度的工作负载,这是一笔几乎白拿的折扣;对必须实时响应的线上服务,高峰期就是你的真实成本,闲时价跟你没关系。
第二层是缓存。多数平台对命中前缀缓存的输入 token 给出远低于标准输入的单价,部分模型的缓存命中价只有标准输入价的几十分之一。这一层的变量不在厂商手里,在你手里:你的提示词结构是否稳定、系统提示是否放在最前面、多轮对话是否复用了历史前缀,决定了你实际能吃到多少折扣。两个团队用同一个模型,因为前缀复用率不同,单位成本差出三四倍并不罕见。
第三层是分词。Sonnet 5 这次换分词器,相同输入映射的 token 数变成 1.0 到 1.35 倍,且倍数随内容类型浮动。这一层最隐蔽,因为它不改变任何一行价目表,只是让你为同样的内容多付钱。凡是跨模型比价都需要注意:不同模型的分词器不同,同样的中文语料在 A 模型上是 1000 个 token,在 B 模型上可能是 1300 个。按 token 比价的前提,是先确认两边的 token 是不是同一个东西。
二、先把口径统一:本文怎么算
为了可比,本文采用一个明确定义的中端口径:综合单价 = (输入单价 + 输出单价)÷ 2,即假设输入与输出 token 数量相等。选 1:1 不是因为它普遍成立,而是因为它是一个中立起点,且便于读者按自己的实际比重调整。后面的第六节会给出三种典型比重的重算结果,你会发现排序会变。
还需要说明三点:其一,海外模型用美元、国内模型用人民币,本文不做汇率换算,因为汇率本身会波动,且多数团队的成本与收入同币种,跨币种比较反而失真。其二,缓存命中价单列,不并入综合单价,因为命中率高度依赖具体用法。其三,促销价与永久价分开列出,凡是标注了到期日的促销价,都额外给出到期后的价格,选型应按到期后的价格建模。
三、国内模型:峰谷与缓存能把价差拉到十倍
单位:元 / 百万 token。综合单价按输入输出 1:1 折算。DeepSeek 的峰谷规则前文已述。
| 模型 | 缓存命中输入 | 输入 | 输出 | 综合单价 |
|---|---|---|---|---|
| 智谱 GLM-5.3-Flash | ¥0.23 | ¥0.8 | ¥2.8 | ¥1.8 |
| 阿里 Qwen3.8-Flash | 约 ¥0.1 | ¥1 | ¥3 | ¥2.0 |
| 腾讯 Hy3 | ¥0.25 | ¥1 | ¥4 | ¥2.5 |
| 小米 MiMo-v2.5-Pro | ¥0.025 | ¥3.0 | ¥6.0 | ¥4.5 |
| DeepSeek V4-Flash | ¥0.10 | ¥3.0 | ¥9.0 | ¥6.0 |
| DeepSeek V4-Pro(闲时) | 未核实 | ¥4.5 | ¥13.5 | ¥9.0 |
| 月之暗面 Kimi K2.6 | ¥1.1 | ¥6.5 | ¥27 | ¥16.75 |
| DeepSeek V4-Pro(高峰) | ¥0.30 | ¥9.0 | ¥27.0 | ¥18.0 |
| 智谱 GLM-5.3 / 5.2 | ¥2 | ¥8 | ¥28 | ¥18.0 |
| 字节 Seed 2.1 Pro | ¥1.2 | ¥6 | ¥30 | ¥18.0 |
| 阿里 Qwen3.8-Max | ¥1.5 | ¥12 | ¥36 | ¥24.0 |
| 月之暗面 Kimi K3 | ¥2.0 | ¥20 | ¥100 | ¥60.0 |
表里最值得看的是首尾差距:最便宜的 GLM-5.3-Flash 综合单价 1.8 元,最贵的 Kimi K3 是 60 元,相差三十多倍。这当然不是"贵的一定不好",Kimi K3 的定价锚定的是它在 Terminal-Bench 一类编码基准上的位置,而 GLM-5.3-Flash 的定位本就是低成本高频调用。真正的问题在于:多数团队的实际负载并不需要旗舰级能力,却长期按旗舰级价格付费。
这里必须逐条标注口径冲突。
GLM-5.3 的定价存在来源分歧:本文采用的速查表给出的是输入 8 元、输出 28 元(8-28 复核);另有两份来源分别给出输入 8 元输出 32 元,以及约 3.6 元与 14.4 元;TheRouter.ai 对 GLM-5.3 直接标注为 Pricing TBA(价格待定),只给了 5.2 的 1.40 与 4.40 美元。四个数字对不上,本文取经过逐页复核且时间最近的一个,并明确提示读者以官方定价页为准,不要把 18 元这个综合单价当作确定值使用。
DeepSeek V4-Pro 的口径随时间变过:8 月 13 日正式版发布时,机构调研纪要记录的价格是未命中输入 3 元、输出 6 元;8 月 17 日改峰谷计价后,高峰变为 9 元与 27 元,闲时减半。所以你如果在网上看到"V4-Pro 输出 6 元"的说法,那是峰谷改革前的旧数,不是错的,是过期的。
腾讯这款要特别小心:表中列的是 Hy3(256K 上下文,输入 1 元输出 4 元)。8 月 28 日新发布的 Hy4 preview 是 770B 参数的新模型,官方口径是价格低于高峰时段的 DeepSeek V4 Pro,但本文未取得可靠的官方具体数字,因此不给具体值,也不把它放进上面的排序表。
四、海外模型:促销价与永久价必须分开看
单位:美元 / 百万 token。
| 模型 | 输入 | 输出 | 综合单价 | 价格性质 |
|---|---|---|---|---|
| GPT-5.6 Luna | $0.20 | $1.20 | $0.70 | 永久价 |
| GPT-5.6 Terra | $2 | $12 | $7 | 永久价 |
| Claude Sonnet 5 | $3 | $15 | $9 | 永久价,另计分词变更 |
| GPT-5.6 Sol | $4 | $20 | $12 | 促销,约 11-21 到期 |
| GPT-5.6 Sol(到期后) | $5 | $30 | $17.5 | 永久价 |
这张表最容易被误读的地方是 Sol。它的促销价 4 与 20 看着比 Sonnet 5 的 3 与 15 贵,但两者不在同一个时间尺度上:Sonnet 5 的 3 与 15 是永久价,Sol 的 4 与 20 大约到 11 月 21 日就结束,之后回到 5 与 30,综合单价从 12 跳到 17.5。如果你的迁移需要工程投入,那么这笔投入应该按 17.5 去算回报,而不是按 12。三个月的差价,通常覆盖不了一次迁移的工程量。
还有一条更根本的提醒:Luna 的综合单价 0.7 美元,是 Sonnet 5 的十三分之一。它不适合复杂推理,但对高吞吐的简单任务(分类、抽取、格式化、路由)完全够用。多数系统的真实负载是混合的,把简单任务从旗舰模型上摘下来放到廉价模型上,通常比换一家供应商省得多。这个问题本批 SOP 篇有具体的分流做法,见 /zh/posts/model-sunset-migration-cost-sop。
五、tokenizer 那一刀:Sonnet 5 实际落在哪
把分词变更算进去,Sonnet 5 的综合单价就不是一个数,而是一个区间。
按 1:1 的输入输出比重、费率 3 与 15 计算,综合单价是 9 美元。乘上分词放大系数:如果负载以自然语言文本为主,放大系数接近 1.0,综合单价就是 9 美元;如果以代码为主、放大系数接近上限 1.35,综合单价变成 12.15 美元。也就是说,同一个 Sonnet 5,在不同负载下的真实单位成本是 9 到 12.15 美元,跨度 35%。
这个区间意味着什么?意味着它和 Terra 的 7 美元、Sol 到期后的 17.5 美元之间的相对位置,会随你的负载类型移动。对纯文本负载,Terra 比 Sonnet 5 便宜约 22%;对代码负载,Terra 比 Sonnet 5 便宜约 42%。反过来,如果你的负载是代码为主,那么 Sonnet 5 涨价后与 Sol 促销价的差距会比标价显示的更小,迁移到 Sol 的性价比相应下降。
需要说明的是,1.0 到 1.35 这个区间是 Anthropic 在发布说明中给出的"视内容类型而定"的口径,具体哪类内容落在哪个位置,官方没有细分。本文不做进一步推测,建议的做法是拿自己的真实语料,用新旧分词器各跑一次计数,得到自己的实际系数,这个成本很低,但比任何估算都准。
六、按你的负载比重重算:三个典型场景
1:1 只是起点。把输入输出比重换成三种常见情形,排序会明显变化。下面用综合成本公式(比重加权平均)重算四个代表性模型。
场景 A:输出密集型,长文生成、报告撰写,输入输出比约 1:3。
| 模型 | 加权综合单价 |
|---|---|
| 智谱 GLM-5.3-Flash | ¥2.3 |
| 腾讯 Hy3 | ¥3.25 |
| DeepSeek V4-Pro(闲时) | ¥11.25 |
| 月之暗面 Kimi K3 | ¥80.0 |
输出占比越高,输出单价越便宜的模型优势越大。GLM-5.3-Flash 与 Hy3 在这个场景下的优势被进一步放大,而 Kimi K3 因为输出单价 100 元,劣势被放大到难以忽视。
场景 B:输入密集型,长文档分析、检索问答,输入输出比约 10:1。
| 模型 | 加权综合单价 |
|---|---|
| 智谱 GLM-5.3-Flash | ¥0.98 |
| 腾讯 Hy3 | ¥1.27 |
| DeepSeek V4-Pro(闲时) | ¥5.32 |
| 月之暗面 Kimi K3 | ¥27.3 |
输入占比高时,缓存命中率的权重骤增。这个场景下真正决定成本的往往不是标价,而是你的提示词工程:能不能把稳定的系统提示放在最前面、能不能让多轮对话复用前缀,直接决定你付的是标准输入价还是缓存命中价。
场景 C:代码负载,需额外计入分词放大系数,以 Sonnet 5 为例。
| 模型 | 加权综合单价 | 备注 |
|---|---|---|
| Claude Sonnet 5(文本为主) | $9.0 | 放大系数 1.0 |
| Claude Sonnet 5(代码为主) | $12.15 | 放大系数 1.35 |
| GPT-5.6 Terra | $7 | 无分词变更记录 |
三个场景合起来的结论很一致:不存在"最便宜的模型",只存在"对你这个负载最便宜的模型"。任何脱离输入输出比重、缓存命中率与内容类型给出的比价结论,都只是在比标价,不是在比成本。
七、选型结论与三条硬提醒
按负载类型给一个可直接执行的结论。高吞吐简单任务走 Luna 或 GLM-5.3-Flash,把旗舰模型留给真正需要的环节;可异步的工作负载尽量调度到闲时,DeepSeek 的峰谷差是一倍,这是不需要任何技术改动就能拿到的折扣;长文档场景优先优化提示词结构去吃缓存命中,而不是急着换更便宜的模型;编码负载跨模型比价时,务必先测出自己的分词放大系数,否则你比的是两个不同的计量单位。
三条硬提醒。其一,按到期后的价格建模:任何促销价都应该按它到期后的水平算回报,Sol 从 12 到 17.5 的跳变就是现成的例子。其二,旧 ID 会过期:本批热点篇记录的 kimi-k2.5 与 moonshot-v1 于今日下线、DashScope 10 月 10 日还有一轮退役 30 多个模型 ID,都说明模型 ID 应该当作有到期日的依赖来管理。其三,别把单篇比价当决策依据:本文所有数字是公开定价的算术折算,未做实际调用压测,不含并发、限流、失败重试与工程质量差异。真要选型,拿自己的真实负载,在候选模型上各跑一周,用真实账单说话,那才是唯一可信的横评。
常见问题
Q1:标价差一倍,实际成本能差十倍,这个结论怎么来的? A1:因为标价只是第一层。往下还有三层:时段(DeepSeek 峰谷差价一倍)、缓存命中(命中与未命中的单价可以差到十倍量级)、分词器(Sonnet 5 换了 tokenizer,同一段输入 token 数乘以 1.0 到 1.35)。四层叠乘之后,两个标价接近的模型,实际账单可能差很远。所以本文的结论不是"标价不可信",而是"标价不可单独信"。
Q2:峰谷计费具体怎么利用? A2:DeepSeek 的规则是工作日 9:00–12:00 与 14:00–18:00 为高峰,闲时价格减半,周末全天按闲时计。凡是能异步的工作负载——批量摘要、离线标注、数据清洗、夜里跑的回归测试——调度到闲时就是不需要任何技术改动就能拿到的折扣。唯一的前提是你的业务能接受延迟。
Q3:缓存命中率一般能做到多少? A3:没有通用数字,它完全取决于你的提示词结构。规律是:把稳定的长内容(系统提示、工具定义、文档上下文)放在前缀,把变化的部分(用户输入、时间戳、会话状态)放在后面,命中率就高;反过来放则命中率接近零。所以要拿真实数字,得在自己的生产流量上测一周,看的是分位数而不是平均值。
Q4:Sonnet 5 到底涨了多少?口径为什么不一致? A4:两个口径都对,看的是不同的东西。费率层面是输入 $2→$3、输出 $10→$15,涨幅 50%;但如果算上 tokenizer 变更带来的输入 token 数放大(官方给的范围是 1.0 到 1.35 倍),编码类负载的复合涨幅在 65% 到 100% 之间,纯文本负载接近 50%。另外这次只影响 API,Consumer 订阅不受影响,两类成本别放在一张表上比。
Q5:促销价到期怎么办?要不要现在迁移? A5:任何需要工程投入的迁移,都应该按促销到期后的价格算回报,而不是按促销价算。GPT-5.6 Sol 的 $4/$20 是促销,约 2026-11-21 后回到 $5/$30,折算后的综合单价从 $12 跳到 $17.5——三个月的差价通常覆盖不了一次迁移的人力成本。判断标准很简单:如果这笔账在促销结束后仍然划算,才值得迁移。