硬核横评
硬核横评

涨价之后怎么选:11 个模型的真实 token 成本横评,把峰谷、缓存与 tokenizer 三重口径算进去

模型标价至少套着三层衣服,只看标价等于只看最外面那层:时段(DeepSeek 8 月 17 日起峰谷计价,工作日 9:00–12:00 与 14:00–18:00 为高峰、闲时减半、周末全天闲时,同一模型单价差一倍)、缓存(命中前缀缓存的输入 token 单价远低于标准输入,变量不在厂商手里而在你的提示词结构里)、分词(Sonnet 5 换分词器后相同输入映射 1.0 到 1.35 倍 token 数,且倍数随内容类型浮动)。本文统一口径为「综合单价 =(输入单价 + 输出单价)÷ 2」,即假设输入输出 token 数量相等,作为中立起点,再给三种典型负载比重的重算结果,并覆盖 11 个模型的标价、缓存命中价、峰谷价与分词放大后的实际位置。结论不是「哪个模型最便宜」,而是「不存在最便宜的模型,只存在对你这个负载最便宜的模型」——脱离输入输出比重、缓存命中率与内容类型给出的比价,只是在比标价而非比成本。国内模型价格来自 2026-08-24 逐页复核、8-28 再复核的官方定价页速查表,海外价格来自 2026-08-31 汇总,存在口径冲突的项目文中逐条标注。未做实际调用压测。

发布于 2026年8月31日9 分钟阅读
<!-- post-aug31-token-cost-comparison-review | review | 涨价之后怎么选:11 个模型的真实 token 成本横评,把峰谷、缓存与 tokenizer 三重口径算进去 -->

2026 年 8 月 31 日这天之后,很多人第一次发现"模型单价"这个数字不太够用。Claude Sonnet 5 的费率从 2 美元与 10 美元恢复到 3 美元与 15 美元,同一天它还换过一次分词器,相同输入映射出的 token 数变成原来的 1.0 到 1.35 倍。也就是说,账单上的涨幅不是费率表上写的那个数。更麻烦的是,国内厂商的定价里还有峰谷时段与缓存命中这两层变量,让"谁更便宜"这件事变得没法靠一行价格回答。这篇做的就是把口径摊平,把一个可比的真实成本算出来。

先说边界:国内模型价格来自一份逐页复核各厂商官方定价页的速查表(2026-08-24 复核,8-28 再次复核确认无调整),海外模型价格来自 aitoolsrecap 于 2026-08-31 的汇总,另有 TheRouter.ai 于 2026-08-24 检索的各平台定价作为交叉参照。价格为 2026-08-31 快照,随时可能变动,实际请以自己账户所在区域的官方定价页为准。存在口径冲突的项目已在文中逐条标注,不取单一数字蒙混。本文未做实际调用压测,所有数字为公开定价的算术折算,不含并发、限流、失败重试等工程成本。非投资建议。

一、标价是最不可信的那个数

模型定价至少套着三层衣服,只看标价等于只看最外面那层。

第一层是时段。DeepSeek 从 8 月 17 日起实行峰谷计价,工作日 9:00–12:00 与 14:00–18:00 是高峰价,闲时减半,周末全天按闲时计。这意味着同一个模型,你把它跑在下午三点还是晚上十点,单价差一倍。对可以异步调度的工作负载,这是一笔几乎白拿的折扣;对必须实时响应的线上服务,高峰期就是你的真实成本,闲时价跟你没关系。

第二层是缓存。多数平台对命中前缀缓存的输入 token 给出远低于标准输入的单价,部分模型的缓存命中价只有标准输入价的几十分之一。这一层的变量不在厂商手里,在你手里:你的提示词结构是否稳定、系统提示是否放在最前面、多轮对话是否复用了历史前缀,决定了你实际能吃到多少折扣。两个团队用同一个模型,因为前缀复用率不同,单位成本差出三四倍并不罕见。

第三层是分词。Sonnet 5 这次换分词器,相同输入映射的 token 数变成 1.0 到 1.35 倍,且倍数随内容类型浮动。这一层最隐蔽,因为它不改变任何一行价目表,只是让你为同样的内容多付钱。凡是跨模型比价都需要注意:不同模型的分词器不同,同样的中文语料在 A 模型上是 1000 个 token,在 B 模型上可能是 1300 个。按 token 比价的前提,是先确认两边的 token 是不是同一个东西。

二、先把口径统一:本文怎么算

为了可比,本文采用一个明确定义的中端口径:综合单价 = (输入单价 + 输出单价)÷ 2,即假设输入与输出 token 数量相等。选 1:1 不是因为它普遍成立,而是因为它是一个中立起点,且便于读者按自己的实际比重调整。后面的第六节会给出三种典型比重的重算结果,你会发现排序会变。

还需要说明三点:其一,海外模型用美元、国内模型用人民币,本文不做汇率换算,因为汇率本身会波动,且多数团队的成本与收入同币种,跨币种比较反而失真。其二,缓存命中价单列,不并入综合单价,因为命中率高度依赖具体用法。其三,促销价与永久价分开列出,凡是标注了到期日的促销价,都额外给出到期后的价格,选型应按到期后的价格建模。

三、国内模型:峰谷与缓存能把价差拉到十倍

单位:元 / 百万 token。综合单价按输入输出 1:1 折算。DeepSeek 的峰谷规则前文已述。

模型缓存命中输入输入输出综合单价
智谱 GLM-5.3-Flash¥0.23¥0.8¥2.8¥1.8
阿里 Qwen3.8-Flash约 ¥0.1¥1¥3¥2.0
腾讯 Hy3¥0.25¥1¥4¥2.5
小米 MiMo-v2.5-Pro¥0.025¥3.0¥6.0¥4.5
DeepSeek V4-Flash¥0.10¥3.0¥9.0¥6.0
DeepSeek V4-Pro(闲时)未核实¥4.5¥13.5¥9.0
月之暗面 Kimi K2.6¥1.1¥6.5¥27¥16.75
DeepSeek V4-Pro(高峰)¥0.30¥9.0¥27.0¥18.0
智谱 GLM-5.3 / 5.2¥2¥8¥28¥18.0
字节 Seed 2.1 Pro¥1.2¥6¥30¥18.0
阿里 Qwen3.8-Max¥1.5¥12¥36¥24.0
月之暗面 Kimi K3¥2.0¥20¥100¥60.0

表里最值得看的是首尾差距:最便宜的 GLM-5.3-Flash 综合单价 1.8 元,最贵的 Kimi K3 是 60 元,相差三十多倍。这当然不是"贵的一定不好",Kimi K3 的定价锚定的是它在 Terminal-Bench 一类编码基准上的位置,而 GLM-5.3-Flash 的定位本就是低成本高频调用。真正的问题在于:多数团队的实际负载并不需要旗舰级能力,却长期按旗舰级价格付费。

这里必须逐条标注口径冲突。

GLM-5.3 的定价存在来源分歧:本文采用的速查表给出的是输入 8 元、输出 28 元(8-28 复核);另有两份来源分别给出输入 8 元输出 32 元,以及约 3.6 元与 14.4 元;TheRouter.ai 对 GLM-5.3 直接标注为 Pricing TBA(价格待定),只给了 5.2 的 1.40 与 4.40 美元。四个数字对不上,本文取经过逐页复核且时间最近的一个,并明确提示读者以官方定价页为准,不要把 18 元这个综合单价当作确定值使用。

DeepSeek V4-Pro 的口径随时间变过:8 月 13 日正式版发布时,机构调研纪要记录的价格是未命中输入 3 元、输出 6 元;8 月 17 日改峰谷计价后,高峰变为 9 元与 27 元,闲时减半。所以你如果在网上看到"V4-Pro 输出 6 元"的说法,那是峰谷改革前的旧数,不是错的,是过期的。

腾讯这款要特别小心:表中列的是 Hy3(256K 上下文,输入 1 元输出 4 元)。8 月 28 日新发布的 Hy4 preview 是 770B 参数的新模型,官方口径是价格低于高峰时段的 DeepSeek V4 Pro,但本文未取得可靠的官方具体数字,因此不给具体值,也不把它放进上面的排序表。

四、海外模型:促销价与永久价必须分开看

单位:美元 / 百万 token。

模型输入输出综合单价价格性质
GPT-5.6 Luna$0.20$1.20$0.70永久价
GPT-5.6 Terra$2$12$7永久价
Claude Sonnet 5$3$15$9永久价,另计分词变更
GPT-5.6 Sol$4$20$12促销,约 11-21 到期
GPT-5.6 Sol(到期后)$5$30$17.5永久价

这张表最容易被误读的地方是 Sol。它的促销价 4 与 20 看着比 Sonnet 5 的 3 与 15 贵,但两者不在同一个时间尺度上:Sonnet 5 的 3 与 15 是永久价,Sol 的 4 与 20 大约到 11 月 21 日就结束,之后回到 5 与 30,综合单价从 12 跳到 17.5。如果你的迁移需要工程投入,那么这笔投入应该按 17.5 去算回报,而不是按 12。三个月的差价,通常覆盖不了一次迁移的工程量。

还有一条更根本的提醒:Luna 的综合单价 0.7 美元,是 Sonnet 5 的十三分之一。它不适合复杂推理,但对高吞吐的简单任务(分类、抽取、格式化、路由)完全够用。多数系统的真实负载是混合的,把简单任务从旗舰模型上摘下来放到廉价模型上,通常比换一家供应商省得多。这个问题本批 SOP 篇有具体的分流做法,见 /zh/posts/model-sunset-migration-cost-sop

五、tokenizer 那一刀:Sonnet 5 实际落在哪

把分词变更算进去,Sonnet 5 的综合单价就不是一个数,而是一个区间。

按 1:1 的输入输出比重、费率 3 与 15 计算,综合单价是 9 美元。乘上分词放大系数:如果负载以自然语言文本为主,放大系数接近 1.0,综合单价就是 9 美元;如果以代码为主、放大系数接近上限 1.35,综合单价变成 12.15 美元。也就是说,同一个 Sonnet 5,在不同负载下的真实单位成本是 9 到 12.15 美元,跨度 35%。

这个区间意味着什么?意味着它和 Terra 的 7 美元、Sol 到期后的 17.5 美元之间的相对位置,会随你的负载类型移动。对纯文本负载,Terra 比 Sonnet 5 便宜约 22%;对代码负载,Terra 比 Sonnet 5 便宜约 42%。反过来,如果你的负载是代码为主,那么 Sonnet 5 涨价后与 Sol 促销价的差距会比标价显示的更小,迁移到 Sol 的性价比相应下降。

需要说明的是,1.0 到 1.35 这个区间是 Anthropic 在发布说明中给出的"视内容类型而定"的口径,具体哪类内容落在哪个位置,官方没有细分。本文不做进一步推测,建议的做法是拿自己的真实语料,用新旧分词器各跑一次计数,得到自己的实际系数,这个成本很低,但比任何估算都准。

六、按你的负载比重重算:三个典型场景

1:1 只是起点。把输入输出比重换成三种常见情形,排序会明显变化。下面用综合成本公式(比重加权平均)重算四个代表性模型。

场景 A:输出密集型,长文生成、报告撰写,输入输出比约 1:3。

模型加权综合单价
智谱 GLM-5.3-Flash¥2.3
腾讯 Hy3¥3.25
DeepSeek V4-Pro(闲时)¥11.25
月之暗面 Kimi K3¥80.0

输出占比越高,输出单价越便宜的模型优势越大。GLM-5.3-Flash 与 Hy3 在这个场景下的优势被进一步放大,而 Kimi K3 因为输出单价 100 元,劣势被放大到难以忽视。

场景 B:输入密集型,长文档分析、检索问答,输入输出比约 10:1。

模型加权综合单价
智谱 GLM-5.3-Flash¥0.98
腾讯 Hy3¥1.27
DeepSeek V4-Pro(闲时)¥5.32
月之暗面 Kimi K3¥27.3

输入占比高时,缓存命中率的权重骤增。这个场景下真正决定成本的往往不是标价,而是你的提示词工程:能不能把稳定的系统提示放在最前面、能不能让多轮对话复用前缀,直接决定你付的是标准输入价还是缓存命中价。

场景 C:代码负载,需额外计入分词放大系数,以 Sonnet 5 为例。

模型加权综合单价备注
Claude Sonnet 5(文本为主)$9.0放大系数 1.0
Claude Sonnet 5(代码为主)$12.15放大系数 1.35
GPT-5.6 Terra$7无分词变更记录

三个场景合起来的结论很一致:不存在"最便宜的模型",只存在"对你这个负载最便宜的模型"。任何脱离输入输出比重、缓存命中率与内容类型给出的比价结论,都只是在比标价,不是在比成本。

七、选型结论与三条硬提醒

按负载类型给一个可直接执行的结论。高吞吐简单任务走 Luna 或 GLM-5.3-Flash,把旗舰模型留给真正需要的环节;可异步的工作负载尽量调度到闲时,DeepSeek 的峰谷差是一倍,这是不需要任何技术改动就能拿到的折扣;长文档场景优先优化提示词结构去吃缓存命中,而不是急着换更便宜的模型;编码负载跨模型比价时,务必先测出自己的分词放大系数,否则你比的是两个不同的计量单位。

三条硬提醒。其一,按到期后的价格建模:任何促销价都应该按它到期后的水平算回报,Sol 从 12 到 17.5 的跳变就是现成的例子。其二,旧 ID 会过期:本批热点篇记录的 kimi-k2.5 与 moonshot-v1 于今日下线、DashScope 10 月 10 日还有一轮退役 30 多个模型 ID,都说明模型 ID 应该当作有到期日的依赖来管理。其三,别把单篇比价当决策依据:本文所有数字是公开定价的算术折算,未做实际调用压测,不含并发、限流、失败重试与工程质量差异。真要选型,拿自己的真实负载,在候选模型上各跑一周,用真实账单说话,那才是唯一可信的横评。

常见问题

Q1:标价差一倍,实际成本能差十倍,这个结论怎么来的? A1:因为标价只是第一层。往下还有三层:时段(DeepSeek 峰谷差价一倍)、缓存命中(命中与未命中的单价可以差到十倍量级)、分词器(Sonnet 5 换了 tokenizer,同一段输入 token 数乘以 1.0 到 1.35)。四层叠乘之后,两个标价接近的模型,实际账单可能差很远。所以本文的结论不是"标价不可信",而是"标价不可单独信"。

Q2:峰谷计费具体怎么利用? A2:DeepSeek 的规则是工作日 9:00–12:00 与 14:00–18:00 为高峰,闲时价格减半,周末全天按闲时计。凡是能异步的工作负载——批量摘要、离线标注、数据清洗、夜里跑的回归测试——调度到闲时就是不需要任何技术改动就能拿到的折扣。唯一的前提是你的业务能接受延迟。

Q3:缓存命中率一般能做到多少? A3:没有通用数字,它完全取决于你的提示词结构。规律是:把稳定的长内容(系统提示、工具定义、文档上下文)放在前缀,把变化的部分(用户输入、时间戳、会话状态)放在后面,命中率就高;反过来放则命中率接近零。所以要拿真实数字,得在自己的生产流量上测一周,看的是分位数而不是平均值。

Q4:Sonnet 5 到底涨了多少?口径为什么不一致? A4:两个口径都对,看的是不同的东西。费率层面是输入 $2→$3、输出 $10→$15,涨幅 50%;但如果算上 tokenizer 变更带来的输入 token 数放大(官方给的范围是 1.0 到 1.35 倍),编码类负载的复合涨幅在 65% 到 100% 之间,纯文本负载接近 50%。另外这次只影响 API,Consumer 订阅不受影响,两类成本别放在一张表上比。

Q5:促销价到期怎么办?要不要现在迁移? A5:任何需要工程投入的迁移,都应该按促销到期后的价格算回报,而不是按促销价算。GPT-5.6 Sol 的 $4/$20 是促销,约 2026-11-21 后回到 $5/$30,折算后的综合单价从 $12 跳到 $17.5——三个月的差价通常覆盖不了一次迁移的人力成本。判断标准很简单:如果这笔账在促销结束后仍然划算,才值得迁移。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-31

常见问题

标价差一倍,实际成本能差十倍,这个结论怎么来的?
因为标价只是第一层,往下还有三层:时段(峰谷差价一倍)、缓存命中(命中与未命中的单价可以差一个量级)、分词器(Sonnet 5 换 tokenizer 后同一段输入 token 数乘以 1.0 到 1.35)。四层叠乘之后,两个标价接近的模型实际账单可能差很远。所以结论不是「标价不可信」,而是「标价不可单独信」。
峰谷计费具体怎么利用?
DeepSeek 的规则是工作日 9:00–12:00 与 14:00–18:00 为高峰,闲时价格减半,周末全天按闲时计。凡是能异步的工作负载——批量摘要、离线标注、数据清洗、夜里跑的回归测试——调度到闲时就是不需要任何技术改动就能拿到的折扣。唯一前提是业务能接受延迟。
缓存命中率一般能做到多少?
没有通用数字,完全取决于提示词结构。规律是:把稳定的长内容(系统提示、工具定义、文档上下文)放在前缀,把变化的部分(用户输入、时间戳、会话状态)放在后面,命中率就高;反过来放则命中率接近零。要拿真实数字,得在自己的生产流量上测一周,并且看分位数而不是平均值。
Sonnet 5 到底涨了多少?为什么各处口径不一致?
两个口径都对,看的是不同东西。费率层面是输入 2 美元到 3 美元、输出 10 美元到 15 美元,涨幅 50%;算上 tokenizer 变更带来的输入 token 数放大(官方范围 1.0 到 1.35 倍),编码类负载复合涨幅在 65% 到 100% 之间,纯文本负载接近 50%。另外这次只影响 API,Consumer 订阅不受影响,两类成本别放在一张表上比。
促销价到期怎么办?要不要现在迁移?
任何需要工程投入的迁移,都应该按促销到期后的价格算回报,而不是按促销价算。GPT-5.6 Sol 的 4 与 20 美元是促销,约 11 月 21 日后回到 5 与 30,折算后综合单价从 12 跳到 17.5——三个月的差价通常覆盖不了一次迁移的人力成本。判断标准很简单:如果这笔账在促销结束后仍然划算,才值得迁移。

相关文章

硬核横评

一个 agent 被攻破就全盘失守:四套凭证与权限治理方案横评

凭据从配置项变成了攻击面,但绝大多数团队防线还停在"给 agent 套个沙箱"。本文与站内沙箱隔离横评明确分工:沙箱管"代码在哪跑",凭据治理管"密钥怎么用、动作谁批、凭据能不能外带"。对比 OpenClaw 2.0、OpenWorker、OpenHuman 与传统密钥托管四套方案,按凭据生命周期六环节(存/用/批/外带/审计/多 agent)拆:OpenClaw 掩码请求 + opt-in proxy 目标白名单;OpenWorker hard floors + 自主权阶梯 + reviewer model + 熔断器,且无人值守绝不自批;OpenHuman Privacy Mode 在 Rust core 强制 + agent 间 E2E 加密。二手数据(SaaS Sentinel 转述,未找到一手报告)显示 1 个 agent 妥协概率 0.24、7 个升到 0.86,风险随数量超线性增长——前提是"任一 agent 提议即执行"。

2026年9月1日11 分钟阅读
硬核横评

腾讯 770B 只激活 49B:五款万亿级开源旗舰横评,决定部署成本的不是总参数

Hy4 preview(770B/49B)发布把开源旗舰的参数军备推到新高,但决定部署成本的不是总参数:激活参数省的是算力,权重驻留吃的是显存。本篇横评五款开放权重旗舰--Hy4 preview、GLM-5.3、Kimi K3(2.8T)、DeepSeek V4(1.6T 口径)、Qwen3.8-Max(2.4T)--按总参/激活比、上下文、许可证、显存门槛(工程估算口径)与 API 价格快照逐项对表。与 8-27 价格横评分工:那篇算 320B 级 API 账,本篇算 700B-2.8T 级参数与部署门槛账。五条按场景结论:追最新选 Hy4(Apache 2.0+MTP 投机解码+FP8 友好)、要参数规模选 K3、要成熟生态选 GLM/DeepSeek、阿里系合规选 Qwen,以及共同一条--先看每 token 成本与稀疏注意力,再看总参。

2026年8月29日9 分钟阅读