一个被大多数「换模型」讨论跳过的问题:提价 350% 之后,DeepSeek 到底还便宜吗?
8 月 17 日,DeepSeek 把 V4-Flash 的高峰时段输出价格从 2 元/百万 tokens 上调到 9 元,涨幅 350%,缓存命中输入同步提价 400%。九天之后的 8 月 26 日,智谱上线并开源了 GLM-5.3-Flash:输出 2.8 元/百万 tokens,对比 DeepSeek V4-Pro 高峰输出的 27 元,恰好是十分之一。蓝鲸新闻的标题写得毫不客气:《DeepSeek提价九天后,智谱用十分之一的价格杀进来》。
这两家掰手腕的这个产品带,业内叫「轻量旗舰」:总参数两三千亿、每 token 只激活一两百亿的 MoE 模型。推理成本压得极低,智能水平却顶在旗舰线上--GLM-5.3-Flash 在 Artificial Analysis 综合智能指数拿 57 分,与 Claude Opus 4.8 持平。于是所有选型建议看起来都顺理成章:换 GLM。
但先别急。把这笔账拆到场景里算完之后,结论会反转一次:在缓存命中率超过九成的编程 Agent 场景,DeepSeek V4-Flash 闲时档反而比 GLM-5.3-Flash 便宜约 32%(推算口径)--提价 350% 的那家,在它最重的用户群里可能还是更便宜的那个。
先划边界:GLM-5.3-Flash 的能力向拆解本站已有热点文章(《10 万张国产卡撑起的开源轻量旗舰》),本文不重复模型评测,只算钱:单价口径、峰谷差价、缓存命中价差、三类场景的真实成本,以及这场价格战背后的行业账本。横评对象为 GLM-5.3-Flash、DeepSeek V4-Flash、DeepSeek V4-Pro、Kimi K3,外加 Claude Opus 4.8 作为国际参照。所有数字逐项标注口径(官方定价 / 媒体报道 / 推算 / 换算),整体为代表性对比,非亲自压测,非投资建议,采购前以各官方页面为准。
一、价格基本盘:五强怎么收钱
先摆总表。注意口径差异极大:有官方一手定价,有媒体报道口径,有推算价,还有换算价,逐项标注(价格为 2026-08-27 快照):
| 模型 | 总参/激活 | 输入(元/M tokens) | 输出(元/M tokens) | 缓存命中输入 | AA 智能指数 | 口径 |
|---|---|---|---|---|---|---|
| GLM-5.3-Flash(智谱) | 320B / 18B | 0.8 | 2.8 | 0.23 | 57(与 Claude Opus 4.8 持平) | 官方定价,2026-08-26 上线 |
| DeepSeek V4-Flash | 2840 亿 / 130 亿 | 闲时约 1.5(推算) | 高峰 9 / 闲时 4.5 | 闲时 0.05(提价 400% 后) | 未采集 | 蓝鲸新闻 2026-08-27;输入闲时价按「GLM 输入为其 53%」反推 |
| DeepSeek V4-Pro | 未采集 | 未采集 | 高峰 27(约 3.96 美元,提价前 0.87 美元) | 未采集 | 53 | 蓝鲸新闻 2026-08-27 |
| Kimi K3(月之暗面) | 2.8 万亿 | 2-20 | 100(上一代的三倍多) | 未采集 | 未采集 | 腾讯云开发者社区,2026-07-17 |
| Claude Opus 4.8(国际参照) | 未采集 | 约 32(换算) | 约 112(换算) | 未采集 | 57 | 按智谱官方「GLM 约为其 1/40」反推,非官方牌价 |
三个第一眼结论:
- 峰谷定价是个新变量。 DeepSeek 在这次提价中引入了分时定价:每天 9-12 点、14-18 点为高峰,V4-Flash 输出闲时 4.5 元、高峰 9 元,一天之内价差一倍;V4-Pro 高峰输出 27 元。国内 API 定价第一次把「时段」写进价格表,采购侧从此要多算一个维度:你的任务能不能挪到闲时跑。
- 「十分之一」的媒体口径成立,但要看跟谁比。 GLM 输出 2.8 元对 V4-Pro 高峰 27 元,恰好 1/10;对 V4-Flash 高峰 9 元约 1/3;对闲时 4.5 元约 62%。同一个「智谱便宜多少」,答案是三档--这正是本文要把账拆开算的原因。
- AA 指数和价格明显背离。 GLM-5.3-Flash 的 57 分与 Opus 4.8 持平,价格却是其约 1/40(智谱官方口径);V4-Pro 53 分,高峰输出却是 GLM 的近 10 倍。在这批模型上,「能力分」和「性价比」已经是两个独立的轴。
另一个值得记录的细节:GLM-5.3-Flash 是全表唯一把缓存命中价压到极低的模型(0.23 元/M,为正常输入的约 29%),同时给到 1M 上下文、128K 最大输出、MIT 开放权重,推理跑在国产 10 万卡集群上。而 DeepSeek 提价的代价已经显形:其在编程工具 OpenCode 上的调用量掉了一半(晚点 LatePost 口径)--价格杠杆的一端是收入,另一端是流失,两家都在用自己的账本下注。
二、核心账本:三个场景,三种答案
单一价格表回答不了「该用谁」。把五强的账拆进三个典型场景(价格为 2026-08-27 快照,DeepSeek 输入闲时价为推算口径):
| 场景 | GLM-5.3-Flash | DeepSeek V4-Flash | 备注 |
|---|---|---|---|
| 编程 Agent(100 万输入中 90 万走缓存) | 0.8×0.1+0.23×0.9=0.287 元/M 输入 | 闲时 1.5×0.1+0.05×0.9=0.195 元/M 输入 | V4-Flash 约省 32%;推算口径 |
| 普通对话/RAG/一次性长文档(缓存几乎不命中) | 输入为 V4-Flash 闲时的 53%、输出为其 62%;叠加优惠期半价为 27%/31% | 闲时档为基准 | GLM 明显更便宜 |
| 高峰时段(9-12、14-18 点) | 无峰谷差价 | 输出翻倍至 9 元/M(V4-Pro 为 27 元/M) | GLM 账面优势最大 |
场景一:编程 Agent,账要反着算。 编程 Agent 的输入高度重复--系统提示词、代码库上下文、工具定义,每一轮都在重发,缓存命中率普遍超过九成。按 100 万输入中 90 万走缓存计:GLM-5.3-Flash 每 M 输入 = 0.8×0.1 + 0.23×0.9 = 0.287 元;DeepSeek V4-Flash 闲时 = 1.5×0.1 + 0.05×0.9 = 0.195 元,便宜约 32%(输入闲时价为推算口径)。换句话说,DeepSeek 缓存命中 0.05 元/M 这个「提价 400% 之后」的价格,横向比仍然是全场最低的输入单价。这就是标题里那个反转:编程党先别急着换模型--先看自己业务的缓存命中率,再把这笔账算出来。当然有两个前提:任务能错峰到闲时跑;那个 1.5 元的输入闲时价是推算值,下单前以官方页面核实。
场景二:零缓存,是 GLM 的甜区。 普通对话、RAG 检索增强、一次性长文档摘要,缓存几乎不命中,谁的牌价便宜谁赢。GLM 输入 0.8、输出 2.8,对 V4-Flash 闲时(约 1.5 / 4.5)分别是 53% 和 62%;叠加 GLM 当前优惠期半价,进一步压到 27% 和 31%。这一档里「半价杀入」是字面意思。
场景三:高峰时段,差价拉开到 3 倍以上。 白天 9-12、14-18 两个窗口,V4 系直接翻倍(V4-Flash 输出 9 元、V4-Pro 27 元),GLM 无峰谷差价。在线客服、白天批处理这类没法错峰的业务,高峰档 GLM 输出 2.8 元对 V4-Flash 的 9 元,约 31%;对 V4-Pro 的 27 元,约 1/10--媒体的「十分之一」在这个场景最成立。反过来,如果你的任务全部能排进夜间闲时,GLM 的优势会缩到最小。
三、能力对照:便宜之外,智商够不够
价格之外补三个坐标(均为第三方或媒体口径,快照 2026-08-27):
- AA 综合智能指数:GLM-5.3-Flash 57 分,与 Claude Opus 4.8 持平;DeepSeek V4-Pro 53 分。GLM-5.3-Flash 是本表「分数/价格比」最极端的模型--但注意 AA 是综合指数,具体到你自己的任务(某类代码、某个垂直领域)的排序可能不同,接入前跑自己的评测集。
- Kimi K3 是能力溢价,不是性价比。 2.8 万亿总参数(超 DeepSeek V4 的 1.6 万亿、文心 5.0 的 2.4 万亿,全球首个开源 3 万亿级),KDA 混合线性注意力+注意力残差,原生视觉理解,1M 上下文;输出 100 元/M 是上一代的三倍多。买它买的是 Frontend Code Arena 1679 分超 Claude Fable 5 登顶、48 小时独立设计并验证一款芯片这类能力上限,不是 token 单价。
- 上下文与开放权重:GLM-5.3-Flash 1M 上下文、128K 最大输出、MIT 开放权重;Kimi K3 同为 1M 上下文、2026-07-27 已开放权重。要私有化部署或做成本兜底(API 涨价时自托管迁移)的团队,这两家是表里唯二的开源选项。
四、账本背后:为什么有人涨价、有人降价
价格战不是情绪,是财务报表(均为媒体援引口径,快照 2026-08-27):
| 公司 | 关键数据 |
|---|---|
| DeepSeek | 前 7 个月营收约 4.75 亿元(2025 全年的 10 倍);净亏损 7.15 亿元;API 业务毛利率 82.9%、整体毛利率 44.6%;AI 基础设施投入约 110 亿元(收入的 23 倍)(The Information 援引知情人士) |
| MiniMax | 上半年收入 1.17 亿美元(+283%);开放平台收入 7392.9 万美元(+703%);整体毛利率 17.9%(去年同期 12.1%);7 月 token 消耗量是 1 月的 20 倍(闫俊杰业绩会口径) |
| 智谱 | 截至一季度 API 调用定价累计提升 83%,调用量反而增长 400% |
| 国际参照 | OpenAI 一季度毛利率 39%;Anthropic 预计今年毛利率从 40% 提到 63% |
这张表解释了两件事。其一,提价是行业动作不是孤例:年初以来已有七家云厂商和模型厂商上调价格(律动 BlockBeats 统计)--在推理成本高企、基础设施投入动辄百亿的行业里,毛利修复是集体议题,OpenAI 和 Anthropic 也在做同一件事。其二,智谱敢在别人提价时杀价,是因为它验证过「调价不掉量」:定价累计 +83%、调用量 +400%--而 DeepSeek 提价 350% 后 OpenCode 调用量掉一半,是反向样本。谁对谁错不好说,但可以确定的是:定价权争夺期的价格表,随时会变。
再补一个需求侧坐标(坤小七Human 2026-07-27 微博口径,社区统计仅供参考):每周 tokens 用量 DeepSeek V4 Flash 为 5.44T(环比+14%)、小米 MiMo-v2.5 为 4.46T(+5%)、MiniMax M3 为 4.24T(+15%)、智谱 GLM-5.2 为 2.9T(+25%)。DeepSeek 仍是消耗量第一,但增速最快的是智谱--GLM-5.3-Flash 这个定价,明显是冲着份额去的。
五、按场景选:五条结论
- 无缓存、重输入输出的对话/RAG/一次性长文档:选 GLM-5.3-Flash。闲时口径也比 V4-Flash 便宜近半,优惠期半价更低,且 1M 上下文和 128K 最大输出同时能打。接入全流程见本站 GLM-5.3-Flash 接入 SOP。
- 编程 Agent、批处理等高缓存命中率场景:先算缓存账再换模型。命中超九成且能错峰,V4-Flash 闲时仍便宜约 32%(推算口径);命中率低或任务只能白天跑,GLM 的 0.23 元缓存价加无峰谷差价更稳。关于 API 成本的通用省钱打法,可复习 API 成本优化 SOP。
- 要能力上限(前端代码、复杂推理、视觉理解):Kimi K3 是能力溢价档,输出 100 元/M 别当性价比选项;GLM-5.3-Flash 的 AA 57 分是全场「分数/价格比」最优。选编程订阅而非 API 的同学,看本站 AI Coding Plan 横评。
- 出海或对国际供应商比价:Claude Opus 4.8 仍是能力锚点(AA 57),但换算价格约为 GLM 的 40 倍。多数中文业务场景,这笔国际预算可以省下来打别的。
- 所有场景共同的一条:别把今天的价格表写死进年度合同。行业进入定价权争夺期,七家提价与智谱降价同时发生,价格快照的有效期可能只有几周--选型上多留一条可切换的通道,比押注任何一家的牌价更值钱。
常见问题
Q1:GLM-5.3-Flash 输出 2.8 元、DeepSeek V4-Flash 闲时 4.5 元,是不是无脑换 GLM? A1:不是,分场景。零缓存的对话/RAG/长文档场景,GLM 输入输出为 V4-Flash 闲时价的 53%/62%,半价期 27%/31%,确实便宜;但编程 Agent 这类缓存命中率超九成的场景,按 90 万/百万走缓存算,GLM 为 0.287 元/M 输入、V4-Flash 闲时为 0.195 元/M,V4-Flash 反而便宜约 32%(推算口径)。先看自己的缓存命中率,再算账。
Q2:高峰时段怎么界定?我的任务能错峰吗? A2:按每天 9-12 点、14-18 点两个窗口为高峰(蓝鲸新闻口径),窗口内调用按高峰价计。批处理、离线评测、夜间跑的 Agent 任务天然适合错峰到闲时档;在线客服、白天实时交互类业务错不了峰,只能按高峰价对比--这一档 GLM 无峰谷差价,优势最大。
Q3:Kimi K3 输出 100 元/M 这么贵,图什么? A3:图能力上限,不图性价比。2.8 万亿总参数(全球首个开源 3 万亿级)、KDA 混合线性注意力+注意力残差、原生视觉理解、1M 上下文,Frontend Code Arena 1679 分超 Claude Fable 5 登顶,48 小时独立设计并验证一款芯片。它的定位是能力溢价档,跟 GLM-5.3-Flash 这类把成本压到极致的轻量旗舰不是同一张牌桌。
Q4:Claude Opus 4.8 的价格为什么是「换算」出来的? A4:因为本文没有采其官方牌价,用的是智谱官方「GLM-5.3-Flash 价格约为其 1/40」的口径反推:输入约 32 元/M、输出约 112 元/M。这是换算口径而非官方牌价,仅供量级参考;按美元牌价核价时以 Anthropic 官方页面为准。
Q5:这轮价格表会变吗?现在锁年约划算吗? A5:会变,而且可能很快。年初以来已有七家云厂商和模型厂商上调价格(律动 BlockBeats 统计),智谱却在降价抢份额;智谱自己一季度定价累计 +83% 时调用量反而 +400%,DeepSeek 提价 350% 后 OpenCode 调用量掉一半。行业处于定价权争夺期,建议架构上保持可切换(多家 API 通道+开源权重兜底),商务上按季度滚动询价,别把今天的快照价写死进年度合同。
参考来源
- 蓝鲸新闻(2026-08-27 15:17):DeepSeek提价九天后,智谱用十分之一的价格杀进来--峰谷定价、V4-Flash/V4-Pro 价格、七家提价统计、DeepSeek/MiniMax/智谱财务口径:https://baijiahao.baidu.com/s?id=1874660001676882489
- 财联社/科创板日报(2026-08-27):10万张国产算力卡扛起"牛来":智谱开源GLM-5.3-Flash--总参/激活、AA 57 分、10 万卡集群:https://baijiahao.baidu.com/s?id=1874642322871069438
- 腾讯云开发者社区(2026-07-17):2.8万亿参数,Kimi K3正式发布--K3 参数、KDA、定价与能力数据:https://cloud.tencent.com/developer/news/4268105
- 智谱 AI 开放文档 GLM-5.3-Flash 模型卡--官方定价、上下文与输出上限、MIT 权重:https://docs.bigmodel.cn/cn/guide/models/vlm/glm-5.3-flash
- Artificial Analysis 综合智能指数(经财联社/蓝鲸转引)--GLM-5.3-Flash 57 分、V4-Pro 53 分、Opus 4.8 57 分
- 晚点 LatePost、The Information、律动 BlockBeats、坤小七Human 微博(2026-07-27)--OpenCode 调用量、DeepSeek 财务、提价统计、周 tokens 社区统计等口径,均经蓝鲸新闻 2026-08-27 报道转引
- 关联阅读:本站 GLM-5.3-Flash 开源上线热点(同批)、GLM-5.3-Flash 接入 SOP(同批)、AI Coding Plan 横评、大模型性价比横评、大模型价格战热点、DeepSeek V4 Flash 实测、国产三强长文本横评、API 成本优化 SOP
本文为代表性横评,基于公开报道与官方定价整理,价格为 2026-08-27 快照(DeepSeek 输入闲时价为推算、Claude Opus 4.8 为换算口径,均已标注),非亲自压测,非投资建议;各家价格与峰谷规则随时可能调整,采购前以官方页面为准。