硬核横评
硬核横评

DeepSeek 提价 350% 九天后,智谱半价杀入:轻量旗舰 API 五强横评,编程党先别急着换模型

DeepSeek 8 月 17 日把 V4-Flash 高峰输出提价 350%(2 元到 9 元/百万 token)并首推峰谷定价,九天后智谱上线 GLM-5.3-Flash(输出 2.8 元)正面接招。本篇把账拆到场景算:零缓存的对话/RAG/长文档场景 GLM 便宜近半(优惠期 27%-31%);但缓存命中率超九成的编程 Agent 场景,V4-Flash 闲时按 90 万/百万走缓存算反而便宜约 32%(推算口径)--提价的那家在它最重的用户群里可能还是更便宜的。高峰时段(9-12、14-18 点)GLM 无峰谷差价优势最大;Kimi K3 输出 100 元/M 是能力溢价不是性价比;行业账本揭示提价是集体动作(DeepSeek 净亏 7.15 亿、智谱定价 +83% 调用量反 +400%)。附五条按场景选型结论。

发布于 2026年8月27日9 分钟阅读
<!-- lite-flagship-llm-price-comparison-review | review | DeepSeek 提价 350% 九天后,智谱半价杀入:轻量旗舰 API 五强横评,编程党先别急着换模型 -->

一个被大多数「换模型」讨论跳过的问题:提价 350% 之后,DeepSeek 到底还便宜吗?

8 月 17 日,DeepSeek 把 V4-Flash 的高峰时段输出价格从 2 元/百万 tokens 上调到 9 元,涨幅 350%,缓存命中输入同步提价 400%。九天之后的 8 月 26 日,智谱上线并开源了 GLM-5.3-Flash:输出 2.8 元/百万 tokens,对比 DeepSeek V4-Pro 高峰输出的 27 元,恰好是十分之一。蓝鲸新闻的标题写得毫不客气:《DeepSeek提价九天后,智谱用十分之一的价格杀进来》。

这两家掰手腕的这个产品带,业内叫「轻量旗舰」:总参数两三千亿、每 token 只激活一两百亿的 MoE 模型。推理成本压得极低,智能水平却顶在旗舰线上--GLM-5.3-Flash 在 Artificial Analysis 综合智能指数拿 57 分,与 Claude Opus 4.8 持平。于是所有选型建议看起来都顺理成章:换 GLM。

但先别急。把这笔账拆到场景里算完之后,结论会反转一次:在缓存命中率超过九成的编程 Agent 场景,DeepSeek V4-Flash 闲时档反而比 GLM-5.3-Flash 便宜约 32%(推算口径)--提价 350% 的那家,在它最重的用户群里可能还是更便宜的那个。

先划边界:GLM-5.3-Flash 的能力向拆解本站已有热点文章(《10 万张国产卡撑起的开源轻量旗舰》),本文不重复模型评测,只算钱:单价口径、峰谷差价、缓存命中价差、三类场景的真实成本,以及这场价格战背后的行业账本。横评对象为 GLM-5.3-Flash、DeepSeek V4-Flash、DeepSeek V4-Pro、Kimi K3,外加 Claude Opus 4.8 作为国际参照。所有数字逐项标注口径(官方定价 / 媒体报道 / 推算 / 换算),整体为代表性对比,非亲自压测,非投资建议,采购前以各官方页面为准。

一、价格基本盘:五强怎么收钱

先摆总表。注意口径差异极大:有官方一手定价,有媒体报道口径,有推算价,还有换算价,逐项标注(价格为 2026-08-27 快照):

模型总参/激活输入(元/M tokens)输出(元/M tokens)缓存命中输入AA 智能指数口径
GLM-5.3-Flash(智谱)320B / 18B0.82.80.2357(与 Claude Opus 4.8 持平)官方定价,2026-08-26 上线
DeepSeek V4-Flash2840 亿 / 130 亿闲时约 1.5(推算)高峰 9 / 闲时 4.5闲时 0.05(提价 400% 后)未采集蓝鲸新闻 2026-08-27;输入闲时价按「GLM 输入为其 53%」反推
DeepSeek V4-Pro未采集未采集高峰 27(约 3.96 美元,提价前 0.87 美元)未采集53蓝鲸新闻 2026-08-27
Kimi K3(月之暗面)2.8 万亿2-20100(上一代的三倍多)未采集未采集腾讯云开发者社区,2026-07-17
Claude Opus 4.8(国际参照)未采集约 32(换算)约 112(换算)未采集57按智谱官方「GLM 约为其 1/40」反推,非官方牌价

三个第一眼结论:

  1. 峰谷定价是个新变量。 DeepSeek 在这次提价中引入了分时定价:每天 9-12 点、14-18 点为高峰,V4-Flash 输出闲时 4.5 元、高峰 9 元,一天之内价差一倍;V4-Pro 高峰输出 27 元。国内 API 定价第一次把「时段」写进价格表,采购侧从此要多算一个维度:你的任务能不能挪到闲时跑。
  2. 「十分之一」的媒体口径成立,但要看跟谁比。 GLM 输出 2.8 元对 V4-Pro 高峰 27 元,恰好 1/10;对 V4-Flash 高峰 9 元约 1/3;对闲时 4.5 元约 62%。同一个「智谱便宜多少」,答案是三档--这正是本文要把账拆开算的原因。
  3. AA 指数和价格明显背离。 GLM-5.3-Flash 的 57 分与 Opus 4.8 持平,价格却是其约 1/40(智谱官方口径);V4-Pro 53 分,高峰输出却是 GLM 的近 10 倍。在这批模型上,「能力分」和「性价比」已经是两个独立的轴。

另一个值得记录的细节:GLM-5.3-Flash 是全表唯一把缓存命中价压到极低的模型(0.23 元/M,为正常输入的约 29%),同时给到 1M 上下文、128K 最大输出、MIT 开放权重,推理跑在国产 10 万卡集群上。而 DeepSeek 提价的代价已经显形:其在编程工具 OpenCode 上的调用量掉了一半(晚点 LatePost 口径)--价格杠杆的一端是收入,另一端是流失,两家都在用自己的账本下注。

二、核心账本:三个场景,三种答案

单一价格表回答不了「该用谁」。把五强的账拆进三个典型场景(价格为 2026-08-27 快照,DeepSeek 输入闲时价为推算口径):

场景GLM-5.3-FlashDeepSeek V4-Flash备注
编程 Agent(100 万输入中 90 万走缓存)0.8×0.1+0.23×0.9=0.287 元/M 输入闲时 1.5×0.1+0.05×0.9=0.195 元/M 输入V4-Flash 约省 32%;推算口径
普通对话/RAG/一次性长文档(缓存几乎不命中)输入为 V4-Flash 闲时的 53%、输出为其 62%;叠加优惠期半价为 27%/31%闲时档为基准GLM 明显更便宜
高峰时段(9-12、14-18 点)无峰谷差价输出翻倍至 9 元/M(V4-Pro 为 27 元/M)GLM 账面优势最大

场景一:编程 Agent,账要反着算。 编程 Agent 的输入高度重复--系统提示词、代码库上下文、工具定义,每一轮都在重发,缓存命中率普遍超过九成。按 100 万输入中 90 万走缓存计:GLM-5.3-Flash 每 M 输入 = 0.8×0.1 + 0.23×0.9 = 0.287 元;DeepSeek V4-Flash 闲时 = 1.5×0.1 + 0.05×0.9 = 0.195 元,便宜约 32%(输入闲时价为推算口径)。换句话说,DeepSeek 缓存命中 0.05 元/M 这个「提价 400% 之后」的价格,横向比仍然是全场最低的输入单价。这就是标题里那个反转:编程党先别急着换模型--先看自己业务的缓存命中率,再把这笔账算出来。当然有两个前提:任务能错峰到闲时跑;那个 1.5 元的输入闲时价是推算值,下单前以官方页面核实。

场景二:零缓存,是 GLM 的甜区。 普通对话、RAG 检索增强、一次性长文档摘要,缓存几乎不命中,谁的牌价便宜谁赢。GLM 输入 0.8、输出 2.8,对 V4-Flash 闲时(约 1.5 / 4.5)分别是 53% 和 62%;叠加 GLM 当前优惠期半价,进一步压到 27% 和 31%。这一档里「半价杀入」是字面意思。

场景三:高峰时段,差价拉开到 3 倍以上。 白天 9-12、14-18 两个窗口,V4 系直接翻倍(V4-Flash 输出 9 元、V4-Pro 27 元),GLM 无峰谷差价。在线客服、白天批处理这类没法错峰的业务,高峰档 GLM 输出 2.8 元对 V4-Flash 的 9 元,约 31%;对 V4-Pro 的 27 元,约 1/10--媒体的「十分之一」在这个场景最成立。反过来,如果你的任务全部能排进夜间闲时,GLM 的优势会缩到最小。

三、能力对照:便宜之外,智商够不够

价格之外补三个坐标(均为第三方或媒体口径,快照 2026-08-27):

  • AA 综合智能指数:GLM-5.3-Flash 57 分,与 Claude Opus 4.8 持平;DeepSeek V4-Pro 53 分。GLM-5.3-Flash 是本表「分数/价格比」最极端的模型--但注意 AA 是综合指数,具体到你自己的任务(某类代码、某个垂直领域)的排序可能不同,接入前跑自己的评测集。
  • Kimi K3 是能力溢价,不是性价比。 2.8 万亿总参数(超 DeepSeek V4 的 1.6 万亿、文心 5.0 的 2.4 万亿,全球首个开源 3 万亿级),KDA 混合线性注意力+注意力残差,原生视觉理解,1M 上下文;输出 100 元/M 是上一代的三倍多。买它买的是 Frontend Code Arena 1679 分超 Claude Fable 5 登顶、48 小时独立设计并验证一款芯片这类能力上限,不是 token 单价。
  • 上下文与开放权重:GLM-5.3-Flash 1M 上下文、128K 最大输出、MIT 开放权重;Kimi K3 同为 1M 上下文、2026-07-27 已开放权重。要私有化部署或做成本兜底(API 涨价时自托管迁移)的团队,这两家是表里唯二的开源选项。

四、账本背后:为什么有人涨价、有人降价

价格战不是情绪,是财务报表(均为媒体援引口径,快照 2026-08-27):

公司关键数据
DeepSeek前 7 个月营收约 4.75 亿元(2025 全年的 10 倍);净亏损 7.15 亿元;API 业务毛利率 82.9%、整体毛利率 44.6%;AI 基础设施投入约 110 亿元(收入的 23 倍)(The Information 援引知情人士)
MiniMax上半年收入 1.17 亿美元(+283%);开放平台收入 7392.9 万美元(+703%);整体毛利率 17.9%(去年同期 12.1%);7 月 token 消耗量是 1 月的 20 倍(闫俊杰业绩会口径)
智谱截至一季度 API 调用定价累计提升 83%,调用量反而增长 400%
国际参照OpenAI 一季度毛利率 39%;Anthropic 预计今年毛利率从 40% 提到 63%

这张表解释了两件事。其一,提价是行业动作不是孤例:年初以来已有七家云厂商和模型厂商上调价格(律动 BlockBeats 统计)--在推理成本高企、基础设施投入动辄百亿的行业里,毛利修复是集体议题,OpenAI 和 Anthropic 也在做同一件事。其二,智谱敢在别人提价时杀价,是因为它验证过「调价不掉量」:定价累计 +83%、调用量 +400%--而 DeepSeek 提价 350% 后 OpenCode 调用量掉一半,是反向样本。谁对谁错不好说,但可以确定的是:定价权争夺期的价格表,随时会变。

再补一个需求侧坐标(坤小七Human 2026-07-27 微博口径,社区统计仅供参考):每周 tokens 用量 DeepSeek V4 Flash 为 5.44T(环比+14%)、小米 MiMo-v2.5 为 4.46T(+5%)、MiniMax M3 为 4.24T(+15%)、智谱 GLM-5.2 为 2.9T(+25%)。DeepSeek 仍是消耗量第一,但增速最快的是智谱--GLM-5.3-Flash 这个定价,明显是冲着份额去的。

五、按场景选:五条结论

  1. 无缓存、重输入输出的对话/RAG/一次性长文档:选 GLM-5.3-Flash。闲时口径也比 V4-Flash 便宜近半,优惠期半价更低,且 1M 上下文和 128K 最大输出同时能打。接入全流程见本站 GLM-5.3-Flash 接入 SOP
  2. 编程 Agent、批处理等高缓存命中率场景:先算缓存账再换模型。命中超九成且能错峰,V4-Flash 闲时仍便宜约 32%(推算口径);命中率低或任务只能白天跑,GLM 的 0.23 元缓存价加无峰谷差价更稳。关于 API 成本的通用省钱打法,可复习 API 成本优化 SOP
  3. 要能力上限(前端代码、复杂推理、视觉理解):Kimi K3 是能力溢价档,输出 100 元/M 别当性价比选项;GLM-5.3-Flash 的 AA 57 分是全场「分数/价格比」最优。选编程订阅而非 API 的同学,看本站 AI Coding Plan 横评
  4. 出海或对国际供应商比价:Claude Opus 4.8 仍是能力锚点(AA 57),但换算价格约为 GLM 的 40 倍。多数中文业务场景,这笔国际预算可以省下来打别的。
  5. 所有场景共同的一条:别把今天的价格表写死进年度合同。行业进入定价权争夺期,七家提价与智谱降价同时发生,价格快照的有效期可能只有几周--选型上多留一条可切换的通道,比押注任何一家的牌价更值钱。

常见问题

Q1:GLM-5.3-Flash 输出 2.8 元、DeepSeek V4-Flash 闲时 4.5 元,是不是无脑换 GLM? A1:不是,分场景。零缓存的对话/RAG/长文档场景,GLM 输入输出为 V4-Flash 闲时价的 53%/62%,半价期 27%/31%,确实便宜;但编程 Agent 这类缓存命中率超九成的场景,按 90 万/百万走缓存算,GLM 为 0.287 元/M 输入、V4-Flash 闲时为 0.195 元/M,V4-Flash 反而便宜约 32%(推算口径)。先看自己的缓存命中率,再算账。

Q2:高峰时段怎么界定?我的任务能错峰吗? A2:按每天 9-12 点、14-18 点两个窗口为高峰(蓝鲸新闻口径),窗口内调用按高峰价计。批处理、离线评测、夜间跑的 Agent 任务天然适合错峰到闲时档;在线客服、白天实时交互类业务错不了峰,只能按高峰价对比--这一档 GLM 无峰谷差价,优势最大。

Q3:Kimi K3 输出 100 元/M 这么贵,图什么? A3:图能力上限,不图性价比。2.8 万亿总参数(全球首个开源 3 万亿级)、KDA 混合线性注意力+注意力残差、原生视觉理解、1M 上下文,Frontend Code Arena 1679 分超 Claude Fable 5 登顶,48 小时独立设计并验证一款芯片。它的定位是能力溢价档,跟 GLM-5.3-Flash 这类把成本压到极致的轻量旗舰不是同一张牌桌。

Q4:Claude Opus 4.8 的价格为什么是「换算」出来的? A4:因为本文没有采其官方牌价,用的是智谱官方「GLM-5.3-Flash 价格约为其 1/40」的口径反推:输入约 32 元/M、输出约 112 元/M。这是换算口径而非官方牌价,仅供量级参考;按美元牌价核价时以 Anthropic 官方页面为准。

Q5:这轮价格表会变吗?现在锁年约划算吗? A5:会变,而且可能很快。年初以来已有七家云厂商和模型厂商上调价格(律动 BlockBeats 统计),智谱却在降价抢份额;智谱自己一季度定价累计 +83% 时调用量反而 +400%,DeepSeek 提价 350% 后 OpenCode 调用量掉一半。行业处于定价权争夺期,建议架构上保持可切换(多家 API 通道+开源权重兜底),商务上按季度滚动询价,别把今天的快照价写死进年度合同。


参考来源

本文为代表性横评,基于公开报道与官方定价整理,价格为 2026-08-27 快照(DeepSeek 输入闲时价为推算、Claude Opus 4.8 为换算口径,均已标注),非亲自压测,非投资建议;各家价格与峰谷规则随时可能调整,采购前以官方页面为准。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-27

常见问题

GLM-5.3-Flash 输出 2.8 元、DeepSeek V4-Flash 闲时 4.5 元,是不是无脑换 GLM?
不是,分场景。零缓存的对话/RAG/长文档场景,GLM 输入输出为 V4-Flash 闲时价的 53%/62%,半价期 27%/31%,确实便宜;但编程 Agent 这类缓存命中率超九成的场景,按 90 万/百万走缓存算,GLM 为 0.287 元/M 输入、V4-Flash 闲时为 0.195 元/M,V4-Flash 反而便宜约 32%(推算口径)。先看自己的缓存命中率,再算账。
高峰时段怎么界定?我的任务能错峰吗?
按每天 9-12 点、14-18 点两个窗口为高峰(蓝鲸新闻口径),窗口内调用按高峰价计。批处理、离线评测、夜间跑的 Agent 任务天然适合错峰到闲时档;在线客服、白天实时交互类业务错不了峰,只能按高峰价对比--这一档 GLM 无峰谷差价,优势最大。
Kimi K3 输出 100 元/M 这么贵,图什么?
图能力上限,不图性价比。2.8 万亿总参数(全球首个开源 3 万亿级)、KDA 混合线性注意力+注意力残差、原生视觉理解、1M 上下文,Frontend Code Arena 1679 分超 Claude Fable 5 登顶,48 小时独立设计并验证一款芯片。它的定位是能力溢价档,跟 GLM-5.3-Flash 这类把成本压到极致的轻量旗舰不是同一张牌桌。
Claude Opus 4.8 的价格为什么是「换算」出来的?
因为本文没有采其官方牌价,用的是智谱官方「GLM-5.3-Flash 价格约为其 1/40」的口径反推:输入约 32 元/M、输出约 112 元/M。这是换算口径而非官方牌价,仅供量级参考;按美元牌价核价时以 Anthropic 官方页面为准。
这轮价格表会变吗?现在锁年约划算吗?
会变,而且可能很快。年初以来已有七家云厂商和模型厂商上调价格(律动 BlockBeats 统计),智谱却在降价抢份额;智谱自己一季度定价累计 +83% 时调用量反而 +400%,DeepSeek 提价 350% 后 OpenCode 调用量掉一半。行业处于定价权争夺期,建议架构上保持可切换(多家 API 通道+开源权重兜底),商务上按季度滚动询价,别把今天的快照价写死进年度合同。

相关文章

硬核横评

腾讯 770B 只激活 49B:五款万亿级开源旗舰横评,决定部署成本的不是总参数

Hy4 preview(770B/49B)发布把开源旗舰的参数军备推到新高,但决定部署成本的不是总参数:激活参数省的是算力,权重驻留吃的是显存。本篇横评五款开放权重旗舰--Hy4 preview、GLM-5.3、Kimi K3(2.8T)、DeepSeek V4(1.6T 口径)、Qwen3.8-Max(2.4T)--按总参/激活比、上下文、许可证、显存门槛(工程估算口径)与 API 价格快照逐项对表。与 8-27 价格横评分工:那篇算 320B 级 API 账,本篇算 700B-2.8T 级参数与部署门槛账。五条按场景结论:追最新选 Hy4(Apache 2.0+MTP 投机解码+FP8 友好)、要参数规模选 K3、要成熟生态选 GLM/DeepSeek、阿里系合规选 Qwen,以及共同一条--先看每 token 成本与稀疏注意力,再看总参。

2026年8月29日9 分钟阅读
硬核横评

AI 大模型性价比横评:中国选手为什么便宜这么多

2026 年中美大模型 API 性价比横评:GPT-5 $10/$30 对 DeepSeek-V3 $0.27/$1.10,差一个数量级。含中美价格对比表和客服场景月成本对比表(10M tokens:GPT-5 $140 vs Qwen Flash $0.50)。核心结论:中国模型成本显著低于美国前沿模型,但选型需权衡合规风险(DoorDash 事件)和能力需求线。代表性对比非亲自压测,以官方为准。

2026年8月1日12 分钟阅读