2026 年的大模型 API 市场,出现了一个让很多开发者困惑的现象:同样跑一个客服 chatbot,月用量 10M tokens,用美国前沿模型一个月花约 $140,换成中国模型只要约 $30 甚至 $4,差出一个数量级。不是中国模型偷工减料,而是整个成本结构不一样。这篇把中美主流大模型的价格、能力和场景成本摊开横着比,按实际用量算账,不讲故事只看数据。
先说清楚:下面所有价格都是据 2026-07 公开报价汇总,以各厂商官方定价为准,不同托管平台和时点有差异。这是一次代表性对比,非亲自压测,能力评价基于公开评测。你看到这篇文章时大概率已有价格更新,以官方最新定价为依据,别拿它当合同。
一、为什么 2026 年大模型选型要看性价比
过去选大模型很简单:看榜单,谁 Elo 分高选谁。2026 年不行了,原因有三个。
第一,前沿模型之间的能力差距在缩小。GPT-5、Claude Opus 5、Gemini 3 这些旗舰在多数 benchmark 上咬得很紧,不再是某一家碾压全场。当能力拉不开差距,价格就成了决定性因素。
第二,中国模型以极低价格杀入战场。DeepSeek、Qwen、Kimi 这些模型不是"便宜一点点",是便宜一个数量级。Fortune 等媒体已经在讨论"中国实验室在成本上击败美国实验室"(China's Moonshot/DeepSeek/Z.AI beating US labs on cost)。这不是营销噱头,是实打实的 API 报价差异。
第三,合规和数据安全成为硬约束。DoorDash 因为用了中国模型 Kimi K2.6 被美国议员调查,说明选型不再只是技术问题,还牵涉供应链合规。便宜不等于能随便用,这是 2026 年选型的新变量。
所以 2026 年的选型逻辑变了:不是"选最强的",而是"在满足能力需求的前提下,选性价比最高且合规风险可控的"。这篇就是按这个逻辑来拆。
二、中美选手入场:价格一览(数据截至 2026-07)
先把中美主流模型的 API 定价摊出来。价格单位是每百万 tokens(input/output),美元。据 2026-07 公开报价汇总,以各厂商官方定价为准,不同托管/时点有差异。
| 模型 | 厂商 | 国家 | 输入 ($/M tokens) | 输出 ($/M tokens) | 定位 |
|---|---|---|---|---|---|
| GPT-5 | OpenAI | 美国 | 10 | 30 | 旗舰 |
| Claude Opus 5 / Opus 4.6 | Anthropic | 美国 | 5 | 25 | 旗舰 |
| Claude Sonnet 5 | Anthropic | 美国 | 2 | 10 | 特价至 2026-08-31,后转 3/15 |
| GPT-4.1 | OpenAI | 美国 | 2 | 8 | 生产级主力 |
| Gemini 3 Flash | 美国 | ~3 | ~3 | 10M tokens 约 $30 | |
| Grok 4.5 | xAI | 美国 | 2 | 6 | 最便宜的生产级(score 70+) |
| GPT-5 Nano | OpenAI | 美国 | — | — | 预算级,以官方为准 |
| Claude Haiku 4.5 | Anthropic | 美国 | — | — | 预算级,以官方为准 |
| DeepSeek-V3 | DeepSeek | 中国 | 0.27 | 1.10 | DeepInfra 托管,比 GPT-4.1 便宜约 7x |
| Qwen3.7 Flash | 阿里 | 中国 | 0.03 | 0.13 | 最便宜 |
| Kimi K2.6 | 月之暗面 | 中国 | — | — | 开源 Modified MIT,以官方为准 |
| GLM | 智谱 | 中国 | — | — | 以官方为准 |
两个细节先点出来。第一,美国阵营内部价格也分三档:旗舰(GPT-5 $10/$30、Opus 5 $5/$25)是第一档,生产级主力(Sonnet 5 $2/$10、GPT-4.1 $2/$8、Gemini 3 Flash ~$3、Grok 4.5 $2/$6)是第二档,预算级(GPT-5 Nano、Haiku 4.5)是第三档。第二档内部价差不大,但跟第一档能差 3-5 倍。第二,中国模型的定价低到不是一个量级。DeepSeek-V3 $0.27/$1.10,比 GPT-4.1 便宜约 7 倍,比 Sonnet 5 特价便宜 10-14 倍(按总成本折算)。Qwen3.7 Flash $0.03/$0.13 更是低到地板,是全表最便宜的模型。
注意几个"—"的格子。GPT-5 Nano、Claude Haiku 4.5 是预算级模型,定价随档位浮动,没给固定数;Kimi K2.6 开源 Modified MIT,走自托管或第三方托管,价格取决于平台;GLM 同理。这些模型的定价请以官方或托管平台最新报价为准,别拿这张表当合同。
三、场景成本对比:按实际用量算账
光看单价不够直观,按场景算月成本才靠谱。以客服 chatbot 为典型场景:月用量 10M tokens,按 80% 输入 + 20% 输出的比例估算(客服场景输入远多于输出)。其中 GPT-5.2 约 $140 和 Gemini 3 Flash 约 $30 为 BenchLM 案例参考值,其余按公开报价折算。代表性对比非亲自压测,以官方为准。
| 模型 | 输入价 | 输出价 | 月成本(8M 输入 + 2M 输出) | 相对 GPT-5 成本 |
|---|---|---|---|---|
| GPT-5 | $10 | $30 | ~$140 | 100% |
| Claude Opus 5 | $5 | $25 | ~$90 | 64% |
| Claude Sonnet 5(特价) | $2 | $10 | ~$36 | 26% |
| GPT-4.1 | $2 | $8 | ~$32 | 23% |
| Gemini 3 Flash | ~$3 | ~$3 | ~$30 | 21% |
| Grok 4.5 | $2 | $6 | ~$28 | 20% |
| DeepSeek-V3 | $0.27 | $1.10 | ~$4.4 | 3% |
| Qwen3.7 Flash | $0.03 | $0.13 | ~$0.50 | 0.4% |
这张表最扎眼的是最后一行:同样跑 10M tokens 的客服 chatbot,GPT-5 花 $140,Qwen3.7 Flash 只要 $0.50,差 280 倍。DeepSeek-V3 $4.4,是 GPT-5 的 3%。即便是美国阵营内部,Grok 4.5($28)比 GPT-5($140)便宜 5 倍,Sonnet 5 特价($36)比 GPT-5 便宜近 4 倍。
但别只看价格。这个表的前提是"能力够用"——客服 chatbot 不需要 GPT-5 的推理天花板,需要的是稳定、快、便宜。如果你的场景是复杂推理、代码生成、长文档分析,旗舰模型的能力差距就会显现,这时候便宜的模型可能"省钱但干不了活"。所以选型的第一步不是看价格表,是先确定你的能力需求线,再在满足需求线的模型里选最便宜的。
四、逐个拆:各家最佳射程
GPT-5:旗舰天花板,贵但强
OpenAI 的旗舰,$10/$30 是全表最贵。能力上,GPT-5 在复杂推理、代码生成、多模态理解上依然是第一梯队。适合对能力要求极高、预算不是约束的场景:金融分析、法律推理、复杂代码架构设计。代价是贵——月用量 10M tokens 花费 $140,是 DeepSeek-V3 的 30 多倍。如果你不是"非 GPT-5 不可"的场景,用它就是在烧钱。
Claude Opus 5 / Opus 4.6:Anthropic 旗舰,长文本和 Agent 强
$5/$25,比 GPT-5 便宜一半。Anthropic 的 Opus 系列在长文本理解、Agent 任务(多步推理加工具调用)上有口碑。适合需要超长上下文窗口、复杂 Agent 工作流的场景。代价是输出价 $25 仍高于生产级模型,大量输出场景成本不低。
Claude Sonnet 5:特价窗口期的性价比之王(美国阵营)
$2/$10,特价至 2026-08-31,之后转 $3/$15。在特价窗口期内,Sonnet 5 是美国阵营里性价比最高的模型之一:能力接近 Opus 5 的 80-90%,价格只有其 40%。月成本 $36,是 GPT-5 的 26%。适合需要较强能力但预算有限的中高负载场景。注意特价结束后成本会涨到约 $54/月(按同样用量),届时性价比下降,需要重新评估。
GPT-4.1:生产级主力,稳定可靠
$2/$8,OpenAI 的生产级主力。能力不如 GPT-5 但足够应付大多数生产场景,价格只有 GPT-5 的 23%。月成本 $32。适合不需要旗舰级推理但要求稳定、生态成熟的场景:API 产品后端、企业应用、内容生成。
Gemini 3 Flash:Google 的性价比牌
约 $3 输入输出同价,10M tokens 约 $30。Google 的 Flash 系列一直走"够用且便宜"路线。输入输出同价简化了计费,月成本 $30 跟 GPT-4.1 接近但计费更简单。适合输入输出比例均衡、需要 Google 生态集成(搜索、多模态)的场景。BenchLM 客服案例中 Gemini 3 Flash $30 对 GPT-5.2 $140 的对比,就是它的典型射程。
Grok 4.5:最便宜的生产级(score 70+)
$2/$6,是美国阵营里最便宜的生产级模型(benchmark score 70+)。月成本 $28,比 GPT-4.1 还便宜。适合预算敏感但需要生产级能力保证的场景。代价是生态不如 OpenAI/Anthropic 成熟,工具链和集成选项少一些。
DeepSeek-V3:中国性价比标杆
$0.27/$1.10,DeepInfra 托管。比 GPT-4.1 便宜约 7 倍,比 Sonnet 5 便宜 10-14 倍。月成本 $4.4,是全表第二便宜的模型。能力上,DeepSeek-V3 在多数 benchmark 上接近 GPT-4.1 水平,推理和代码能力有口碑。适合预算极敏感、用量大、需要接近生产级能力的场景:大规模内容生成、客服、数据标注辅助。代价是托管在第三方平台(DeepInfra),数据合规需自行评估;在中国大陆以外部署可能受网络影响。
Qwen3.7 Flash:地板价,量大到离谱才选
$0.03/$0.13,全表最便宜。月成本 $0.50,是 GPT-5 的 0.4%。能力上 Qwen Flash 系列定位轻量快速,适合超大规模、对单次质量要求不极端的场景:批量分类、简单问答、数据提取。如果你的月用量是 100M tokens 级别,Qwen3.7 Flash 的成本优势会放大到恐怖的程度。代价是复杂推理能力弱于旗舰,不适合高难度任务。
Kimi K2.6:开源中国选手,合规变量
月之暗面出品,开源 Modified MIT 许可。Kimi 的特殊性在于它同时是"中国模型"和"开源模型"——你可以自托管,数据不出门,但这也意味着它被 DoorDash 事件卷入了合规争议。适合需要开源可控、愿意自托管的场景,但选型前必须评估供应链合规风险(尤其是面向美国市场或受美国监管的企业)。
五、选型决策树:你该选谁
别看热度选,看你的活是什么。给一个决策路径,直接对号入座。
你需要旗舰级推理能力(复杂推理、法律或金融分析、高难度代码架构),预算不是约束。选 GPT-5 或 Claude Opus 5。GPT-5 能力天花板但最贵,Opus 5 便宜一半且长文本和 Agent 强。按场景偏好二选一。
你需要较强能力但预算有限,追求美国阵营性价比。选 Claude Sonnet 5(趁特价窗口期)或 GPT-4.1。Sonnet 5 特价 $2/$10 最划算,注意 2026-08-31 后涨价。
你要生产级能力保证、预算敏感、在美国阵营内选。选 Grok 4.5($2/$6,最便宜的生产级 score 70+)或 Gemini 3 Flash(约 $3,输入输出同价计费简单)。
你预算极敏感、用量大、能力需求在中上游。选 DeepSeek-V3($0.27/$1.10,比 GPT-4.1 便宜 7 倍)。评估数据合规后部署。
你超大规模用量、单次质量要求不极端。选 Qwen3.7 Flash($0.03/$0.13,全表最便宜)。
你需要开源可控、愿意自托管。选 Kimi K2.6(开源 Modified MIT)。但必须评估供应链合规风险。
还有两种常见组合。一是旗舰做难活、廉价模型做量产:GPT-5 或 Opus 5 处理复杂推理和高价值任务,DeepSeek-V3 或 Qwen Flash 批量处理简单任务,按任务难度分流。二是美国模型做合规敏感场景、中国模型做非敏感场景:面向美国用户或受监管的业务用 GPT-4.1 或 Grok 4.5,内部工具和非敏感场景用 DeepSeek-V3,合规和成本两不误。
六、四个避坑:价格口径、合规风险、能力折算、托管差异
第一,价格口径不一样别直接比大小。有的模型输入输出同价(Gemini 3 Flash),有的输入便宜输出贵(GPT-5 $10/$30)。你的实际成本取决于输入输出比例:客服场景输入远多于输出,输出价高的模型吃亏;内容生成场景输出多,输入价低的模型更划算。先估你的输入输出比例,再按总成本折算,别只看输入价或输出价。
第二,合规风险是 2026 年的新变量。DoorDash 因为用 Kimi K2.6 被美国议员调查,说明用中国模型不只是技术决策,还牵涉供应链合规。面向美国市场或受美国监管的企业,选型前必须过法务:中国模型(DeepSeek、Qwen、Kimi、GLM)的合规风险需要评估,即便技术上性价比再高。这不是危言耸听,是已有前车之鉴。
第三,能力差距在极端场景会放大。便宜的模型在简单任务上跟旗舰差距小,但在复杂推理、长链 Agent、多模态理解等极端场景会拉开差距。客服 chatbot 用 Qwen Flash 没问题,但金融推理用 Qwen Flash 可能"省钱但出错"。先确定你的能力需求线,再在满足需求线的模型里选最便宜的,别为了省钱选一个干不了活的。
第四,同一模型不同托管平台价差大。DeepSeek-V3 的 $0.27/$1.10 是 DeepInfra 托管价,官方 DeepSeek API 或其他平台报价可能不同。同一个模型,不同托管方的价格、延迟、可用率、数据政策都不一样。接 API 前货比三家,别看到一个报价就以为全平台同价。
七、中国模型为什么便宜这么多
很多人问:中国模型便宜到这个程度,是不是有什么猫腻?答案是成本结构不同,不是偷工减料。
一是训练效率。DeepSeek 等中国厂商在算法优化上投入极深,用更少的算力训练出接近前沿的模型,训练成本低于美国同档。
二是工程优化。推理端的工程优化(量化、批处理、KV cache 优化)让单位 token 的推理成本大幅下降,这部分优化直接反映在 API 定价上。
三是市场策略。中国厂商用低价抢占市场份额和开发者生态,模型本身可能不赚钱,利润来自配套云服务。这跟美国巨头用云服务补贴模型定价的逻辑一样,只是中国厂商更激进。
四是开源竞争。Kimi K2.6 开源 Modified MIT,DeepSeek 也有开源版本。开源模型拉低了整个市场的定价基准,闭源模型想高价卖越来越难。
但便宜有代价。合规风险(DoorDash 事件)、数据政策不确定性、海外部署的网络延迟、英文场景的能力折扣,都是选型时需要算进去的隐性成本。性价比不只是 API 单价,是总持有成本。
参考来源
- 各厂商官方定价页(OpenAI / Anthropic / Google / xAI / DeepSeek / 阿里 / 月之暗面 / 智谱),据 2026-07 公开报价汇总
- DeepInfra 托管 DeepSeek-V3 定价
- Fortune 报道:China's Moonshot/DeepSeek/Z.AI beating US labs on cost
- BenchLM 客服场景成本案例(GPT-5.2 约 $140 vs Gemini 3 Flash 约 $30)
- Artificial Analysis 大模型 Elo 榜单与公开评测