国产大模型的牌桌,过去一年从"谁追得上 GPT"卷到了"谁是国产第一"。DeepSeek 是最早的破局者,但 2026 年下半年还能稳定坐上牌桌的,是 Kimi、通义千问、智谱 GLM 这三家。本文按长文本/上下文、编程、Agent、多模态、价格、开源六个维度横评,给你一张能照着选的表。先说清楚:跑分数据来自各厂公开榜单和第三方追踪器,标注为「代表性数值,非亲自压测」;价格是公开 API 定价区间,以官网为准。
一、为什么"国产三强"值得横评
OpenAI 涨价、Claude 限流、Gemini 时灵时不灵,加上数据出境合规问题,国内开发者在 2026 年越来越把"国产替代"从备选项变成默认项。三家来头都不小:
- Kimi(月之暗面):7 月 16 日发 K3 API,7 月 27 日晚上把权重开源,2.8 万亿参数 MoE、100 万 token 上下文,是当前全球最大的开源模型。
- 通义千问(阿里):开源走得最坚决的巨头,Qwen3 系列从 0.6B 到旗舰基本全线放权,外加闭源的 Qwen3 Max 当 API 打手。
- 智谱 GLM:清华系,国产大模型最早商业化的一家,GLM-4.5 系列开源,闭源 GLM-4.6 + AutoGLM 押注 Agent。
三家路子不一样:Kimi 押"长上下文 + 开源换社区",Qwen 押"全尺寸开源 + 阿里云兜底",GLM 押"Agent + 商业化先行"。横评的意义就是看清这几条路各自走到哪了。
二、评测对象与方法
评测对象(2026 年 7 月版本):
| 模型 | 旗舰版 | 一句话定位 |
|---|---|---|
| Kimi K3 | K3(开源 + API) | 长上下文 + 多模态 + 开源巨兽 |
| 通义千问 Qwen3 | Qwen3 Max(闭源)/ Qwen3-235B-A22B(开源) | 全尺寸开源 + 阿里云生态 |
| 智谱 GLM | GLM-4.6(闭源)/ GLM-4.5(开源) | Agent 押注 + 最早商业化 |
评测维度:长文本/上下文、编程能力、Agent/工具调用、多模态、价格/API、开源情况。每个维度给一个"最佳场景"判断。所有跑分均来自各厂官方公布或第三方榜单(Artificial Analysis、Arena、Vals AI、SWE-bench、LiveCodeBench 等),为代表性数值,非亲自压测;价格以各厂官网定价区间为准,标注「以官网为准」。
三、核心能力对比表
| 维度 | Kimi K3 | 通义千问 Qwen3 Max / 235B | 智谱 GLM-4.6 / 4.5 |
|---|---|---|---|
| 总参数 | 2.8 万亿 MoE(16/896 激活) | 235B MoE(22B 激活) | GLM-4.5 约 355B MoE(4.5 未全公开) |
| 上下文窗口 | 100 万 token | 100 万 token(部分版本 256K) | 20 万 token(GLM-4.6)/ 128K(GLM-4.5) |
| 原生多模态 | 视觉原生 | Qwen3-VL(独立模型) | GLM-4V(视觉)/ CogAgent |
| 思考模式 | 内置常驻 | 可选 / 混合推理 | 内置(GLM-4.6) |
| 编程能力 | Arena 前端代码盲测第一 | Qwen3 Coder 专门优化 | 中上,偏 Agent 链路 |
| Agent/工具调用 | 强(思考 + 长上下文) | 强(Qwen-Agent 框架) | 最强(AutoGLM / CogAgent) |
| 开源情况 | 全量开源(7 月 27 日,MXFP4) | 全尺寸开源(HF / ModelScope) | GLM-4.5 系列开源 |
| 商用许可 | 可商用、可自部署 | 可商用(Apache-2.0 / Qwen License) | 可商用(需查许可条款) |
| 适合人群 | 长文档 / 代码 / 自部署旗舰 | 全栈 / 阿里云用户 / 中文场景 | Agent 应用 / 国内企业 |
四、逐个拆解
Kimi K3:长上下文的开源炸弹
K3 是月之暗面被 DeepSeek 压了 18 个月之后的反手牌,参数堆到 2.8 万亿、上下文拉到 100 万 token,7 月 27 日把权重全放出去。架构两个亮点:Kimi Delta Attention(混合线性注意力)和 Attention Residuals(残差连接替代方案),都在 GitHub 公开过。权重用 MXFP4 量化、激活 MXFP8,训练时就做量化感知,所以原版跑起来不像"硬塞"。
强在哪:长文档一锤定音。100 万 token 上下文 + 常驻思考模式,处理整本合同、整个代码仓库、几十页财报,不用切片不用 RAG,直接喂。Arena 前端代码盲测拿了第一,盖过美国头部模型;Artificial Analysis 综合排第三,前面是 Fable 5 和 GPT-5.6 Sol Max。
弱在哪:贵且重。2.8 万亿参数自部署门槛极高,单卡根本想都别想,至少 H100 集群的事;API 端价格对标旗舰,重度调用比 Qwen 中段贵一截。多模态只覆盖视觉,没有音视频。
通义千问 Qwen3:开源最坚决的巨头
阿里在开源这件事上真砸钱:Qwen3 从 0.6B 到 235B 全尺寸都放权重,Hugging Face 和 ModelScope 双开,外加闭源 Qwen3 Max 当 API 旗舰。旗舰 MoE 是 Qwen3-235B-A22B(235B 总参、22B 激活),密度比 K3 高很多,单卡推理现实得多。
强在哪:性价比 + 全栈。0.6B 这种小模型能在手机和嵌入式上跑,235B 旗舰在服务器上推得动,一条产品线打通端到云。编程有专门的 Qwen3 Coder(SWE-bench 公开榜单常年国产前列),Agent 有 Qwen-Agent 框架,多模态有 Qwen3-VL,每条线都有人维护。阿里云百炼(DashScope)API 在国内最稳,价格也最卷。
弱在哪:旗舰尺寸仍小于 K3,长上下文极限场景(>50 万 token)不如 K3 干脆;模型尺寸太多,开发者第一次选容易晕。
智谱 GLM:Agent 押注最狠
智谱是清华系,国产大模型里最早商业化、最早搞 Agent 的一家。GLM-4.5 系列已开源,闭源 GLM-4.6 是 API 旗舰,AutoGLM 把浏览器和手机操作 Agent 化,CogAgent 专攻 GUI 操作。上下文 20 万,没去卷百万 token。
强在哪:Agent 一条龙。AutoGLM 直接做浏览器 / 手机操作 Agent,原生中文、免翻墙、网页即用,国内小白门槛最低。GLM-4.6 思考模式 + 工具调用链路打磨得最熟,做"会自己调工具完成任务"的应用,GLM 是国产里最现成的。智谱也是国内最早对标 OpenAI 接口的,迁移成本低。
弱在哪:上下文最短,20 万 token 在三家里排末位;多模态视觉走 GLM-4V 这条独立线,不像 K3 原生;开源的 GLM-4.5 比 K3 / Qwen3 旗舰小一档,自部署旗舰只能走闭源 API。
五、价格对比表
价格取各厂公开 API 定价区间(人民币,元 / 百万 token),以官网为准,可能有调整:
| 模型 | 输入价格 | 输出价格 | 备注 |
|---|---|---|---|
| Kimi K3 API | 约 10-20 元 | 约 60-100 元 | 旗舰级,对标 Fable 5 一档 |
| 通义千问 Qwen3 Max | 约 5-15 元 | 约 15-50 元 | 阿里云百炼,分段计价 |
| 通义千问 Qwen3-235B(开源自部署) | 0(算力自付) | 0(算力自付) | 仅算 GPU 成本 |
| 智谱 GLM-4.6 | 约 5-10 元 | 约 10-30 元 | 2025 年价格战发起者 |
| 智谱 GLM-4.5 Air(开源自部署) | 0(算力自付) | 0(算力自付) | 仅算 GPU 成本 |
看点:
- 自部署路线,K3 旗舰尺寸最大、算力成本最高;Qwen3-235B 和 GLM-4.5 单卡能凑合,性价比更友好。
- API 端,GLM-4.6 历史最低,是 2025 年价格战的发起者;Qwen3 Max 中段最稳;K3 API 旗舰最贵但能力天花板最高。
- 价格是会战的,今天写的明天可能就改,一切以官网为准。
六、代表性测试数据
以下为各厂公开榜单 / 第三方追踪器聚合数据,代表性数值,非亲自压测:
| 测试 | Kimi K3 | Qwen3 Max / 235B | GLM-4.6 |
|---|---|---|---|
| 上下文窗口 | 100 万 token | 100 万 token | 20 万 token |
| Arena 前端代码盲测 | 第一 | 前三 | 前五 |
| Artificial Analysis 智能指数 | 第三(前二是 Fable 5、GPT-5.6 Sol Max) | 前五 | 前八 |
| SWE-bench Verified(公开) | 中上 | 国产前列 | 中上 |
| LiveCodeBench | 中上 | 国产前列 | 中上 |
| 工具调用 / Agent | 强(思考 + 长上下文) | 强(Qwen-Agent) | 最强(AutoGLM / CogAgent) |
| 多模态 | 视觉原生 | Qwen3-VL | GLM-4V |
| 开源权重 | 2.8T MXFP4 | 全尺寸 | GLM-4.5 系列 |
看点:
- 长文档场景,K3 和 Qwen3 Max 都到 100 万 token,GLM 落在 20 万——超大上下文是前两家的主场。
- 编程场景,Qwen3 Coder 公开榜单常年国产前列;K3 在 Arena 前端盲测第一;GLM 中上但偏 Agent 链路。
- Agent / 工具调用,GLM 押注最狠,AutoGLM 已经把浏览器 / 手机操作做成产品;K3 靠思考模式 + 长上下文跟;Qwen3 走框架路线(Qwen-Agent)。
- 多模态,三家都只覆盖视觉,K3 是原生(不用切模型),Qwen3-VL 和 GLM-4V 是独立模型。语音、视频都还不是这三家的主场。
七、为什么没有 DeepSeek
很多人问:DeepSeek 也是国产第一梯队,为什么不放进来?三个原因。
第一,DeepSeek 的轨迹和这三家不同。DeepSeek V4 Pro 约 1.6 万亿参数,是 2024 年最早把国产开源推到全球视野的一家,Artificial Analysis 综合也常年排前五。但它的节奏更偏"研究型开源":发论文、放权重、慢慢迭代商业化 API,没有像 Kimi/K3、Qwen3、GLM-4.6 这样把"商业旗舰 + 开源旗舰"双线同步推到市场第一线。
第二,三家都是"商业 API + 开源权重"双线作战,DeepSeek 的商业 API 节奏更慢,更多走"权重即产品"的路线,可比维度不同。
第三,第二梯队的玩家:MiniMax(押音视频)、百川 / Stepfun / 零一万物等,各有专长但综合能力、API 生态、开发者基数都还没到这三家级别。所以"国产三强"这个判定基本是当前市场共识。
如果你坚持把 DeepSeek 也算进来,那就是"四强",DeepSeek V4 Pro 在长上下文(也是 100 万级)、编程、开源尺寸上都是顶级,价格也很卷;但论"商业 API 现成度 + Agent 生态 + 应用层",它确实走在另一条路上。
八、选型建议
- 要处理整本合同 / 整个代码仓库 / 几十页财报 -> Kimi K3,100 万 token 上下文 + 思考模式一锤定音,自部署可选。
- 要性价比 + 全尺寸开源 + 阿里云生态 -> 通义千问 Qwen3,从 0.6B 到 235B 一条线,端到云都有。
- 要做"会自己调工具的 Agent 应用",尤其浏览器 / 手机操作 -> 智谱 GLM-4.6 + AutoGLM,国产最现成。
- 预算敏感的中小团队 -> Qwen3 Max API 或 GLM-4.6,价格最卷;重度调用还能上自部署 Qwen3-235B。
- 预算充足、要能力天花板 -> Kimi K3 API。
- 要私有部署 + 旗舰尺寸 -> 只有 Kimi K3(GLM-4.6 / Qwen3 Max 闭源),算力门槛要 H100 集群。
- 要私有部署 + 性价比 -> Qwen3-235B-A22B(开源 MoE)或 GLM-4.5(开源),单卡能跑。
九、三大避坑
- 别拿"国产三强"硬刚 Fable 5 / GPT-5.6 旗舰推理:复杂长链推理、超难数学,国产旗舰仍逊国际顶配一档,差距从一年前的一年多压到现在三到五个月(Nathan Lambert 的判断),但还没追平。选型别吹过头。
- 长上下文不是免费午餐:100 万 token 听着爽,但实际推理成本、首 token 延迟、长文本里的"中间被忘"问题都是真实代价。先看自己场景到底要不要 >20 万 token,再决定要不要上旗舰。
- 开源不等于免费商用:K3 / Qwen3 / GLM-4.5 都给了商用许可,但条款各不一样(Apache-2.0、Qwen License、各家自有许可),商用前必须逐条读,尤其涉及蒸馏、再发布、合规声明。
参考来源
- Kimi K3 开源下载与 API(月之暗面):platform.moonshot.cn
- 通义千问 Qwen3 开源仓库:github.com/QwenLM/Qwen3
- 阿里云百炼 DashScope 文档:help.aliyun.com/zh/model-studio/
- 智谱 GLM 开源仓库(Zhipu AI):github.com/zhipuai
- 智谱开放平台 bigmodel.cn:bigmodel.cn
- Artificial Analysis 模型榜单:artificialanalysis.ai