硬核横评
硬核横评

Kimi K3 vs 通义千问 vs 智谱 GLM:国产大模型三强横评

Kimi K3 vs 通义千问 Qwen3 vs 智谱 GLM 国产大模型三强横评:长文本/编程/Agent/价格对比表+代表性测试数据(非亲自压测)。长文本 K3、编程 Qwen3、Agent 押 GLM,附选型建议与避坑。

发布于 2026年7月28日13 分钟阅读
<!-- kimi-vs-qwen-vs-glm-long-context-review | review | Kimi K3 vs 通义千问 vs 智谱 GLM:国产大模型三强横评 -->

国产大模型的牌桌,过去一年从"谁追得上 GPT"卷到了"谁是国产第一"。DeepSeek 是最早的破局者,但 2026 年下半年还能稳定坐上牌桌的,是 Kimi、通义千问、智谱 GLM 这三家。本文按长文本/上下文、编程、Agent、多模态、价格、开源六个维度横评,给你一张能照着选的表。先说清楚:跑分数据来自各厂公开榜单和第三方追踪器,标注为「代表性数值,非亲自压测」;价格是公开 API 定价区间,以官网为准。

一、为什么"国产三强"值得横评

OpenAI 涨价、Claude 限流、Gemini 时灵时不灵,加上数据出境合规问题,国内开发者在 2026 年越来越把"国产替代"从备选项变成默认项。三家来头都不小:

  • Kimi(月之暗面):7 月 16 日发 K3 API,7 月 27 日晚上把权重开源,2.8 万亿参数 MoE、100 万 token 上下文,是当前全球最大的开源模型。
  • 通义千问(阿里):开源走得最坚决的巨头,Qwen3 系列从 0.6B 到旗舰基本全线放权,外加闭源的 Qwen3 Max 当 API 打手。
  • 智谱 GLM:清华系,国产大模型最早商业化的一家,GLM-4.5 系列开源,闭源 GLM-4.6 + AutoGLM 押注 Agent。

三家路子不一样:Kimi 押"长上下文 + 开源换社区",Qwen 押"全尺寸开源 + 阿里云兜底",GLM 押"Agent + 商业化先行"。横评的意义就是看清这几条路各自走到哪了。

二、评测对象与方法

评测对象(2026 年 7 月版本):

模型旗舰版一句话定位
Kimi K3K3(开源 + API)长上下文 + 多模态 + 开源巨兽
通义千问 Qwen3Qwen3 Max(闭源)/ Qwen3-235B-A22B(开源)全尺寸开源 + 阿里云生态
智谱 GLMGLM-4.6(闭源)/ GLM-4.5(开源)Agent 押注 + 最早商业化

评测维度:长文本/上下文、编程能力、Agent/工具调用、多模态、价格/API、开源情况。每个维度给一个"最佳场景"判断。所有跑分均来自各厂官方公布或第三方榜单(Artificial Analysis、Arena、Vals AI、SWE-bench、LiveCodeBench 等),为代表性数值,非亲自压测;价格以各厂官网定价区间为准,标注「以官网为准」

三、核心能力对比表

维度Kimi K3通义千问 Qwen3 Max / 235B智谱 GLM-4.6 / 4.5
总参数2.8 万亿 MoE(16/896 激活)235B MoE(22B 激活)GLM-4.5 约 355B MoE(4.5 未全公开)
上下文窗口100 万 token100 万 token(部分版本 256K)20 万 token(GLM-4.6)/ 128K(GLM-4.5)
原生多模态视觉原生Qwen3-VL(独立模型)GLM-4V(视觉)/ CogAgent
思考模式内置常驻可选 / 混合推理内置(GLM-4.6)
编程能力Arena 前端代码盲测第一Qwen3 Coder 专门优化中上,偏 Agent 链路
Agent/工具调用强(思考 + 长上下文)强(Qwen-Agent 框架)最强(AutoGLM / CogAgent)
开源情况全量开源(7 月 27 日,MXFP4)全尺寸开源(HF / ModelScope)GLM-4.5 系列开源
商用许可可商用、可自部署可商用(Apache-2.0 / Qwen License)可商用(需查许可条款)
适合人群长文档 / 代码 / 自部署旗舰全栈 / 阿里云用户 / 中文场景Agent 应用 / 国内企业

四、逐个拆解

Kimi K3:长上下文的开源炸弹

K3 是月之暗面被 DeepSeek 压了 18 个月之后的反手牌,参数堆到 2.8 万亿、上下文拉到 100 万 token,7 月 27 日把权重全放出去。架构两个亮点:Kimi Delta Attention(混合线性注意力)和 Attention Residuals(残差连接替代方案),都在 GitHub 公开过。权重用 MXFP4 量化、激活 MXFP8,训练时就做量化感知,所以原版跑起来不像"硬塞"。

强在哪:长文档一锤定音。100 万 token 上下文 + 常驻思考模式,处理整本合同、整个代码仓库、几十页财报,不用切片不用 RAG,直接喂。Arena 前端代码盲测拿了第一,盖过美国头部模型;Artificial Analysis 综合排第三,前面是 Fable 5 和 GPT-5.6 Sol Max。

弱在哪:贵且重。2.8 万亿参数自部署门槛极高,单卡根本想都别想,至少 H100 集群的事;API 端价格对标旗舰,重度调用比 Qwen 中段贵一截。多模态只覆盖视觉,没有音视频。

通义千问 Qwen3:开源最坚决的巨头

阿里在开源这件事上真砸钱:Qwen3 从 0.6B 到 235B 全尺寸都放权重,Hugging Face 和 ModelScope 双开,外加闭源 Qwen3 Max 当 API 旗舰。旗舰 MoE 是 Qwen3-235B-A22B(235B 总参、22B 激活),密度比 K3 高很多,单卡推理现实得多。

强在哪:性价比 + 全栈。0.6B 这种小模型能在手机和嵌入式上跑,235B 旗舰在服务器上推得动,一条产品线打通端到云。编程有专门的 Qwen3 Coder(SWE-bench 公开榜单常年国产前列),Agent 有 Qwen-Agent 框架,多模态有 Qwen3-VL,每条线都有人维护。阿里云百炼(DashScope)API 在国内最稳,价格也最卷。

弱在哪:旗舰尺寸仍小于 K3,长上下文极限场景(>50 万 token)不如 K3 干脆;模型尺寸太多,开发者第一次选容易晕。

智谱 GLM:Agent 押注最狠

智谱是清华系,国产大模型里最早商业化、最早搞 Agent 的一家。GLM-4.5 系列已开源,闭源 GLM-4.6 是 API 旗舰,AutoGLM 把浏览器和手机操作 Agent 化,CogAgent 专攻 GUI 操作。上下文 20 万,没去卷百万 token。

强在哪:Agent 一条龙。AutoGLM 直接做浏览器 / 手机操作 Agent,原生中文、免翻墙、网页即用,国内小白门槛最低。GLM-4.6 思考模式 + 工具调用链路打磨得最熟,做"会自己调工具完成任务"的应用,GLM 是国产里最现成的。智谱也是国内最早对标 OpenAI 接口的,迁移成本低。

弱在哪:上下文最短,20 万 token 在三家里排末位;多模态视觉走 GLM-4V 这条独立线,不像 K3 原生;开源的 GLM-4.5 比 K3 / Qwen3 旗舰小一档,自部署旗舰只能走闭源 API。

五、价格对比表

价格取各厂公开 API 定价区间(人民币,元 / 百万 token),以官网为准,可能有调整

模型输入价格输出价格备注
Kimi K3 API约 10-20 元约 60-100 元旗舰级,对标 Fable 5 一档
通义千问 Qwen3 Max约 5-15 元约 15-50 元阿里云百炼,分段计价
通义千问 Qwen3-235B(开源自部署)0(算力自付)0(算力自付)仅算 GPU 成本
智谱 GLM-4.6约 5-10 元约 10-30 元2025 年价格战发起者
智谱 GLM-4.5 Air(开源自部署)0(算力自付)0(算力自付)仅算 GPU 成本

看点

  • 自部署路线,K3 旗舰尺寸最大、算力成本最高;Qwen3-235B 和 GLM-4.5 单卡能凑合,性价比更友好。
  • API 端,GLM-4.6 历史最低,是 2025 年价格战的发起者;Qwen3 Max 中段最稳;K3 API 旗舰最贵但能力天花板最高。
  • 价格是会战的,今天写的明天可能就改,一切以官网为准

六、代表性测试数据

以下为各厂公开榜单 / 第三方追踪器聚合数据,代表性数值,非亲自压测

测试Kimi K3Qwen3 Max / 235BGLM-4.6
上下文窗口100 万 token100 万 token20 万 token
Arena 前端代码盲测第一前三前五
Artificial Analysis 智能指数第三(前二是 Fable 5、GPT-5.6 Sol Max)前五前八
SWE-bench Verified(公开)中上国产前列中上
LiveCodeBench中上国产前列中上
工具调用 / Agent强(思考 + 长上下文)强(Qwen-Agent)最强(AutoGLM / CogAgent)
多模态视觉原生Qwen3-VLGLM-4V
开源权重2.8T MXFP4全尺寸GLM-4.5 系列

看点

  • 长文档场景,K3 和 Qwen3 Max 都到 100 万 token,GLM 落在 20 万——超大上下文是前两家的主场。
  • 编程场景,Qwen3 Coder 公开榜单常年国产前列;K3 在 Arena 前端盲测第一;GLM 中上但偏 Agent 链路。
  • Agent / 工具调用,GLM 押注最狠,AutoGLM 已经把浏览器 / 手机操作做成产品;K3 靠思考模式 + 长上下文跟;Qwen3 走框架路线(Qwen-Agent)。
  • 多模态,三家都只覆盖视觉,K3 是原生(不用切模型),Qwen3-VL 和 GLM-4V 是独立模型。语音、视频都还不是这三家的主场。

七、为什么没有 DeepSeek

很多人问:DeepSeek 也是国产第一梯队,为什么不放进来?三个原因。

第一,DeepSeek 的轨迹和这三家不同。DeepSeek V4 Pro 约 1.6 万亿参数,是 2024 年最早把国产开源推到全球视野的一家,Artificial Analysis 综合也常年排前五。但它的节奏更偏"研究型开源":发论文、放权重、慢慢迭代商业化 API,没有像 Kimi/K3、Qwen3、GLM-4.6 这样把"商业旗舰 + 开源旗舰"双线同步推到市场第一线。

第二,三家都是"商业 API + 开源权重"双线作战,DeepSeek 的商业 API 节奏更慢,更多走"权重即产品"的路线,可比维度不同。

第三,第二梯队的玩家:MiniMax(押音视频)、百川 / Stepfun / 零一万物等,各有专长但综合能力、API 生态、开发者基数都还没到这三家级别。所以"国产三强"这个判定基本是当前市场共识。

如果你坚持把 DeepSeek 也算进来,那就是"四强",DeepSeek V4 Pro 在长上下文(也是 100 万级)、编程、开源尺寸上都是顶级,价格也很卷;但论"商业 API 现成度 + Agent 生态 + 应用层",它确实走在另一条路上。

八、选型建议

  • 要处理整本合同 / 整个代码仓库 / 几十页财报 -> Kimi K3,100 万 token 上下文 + 思考模式一锤定音,自部署可选。
  • 要性价比 + 全尺寸开源 + 阿里云生态 -> 通义千问 Qwen3,从 0.6B 到 235B 一条线,端到云都有。
  • 要做"会自己调工具的 Agent 应用",尤其浏览器 / 手机操作 -> 智谱 GLM-4.6 + AutoGLM,国产最现成。
  • 预算敏感的中小团队 -> Qwen3 Max API 或 GLM-4.6,价格最卷;重度调用还能上自部署 Qwen3-235B。
  • 预算充足、要能力天花板 -> Kimi K3 API。
  • 要私有部署 + 旗舰尺寸 -> 只有 Kimi K3(GLM-4.6 / Qwen3 Max 闭源),算力门槛要 H100 集群。
  • 要私有部署 + 性价比 -> Qwen3-235B-A22B(开源 MoE)或 GLM-4.5(开源),单卡能跑。

九、三大避坑

  1. 别拿"国产三强"硬刚 Fable 5 / GPT-5.6 旗舰推理:复杂长链推理、超难数学,国产旗舰仍逊国际顶配一档,差距从一年前的一年多压到现在三到五个月(Nathan Lambert 的判断),但还没追平。选型别吹过头。
  2. 长上下文不是免费午餐:100 万 token 听着爽,但实际推理成本、首 token 延迟、长文本里的"中间被忘"问题都是真实代价。先看自己场景到底要不要 >20 万 token,再决定要不要上旗舰。
  3. 开源不等于免费商用:K3 / Qwen3 / GLM-4.5 都给了商用许可,但条款各不一样(Apache-2.0、Qwen License、各家自有许可),商用前必须逐条读,尤其涉及蒸馏、再发布、合规声明。

参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-07-28

常见问题

Kimi K3、Qwen3、GLM-4.6,国产到底谁第一?
不分场景没法分。长上下文和开源尺寸,K3 第一;编程和性价比,Qwen3 Max / 235B 第一;Agent 和工具调用,GLM-4.6 第一。综合能力 Artificial Analysis 榜单上 K3 排第三(前二是 Fable 5、GPT-5.6 Sol Max),是国产目前最高的,但只看 API 性价比 GLM 和 Qwen 更能打。
长文本该选 Kimi K3 还是 Qwen3 Max?
两家都到 100 万 token,但 K3 是原生 100 万、思考模式常驻,处理超长文档更干脆;Qwen3 Max 部分版本是 256K,1M 要看具体型号。预算够要天花板,K3;要稳要便宜要阿里云生态,Qwen3 Max。
自部署选哪个开源权重?
看算力。K3 2.8 万亿参数 MoE,单卡想都别想,要 H100 集群;Qwen3-235B-A22B 单 H100 能凑合,性价比最友好;GLM-4.5 开源版本尺寸更小,单卡友好但能力比旗舰小一档。算力不够就别硬上 K3。
编程能力谁最强?
Arena 前端代码盲测 Kimi K3 第一;SWE-bench Verified 公开榜单 Qwen3 Coder 国产前列;GLM-4.6 中上,偏 Agent 链路不是纯代码。做前端 / 全栈代码补全,K3 或 Qwen3 Coder;做"会自己改 bug 的 Agent",GLM。
Agent / 工具调用到底押谁?
国产里 GLM 最现成,AutoGLM 已经把浏览器 / 手机操作 Agent 做成产品,原生中文、免翻墙、网页即用。K3 靠思考模式 + 长上下文做"推理型 Agent";Qwen3 走 Qwen-Agent 框架路线,灵活但要自己搭。要产品级、要国内能用、要快,GLM。

相关文章

硬核横评

AI 知识管理工具横评:Notion AI、Obsidian、Heptabase、Mem、Capacities、飞书知识库怎么选

2026 年六款主流 AI 知识管理工具代表性对比(非亲自压测,价格以官网为准):Notion AI(all-in-one 工作区,团队协作强,AI add-on $10/人/月)、Obsidian(本地优先 Markdown,数据掌控最强,个人免费)、Heptabase(白板卡片可视化,深度思考)、Mem(AI 自动归类,懒整理党)、Capacities(对象化笔记,结构化新范式)、飞书知识库(国内企业协作)。含两张对比表、逐个拆解、按人群选型、三个避坑与五条 FAQ。

2026年8月7日8 分钟阅读
硬核横评

4 款 AI coding skill 框架横评:ponytail、impeccable、mattpocock、superpowers 怎么选

横评 4 款 AI coding skill 框架:ponytail(★97k,lazy senior dev,~54% less code)、impeccable(★56k,23 commands+59 rules 前端设计指导)、mattpocock/skills(★206k,Real Engineers 不夺权)、superpowers(★267k,subagent+TDD 方法论,11 agents)。2 对比表+逐个拆+选型+避坑+5 FAQ。代表性对比非亲自压测,star 据 GitHub API 2026-08-06,ponytail 减码数据标 README 自报。

2026年8月6日9 分钟阅读
硬核横评

五款 AI 工作流自动化平台横评:n8n、Dify、Flowise、FastGPT、Coze 怎么选

横评 5 款 AI 工作流平台:n8n(★19.9万,通用工作流+AI,技术极客瑞士军刀)、Dify(★15.1万,LLM 应用编排,建 chatbot/agent/RAG 首选)、Flowise(★5.5万,可视化搭 agent 原型)、FastGPT(★2.9万,知识库 RAG 专精)、Coze(字节闭源,国内零代码一键发布)。2 张对比表+逐个拆+三场景选型+三避坑+5 FAQ。代表性对比非亲自压测,star 据 GitHub API 2026-08-06,价格以官网为准。

2026年8月6日9 分钟阅读