开源项目
开源项目

GLM-5.3 深度解析:智谱开源编程第一,还会找漏洞,「开源的盾」启动

智谱 GLM-5.3(2026-08-14):基座未变,靠后训练 Scaling 大幅提升智能上界,成当前编程能力最强开源模型(Terminal Bench 3.0 等多项开源第一),并涌现网络安全能力(代码审查/漏洞发现),联合安全团队发现 2436 个漏洞,启动「开源的盾」计划。深度解析+5 避坑。仓库/星数以官方为准,非实测。

发布于 2026年8月14日8 分钟阅读
<!-- glm-5-3-resource | open-source | GLM-5.3 深度解析:智谱开源编程第一,还会找漏洞,「开源的盾」启动 -->

2026 年 8 月 14 日,智谱发布 GLM-5.3,定位一句话:基座未变,靠后训练 Scaling 大幅提升智能上界,成为当前编程能力最强的开源模型,并且「意外」涌现出强大的网络安全能力--联合多家安全团队累计发现 2436 个漏洞,并启动「开源的盾」计划。开源模型第一次把「安全」从被动对齐变成了主动武器。本文是 GLM-5.3 的独立深度盘,与本站 8·14 四连发热点 互补:那篇报四家齐发,这篇把 GLM-5.3 掰开揉碎;想动手用大模型做安全扫描见 安全审计 SOP,安全工具选型见 AI 代码安全审计横评

先说清边界:本文基于智谱官方发布信息整理(截至 2026-08-14),非实测复现;GLM 系列的开源仓库、许可证、模型权重与具体星数以智谱官方仓库(THUDM)为准,本文不杜撰未经核实的 GitHub 数据。能力与基准分以官方为准。

一、定位:后训练 Scaling,基座不动把大脑「教」聪明

GLM-5.3 最值得记住的不是某个参数,而是它的打法:基座(预训练模型)未变,靠后训练 Scaling 提升智能上界。后训练指的是预训练之后的阶段--指令微调、强化学习、对抗训练等。智谱把这一阶段的算力与数据规模堆上去,让同一个参数规模的模型在「会做题、会写代码、会推理」上跨台阶。

这件事的意义在于「换条赛道追」。当开源阵营在「谁参数大」上被闭源旗舰(GPT-5.6、Claude Opus 5、Gemini 3)压制时,GLM-5.3 证明:参数不动,把后训练这条曲线吃透,一样能抬升智能上界。对中小团队是好消息--后训练比重新预训练一个超大模型便宜得多,是开源可复制的路线。但要分清:后训练 Scaling 不是万能药,它受基座天花板约束,基座没的东西后训练变不出来。

二、编程能力:开源第一,Terminal Bench 3.0 等多项登顶

官方称 GLM-5.3 是当前编程能力最强的开源模型,在 Terminal Bench 3.0 等多项基准测试中取得开源第一。Terminal Bench 这类基准测的是「在真实终端环境里完成工程任务」的能力,比单纯的代码补全更贴近 Agent 场景。

维度GLM-5.3说明
路线后训练 Scaling(基座未变)不卷参数,卷后训练算力/数据
编程能力开源第一(Terminal Bench 3.0 等多项)真实终端任务基准
安全能力涌现(代码审查、漏洞发现)联合发现 2436 个漏洞
开源是(智谱官方)仓库/许可证以官方为准
生态「开源的盾」计划安全方向专项

和上批本站 前沿编码模型横评 里的 DeepSeek-V4-Pro(1M 上下文 + Anthropic API 兼容)比,两者都是开源编程第一梯队,但路线不同:DeepSeek 押「长上下文 + 生态兼容」,GLM-5.3 押「后训练 + 安全涌现」。国内开发者常见组合:日常编码用 DeepSeek-V4-Pro(接 Claude 工具链便宜),需要代码审查/漏洞排查时切 GLM-5.3。具体数值与排名以各官方为准,本文做代表性定位。

三、安全能力涌现:从被动对齐到主动找漏洞

GLM-5.3 最意外的一手是网络安全能力的涌现:在代码审查与漏洞发现等任务上表现突出。智谱联合多家安全团队,累计发现 2436 个漏洞,并启动「开源的盾」计划。

这件事比「编程登顶」更值得关注。过去模型的安全工作几乎都是被动的--对齐、红队、防滥用,目的是「别干坏事」。GLM-5.3 把它翻成主动的:模型本身能审代码、能定位漏洞,成为安全团队的攻防武器。这暗示后训练 Scaling 不只抬升编程分,还顺带把「理解代码意图、发现异常逻辑」这类能力一起抬了上来--编程和安全本来共享同一棵技能树。

但要泼冷水:第一,「发现漏洞」≠「取代安全审计」。LLM 找的是它训练数据里见过的漏洞模式,对新型 0day、复杂业务逻辑漏洞、跨模块链路漏洞仍会漏报,正规安全管线(SAST + SCA + 人工审计)不能撤。第二,安全能力是双刃:能找漏洞的模型也更容易被用来造漏洞或写攻击,部署与开放策略要看智谱官方的安全约束。第三,2436 个漏洞的具体构成、严重级别、是否已披露以官方与对应 CVE/平台为准,本文不展开未核实细节。

四、怎么用:API 与开源权重两条路

落地有两条路。API 路线:通过智谱开放平台调用 GLM-5.3,适合不想本地部署、要稳定 SLA 的团队,定价与配额以智谱官方为准。开源权重路线:GLM 系列历来开源权重(THUDM 仓库),可本地或私有化部署,适合数据敏感(代码不出域)、要深度定制后训练的场景;具体模型文件、许可证、显存要求以官方仓库为准。

注意 GLM-5.3「基座未变」意味着它的预训练权重结构与上一代一致,已有的部署脚本、推理框架(vLLM/SGLang 等)大多能复用,迁移成本低--这是后训练路线的附带红利。但后训练产出的能力差异,仍需在你自己的真实任务上验证,别假设「同基座 = 表现一致」。

五、避坑代价:五条必须知道的坑

第一,「基座未变」不等于「能力没变」,要按新模型测。后训练 Scaling 大幅改变了模型行为,把它当上一代直接上线会踩坑。修法:用你的真实任务跑一轮回归,尤其边界 case 和 prompt 模板。

第二,安全能力涌现是甜头也是边界,别过度信任。GLM-5.3 能找漏洞,但漏报新型与复杂逻辑漏洞是常态。修法:LLM 审计作为 SAST/SCA 之上的「复核层」,不替代正规管线;关键漏洞必须人工确认。

第三,「开源第一」是基准分,不是你的任务的分。Terminal Bench 3.0 等测的是通用工程任务,你的特定语言/框架/业务逻辑未必在测区。修法:上线前用自建小评测集验证,别只看官方榜单。

第四,preview/快速迭代期接口可能变。GLM 系列迭代快,API 参数、模型名、权重版本可能调整。修法:生产环境锁版本,关注官方变更日志,别写死调最新快照。

第五,安全模型要守好部署边界。能审漏洞的模型权重若被滥用可作攻击工具,私有化部署时注意访问控制与审计。修法:内网部署 + 权限管控 + 输出审计,遵守智谱官方的使用政策与许可证。

适合:要开源编程最强模型、想把代码安全审计纳入开发流程、对成本与可私有化敏感的工程团队。别凑热闹:你只要行内补全--轻量模型就够;你要纯终端 Agent 且已押 DeepSeek 生态--看 DeepSeek 接 Claude Code SOP;你不碰代码安全--这模型的安全溢价对你用不上。

常见问题

Q1:GLM-5.3 和上一代比,到底强在哪? A1:基座(预训练模型)未变,强在后训练 Scaling--把指令微调、强化学习等后训练阶段的算力与数据堆上去,大幅提升智能上界。结果是编程能力登顶开源第一(Terminal Bench 3.0 等多项基准),并涌现出代码审查与漏洞发现等网络安全能力。

Q2:GLM-5.3 是开源的吗,在哪下? A2:智谱 GLM 系列开源(THUDM 仓库),GLM-5.3 延续开源路线。具体模型权重文件、许可证、显存要求与星数以智谱官方仓库为准,本文不杜撰未经核实的仓库数据。可本地或私有化部署,也可走智谱开放平台 API。

Q3:GLM-5.3 说能找漏洞,能替代安全审计工具吗? A3:不能。LLM 找的是训练数据里见过的漏洞模式,对新型 0day、复杂业务逻辑漏洞、跨模块链路漏洞仍会漏报。正确用法是把 GLM-5.3 作为 SAST/SCA 之上的「智能复核层」,正规安全管线(静态扫描 + 依赖扫描 + 人工审计)不能撤。关键漏洞必须人工确认。

Q4:GLM-5.3 和 DeepSeek-V4-Pro 怎么选? A4:同为开源编程第一梯队,路线不同。DeepSeek-V4-Pro 押长上下文(1M)+ Anthropic API 兼容(复用 Claude 工具链便宜);GLM-5.3 押后训练 Scaling + 安全能力涌现。常见组合:日常编码用 DeepSeek-V4-Pro,代码审查/漏洞排查切 GLM-5.3。具体规格与基准以各官方为准。

Q5:「后训练 Scaling」是什么,为什么值得记? A5:预训练之后的阶段(指令微调、强化学习、对抗训练等)扩大规模来抬升能力。意义在于:参数不动也能变强,比重新预训练超大模型便宜得多,是开源可复制的路线。但它受基座天花板约束,基座没有的能力后训练变不出来。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-14

常见问题

GLM-5.3 和上一代比,到底强在哪?
基座(预训练模型)未变,强在后训练 Scaling--把指令微调、强化学习等后训练阶段的算力与数据堆上去,大幅提升智能上界。结果是编程能力登顶开源第一(Terminal Bench 3.0 等多项基准),并涌现出代码审查与漏洞发现等网络安全能力。
GLM-5.3 是开源的吗,在哪下?
智谱 GLM 系列开源(THUDM 仓库),GLM-5.3 延续开源路线。具体模型权重文件、许可证、显存要求与星数以智谱官方仓库为准,本文不杜撰未经核实的仓库数据。可本地或私有化部署,也可走智谱开放平台 API。
GLM-5.3 说能找漏洞,能替代安全审计工具吗?
不能。LLM 找的是训练数据里见过的漏洞模式,对新型 0day、复杂业务逻辑漏洞、跨模块链路漏洞仍会漏报。正确用法是把 GLM-5.3 作为 SAST/SCA 之上的「智能复核层」,正规安全管线(静态扫描 + 依赖扫描 + 人工审计)不能撤。关键漏洞必须人工确认。
GLM-5.3 和 DeepSeek-V4-Pro 怎么选?
同为开源编程第一梯队,路线不同。DeepSeek-V4-Pro 押长上下文(1M)+ Anthropic API 兼容(复用 Claude 工具链便宜);GLM-5.3 押后训练 Scaling + 安全能力涌现。常见组合:日常编码用 DeepSeek-V4-Pro,代码审查/漏洞排查切 GLM-5.3。具体规格与基准以各官方为准。
「后训练 Scaling」是什么,为什么值得记?
预训练之后的阶段(指令微调、强化学习、对抗训练等)扩大规模来抬升能力。意义在于:参数不动也能变强,比重新预训练超大模型便宜得多,是开源可复制的路线。但它受基座天花板约束,基座没有的能力后训练变不出来。

相关文章

开源项目

Open-AutoGLM 拆解:智谱把手机 Agent 开源了,一句「打开小红书搜美食」它自己动手

zai-org/Open-AutoGLM(26,104 星 / 4,019 fork,Apache-2.0,Python)是智谱开源的手机端 GUI Agent 框架:ADB 控制真机 + VLM 屏幕感知,截图、看懂界面、规划、点击循环执行,10 个固定操作原语,不依赖无障碍接口和控件树。配 AutoGLM-Phone-9B 专用模型(第三方 API / vLLM 本地部署 24GB+ 显存 / Claude Code+GLM Coding Plan 三种取用),内置敏感操作确认与人工接管两道安全门,官方覆盖 Android 50+、鸿蒙 60+ 主流应用。README 专设「给 AI 看的部署指南」,用 agent 装 agent。注意口径:仓库最近 push 停在 2026-03-06,星数是历史积累。

2026年8月27日8 分钟阅读
开源项目

LLaDA-Image:蚂蚁全开源的 6B 统一生图编辑模型

蚂蚁 InclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image(GitHub 2026-09-09 快照 208 星 / Python / 创建 2026-08-31)。单一权重同时做文生图与指令编辑,backbone 与 DiT 都是扩散模型的统一框架,图像-only 预训练建视觉先验,Turbo 版用 Twin-DMD 蒸馏把 50 步压到 4 步;Qwen-Image-Bench 英文 53.53、中文 53.38 双料 SOTA;HF 与 ModelScope 提供 Base/Turbo 各含 FP8 四档权重,9-07 起有社区 ComfyUI。最重要避坑:仓库 license 字段为 null、无 LICENSE 文件,商用前须向官方确认,不可臆测为 Apache/MIT。

2026年9月9日10 分钟阅读
开源项目

OpenMAIC周增八千星登顶,把文档变多智能体课堂

THU-MAIC/OpenMAIC 以周增 8,095 星登顶 GitHub 周榜(2026-09-08 快照 33,053 星 / 5,369 fork / TypeScript / MIT)。它把任意主题或文档变成多智能体互动课堂:AI 老师与 AI 同学实时讲课、讨论、白板板书、TTS 朗读,生成幻灯片、测验、交互式模拟与 PBL 项目制学习,可导出 .pptx 与交互 HTML。v1.0.0(2026-08-27)新增 Agent workbench 聊天式构建、持久化会话、20 个内置技能;技术栈 Next.js 16 / React 19 / LangGraph 1.1;v0.3.0 起由 AGPL-3.0 转 MIT,并内置 SKILL.md 标准技能包,可从 OpenClaw、Codex、WorkBuddy 等工作台直接生成课堂。

2026年9月8日10 分钟阅读