前沿热点
前沿热点

「牛来」真身揭晓:智谱开源 GLM-5.3-Flash,追平 Claude Opus 4.8 只花四十分之一价钱

匿名模型 Ox-Alpha 8 月 20 日空降 OpenRouter,首日调用量登顶并终结 DeepSeek 56 天霸榜;8 月 26 日晚智谱官宣揭晓:它就是开源的 GLM-5.3-Flash(320B-A18B)。GLM-5 系列首个原生多模态模型(视频/图像/文本/文件输入),稀疏+线性注意力混合架构让注意力计算量降 3 倍、KV 缓存缩小 4.4 倍;Artificial Analysis 综合智能指数 57 分追平 Claude Opus 4.8,定价(输入 0.8/输出 2.8 元每百万 token)约为其四十分之一,全部流量跑在 10 万张国产算力卡上,权重以 MIT 协议开放。一个转折要记住:缓存命中 0.23 元反而高于 DeepSeek V4-Flash 闲时的 0.05 元,缓存命中率超九成的编程 Agent 先算账再换。

发布于 2026年8月27日6 分钟阅读
<!-- zhipu-glm-5-3-flash-open-source-hotspot | hotspot | 「牛来」真身揭晓:智谱开源 GLM-5.3-Flash,追平 Claude Opus 4.8 只花四十分之一价钱 -->

过去一周,海外开发者社区被一个匿名模型刷屏:它叫 Ox-Alpha,8 月 20 日以「隐身模型」身份空降 OpenRouter,首日调用量直接登顶并创下平台单日历史纪录。中文社区给它起了个更接地气的名字--「牛来」。8 月 26 日晚,谜底揭晓:智谱正式上线并开源 GLM-5.3-Flash(320B-A18B),官方确认它就是 Ox-Alpha。Artificial Analysis 综合智能指数 57 分、与 Claude Opus 4.8 持平,定价却只有后者的约四十分之一--而承载这一切的,是 10 万张国产算力卡。

先说边界:本文事实基于财联社/科创板日报(记者李明明)、爱范儿、蓝鲸新闻 2026-08-26/27 报道与智谱官方文档、模型卡整理;价格为快照,以官方页面为准;非投资建议。

一、「牛来」是谁:终结 DeepSeek 56 天霸榜的隐身模型

先把时间线捋清楚。8 月 20 日,Ox-Alpha 以不署名的方式上线 OpenRouter:首日调用量登顶并创平台单日历史纪录,终结了 DeepSeek 在 OpenCode 长达 56 天的霸榜,单日处理 tokens 达 62T,成为 OpenRouter 与 OpenCode 两大平台当周最受欢迎模型,直接刷新了双平台的历史纪录。整个测试期 5 天里,它承接了约 50T token 的调用量。

社区没闲着。独立研究员的技术指纹报告显示:其分词器在 25 组提示词测试中与 GLM-5.3 的 Token 计数完全一致,11 项探针交叉测试与 GLM 家族全匹配,报告给出的判断是「99% 把握」指向智谱。8 月 26 日晚,智谱官宣 GLM-5.3-Flash 上线并开源,官方确认它就是那个 Ox-Alpha--猜谜游戏结束,但这场匿名营销本身已经把热度拉满:先让全球开发者用脚投票,再揭晓身份。

值得体会的是这套打法的精妙之处。传统发布会的顺序是「先讲参数、再等用户验证」,Ox-Alpha 把顺序倒了过来:模型先以匿名身份承接真实负载,单日 62T token、终结 56 天霸榜、双平台历史纪录,全部是用户自己跑出来的成绩单;等社区拿着分词器指纹把答案猜到 99% 时,官方只需补上最后 1%。匿名本身成了最好的传播机制--猜谜的人越多,「牛来」两个字的讨论度就越高,揭晓那一刻的声量自然越大。

二、架构:稀疏+线性注意力混合,GLM-5 系列首个原生多模态

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型:总参数 320B、激活参数 18B、45 层,基于 30T Token 多模态语料预训练,输入模态覆盖视频、图像、文本、文件,上下文窗口 1M、最大输出 128K。它是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,并创新采用流形约束超连接(mHC)。

架构层面的降本幅度,用官方数据说话:

维度GLM-5.3-Flash对比基准变化
注意力计算量混合注意力GLM-5.3降低 3.01 倍
KV 缓存占用混合注意力GLM-5.3缩小 4.44 倍
激活参数180 亿GLM-4.5 系列的 320 亿下降 44%
层数45 层GLM-4.5 系列的 92 层减半

注意力计算量降 3 倍、KV 缓存缩小 4 倍多、激活参数比上代系列近乎腰斩--这三个数字叠加,就是「四十分之一价钱」在架构端的来源。

再看模态与上下文。1M 上下文窗口加 128K 最大输出,意味着一次塞进整个代码仓库、一份完整研报或一段长视频都还有余量;而视频、图像、文本、文件四种输入模态原生齐备,省掉了「先跑一个视觉模型、再拼接文本模型」的多级流水线。对 Agent 类应用来说,这两点合在一起,才是「一个模型看完整个工作现场」的前提。

三、能力:57 分追平 Claude Opus 4.8,视觉原生融入 Coding 循环

在 Artificial Analysis 的综合智能指数上,GLM-5.3-Flash 拿到 57 分,与 Claude Opus 4.8 持平,高于 GLM-5.2 的 53 分和 DeepSeek V4 Pro 正式版的 53 分。以一个 18B 激活参数的模型追平旗舰闭源模型,这是本次发布最硬的能力证据。

更具辨识度的是 Visual Coding(深度视觉编码):视觉能力原生融入 Coding 循环,模型能主动观察界面、渲染结果与交互反馈并持续改进,在代码、浏览器与图形界面之间协同完成任务。场景也拓展到了 Office、金融研究和专业文档,可直接交付 PPTX/PDF/DOCX/XLSX 等成品文件。换句话说,它不只是「能看图的模型」,而是把「看」嵌进了写代码的每一步反馈回路里。

四、价格:Opus 的四十分之一,但缓存命中有个转折

API 定价(每百万 token):输入 0.8 元、输出 2.8 元、缓存命中 0.23 元。这一定价为 GLM-5.3 的 1/10(限时折扣期内低至 1/20),约为 Claude Opus 4.8 的 1/40。

放在 DeepSeek 刚提价的背景里看更有意思。8 月 17 日 DeepSeek 对 V4 系列提价并首次引入峰谷定价(每天 9-12 点、14-18 点为高峰):V4-Flash 输出从每百万 token 2 元涨到高峰 9 元,涨幅 350%,缓存命中输入涨 400%;V4-Pro 高峰输出 27 元(约合 3.96 美元,提价前为 0.87 美元)。提价之后,V4-Flash 在 OpenCode 上的调用量掉了一半(《晚点LatePost》报道)。GLM-5.3-Flash 相对 DeepSeek V4-Flash 闲时价的对比:

项目(每百万 token)GLM-5.3-Flash相当于 V4-Flash 闲时价半价期内
输入0.8 元53%27%
输出2.8 元62%31%
缓存命中0.23 元4.6 倍(V4-Flash 闲时 0.05 元)--

注意那个转折:缓存命中 0.23 元反而高于 DeepSeek V4-Flash 闲时的 0.05 元。而编程类 Agent 的缓存命中率普遍超过九成,输入大头走的是缓存价--对这类重度用户,DeepSeek 实际更便宜;GLM-5.3-Flash 的「四十分之一」更多是相对 Opus 的旗舰级对比,而非对所有对手的全面碾压。选型时先算清楚自己的缓存命中率,再选边。

给预算一个直观参照:假设一个团队每天消耗 100M token、输入输出比 3:1,按 GLM-5.3-Flash 定价一天成本约 130 元(输入 75M 约 60 元、输出 25M 约 70 元);若缓存命中九成,输入大头按 0.23 元计,还能再压掉一大截。同样负载放在 Claude Opus 4.8 上,账单直接乘以四十。这也是中小团队盯住这类「旗舰性能、lite 价格」模型的原因。具体接入步骤(Coding Plan、ZCode、API 迁移路径),本站同批 SOP 有完整拆解。

五、10 万张国产算力卡:国产芯片首次大规模服务全球真实负载

比模型本身更有信号意义的是算力底盘。10 万张国产芯片承载了 Ox-Alpha 测试期间的全部线上流量及发布后的线上服务,这是国产算力首次大规模直接服务全球真实负载。供应商或来自华为、海光、摩尔线程(《晚点LatePost》/科创板日报援引相关人士,智谱官方未评论;智谱官方博客的表述是「数万个国产加速器」加自研高带宽互联网络)。

工程层面的细节同样值得记录:智谱在 SGLang 基础上构建了专用推理引擎,采用 W8A8 量化、INT8/FP8/BF16 混合缓存量化、Encode-Prefill-Decode(EPD)三段分离调度,同一套硬件端到端性能提升 3 倍。用大白话拆解:W8A8 量化是把权重和激活压到 8 位精度,显存和带宽开销同步下降;混合缓存量化按 KV 缓存的新旧冷热分别用 INT8/FP8/BF16 存放;EPD 三段分离则是把编码、预填充、解码三个阶段拆开各自调度,让不同阶段的硬件不再互相等待。智谱称,单 token 的硬件效率与成本已达主流英伟达 GPU 同等水平。

边界要说清楚:训练环节的国产化,全行业尚无答案;10 万张卡的芯片构成,也没有官方口径。推理侧的这一步是真实的,但别外推成「全链条自主」。

六、开源与价格战语境:MIT 协议开放,行业却在集体提价

GLM-5.3-Flash 以 MIT 协议开放权重,上线即登陆 Hugging Face,接入 ZCode 等编码平台;GLM Coding Plan 已全量上线 GLM-5.3-Flash 且额度翻 3 倍,官方每天限量发放 10,000 张体验卡。

把它放进 2026 年的价格战语境里看:DeepSeek 提价九天后智谱用十分之一的价格杀进来(蓝鲸新闻的标题一针见血),但整个行业其实在反向操作--智谱自己今年 2 月取消了 Coding Plan 首购优惠,3 月将 GLM-5-Turbo API 上调 20%,截至一季度 API 调用定价累计提升 83%,调用量反而增长了 400%;Kimi K3 输出价格定到每百万 token 100 元,是上一代的三倍多;年初以来已有七家云厂商和模型厂商上调价格(律动 BlockBeats 统计)。

换句话说,行业共识是「白菜价不可持续」,而智谱的打法是:用 GLM-5.3-Flash 这个 18B 激活、架构降本的模型去打价格战,旗舰线 GLM-5.3 维持原价--低价不是慷慨,是新架构给的底气。

这里还藏着一个对采购方实用的信号:当一家厂商一边整体提价、一边对某个特定模型打到一折,说明那个折扣大概率不是烧钱换市场,而是架构红利,短期内被收回的概率相对更低。当然这只是推断,不做承诺。

一句话收尾:当 57 分的智能被压到 Opus 四十分之一的价格、跑在 10 万张国产卡上、还以 MIT 协议开放权重,「便宜的旗舰」第一次不是营销话术,而是一份可以核对的报价单。


参考来源

本文基于公开报道与官方文档整理(截至 2026-08-27),价格与活动为快照,以官方页面为准,非投资建议。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-27

相关文章

前沿热点

阿里把 Qwen4 的架构提前摊牌了:Qwen3.8-Flash-Next 放出 125B 权重,唯独没放协议文件

阿里 8 月 26 日放出 Qwen3.8-Flash-Next:一个多模态 MoE 模型,更是 Qwen4 架构的早期预览——官方给它定的角色,等同于当年 Qwen3-Next 之于 Qwen3.5。主模型 125B,额外挂 51B N-gram embeddings,每 token 只激活 6B;相比 Qwen3.7-Plus 训练成本约 1/9,coding 与 office 任务反而更强。四维升级逐个拆开:GDN 压缩历史叠加 QSA 用压缩索引器在微块粒度挑重点、Gated Residual 把残差流扩成 4 分支、N-gram Embedding 可卸载到主机内存靠异步预取与计算重叠、优化器换成 Muon。原生 262,144 tokens,YaRN 可外推到 1M。生产版 Qwen3.8-Flash 在 QwenCloud 报价 \$0.16/\$0.47 每百万 token(不同来源口径略有出入,以官网为准)。但真正的悬念是协议:GitHub 仓库没有 LICENSE 文件,license 字段为 None,README 只让读者去 HF/ModelScope 模型页查看,社区已经有人在追问「为什么不是 Apache 2.0」——本文标注为未确认,商用前务必自行核对模型页协议。

2026年8月30日6 分钟阅读