过去一周,海外开发者社区被一个匿名模型刷屏:它叫 Ox-Alpha,8 月 20 日以「隐身模型」身份空降 OpenRouter,首日调用量直接登顶并创下平台单日历史纪录。中文社区给它起了个更接地气的名字--「牛来」。8 月 26 日晚,谜底揭晓:智谱正式上线并开源 GLM-5.3-Flash(320B-A18B),官方确认它就是 Ox-Alpha。Artificial Analysis 综合智能指数 57 分、与 Claude Opus 4.8 持平,定价却只有后者的约四十分之一--而承载这一切的,是 10 万张国产算力卡。
先说边界:本文事实基于财联社/科创板日报(记者李明明)、爱范儿、蓝鲸新闻 2026-08-26/27 报道与智谱官方文档、模型卡整理;价格为快照,以官方页面为准;非投资建议。
一、「牛来」是谁:终结 DeepSeek 56 天霸榜的隐身模型
先把时间线捋清楚。8 月 20 日,Ox-Alpha 以不署名的方式上线 OpenRouter:首日调用量登顶并创平台单日历史纪录,终结了 DeepSeek 在 OpenCode 长达 56 天的霸榜,单日处理 tokens 达 62T,成为 OpenRouter 与 OpenCode 两大平台当周最受欢迎模型,直接刷新了双平台的历史纪录。整个测试期 5 天里,它承接了约 50T token 的调用量。
社区没闲着。独立研究员的技术指纹报告显示:其分词器在 25 组提示词测试中与 GLM-5.3 的 Token 计数完全一致,11 项探针交叉测试与 GLM 家族全匹配,报告给出的判断是「99% 把握」指向智谱。8 月 26 日晚,智谱官宣 GLM-5.3-Flash 上线并开源,官方确认它就是那个 Ox-Alpha--猜谜游戏结束,但这场匿名营销本身已经把热度拉满:先让全球开发者用脚投票,再揭晓身份。
值得体会的是这套打法的精妙之处。传统发布会的顺序是「先讲参数、再等用户验证」,Ox-Alpha 把顺序倒了过来:模型先以匿名身份承接真实负载,单日 62T token、终结 56 天霸榜、双平台历史纪录,全部是用户自己跑出来的成绩单;等社区拿着分词器指纹把答案猜到 99% 时,官方只需补上最后 1%。匿名本身成了最好的传播机制--猜谜的人越多,「牛来」两个字的讨论度就越高,揭晓那一刻的声量自然越大。
二、架构:稀疏+线性注意力混合,GLM-5 系列首个原生多模态
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型:总参数 320B、激活参数 18B、45 层,基于 30T Token 多模态语料预训练,输入模态覆盖视频、图像、文本、文件,上下文窗口 1M、最大输出 128K。它是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,并创新采用流形约束超连接(mHC)。
架构层面的降本幅度,用官方数据说话:
| 维度 | GLM-5.3-Flash | 对比基准 | 变化 |
|---|---|---|---|
| 注意力计算量 | 混合注意力 | GLM-5.3 | 降低 3.01 倍 |
| KV 缓存占用 | 混合注意力 | GLM-5.3 | 缩小 4.44 倍 |
| 激活参数 | 180 亿 | GLM-4.5 系列的 320 亿 | 下降 44% |
| 层数 | 45 层 | GLM-4.5 系列的 92 层 | 减半 |
注意力计算量降 3 倍、KV 缓存缩小 4 倍多、激活参数比上代系列近乎腰斩--这三个数字叠加,就是「四十分之一价钱」在架构端的来源。
再看模态与上下文。1M 上下文窗口加 128K 最大输出,意味着一次塞进整个代码仓库、一份完整研报或一段长视频都还有余量;而视频、图像、文本、文件四种输入模态原生齐备,省掉了「先跑一个视觉模型、再拼接文本模型」的多级流水线。对 Agent 类应用来说,这两点合在一起,才是「一个模型看完整个工作现场」的前提。
三、能力:57 分追平 Claude Opus 4.8,视觉原生融入 Coding 循环
在 Artificial Analysis 的综合智能指数上,GLM-5.3-Flash 拿到 57 分,与 Claude Opus 4.8 持平,高于 GLM-5.2 的 53 分和 DeepSeek V4 Pro 正式版的 53 分。以一个 18B 激活参数的模型追平旗舰闭源模型,这是本次发布最硬的能力证据。
更具辨识度的是 Visual Coding(深度视觉编码):视觉能力原生融入 Coding 循环,模型能主动观察界面、渲染结果与交互反馈并持续改进,在代码、浏览器与图形界面之间协同完成任务。场景也拓展到了 Office、金融研究和专业文档,可直接交付 PPTX/PDF/DOCX/XLSX 等成品文件。换句话说,它不只是「能看图的模型」,而是把「看」嵌进了写代码的每一步反馈回路里。
四、价格:Opus 的四十分之一,但缓存命中有个转折
API 定价(每百万 token):输入 0.8 元、输出 2.8 元、缓存命中 0.23 元。这一定价为 GLM-5.3 的 1/10(限时折扣期内低至 1/20),约为 Claude Opus 4.8 的 1/40。
放在 DeepSeek 刚提价的背景里看更有意思。8 月 17 日 DeepSeek 对 V4 系列提价并首次引入峰谷定价(每天 9-12 点、14-18 点为高峰):V4-Flash 输出从每百万 token 2 元涨到高峰 9 元,涨幅 350%,缓存命中输入涨 400%;V4-Pro 高峰输出 27 元(约合 3.96 美元,提价前为 0.87 美元)。提价之后,V4-Flash 在 OpenCode 上的调用量掉了一半(《晚点LatePost》报道)。GLM-5.3-Flash 相对 DeepSeek V4-Flash 闲时价的对比:
| 项目(每百万 token) | GLM-5.3-Flash | 相当于 V4-Flash 闲时价 | 半价期内 |
|---|---|---|---|
| 输入 | 0.8 元 | 53% | 27% |
| 输出 | 2.8 元 | 62% | 31% |
| 缓存命中 | 0.23 元 | 4.6 倍(V4-Flash 闲时 0.05 元) | -- |
注意那个转折:缓存命中 0.23 元反而高于 DeepSeek V4-Flash 闲时的 0.05 元。而编程类 Agent 的缓存命中率普遍超过九成,输入大头走的是缓存价--对这类重度用户,DeepSeek 实际更便宜;GLM-5.3-Flash 的「四十分之一」更多是相对 Opus 的旗舰级对比,而非对所有对手的全面碾压。选型时先算清楚自己的缓存命中率,再选边。
给预算一个直观参照:假设一个团队每天消耗 100M token、输入输出比 3:1,按 GLM-5.3-Flash 定价一天成本约 130 元(输入 75M 约 60 元、输出 25M 约 70 元);若缓存命中九成,输入大头按 0.23 元计,还能再压掉一大截。同样负载放在 Claude Opus 4.8 上,账单直接乘以四十。这也是中小团队盯住这类「旗舰性能、lite 价格」模型的原因。具体接入步骤(Coding Plan、ZCode、API 迁移路径),本站同批 SOP 有完整拆解。
五、10 万张国产算力卡:国产芯片首次大规模服务全球真实负载
比模型本身更有信号意义的是算力底盘。10 万张国产芯片承载了 Ox-Alpha 测试期间的全部线上流量及发布后的线上服务,这是国产算力首次大规模直接服务全球真实负载。供应商或来自华为、海光、摩尔线程(《晚点LatePost》/科创板日报援引相关人士,智谱官方未评论;智谱官方博客的表述是「数万个国产加速器」加自研高带宽互联网络)。
工程层面的细节同样值得记录:智谱在 SGLang 基础上构建了专用推理引擎,采用 W8A8 量化、INT8/FP8/BF16 混合缓存量化、Encode-Prefill-Decode(EPD)三段分离调度,同一套硬件端到端性能提升 3 倍。用大白话拆解:W8A8 量化是把权重和激活压到 8 位精度,显存和带宽开销同步下降;混合缓存量化按 KV 缓存的新旧冷热分别用 INT8/FP8/BF16 存放;EPD 三段分离则是把编码、预填充、解码三个阶段拆开各自调度,让不同阶段的硬件不再互相等待。智谱称,单 token 的硬件效率与成本已达主流英伟达 GPU 同等水平。
边界要说清楚:训练环节的国产化,全行业尚无答案;10 万张卡的芯片构成,也没有官方口径。推理侧的这一步是真实的,但别外推成「全链条自主」。
六、开源与价格战语境:MIT 协议开放,行业却在集体提价
GLM-5.3-Flash 以 MIT 协议开放权重,上线即登陆 Hugging Face,接入 ZCode 等编码平台;GLM Coding Plan 已全量上线 GLM-5.3-Flash 且额度翻 3 倍,官方每天限量发放 10,000 张体验卡。
把它放进 2026 年的价格战语境里看:DeepSeek 提价九天后智谱用十分之一的价格杀进来(蓝鲸新闻的标题一针见血),但整个行业其实在反向操作--智谱自己今年 2 月取消了 Coding Plan 首购优惠,3 月将 GLM-5-Turbo API 上调 20%,截至一季度 API 调用定价累计提升 83%,调用量反而增长了 400%;Kimi K3 输出价格定到每百万 token 100 元,是上一代的三倍多;年初以来已有七家云厂商和模型厂商上调价格(律动 BlockBeats 统计)。
换句话说,行业共识是「白菜价不可持续」,而智谱的打法是:用 GLM-5.3-Flash 这个 18B 激活、架构降本的模型去打价格战,旗舰线 GLM-5.3 维持原价--低价不是慷慨,是新架构给的底气。
这里还藏着一个对采购方实用的信号:当一家厂商一边整体提价、一边对某个特定模型打到一折,说明那个折扣大概率不是烧钱换市场,而是架构红利,短期内被收回的概率相对更低。当然这只是推断,不做承诺。
一句话收尾:当 57 分的智能被压到 Opus 四十分之一的价格、跑在 10 万张国产卡上、还以 MIT 协议开放权重,「便宜的旗舰」第一次不是营销话术,而是一份可以核对的报价单。
参考来源
-
财联社/科创板日报(2026-08-27,记者李明明):《10万张国产算力卡扛起"牛来":智谱开源GLM-5.3-Flash》,https://baijiahao.baidu.com/s?id=1874642322871069438
-
爱范儿(新浪,2026-08-26 23:20):智谱开源 GLM-5.3-Flash 原生多模态模型,https://sina.cn/news/detail/5336304606774049.html
-
蓝鲸新闻(2026-08-27 15:17):《DeepSeek提价九天后,智谱用十分之一的价格杀进来》,https://baijiahao.baidu.com/s?id=1874660001676882489
-
智谱 AI 开放文档 GLM-5.3-Flash 模型卡:https://docs.bigmodel.cn/cn/guide/models/vlm/glm-5.3-flash
-
GLM Coding Plan 官方页:https://bigmodel.cn/glm-coding
-
关联阅读:本批姊妹篇 GLM-5.3-Flash 接入 SOP、轻量旗舰 API 五强横评;往期 GLM-5.3 深度解析、ZCode 3.0 与 Coding Plan 额度回满、大模型价格战、DeepSeek V4 Flash 上线
本文基于公开报道与官方文档整理(截至 2026-08-27),价格与活动为快照,以官方页面为准,非投资建议。