2026 年 8 月 14 日,周五,AI 模型圈罕见地「四家同日发牌」:谷歌推出编程与 Agents 向的 Gemini 3.7 Flash,智谱发布后训练 Scaling 路线的 GLM-5.3,MiniMax 开源音乐模型 MiniMax-Music3,小红书 dots 模型实验室开源多模态 MoE dots3-note preview。四条新闻背后是同一条主线:编程/Agent 能力成为所有厂商的主战场,开源侧正在从「追参数」转向「卷后训练、卷安全、卷多模态」。这篇速报把四件事一次讲清,并给出各自的看点与冷水。深度盘 GLM-5.3 见本站 GLM-5.3 开源解析,安全这条线的工具选型见 AI 代码安全审计工具横评。
先说清边界:本文事实基于四家今日发布信息整理(来源:IT之家、智谱官方、机器之心,截至 2026-08-14),非实测复现;规格与定价以各官方渠道为准。MiniMax-Music3 与本站早前 AI 音乐 2026 热点 互补不重复:那篇讲音乐赛道格局,这篇只报 Music3 这条新闻。
一、四连发一览:谁发了什么
| 公司 | 模型 | 类型 | 核心亮点 | 开源 |
|---|---|---|---|---|
| 谷歌 | Gemini 3.7 Flash | 编程/Agents 向主力 | 编程+Agents 场景大幅提升;首发至 2026 年底半价(输入 $0.75/M、输出 $3.75/M) | 否 |
| 智谱 | GLM-5.3 | 编程+安全 | 后训练 Scaling 提升智能上界;开源编程第一;涌现网络安全能力,联合安全团队发现 2436 个漏洞 | 是 |
| MiniMax | MiniMax-Music3 | 音乐生成 | 歌词生成最长 5 分钟歌曲;8B+0.6B 分层架构;32kHz 立体声 WAV | 是 |
| 小红书 | dots3-note preview | 多模态 MoE | 280B 总参/16B 激活;512K 上下文;文本+视觉+语音 | 是 |
四家里三家开源、三家与编程或 Agent 相关。这不是巧合,是当下竞争焦点的直接投影:闭源侧拼编程性价比,开源侧拼后训练与多模态。
二、Gemini 3.7 Flash:编程与 Agents,半价首发
谷歌这次把 Flash 主力档明确指向编程与 Agents 场景,官方称在软件工程、知识工作及网页开发等方面大幅提升。对开发者的直接意义是:Cursor、Cline、Claude Code 这类编码工具里,Flash 档从「便宜够用的配角」向「能扛主力活」靠拢。
价格是更狠的一刀。即日起至 2026 年底,首发优惠价为 3.6 Flash 原价的一半:输入每百万 Token 0.75 美元,输出 3.75 美元。对照国产阵营 DeepSeek-V4-Pro(输出 6 元/M,约合 $0.85)这个定价谈不上碾压,但叠加 Gemini 生态(Gemini Spark 已接入该模型,并优化了 Workspace 工具使用能力)与多模态底子,对海外开发者的吸引力是实打实的。冷水:优惠价有时限(2026 年底),长期成本规划别按首发价做假设;国内访问仍需梯子。
三、GLM-5.3:基座未变,后训练 Scaling,还会找漏洞
智谱这手牌路数不一样:基座未变,靠后训练 Scaling 大幅提升智能上界。翻译一下:参数规模不动,把训练后阶段(强化学习等)的算力和数据堆上去,把同一个大脑「教」得更聪明。官方称 GLM-5.3 已是当前编程能力最强的开源模型,在 Terminal Bench 3.0 等多项基准测试中取得开源第一。
更有意思的是安全能力的涌现:GLM-5.3 在代码审查与漏洞发现等任务上表现突出,智谱联合多家安全团队累计发现 2436 个漏洞,并启动「开源的盾」计划。开源模型第一次把「网络安全」从被动防守(对齐、防滥用)变成主动武器(帮你找漏洞)。这条线的深度拆解见本站 GLM-5.3 开源解析,用大模型给代码库做安全扫描的实操见 安全审计 SOP。
四、MiniMax-Music3 与 dots3-note:开源侧的两个信号
MiniMax-Music3 是开源音乐模型的又一次结构升级。分层架构是它的技术看点:8B 全局模型负责长程语义与结构(整首歌的主题、段落推进),0.6B 局部模型恢复细粒度声学信息(音色、咬字)。支持歌词生成最长 5 分钟歌曲,输出 32kHz 立体声 WAV,能保持主题、节奏、歌声身份及编曲推进,覆盖前奏、主歌、副歌等完整结构。对本站 AI 音乐 2026 热点 判断的「开源要掀桌」是个新的实证。
dots3-note preview 是小红书 dots 模型实验室开源的 dots3 系列首个版本:总参数 280B、激活参数仅 16B 的 MoE,支持 512K 超长上下文,具备文本、视觉与语音多模态理解能力,针对复杂推理、Agent 和多模态感知优化,官方称多项 benchmark 可比肩参数数倍的大模型。看点有二:其一,16B 激活意味着推理成本被压到「中等模型」档位,长上下文 + 多模态 + 低激活成本的组合对 Agent 场景很实用;其二,内容平台(小红书)下场开源基座级模型,说明数据优势方也想进牌桌。注意它是 preview 版,成熟度与文档完备度以官方仓库为准,生产接入前先小规模验证。
五、冷思考:为什么是同一天,怎么看
同日四发没有阴谋,只有共振。第一,编程/Agent 是唯一的公约数:Gemini 3.7 Flash 为编程定价,GLM-5.3 为编程登顶,dots3-note 为 Agent 优化--编码代理是当前模型落地最确定、付费意愿最强的场景,所有厂商都在往这挤。第二,开源的打法变了:GLM-5.3 证明「基座不动 + 后训练 Scaling」也能抬升智能上界,MiniMax-Music3 和 dots3-note 则把开源推向音乐、多模态这些细分纵深--开源不再只追「对标 GPT」,而是各占生态位。第三,安全成为新卖点:2436 个漏洞说明模型能力的「涌现」已经溢出到安全领域,后续大概率有更多厂商跟进。
选型速记:海外开发者要编程性价比,试 Gemini 3.7 Flash 首发价;国内开发者要开源编程最强 + 安全审计,看 GLM-5.3;要本地跑音乐生成,MiniMax-Music3;要长上下文多模态 Agent 底座,蹲 dots3-note 的正式版。四条线并存,先想场景再选模型。
常见问题
Q1:Gemini 3.7 Flash 的首发优惠价是多少,持续到什么时候? A1:即日起至 2026 年底,输入每百万 Token 0.75 美元、输出 3.75 美元,为 3.6 Flash 原价的一半。2026 年底后价格以谷歌官方公告为准,长期成本规划别按首发价做假设。
Q2:GLM-5.3 说「基座未变」,那它强在哪? A2:强在后训练 Scaling:参数规模(基座)不动,把训练后阶段的算力与数据堆上去,大幅提升智能上界。结果是编程能力登顶开源第一(Terminal Bench 3.0 等多项基准),并涌现出代码审查与漏洞发现等网络安全能力。
Q3:MiniMax-Music3 的 8B+0.6B 分层架构是什么意思? A3:8B 全局模型负责长程语义与结构(整首歌的主题、段落推进),0.6B 局部模型负责恢复细粒度声学信息(音色、咬字等)。两层分工让「最长 5 分钟、结构完整、歌声身份稳定」的歌曲生成成为可能,输出 32kHz 立体声 WAV。
Q4:dots3-note preview 的 280B/16B 是什么概念? A4:MoE(混合专家)架构:总参数 280B,但每次推理只激活约 16B。效果对标大参数模型的同时,推理成本接近一个中等规模模型,加上 512K 上下文与文本+视觉+语音多模态,适合复杂推理、Agent 与多模态感知场景。注意是 preview 版,生产接入需先验证。
Q5:四款同日发布,选型上怎么快速决策? A5:按场景切:编程+Agents 且在海外生态,试 Gemini 3.7 Flash(首发半价到 2026 年底);要开源编程最强 + 代码安全审计,看 GLM-5.3;本地音乐生成选 MiniMax-Music3;长上下文多模态 Agent 底座等 dots3-note 正式版。先定场景再定模型,别为参数表买单。
参考来源
- IT 之家:谷歌推出 Gemini 3.7 Flash(编程与 Agents 场景、首发优惠价、Gemini Spark 接入),2026-08-14
- 智谱官方:GLM-5.3 发布(后训练 Scaling、Terminal Bench 3.0 开源第一、2436 个漏洞、「开源的盾」计划),2026-08-14
- IT 之家:MiniMax 开源 MiniMax-Music3(分层架构、5 分钟歌曲、32kHz 立体声),2026-08-14
- 机器之心:小红书 dots 模型实验室开源 dots3-note preview(280B/16B MoE、512K 上下文、多模态),2026-08-14
- 本站相关:GLM-5.3 开源解析 | AI 代码安全审计工具横评 | 用大模型给代码库做安全扫描 SOP | AI 音乐 2026 热点 | DeepSeek-V4-Pro-0813 热点