2026 年 9 月 2 日(美太平洋时间),Google DeepMind 同时发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,国内在 9 月 3 日跟进报道。这是 Google 在约六周内发布的第三个 Flash 档模型——前两个分别是 7 月 21 日的 3.6 Flash 与 8 月 13 日的 3.7 Flash。官方的定位是"最聪明的 Flash",专攻长程软件工程、自主智能体与企业管理流。但这次发布真正有意思的不是"又发了一个",而是 Google 正在以业内罕见的节奏迭代这条廉价高吞吐产品线,并且把一个被很多人忽略的成本真相摆上了台面:单价没涨、模型更聪明,可因为模型会"更努力地干活",单任务的实际花费反而更高了。本文把所有数字按来源分层标注,方便你在汇报里如实引用。
一、发布背景:六周内第三个 Flash 档
先说节奏本身。从 2026 年 7 月 21 日的 Gemini 3.6 Flash,到 8 月 13 日的 3.7 Flash,再到 9 月 2 日的 3.8 Flash,Google 在六个星期内连发三款 Flash 档模型。这种迭代速度在主流实验室里并不常见:通常旗舰模型的大版本间隔以季度计,而 Flash 档作为"廉价高吞吐"的产品线,过去更多是跟着旗舰一起更新,而不是独立高频滚动。把节奏摆出来是为了说明一件事:Google 现在把 Flash 档当成一条独立、快速打磨的产品线来运营,目标是让"便宜那一半"也能持续吃到能力进步。
对工程团队的现实含义是,评估结论的有效期变短了——你上个月给 3.7 Flash 下的判断,可能这个月就被 3.8 Flash 改写。本文所有跨代比较都以 3.7 Flash 为最近基线,凡是涉及版本对照,请记住这条六个星期三连发的时间线。另外,这次两款模型是同一场发布会一起出的,发布结构本身也值得留意:主模型面向大众与开发者,安全特化兄弟线走可信访问,两条线的开放范围从一开始就不一样。
另一个背景点是同场发布的 Gemini 3.8 Flash Cyber。它不是 3.8 Flash 的简单变体,而是一条安全特化的兄弟线,只通过新的"Fairwind Program"分发给经过审核的防御方,没有公开价格。关于 Cyber 的更多讨论放在第五节,这里先把它和主模型放在同一张发布表上,提醒读者:这次"发布了什么"和"你能拿到什么"是两件事。
二、规格:百万级上下文与三级思考
3.8 Flash 的核心规格如下,先把数字摆清楚再谈含义。
| 规格 | Gemini 3.8 Flash | 对照说明 |
|---|---|---|
| 输入上下文 | 1,048,576 tokens | 即 1M,维持 Flash 档百万级上下文 |
| 最大输出 | 65,536 tokens(64K) | 文本输出上限,注意是 64K 而非旗舰的 128K |
| 输入模态 | 文本、图像、视频、音频、PDF | 多模态输入 |
| 输出模态 | 仅文本 | 输出不带多模态生成 |
| 思考级别 | low / medium / high 三档 | 用户可按任务选择推理强度 |
| 知识截止 | 2026 年 3 月(部分领域 2025 年 1 月) | 部分领域截止更早,需注意 |
几个规格点要单独讲。第一,输出上限是 64K 而不是旗舰的 128K,对绝大多数 agent 链路够用,但超长生成任务要留余量,别在提示里假设它能一次性吐出十万字。第二,思考分三档而不是"自适应常开",这给了工程侧一个明确的杠杆:简单任务用 low 省 token,硬任务用 high 换质量——而这个杠杆恰恰是后面"单任务成本"话题的开关,因为它直接决定模型有多"努力"。第三,知识截止在部分领域停在 2025 年 1 月,引用近期事实尤其是这些领域的近期事实时,要主动带检索或工具,不要默认模型知道。
上架渠道很广:Gemini API、Google AI Studio、Android Studio、Antigravity、Gemini Enterprise、Gemini app,以及 Search 里的 AI Mode。覆盖面从开发者到终端用户到企业到搜索入口,说明 Google 这次想让 3.8 Flash 同时打穿工程侧与消费侧。对团队来说,这意味着你大概率不需要换平台就能用上,但也要分别测各入口的能力一致性,因为不同入口可能套了不同护栏与默认参数。
三、基准:coding 是强项,OS 与长程是短板
口径先说清:下表里的 Google 自家基准(DeepSWE、Terminal-Bench、SWE-Bench Pro、HLE-Verified、Vals、Harvey)均为 Google 公布口径,不是独立第三方实测;Terminal-Bench 4.0 等少数项为第三方或更晚报道,已单独标注。我们尚未看到独立机构对这批数字做同条件复核,读的时候看量级与趋势,别把单点数字当确定值抄进选型文档。
| 基准 | Gemini 3.8 Flash | 已公布对照 | 口径说明 |
|---|---|---|---|
| DeepSWE v1.1 | 73.7% | Claude Opus 5 74.0%、GPT-5.6 Sol 72.7%、3.7 Flash 65.3% | Google 公布;逼近 Opus 5 |
| Terminal-Bench 2.1 | 89.4% | Opus 5 89.1% | Google 公布;标称世界 #1 |
| SWE-Bench Pro | 61.6% | 未给对照 | Google 公布 |
| HLE-Verified | 54.9% | 未给对照 | Google 公布 |
| Terminal-Bench 4.0 | 19.1% | Opus 5 51.8%、Fable 5.1 55.8%、GPT-5.6 Sol 37.3% | 明显短板 |
| OSWorld 2.0 | 59.0% | Opus 5 75.4% | 明显短板 |
| Vals Finance Agent v2 | 61.4% | — | Google 公布;标称 #1 |
| Harvey Legal Agent | 10.0% | — | Google 公布;标称 #1 |
读这张表要分两层。强项层:DeepSWE 73.7% 仅比 Opus 5 低 0.3 个百分点,Terminal-Bench 2.1 的 89.4% 被 Google 标为世界第一,但也只比 Opus 5 的 89.1% 高 0.3 个百分点,属于同一档。这两个数字支撑"frontier 级 coding 已被压进廉价线"的判断。值得提醒的是 Terminal-Bench 2.1 的 89.4% 与部分媒体给出的 90.8% 存在差异,本文以 Google 公布的 89.4% 为准,并如实标注这个口径差,因为它说明第三方复测可能给出不同数值。
短板层更关键:Terminal-Bench 4.0 只有 19.1%,不到 Opus 5(51.8%)的一半,也明显低于 Fable 5.1(55.8%)和 GPT-5.6 Sol(37.3%);OSWorld 2.0 的 59.0% 也落后 Opus 5 的 75.4% 约十六个百分点。这两个差距说明 3.8 Flash 在"超长程、跨多步工具链、需要稳定操作图形界面"的任务上仍明显弱于旗舰。换句话说,它的 coding 强项集中在"写代码、跑终端"这类可验证闭环,而在"长时间自主操作真实系统"上还有明显代差,别把 DeepSWE 的高分外推到整段自主工作流。
财务与法律两个垂直 agent 基准拿下了标称 #1(Vals 61.4%、Harvey 10.0%),但这两个基准缺少同条件对照,且 Harvey 10.0% 本身绝对值偏低,引用时请带上"标称、缺对照"的限定,不要当成可复现承诺。横向对比各厂旗舰与 Flash 档的编程推理能力,见 旗舰模型编程推理横评;想用更轻量的视觉实验思路搭贴近业务的评测,见 DeepSeek V4 Flash 视觉实验资源。
四、成本:单价没涨,单任务更贵
定价这块,Google 给了"限时同价"的安排,先把价目摆出来。
| 计费项 | 介绍期(至 2026-12-31) | 标准价(2027-01-01 起) |
|---|---|---|
| 输入 | 每百万 token 0.75 美元 | 每百万 token 1.50 美元 |
| 输出 | 每百万 token 3.75 美元 | 每百万 token 7.50 美元 |
介绍期价格和 3.7 Flash 完全相同,等于没有涨价;从 2027 年元旦起恢复标准价,正好翻倍。所以"同价更聪明"在单价层面是成立的,前提是你在介绍期窗口内把工作负载迁过来。这条窗口本身是落地清单里的一条动作,别等到了 12 月底才想起。
但真正要讲的是单任务成本。关键机制在这里:Google 让模型"更努力地干活"——更多推理步数、更多迭代式工具调用、更长的 agentic 循环。第三方评测机构 Artificial Analysis 实测下来,单任务成本因此上升约 40%,从 0.40 美元涨到 0.58 美元。也就是说,单价表上的"更便宜"被更长的实际工作路径吃掉了一部分——模型变聪明的方式,是花更多 token 把事做完。这条数字来自 Artificial Analysis 的实测,不是 Google 官方口径,引用时请按第三方来源对待。
这个 nuance 对工程账影响很大。如果你的工作负载是短平快的调用,单价没变、模型更聪明,你是净赚的;但如果是长程 agent、需要反复试错和工具循环的任务,账单会按 token 膨胀而不是按"一次调用"膨胀。3.8 Flash 相比 Opus 5 的单位价大约是七分之一,这是它的核心吸引力,但七分之一的前提是你控制住每任务的实际 token 消耗,而不是放任模型全程 high 思考加长循环。
怎么压住这个膨胀?两条路。一是在代码里把思考级别按任务调低,低风险批量任务用 low 省 token;二是把可复用的上下文放进缓存,减少重复读取。后者正是 缓存成本横评 里讲的逻辑——agentic 链路的 token 大头正是反复读取同一份系统提示、工具定义与长历史。换句话说,3.8 Flash 的性价比不是自动兑现的,它取决于你有没有把"更努力"这道开关管起来。
五、Gemini 3.8 Flash Cyber:安全模型的新分发模式
同场发布的 Gemini 3.8 Flash Cyber 是赛道另一端的东西。它是面向网络安全特化的兄弟模型,但分发方式与主模型完全不同:只通过新的"Fairwind Program"分发给经过审核的防御方,走可信访问,没有公开价格。本文无法确认其定价,标注为【未确认】。
Cyber 的存在本身释放两个信号。第一,Google 明确说安全方向的训练也抬升了基础模型的编程能力——也就是说,3.8 Flash 在 coding 上的进步,有一部分来自安全训练的外溢。这解释了为什么一个"更会写代码"的通用 Flash 档,能在一个没有公开发布的安全线上获得训练收益,两条线在能力上是互相喂养的。第二,也是更值得记下的:安全特化模型不再走"公开发布 + 统一价格"的老路,而是走"审核防御方 + 可信访问"的门槛式分发。
这和 Anthropic 把 Mythos 5.1 限在美国机构、Claude 走差异化开放是同一类思路,说明头部实验室正在把"能力强度"和"谁能拿到"正式解耦。对工程团队的直接含义是:Cyber 大概率不是你能在控制台一键开通的选项,它的价值更像一份"能力上界公告"加一次分发模式示范。真正能落到你工作流里的,是主模型 3.8 Flash 在编程与安全相关任务上的外溢收益,而不是 Cyber 本身。评估时请把两者分开:前者可立即评估,后者先当它不存在,等 Fairwind Program 对你所在机构开放再说。
六、落地清单
| 动作 | 依据 | 优先级 |
|---|---|---|
| 把 3.8 Flash 纳入编码与 agent 评估 | DeepSWE 73.7%、Terminal-Bench 2.1 89.4%,逼近旗舰 | 高 |
| 按任务调思考级别管控 token | 单任务成本因更努力上升约 40%(第三方实测) | 高 |
| 长程 OS / 多步 GUI 任务先别全切 | Terminal-Bench 4.0 19.1%、OSWorld 2.0 59.0% 明显弱 | 高 |
| 赶介绍期单价窗口 | 同价至 2026-12-31,2027 起翻倍 | 中 |
| 用缓存架构压单任务成本 | 见缓存成本横评 | 中 |
| 把 Cyber 当能力公告而非可用选项 | 仅 Fairwind 可信访问,价格未确认 | 中 |
其中第二、三、五条要连起来看:先按第三条识别哪些任务 3.8 Flash 还做不好(别硬切,别被 DeepSWE 高分误导),再用第二条把能做好的任务按思考级别压 token,最后用第五条的缓存架构把单任务账单压回"七分之一 Opus"的量级。这三步是这套发布对工程侧最实在的落地顺序,也是把"更聪明但更贵"重新拧回"更聪明且更便宜"的唯一办法。
最后一件值得单独讲:这次发布最该被记住的,不是那个逼近 Opus 的 coding 分数,而是"廉价线以罕见节奏滚动 + 单任务成本因更努力而膨胀 + 安全模型走门槛式分发"这三件事叠在一起。它提醒工程团队,性价比不是出厂设置,而是你管不管得住"模型有多努力"这个函数的结果;也提醒采购侧,便宜线的能力上限正在快速逼近旗舰,但开放范围正被按风险重新切分。
参考来源
- Google DeepMind 官方博客与发布说明(Gemini 3.8 Flash / 3.8 Flash Cyber,2026-09-02)——"最聪明的 Flash"定位、与 3.6 Flash(7-21)、3.7 Flash(8-13)的六周三连发节奏、百万级输入上下文、64K 输出、多模态输入与文本输出、三级思考、2026 年 3 月知识截止(部分领域 2025 年 1 月)、上架渠道(Gemini API / AI Studio / Android Studio / Antigravity / Gemini Enterprise / Gemini app / Search AI Mode)、介绍期 0.75/3.75 美元与 2027 年起 1.50/7.50 美元定价、全部 Google 自家基准(DeepSWE 73.7%、Terminal-Bench 2.1 89.4%、SWE-Bench Pro 61.6%、HLE-Verified 54.9%、Vals 61.4%、Harvey 10.0%)、"安全训练抬升基础模型编程"的表述、3.8 Flash Cyber 与 Fairwind Program 可信访问分发模式。上述除 Cyber 价格外均为 Google 公布口径;具体公告 URL 未确认。
- Artificial Analysis(第三方评测)——单任务成本因更高推理努力上升约 40%(0.40 美元升至 0.58 美元)。该数字为第三方实测,非 Google 官方口径,且受具体任务与努力设置影响。
- 腾讯新闻、IT之家(2026-09-03)——国内报道时间与发布信息的中文交叉印证;部分媒体对 Terminal-Bench 2.1 给出 90.8% 一说,与 Google 公布的 89.4% 存在口径差,本文以 Google 口径为准并已注明。
- 9to5Google、VentureBeat、MarkTechPost——发布要点、Flash 档迭代节奏与 Cyber 门槛式分发模式的英文报道交叉印证。
- 对照基准来源(Google 公布口径中引用的对照项)——Claude Opus 5(DeepSWE 74.0%、Terminal-Bench 2.1 89.1%、Terminal-Bench 4.0 51.8%、OSWorld 2.0 75.4%)、GPT-5.6 Sol(DeepSWE 72.7%、Terminal-Bench 4.0 37.3%)、Claude Fable 5.1(Terminal-Bench 4.0 55.8%)作为跨模型比较基线。