发布时间与产品矩阵
Google 与 DeepMind 于 2026 年 9 月 2 日(美西时间)正式发布 Gemini 3.8 系列,对应北京时间为 9 月 3 日。官方信息来自 blog.google 与 deepmind.google 两个一手渠道,本次所有关键数据均以这两个来源为基准。本次发布最大的看点,并不是一个单一旗舰模型的常规迭代,而是一次性推出两款共享同一底层智能、但通过长周期智能体循环(long-running agentic loops)进行差异化调优的变体:面向通用任务的 Gemini 3.8 Flash,以及面向网络安全场景的 Gemini 3.8 Flash Cyber。
两款模型的关系值得先讲清楚。它们建立在相同的基座智能之上,也就是说底层的推理与语言能力是同源的。差异来自后训练阶段的目标设定:Flash 被定位为“最聪明的劳模”(most intelligent workhorse),强调长周期软件工程、智能体任务以及跨领域的多步推理;Flash Cyber 则被定位为“能力最强的安全模型”(most capable cybersecurity model),专门强化自主漏洞发现与自动化补丁生成。这种“同一底座、两条调优路线”的设计,让 Google 能够在不过度分裂产品线的前提下,为安全场景单独开一条赛道。
通用版 Flash:长周期智能体工作负载
据官方博客,Gemini 3.8 Flash 的目标是成为开发者的主力模型。它在长周期软件工程任务上表现突出,能够独立完成跨文件的修改、构建与测试闭环;在智能体任务中,它可以自主规划多步流程并调用工具;在跨领域的多步推理上,它也能在科学、代码与日常逻辑之间切换。对于需要把“想法”持续转化为“可运行成果”的场景,Flash 是更合适的一档。
价格方面,Google 给出了一个对开发者友好的延续方案。在推广期内,Flash 的输入与输出价格分别为每百万 token 0.75 美元与 3.75 美元,与上一代入门的 3.7 Flash 持平;从 2027 年 1 月 1 日起,标准价格将调整为每百万 token 1.50 美元与 7.50 美元。这意味着早期采用者可以在成本不升的前提下,直接获得更强的长周期能力,对于预算敏感的个人开发者与中小团队尤其友好。
Flash Cyber:能“发现”也能“修补”的安全模型
Flash Cyber 是本次发布中最具标志性的一项能力。它不只是被动地回答安全问题,而是能够在一个闭环里自主发现漏洞并生成修复补丁。官方给出的几个关键数字,能帮我们理解它的实际水位:在 CWE-Bench 的 pass@1 指标上,Flash Cyber 达到 47.2%,与领先前沿模型约 47.8% 的水平相当;在内部跨语言漏洞发现任务中,面对真实代码库、覆盖 20 种编程语言,其成功率超过 70%;在 Chrome 安全团队的真实世界补丁任务上,它的正确补丁数量是一款更大的商业模型的 2.6 倍;在与 Wiz 合作的渗透测试召回率上,它带来了 7.5% 到 9.7% 的提升,同时把成本降低了 2.3 倍到 5.2 倍。
更值得注意的是它发现关键基础漏洞的速度。官方称,找到一个关键的基础层漏洞通常要以月计,而 Flash Cyber 在真实场景中将这一时间压缩到 2 小时以内。这种“从月到小时”的跃迁,对防守方而言意义巨大:它意味着在攻击者利用窗口打开之前,漏洞就可能已经被发现并修补。把发现与修补压缩进同一个闭环,是它与传统“只报不修”工具最本质的区别。
能力数字一览
下面的表格汇总了官方公布的一手数字,便于横向比较。所有数值均来自官方博客的一手口径,唯独上下文窗口一项来自文档站。
| 指标 | 数值 | 口径 |
|---|---|---|
| HLE-Verified | 54.9% | 官方博客(一手) |
| CWE-Bench pass@1(Cyber) | 47.2% | 官方博客;前沿模型约 47.8% |
| 跨语言漏洞发现成功率 | >70% | 内部真实代码库,20 种语言 |
| Chrome 安全正确补丁 | 2.6 倍 | 对比更大的商业模型 |
| Wiz 渗透测试召回率提升 | +7.5%~9.7% | 同时成本降 2.3~5.2 倍 |
| 关键基础漏洞发现时间 | <2 小时 | 通常需数月 |
| 上下文窗口 | 1M | 据 ai.google.dev 文档(二手) |
需要特别标注的是,上下文窗口 1M 这一项来自 ai.google.dev 的文档,属于二手口径,本文据此标注而非官方博客直引。另有一项媒体口径存在冲突:Terminal-bench 2.1 的不同媒体给出了 90.8% 与 89.4% 两种数字,为保证严谨,本文不采用该具体数值,仅作冲突说明,并标注为“媒体口径、存在差异”。
Fairwind 计划:只交给可信的防守者
Flash Cyber 并不会公开发售。官方明确,它仅通过 Fairwind Program 提供给受信任的防守者,包括各国政府、关键基础设施运营方(医疗、电信、能源、金融)以及核心科技平台。截至目前,Fairwind 计划已经拥有 650 多家全球合作伙伴,典型代表包括 CrowdStrike、Palo Alto Networks、Snowflake、Wiz 与 Armadin。
这种“能力很强、但只给防守方”的安排,体现了一种责任披露的姿态。Google 并非把最强的攻防能力摆上货架,而是把它嵌入到一个受治理的分发渠道里,确保使用场景与使用者身份受到约束。对于安全社区而言,这既提供了前所未有的工具,也划出了清晰的使用边界。它同时传递了一个信号:在网络安全这种高风险领域,模型能力的释放需要与使用者的信任等级挂钩。
安全护栏与前沿安全框架
在能力开放的同时,Google 也对 Flash Cyber 施加了护栏。模型内置了 CBRN(化学、生物、放射、核)与网络攻击滥用的防护,遵循其 Frontier Safety Framework(前沿安全框架)。在 Gray Swan 的间接提示注入(IPI)基准上,模型的鲁棒性相较前代有显著提升;不过官方并未公布该基准的具体提升数字,因此本文不补充任何未经证实的量化结论,只转述“显著提升”这一官方定性描述。
护栏的意义在于防止能力外溢。一个能自主发现并修补漏洞的模型,如果被用于进攻,风险同样可观。通过把进攻性能力置于防护之后、把防御性补丁作为优先输出,Google 试图在“可用”与“可控”之间取得平衡。这也解释了为什么 Flash Cyber 强调“优先防御性补丁而非进攻性能力”——它的默认行为倾向于帮助防守方封堵漏洞,而不是生成进攻性利用。
对开发者意味着什么
对于普通开发者,本次发布最直接的收益来自通用版 Flash。更长的上下文(据文档站为 1M)、更强的长周期软件工程能力,以及延续自 3.7 Flash 的友好价格,使它成为日常编码与智能体编排的务实选择。如果你已经在用 3.7 Flash 跑流水线,迁移到 3.8 Flash 在成本上几乎是平滑的,而能力上限明显更高。
对于安全团队,Flash Cyber 则意味着一种工作流的根本变化:漏洞扫描、影响评估、补丁建议可以部分交给模型完成,人类专家专注于验证与决策。但前提是你的组织处于 Fairwind 计划覆盖的防守者范围内,否则无法直接使用该变体。这也提醒我们,最强的模型能力未必人人可得,分发策略本身就是能力的一部分。
与前代 3.7 Flash 的承接关系
从命名与定价都能看出,3.8 Flash 是 3.7 Flash 的直接继承者,而非替代旗舰的高价档。推广期价格完全对齐,说明 Google 希望用户无痛升级。真正的增量来自后训练带来的长周期与跨域能力,而非单纯堆参数。对行业而言,这延续了“Flash 一档走量、Ultra 一档立标杆”的产品节奏,让大多数应用落在可负担的区间。
局限与边界
需要清醒看待的是,Flash Cyber 的能力虽强,却并非万能。CWE-Bench 47.2% 的 pass@1 意味着仍有过半的漏洞修复任务无法一次通过;跨语言发现成功率“超过 70%”也只是内部口径,真实战场的不确定性更高。此外,所有数据都来自 Google 自身基准与合作伙伴场景,独立第三方的复现仍待观察。本文不对其未公开的具体场景做推断,也不引用存在冲突的媒体数字。
战略解读:把安全单独开一条赛道
从产品策略看,Google 的“双模型”打法值得玩味。通用 Flash 守住开发者与生产场景的基本盘,Flash Cyber 则在安全这一高价值、高敏感领域单独建队。二者共享底座,降低了维护与对齐成本;又通过差异化的后训练,满足了两类截然不同的需求。
对行业而言,Flash Cyber 是一个标志性节点:自主“发现并修复”的闭环首次以如此明确的形态出现,且被限定在防守者手中。这种“能力开放但渠道受控”的做法,可能成为大模型进入高风险领域的参考范式。围绕开源与开放的讨论仍会继续,但至少在这一发布中,Google 给出的是一条偏谨慎、偏责任的路线。
行业横向比较
把 Flash Cyber 放到更大的坐标系里看,它的独特性不在于“模型能做安全”,而在于“模型把发现与修补闭环化、并且只交给防守方”。此前行业里的安全大模型多停留在辅助分析与告警层面,真正能端到端产出可合并补丁的并不多。Google 借助自身体量的工程与基准资源,把这条链路跑通,并以治理渠道限定使用人群,这在方向上与“能力即服务、谁都能买”的路线形成对照。值得注意的是,这种对照并非技术优劣之争,而是分发哲学的差异:一方主张尽量开放,另一方主张按信任分级。Flash Cyber 选择的是后者,它用可验证的防守者身份,换来了对最强能力的访问资格。
采用建议
对于处在 Fairwind 覆盖范围内的防守组织,建议先以小范围真实仓库做试点:用 Flash Cyber 生成补丁草案,再由人类安全工程师复核与合并,把模型定位为“高级助理”而非“自动提交者”。对于普通开发者,通用版 Flash 已是性价比突出的日常选择,可优先用于长周期编码与智能体编排。无论哪一类用户,都应把官方数字视为基准环境下的参考,落地时以自身场景的实测为准。
如果你想了解更广义的模型生态动态,可延伸阅读相关报道:开源协作方向的 DeepSeek Harness 开源实践,编码评审方向的 CodeArena 编码评测,以及协议与流程方向的 Kimi 双协议 SOP。