前沿热点
前沿热点

Gemini 3.8 Flash 发布:更聪明但单任务更贵

2026-09-02(美东)/ 9-3 国内,Google DeepMind 同发 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,6 周内第 3 个 Flash 版本。3.8 Flash 定位"最聪明的 Flash 工作马":1M 上下文、64K 输出、三档思考、知识截止 2026-03;定价与 3.7 Flash 持平(输入 $0.75/输出 $3.75,优惠至 2026-12-31,之后 $1.50/$7.50)。基准:DeepSWE v1.1 73.7%(逼近 Opus 5 的 74.0%)、Terminal-Bench 2.1 89.4%(世界 #1)、HLE-Verified 54.9%;短板在 Terminal-Bench 4.0 仅 19.1%、OSWorld 2.0 59.0%。Flash Cyber 仅经 Fairwind Program 限可信防御方,无公开价【未确认】。关键反差:单价未涨,但 Artificial Analysis 实测单任务成本因"更努力"上涨约 40%($0.40→$0.58)。所有分数含官方口径与第三方实测,引用须标注。

发布于 2026年9月1日9 分钟阅读
<!-- gemini-3-8-flash-hotspot | hotspot | Gemini 3.8 Flash 发布:更聪明但单任务更贵 -->

2026 年 9 月 2 日(美太平洋时间),Google DeepMind 同时发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,国内在 9 月 3 日跟进报道。这是 Google 在约六周内发布的第三个 Flash 档模型——前两个分别是 7 月 21 日的 3.6 Flash 与 8 月 13 日的 3.7 Flash。官方的定位是"最聪明的 Flash",专攻长程软件工程、自主智能体与企业管理流。但这次发布真正有意思的不是"又发了一个",而是 Google 正在以业内罕见的节奏迭代这条廉价高吞吐产品线,并且把一个被很多人忽略的成本真相摆上了台面:单价没涨、模型更聪明,可因为模型会"更努力地干活",单任务的实际花费反而更高了。本文把所有数字按来源分层标注,方便你在汇报里如实引用。


一、发布背景:六周内第三个 Flash 档

先说节奏本身。从 2026 年 7 月 21 日的 Gemini 3.6 Flash,到 8 月 13 日的 3.7 Flash,再到 9 月 2 日的 3.8 Flash,Google 在六个星期内连发三款 Flash 档模型。这种迭代速度在主流实验室里并不常见:通常旗舰模型的大版本间隔以季度计,而 Flash 档作为"廉价高吞吐"的产品线,过去更多是跟着旗舰一起更新,而不是独立高频滚动。把节奏摆出来是为了说明一件事:Google 现在把 Flash 档当成一条独立、快速打磨的产品线来运营,目标是让"便宜那一半"也能持续吃到能力进步。

对工程团队的现实含义是,评估结论的有效期变短了——你上个月给 3.7 Flash 下的判断,可能这个月就被 3.8 Flash 改写。本文所有跨代比较都以 3.7 Flash 为最近基线,凡是涉及版本对照,请记住这条六个星期三连发的时间线。另外,这次两款模型是同一场发布会一起出的,发布结构本身也值得留意:主模型面向大众与开发者,安全特化兄弟线走可信访问,两条线的开放范围从一开始就不一样。

另一个背景点是同场发布的 Gemini 3.8 Flash Cyber。它不是 3.8 Flash 的简单变体,而是一条安全特化的兄弟线,只通过新的"Fairwind Program"分发给经过审核的防御方,没有公开价格。关于 Cyber 的更多讨论放在第五节,这里先把它和主模型放在同一张发布表上,提醒读者:这次"发布了什么"和"你能拿到什么"是两件事。

二、规格:百万级上下文与三级思考

3.8 Flash 的核心规格如下,先把数字摆清楚再谈含义。

规格Gemini 3.8 Flash对照说明
输入上下文1,048,576 tokens即 1M,维持 Flash 档百万级上下文
最大输出65,536 tokens(64K)文本输出上限,注意是 64K 而非旗舰的 128K
输入模态文本、图像、视频、音频、PDF多模态输入
输出模态仅文本输出不带多模态生成
思考级别low / medium / high 三档用户可按任务选择推理强度
知识截止2026 年 3 月(部分领域 2025 年 1 月)部分领域截止更早,需注意

几个规格点要单独讲。第一,输出上限是 64K 而不是旗舰的 128K,对绝大多数 agent 链路够用,但超长生成任务要留余量,别在提示里假设它能一次性吐出十万字。第二,思考分三档而不是"自适应常开",这给了工程侧一个明确的杠杆:简单任务用 low 省 token,硬任务用 high 换质量——而这个杠杆恰恰是后面"单任务成本"话题的开关,因为它直接决定模型有多"努力"。第三,知识截止在部分领域停在 2025 年 1 月,引用近期事实尤其是这些领域的近期事实时,要主动带检索或工具,不要默认模型知道。

上架渠道很广:Gemini API、Google AI Studio、Android Studio、Antigravity、Gemini Enterprise、Gemini app,以及 Search 里的 AI Mode。覆盖面从开发者到终端用户到企业到搜索入口,说明 Google 这次想让 3.8 Flash 同时打穿工程侧与消费侧。对团队来说,这意味着你大概率不需要换平台就能用上,但也要分别测各入口的能力一致性,因为不同入口可能套了不同护栏与默认参数。

三、基准:coding 是强项,OS 与长程是短板

口径先说清:下表里的 Google 自家基准(DeepSWE、Terminal-Bench、SWE-Bench Pro、HLE-Verified、Vals、Harvey)均为 Google 公布口径,不是独立第三方实测;Terminal-Bench 4.0 等少数项为第三方或更晚报道,已单独标注。我们尚未看到独立机构对这批数字做同条件复核,读的时候看量级与趋势,别把单点数字当确定值抄进选型文档。

基准Gemini 3.8 Flash已公布对照口径说明
DeepSWE v1.173.7%Claude Opus 5 74.0%、GPT-5.6 Sol 72.7%、3.7 Flash 65.3%Google 公布;逼近 Opus 5
Terminal-Bench 2.189.4%Opus 5 89.1%Google 公布;标称世界 #1
SWE-Bench Pro61.6%未给对照Google 公布
HLE-Verified54.9%未给对照Google 公布
Terminal-Bench 4.019.1%Opus 5 51.8%、Fable 5.1 55.8%、GPT-5.6 Sol 37.3%明显短板
OSWorld 2.059.0%Opus 5 75.4%明显短板
Vals Finance Agent v261.4%Google 公布;标称 #1
Harvey Legal Agent10.0%Google 公布;标称 #1

读这张表要分两层。强项层:DeepSWE 73.7% 仅比 Opus 5 低 0.3 个百分点,Terminal-Bench 2.1 的 89.4% 被 Google 标为世界第一,但也只比 Opus 5 的 89.1% 高 0.3 个百分点,属于同一档。这两个数字支撑"frontier 级 coding 已被压进廉价线"的判断。值得提醒的是 Terminal-Bench 2.1 的 89.4% 与部分媒体给出的 90.8% 存在差异,本文以 Google 公布的 89.4% 为准,并如实标注这个口径差,因为它说明第三方复测可能给出不同数值。

短板层更关键:Terminal-Bench 4.0 只有 19.1%,不到 Opus 5(51.8%)的一半,也明显低于 Fable 5.1(55.8%)和 GPT-5.6 Sol(37.3%);OSWorld 2.0 的 59.0% 也落后 Opus 5 的 75.4% 约十六个百分点。这两个差距说明 3.8 Flash 在"超长程、跨多步工具链、需要稳定操作图形界面"的任务上仍明显弱于旗舰。换句话说,它的 coding 强项集中在"写代码、跑终端"这类可验证闭环,而在"长时间自主操作真实系统"上还有明显代差,别把 DeepSWE 的高分外推到整段自主工作流。

财务与法律两个垂直 agent 基准拿下了标称 #1(Vals 61.4%、Harvey 10.0%),但这两个基准缺少同条件对照,且 Harvey 10.0% 本身绝对值偏低,引用时请带上"标称、缺对照"的限定,不要当成可复现承诺。横向对比各厂旗舰与 Flash 档的编程推理能力,见 旗舰模型编程推理横评;想用更轻量的视觉实验思路搭贴近业务的评测,见 DeepSeek V4 Flash 视觉实验资源

四、成本:单价没涨,单任务更贵

定价这块,Google 给了"限时同价"的安排,先把价目摆出来。

计费项介绍期(至 2026-12-31)标准价(2027-01-01 起)
输入每百万 token 0.75 美元每百万 token 1.50 美元
输出每百万 token 3.75 美元每百万 token 7.50 美元

介绍期价格和 3.7 Flash 完全相同,等于没有涨价;从 2027 年元旦起恢复标准价,正好翻倍。所以"同价更聪明"在单价层面是成立的,前提是你在介绍期窗口内把工作负载迁过来。这条窗口本身是落地清单里的一条动作,别等到了 12 月底才想起。

但真正要讲的是单任务成本。关键机制在这里:Google 让模型"更努力地干活"——更多推理步数、更多迭代式工具调用、更长的 agentic 循环。第三方评测机构 Artificial Analysis 实测下来,单任务成本因此上升约 40%,从 0.40 美元涨到 0.58 美元。也就是说,单价表上的"更便宜"被更长的实际工作路径吃掉了一部分——模型变聪明的方式,是花更多 token 把事做完。这条数字来自 Artificial Analysis 的实测,不是 Google 官方口径,引用时请按第三方来源对待。

这个 nuance 对工程账影响很大。如果你的工作负载是短平快的调用,单价没变、模型更聪明,你是净赚的;但如果是长程 agent、需要反复试错和工具循环的任务,账单会按 token 膨胀而不是按"一次调用"膨胀。3.8 Flash 相比 Opus 5 的单位价大约是七分之一,这是它的核心吸引力,但七分之一的前提是你控制住每任务的实际 token 消耗,而不是放任模型全程 high 思考加长循环。

怎么压住这个膨胀?两条路。一是在代码里把思考级别按任务调低,低风险批量任务用 low 省 token;二是把可复用的上下文放进缓存,减少重复读取。后者正是 缓存成本横评 里讲的逻辑——agentic 链路的 token 大头正是反复读取同一份系统提示、工具定义与长历史。换句话说,3.8 Flash 的性价比不是自动兑现的,它取决于你有没有把"更努力"这道开关管起来。

五、Gemini 3.8 Flash Cyber:安全模型的新分发模式

同场发布的 Gemini 3.8 Flash Cyber 是赛道另一端的东西。它是面向网络安全特化的兄弟模型,但分发方式与主模型完全不同:只通过新的"Fairwind Program"分发给经过审核的防御方,走可信访问,没有公开价格。本文无法确认其定价,标注为【未确认】。

Cyber 的存在本身释放两个信号。第一,Google 明确说安全方向的训练也抬升了基础模型的编程能力——也就是说,3.8 Flash 在 coding 上的进步,有一部分来自安全训练的外溢。这解释了为什么一个"更会写代码"的通用 Flash 档,能在一个没有公开发布的安全线上获得训练收益,两条线在能力上是互相喂养的。第二,也是更值得记下的:安全特化模型不再走"公开发布 + 统一价格"的老路,而是走"审核防御方 + 可信访问"的门槛式分发。

这和 Anthropic 把 Mythos 5.1 限在美国机构、Claude 走差异化开放是同一类思路,说明头部实验室正在把"能力强度"和"谁能拿到"正式解耦。对工程团队的直接含义是:Cyber 大概率不是你能在控制台一键开通的选项,它的价值更像一份"能力上界公告"加一次分发模式示范。真正能落到你工作流里的,是主模型 3.8 Flash 在编程与安全相关任务上的外溢收益,而不是 Cyber 本身。评估时请把两者分开:前者可立即评估,后者先当它不存在,等 Fairwind Program 对你所在机构开放再说。

六、落地清单

动作依据优先级
把 3.8 Flash 纳入编码与 agent 评估DeepSWE 73.7%、Terminal-Bench 2.1 89.4%,逼近旗舰
按任务调思考级别管控 token单任务成本因更努力上升约 40%(第三方实测)
长程 OS / 多步 GUI 任务先别全切Terminal-Bench 4.0 19.1%、OSWorld 2.0 59.0% 明显弱
赶介绍期单价窗口同价至 2026-12-31,2027 起翻倍
用缓存架构压单任务成本见缓存成本横评
把 Cyber 当能力公告而非可用选项仅 Fairwind 可信访问,价格未确认

其中第二、三、五条要连起来看:先按第三条识别哪些任务 3.8 Flash 还做不好(别硬切,别被 DeepSWE 高分误导),再用第二条把能做好的任务按思考级别压 token,最后用第五条的缓存架构把单任务账单压回"七分之一 Opus"的量级。这三步是这套发布对工程侧最实在的落地顺序,也是把"更聪明但更贵"重新拧回"更聪明且更便宜"的唯一办法。

最后一件值得单独讲:这次发布最该被记住的,不是那个逼近 Opus 的 coding 分数,而是"廉价线以罕见节奏滚动 + 单任务成本因更努力而膨胀 + 安全模型走门槛式分发"这三件事叠在一起。它提醒工程团队,性价比不是出厂设置,而是你管不管得住"模型有多努力"这个函数的结果;也提醒采购侧,便宜线的能力上限正在快速逼近旗舰,但开放范围正被按风险重新切分。


参考来源

  • Google DeepMind 官方博客与发布说明(Gemini 3.8 Flash / 3.8 Flash Cyber,2026-09-02)——"最聪明的 Flash"定位、与 3.6 Flash(7-21)、3.7 Flash(8-13)的六周三连发节奏、百万级输入上下文、64K 输出、多模态输入与文本输出、三级思考、2026 年 3 月知识截止(部分领域 2025 年 1 月)、上架渠道(Gemini API / AI Studio / Android Studio / Antigravity / Gemini Enterprise / Gemini app / Search AI Mode)、介绍期 0.75/3.75 美元与 2027 年起 1.50/7.50 美元定价、全部 Google 自家基准(DeepSWE 73.7%、Terminal-Bench 2.1 89.4%、SWE-Bench Pro 61.6%、HLE-Verified 54.9%、Vals 61.4%、Harvey 10.0%)、"安全训练抬升基础模型编程"的表述、3.8 Flash Cyber 与 Fairwind Program 可信访问分发模式。上述除 Cyber 价格外均为 Google 公布口径;具体公告 URL 未确认。
  • Artificial Analysis(第三方评测)——单任务成本因更高推理努力上升约 40%(0.40 美元升至 0.58 美元)。该数字为第三方实测,非 Google 官方口径,且受具体任务与努力设置影响。
  • 腾讯新闻、IT之家(2026-09-03)——国内报道时间与发布信息的中文交叉印证;部分媒体对 Terminal-Bench 2.1 给出 90.8% 一说,与 Google 公布的 89.4% 存在口径差,本文以 Google 口径为准并已注明。
  • 9to5Google、VentureBeat、MarkTechPost——发布要点、Flash 档迭代节奏与 Cyber 门槛式分发模式的英文报道交叉印证。
  • 对照基准来源(Google 公布口径中引用的对照项)——Claude Opus 5(DeepSWE 74.0%、Terminal-Bench 2.1 89.1%、Terminal-Bench 4.0 51.8%、OSWorld 2.0 75.4%)、GPT-5.6 Sol(DeepSWE 72.7%、Terminal-Bench 4.0 37.3%)、Claude Fable 5.1(Terminal-Bench 4.0 55.8%)作为跨模型比较基线。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-09-01

相关文章

前沿热点

王炸 DeepSeek-V4-Pro-0813 来了:1M 上下文 + Anthropic API 兼容,国产模型叫板 Claude

2026-08-13 DeepSeek 把 V4-Pro 更新到 0813 快照、V4-Flash 到 0731,调用名不变。1M 上下文+384K 输出、思考模式默认开、原生 Anthropic API 兼容(base_url api.deepseek.com/anthropic)= 改两个环境变量就能把 Claude Code 切到 DeepSeek。Pro ¥6/M 输出、Flash ¥2/M,官方挂涨价预警。事实据官方文档,以官网为准。

2026年8月13日7 分钟阅读
前沿热点

Meta Muse Spark 1.1:扎克伯格重返 X,1M 上下文 agentic 模型与 Meta 首个付费 API

2026 年 7 月 9 日扎克伯格时隔三年重返 X 发布 Muse Spark 1.1,1M 上下文 agentic 模型,$1.25/$4.25 定价,配 Meta 首个付费 API。agentic 工具使用跑分领先(MCP Atlas 88.1/JobBench 54.7),但独立智能指数仅 51、coding 与长程 GDPval-AA v2 落后;发布半月后 Opus 5/GPT-5.6 上场使其位置被动,真正卖点是极低单价下的 token 效率(每任务约 $0.26)。

2026年7月31日7 分钟阅读
前沿热点

ChatGPT Images 2.5:延迟减半与一致性升级

OpenAI 2026-09-09 推出新一代图像模型 ChatGPT Images 2.5:官方口径称延迟较 2.0 最高降低 50%,更好保留参考照片主体并维持多轮编辑一致性;ChatGPT 同步上线手绘草图、模板、图片评论与提示词分享;API 推出 Flare 与 Sunburst 两款模型。本文逐条拆升级点,判断真升级不在画质而在「延迟与一致性」,解读双模型是能力分层与定价分流的前奏(分析非官方口径),并算闭源 API 的长期锁价账。

2026年9月9日9 分钟阅读