2026 年 9 月 30 日,Google DeepMind 官宣了 Gemini 4 家族的第一款模型:Argon。署名的是 DeepMind 高级副总裁、首席 AI 架构师 Koray Kavukcuoglu。发布文里最抓眼球的不是又一个总榜第一,而是两个数字:一条回复最多能输出 100 万 token,是上一代 64K 上限的约 16 倍;以及一个叫 DeepSWE v1.1 的长程软件工程基准上,谷歌自报拿下 77.9% 的 SOTA 成绩。
不过这次发布还有一个绕不开的前提:你暂时用不上它。Argon 走的是受控分阶段发布,只有 Fairwind Program 的 650 多家合作伙伴能先碰,普通用户和付费 API 都还没有入口,官方也没给开放日期。这篇文章把官方口径里的数字、案例和短板一次讲清楚,方便你在它真正开放之前建立判断。
输出上限 1M token:16 倍意味着什么
先说最直观的变化。上一代 Gemini 的单次输出上限是 64K token,写一个稍大的代码文件、或者一份长报告,就顶到头了,得拆成好几轮接着生成。Argon 把这个上限直接拉到 1M token,官方称行业领先。
16 倍是什么概念?64K token 大约对应几万行代码,而 1M token 意味着模型理论上可以在一次回复里完整输出一个中型项目的代码库,或者在一份长文档里保持从头到尾的上下文记忆。对长程任务来说,输出上限决定的是「一次能交付多少」,而不是「聊得有多长」——这正好对应 Argon 的定位。
站内之前有一篇横评专门对比过各家旗舰模型「一口气能输出多少 token」(见 一条回复百万 token 的横评),当时的结论是输出容量和价格的组合差异很大。Argon 的 1M 输出上限等于把这个维度又推高了半个量级,等它开放后值得回头更新那张对比表。
DeepSWE v1.1:77.9% 的长程软件工程成绩
Argon 的主打基准是 DeepSWE v1.1,官方定义为长程软件工程测试。谷歌自报的成绩是 77.9%,并列出的对比对象包括 GPT-6 Astra 的 74.1%、Claude Fable 5.1 的 67.4%、Claude Opus 5.5 的 74.2%。注意,这些数字全部来自 DeepMind 官网公布的基准表,属于谷歌自报口径,还没有独立的第三方复现。
DeepSWE 这类基准考察的不是「写一个函数」,而是让模型在真实代码库里完成一连串相互依赖的改动:定位问题、跨文件重构、跑测试、修复回归,中间任何一步掉链子都会导致最终失败。这也是为什么 Argon 把「真实世界软件工程」写进定位第一行——它的设计目标是长程复杂工作流,除了软件工程,还包括企业知识工作(法律、金融)和网络安全防御。
需要提醒的是,DeepSWE v1.1 的分数只能和同一版本的 DeepSWE 对比。不同基准之间是不同的卷子,跨基准直接比大小没有意义,这也是我们一直坚持的口径。
官方基准表:强项很亮,短板也要看全
DeepMind 官网给了一张相当长的基准表,我们把它拆成强项和短板两部分,全部标注为谷歌自报。
强项一侧:
- DeepSWE v1.1(长程软件工程)77.9%,高于对比行;
- AutomationBench(Zapier 工作流自动化)51.3%,对比 GPT-6 Astra 41.4、Claude Fable 5.1 31.4、Claude Opus 5.5 42.5;
- Vals Index 68.9,Vals Finance Agent v2 65.4,Harvey 法律 Agent 19.6(Astra 同项只有 5.4);
- GraphWalks 256k-1M 长上下文 BFS(F1)84.2%,Astra 为 71.8;
- Agent's Last Exam 39.5%;CWE-bench v1 68% 并列第一;LVBench 91.7%。
从这张表的分布能看出谷歌想讲的故事:Argon 不是「全科第一」,而是在长任务、多步骤 Agent 场景上押了重注——自动化工作流、金融与法律知识工作、长上下文图遍历,全是一条主线。
短板一侧,官方表格里同样写着,这部分必须如实说:
- FrontierSWE v2 55.0,低于 Astra 的 65.5;
- Terminal-bench 4.0 57.4,低于 Claude Opus 5.5 的 66.4;
- Terminal-Bench Science 0.1 57.6,低于 Astra 的 68.1。
也就是说,在最难的下一版软件工程卷子和终端操作类任务上,Argon 反而落后。FrontierSWE v2 和 DeepSWE v1.1 是两套不同的卷子,不能拿 77.9 和 55.0 放在一起算平均。合理解读是:Argon 的长程能力是真的,但「全面超越上一梯队」这个结论从这张表里得不出来,尤其在终端执行这条线上它还在追赶。此前站内写过一篇旗舰编码与推理横评(见 旗舰模型编码推理横评),等 Argon 开放后这类横评需要加入它再跑一轮。
为什么长程卷子能赢、终端卷子会输?一个可能的解释是两者的考察重心不同:DeepSWE v1.1 这类长程基准考的是「把一个多步骤大任务推到底」,奖励的是上下文容量、任务分解和跨文件的一致性,这正好压在 1M 输出上限和长程工作流的强项上;而 Terminal-bench 这类终端基准考的是「在真实 shell 里快而准地执行单步操作」,拼的是对命令行环境、报错信号和系统状态的即时反应,容错空间小得多。当然这只是基于题型差异的推测,谷歌官方没有解释落后原因,真实差距要等独立评测拆解。对使用者的实际含义倒很清楚:把大改造、大迁移这类长任务交给它值得期待,把高频小步的终端操作流程交给它则要先打个问号。
80 万行 Zircon 迁移:一次改写整个内核
分数之外,官方博客给了几个内部案例,其中最有画面感的是 Fuchsia Zircon 内核的 C/C++ 到 Rust 迁移。Zircon 是谷歌自研操作系统 Fuchsia 的内核,代码量以十万行计。Argon 完成的这次迁移规模达到 80 万行以上——相当于一个几十人的团队干上几年的工作量,模型在一条回复的工作流里推进完成,之后经自动化测试、仿真和人工评审才部署。
80 万行是什么量级?按一个源码文件平均几百行算,这是数千个文件的系统性改写:内存安全的语义转换、依赖关系的梳理、边界条件的处理,一环扣一环。上一代模型受限于 64K 输出和较短的自主执行链,这类任务只能切成碎片交给工程师拼装。Argon 能把它作为一个整体工作流交付,正是 1M 输出上限和长程能力叠加的结果。
第二个案例是 libgav1,谷歌开源的 AV1 视频解码器。Argon 把其中 3.2 万行 SIMD 代码替换成 Rust 实现,结果比原来的 Rust 移植版快 2.7 倍,而且输出逐帧一致——解码结果分毫不差。这个案例的价值在于它不只是「改写」,而是改写后还更快,同时用逐帧一致性证明了正确性,对视频这种容错率极低的场景是硬指标。
还有几个案例佐证了同样的模式:数据中心内存优化释放了 300+ TiB(官方预估上限在 500TiB 到 1PiB 之间);一个量子算法子程序在数分钟内击败了已发表基线 40%;它还发现了一个全球多家医院在用的医疗软件的敏感信息暴露漏洞,官方称此前的前沿模型都没有发现这个问题。
定价:引入期 $2/$10,之后 $4/$20
价格方面,多源一致的口径是:Argon 引入期定价为每百万 token 输入 2 美元、输出 10 美元,缓存输入享受输入价 95% 的折扣;引入期结束后调整为每百万 token 输入 4 美元、输出 20 美元。
这个定价放在 1M 输出上限的背景下看是合理的——输出单价不低,但给了长达百万级的单次输出空间。真正的问题是等价的性价比:如果长程任务的成功率确实如 DeepSWE 所示领先,一次跑通的大任务可能比多轮返工更省钱;但如果任务落在它的短板区(终端操作类),20 美元一百万 token 的输出价就不便宜了。这些都要等实际开放后用真实任务验证。
Fairwind 受控发布:想用还得再等等
这次发布最反常识的部分是:宣布了,但你用不了。Argon 通过 Fairwind Program 先行发布,覆盖 650 多家合作伙伴,优先级给到政府、关键基础设施和核心平台类客户;其中受信任的防御者还能拿到去除了网络安全防护栏的版本,用于防御性安全研究。
普通用户、付费 API 都暂不可用,官方没有给出任何开放日期。谷歌还提到 Argon 参与了美国政府的自愿预发布通道——把前沿模型先交给政府侧评估,这在谷歌的发布流程里也是相对少见的做法。
受控发布的逻辑不难理解:一个号称对间接提示注入最有韧性、但自主执行能力极强的模型,直接全量放开的风险确实比聊天模型大。官方在安全部分称,Argon 对间接提示注入的抵抗力是系列里最强的,链式思维与动作都有监控机制,可以中止执行,且沙箱隔离做了加固。但对用户来说,现实的结论只有一句:目前没有任何正规入口,看到「Argon API 代充」之类的话术可以直接判定为骗局。
42 批我们写过 Claude Sonnet 5.5 的发布(见 Sonnet 5.5 发布热点),当时 Anthropic 选择的也是分阶段推进。不到一个月,谷歌用 Argon 把长程 Agent 这条赛道的牌面又抬高了一轮。两家的路线差异正在变得清晰:一家先全量再收紧,一家先关门再放人。
另外值得一提的是开源侧的参照:DeepSeek-V4-Flash-Vision-Exp 在同一版 DeepSWE 上自报 59.3%,MIT 协议开源可本地跑(见 DeepSeek V4.1 开源热点)。77.9 对 59.3 的差距不小,但一个是拿不到的自报分数,一个是今天就能下载跑分的开源权重——「可验证性」本身也是比较模型时 worth 计入的一环。
怎么读这次发布
把所有信息摆在一起,我们建议用三个问题来消化这次发布。
第一,分数能信几分?DeepSWE v1.1 的 77.9% 是谷歌自报,基准表里对比友商的行也是谷歌替友商跑的数。历史经验是,自报分数通常不会离谱,但选题自由度在发布方手里——哪些基准进表格、哪些不进,本身就是一种叙事。好在这次谷歌把短板行也放进了官方表格,这种透明度在各家发布会里并不多见,至少给了我们同时看强项和弱项的机会。
第二,案例和分数是不是一回事?80 万行 Zircon 迁移、libgav1 提速 2.7 倍,这些是谷歌内部真实跑过的任务,有部署结果背书,比基准分数更硬;但它们是谷歌挑选的、跑在谷歌自己代码库上的案例,外部用户在自己的工程环境里能复现几分,是另一回事。看案例取其上限,看基准取其分布,两者不要混着用。
第三,什么时候轮到普通用户?官方没有给日期,所以任何排期都是猜测。可以观察的信号是:Fairwind 之外的 API 文档页何时挂出 Argon,以及谷歌官网何时把 Argon 加进 Gemini 应用的模型列表。在那之前,对普通开发者的可执行建议只有一条:别等它,先把手头任务在自己能访问的模型上跑通,Argon 开放后把同一套任务脚本原样迁移过去做对比,那才是属于你自己的基准。
主攻搜索词
围绕这篇的发布,用户接下来会搜的自然是这些问题,我们按这些方向组织了本文的信息:
- gemini 4 argon 什么时候开放 / 普通用户怎么用上 Argon
- 谷歌 Argon api 价格多少钱
- Argon 的 DeepSWE 77.9 是什么基准、可信吗
- gemini 4 argon 和 GPT-6 Astra / Claude Opus 5.5 哪个强
本文由 AI 辅助生成,经人工审核编辑。