一、换一根轴:从单价到单次输出上限
先交代分工:本站 9 月底已有 编程模型价格横评,把 Claude Sonnet 5.5 与 GPT-6.1 Sol 的输入、输出与缓存单价摆在一起算过性价比账,本篇不重复那份报价单的活。这一篇换一根轴:单次输出上限。2026 年 9 月 30 日,Google 发布 Gemini 4 Argon,把输出上限从此前通行的 6.4 万 token 一步拉到 100 万 token,官方口径称行业第一。对长任务来说,这等于换了战场维度:过去要拆成十几轮接力喂的活,现在理论上可以一口气吐完,上下文反复搬运的开销也随之改写。
按「受控新旗舰、现役效率标杆、缓存性价比、开源对照」四个位置,本篇选了四款:Gemini 4 Argon(Google)、Claude Sonnet 5.5(Anthropic)、GPT-6.1 Sol(OpenAI)、GLM-5.3(开源)。时点统一为 2026-10-05。
为什么单次输出上限值得单独拎出来讲?因为长任务的痛点从来不只是「想得远」,还有「写得完」。代码迁移、大规模重构、整套文档生成,这类活的产出本身就可能几十万 token 起步。过去上限 6.4 万 token 的时代,工程侧的办法是把任务切碎、搭接力与校验层,每多一轮就多一次上下文搬运与走样风险。输出上限扩到百万级,意味着这些中间层有机会被省掉,也意味着定价里的缓存与上下文口径要重新算账。
边界先说清:本文所有对比基于官方公告、官方文档与媒体报道整理,非亲自压测。没有压测数据,本篇不做「谁是第一」的仲裁,只在各自行内说明射程,最后按需求给结论。涉及价格处均为快照口径,以官方页面为准。
二、对比表:四行横向看
| 维度 | Gemini 4 Argon | Claude Sonnet 5.5 | GPT-6.1 Sol | GLM-5.3 |
|---|---|---|---|---|
| 发布时点 | 9 月 30 日(美东) | 9 月 28 日(美东) | 站内既立口径 | 开源权重已放出 |
| 单次输出上限 | 100 万 token(官方称行业第一) | 官方未强调大数字,不编 | 本篇口径未列,不编 | 未公布 |
| 定价与缓存 | 介绍价 $2/$10,缓存输入 $0.10,期后升至 $4/$20(官方预告) | $2/$10,缓存读取 $0.20 | 输入 $2、输出 $10,缓存 $0.10 | 国内 API $1.40/$4.40 |
| 基准口径 | 官方 18 项中 13 项第一,独立口径略落后 | Terminal-Bench 4.0 得 70.6% | DeepSWE v1.1 约五分之一成本对齐 Astra | 开源编程 SOTA,CyberGym 84.5% 全场最高 |
| 可用状态 | 受控分阶段发布,普通用户未开放 | 已上线,三朵云同步 | 已可用 | 可自部署,也有 API |
| 开源 | 否 | 否 | 否 | 是,约 750GB(bf16) |
| 适合谁 | 等 API 开放的尝鲜者 | 要均衡性价比与多云部署的团队 | 靠缓存省钱跑 agent 的管线 | 要开源自部署与便宜 API 的团队 |
表里最值得盯的是「可用状态」一行:把数字喊得最响的那一款,恰恰是当下买不到的。这决定了后面四节的读法——Argon 看规格与口径冲突,Sonnet 5.5 和 Sol 看当下的账,GLM-5.3 看开源门槛。另一个读法是「定价与缓存」一行:四款的输入价都在 1 到 2 美元一档,真正的差异藏在缓存列——那往往是 agent 时代账单的大头。
三、Gemini 4 Argon:数字最响,门开得最小
Argon 是四款里唯一把「输出上限」当成主发布点的。据官方公告与多家媒体 9 月 30 日报道,其单次输出上限从上一代的 6.4 万 token 提升到 100 万 token,官方称行业第一。基准面官方口径同样激进:18 项基准中 13 项第一、另有 1 项并列;DeepSWE v1.1 得 77.9% 创 SOTA;CWE-bench v1 得 68% 并列第一。内部案例也给了长任务想象空间:libgav1 解码器 3.2 万行 SIMD 代码重写后快 2.7 倍,Fuchsia Zircon 内核 80 万行 C/C++ 转 Rust,数据中心内存优化释放超 300 TiB——这些量级的工程,正是旧输出上限下拆成十几轮也难做稳的活。
这些案例还有一个共同点:都是「产出量级先顶到天花板」的活。3.2 万行 SIMD 重写、80 万行内核翻译,中间产物本身就远超旧上限,按旧玩法得靠外部脚本把任务切片再拼装,切片边界的语义损耗是工程里最难缠的部分。百万 token 输出把切片逻辑收进模型内部,这正是 Google 把它列为头号卖点的理由。
但两点必须如实摆出来。第一是可用状态:Argon 走受控分阶段发布,目前仅限 Fairwind 计划(650 多家网络安全伙伴)与 Google 内部使用,下一阶段面向付费 API 客户与 AI Ultra 订阅,日期未公布,普通用户与开发者尚未开放。把它放进选型表需要一点纪律:它现在是「可进观察名单、不可进排期」的状态。Fairwind 面向网络安全伙伴,说明 Google 先把高风险场景交给受控伙伴验证,这与大型模型的受控发布惯例一致;任何「本月开放」的说法都是猜测。第二是口径冲突:Artificial Analysis 的独立测评显示其表现略落后官方口径,Agent Arena 代码维度落后于 Opus 4.8 与 GPT-5.6-Sol。官方 13/18 领先与独立口径落后并存,两头都得看,别只信一头。
定价侧(快照口径):介绍价 $2/$10,缓存输入享受 95% 折扣即 $0.10/百万 token;官方预告期后将升至 $4/$20。也就是说,即便将来开放,现在的介绍价也有窗口期。
四、Claude Sonnet 5.5:不追大数字,追单任务效率
Sonnet 5.5 是四款里唯一没把输出上限当卖点的,官方也确实没强调大数字,本篇不编。它的账是另一种算法:输出速度比 Sonnet 5 提升超 30%,多数工作每任务 token 成本最高降 30%——单价不变,靠省 token 降总账。基准面上,Terminal-Bench 4.0 得 70.6%,而 Sonnet 5 仅 10.3%;CursorBench 4.0 得 55.5%,已接近 Opus 5.5 的 57.8%;OSWorld 2.1 从 57.0% 升到 80.1%。
落地侧的现实感比 Argon 强得多:9 月 28 日发布当天就在 Claude 平台与 AWS Bedrock、Google Cloud Vertex、Microsoft Azure 三朵云同步上线,Claude Code 同日整合,并提供零数据保留选项。价格与 Sonnet 5 持平:输入 $2、输出 $10、缓存读取 $0.20(快照口径)。发布细节可读本站 Sonnet 5.5 发布热点,开通路径见 Sonnet 5.5 怎么调用。
定位上,官方把它说成 Opus 5.5 的更快更低成本互补,适合范围明确的日常任务:修 bug、做文档、幻灯片与表格。基准细节也对得上:GDPval-AA 仅比 Opus 5.5 低 2 分,Chartography 从 15.6% 升到 61.6%。安全侧首次给 Sonnet 系列配上与 Opus 同级的网络安全防护机制,高风险网络安全请求可自动回退到 Sonnet 5。模型 ID 为 claude-sonnet-5-5,知识截止 2026 年 6 月,与 Opus 5.5 相同。另有官方预告:更高吞吐更低成本的 Haiku 5.5 将在数周内发布,规格未公布,本篇不展开。
五、GPT-6.1 Sol:缓存 $0.10,agent 管线的省钱解
Sol 的位置在站内 GPT-6.1 Sol 发布专文 已立:智能接近 Astra,官方定价输入 $2、输出 $10、缓存 $0.10——缓存比标准输入便宜 95%。这笔账在长任务场景里分量最重:agent 管线每轮都要重复读上下文,输出上限再大,账单的大头往往也在缓存读取上。成本效率的实证口径是 DeepSWE v1.1 以约五分之一的成本对齐 Astra,Terminal-Bench Science 每任务 $5.47。
背景一句:GPT-6.1 Astra 因安全原因推迟发布(Reuters 9 月 28 日口径),所以这条产品线当下能押注的就是 Sol。Astra 的来龙去脉可读本站 GPT-6 Astra 评测。
把缓存这件事讲透:长任务的典型形态是多轮 agent 循环,每一轮都要把系统提示、工具说明与历史上下文重读一遍。缓存读取按 $0.10 计价时,重复读取的成本只有标准输入的二十分之一,跑得越久省得越多。这也是为什么本篇把「输出上限」与「缓存口径」放进同一张表看:上限决定一口气能写多长,缓存决定接力搬运要花多少钱,两个数字合起来才是长任务的真实账单。
六、GLM-5.3:开源对照行,自部署的底线选项
四款里唯一的开源权重就是 GLM-5.3,它在本篇的角色是对照:闭源三款给不了的「数据不出内网、可按业务微调」,它给。按 ModelScope 实核,权重分 141 个分片共约 750GB(bf16),自部署要备好对应的 GPU 资源;不想自己运维,国内 API 定价 $1.40/$4.40,是四款里输入价最低的一行。能力定性为开源编程 SOTA:Terminal Bench 3.0 开源最高、Agents' Last Exam 开源 SOTA、CyberGym 得 84.5% 全场最高。深度拆解可读本站 GLM-5.3 深度解析。
自部署的门槛也要算清楚:约 750GB 的 bf16 权重只是静态体积,推理还要留出激活与 KV 缓存的余量,单机放不下就要上多卡与量化方案。换来的是三样闭源模型给不了的东西:数据不出内网、可按业务微调、可以按自己的预算做推理调度。对有 GPU 存量与合规硬要求的团队,这笔账往往比 API 报价更划算。
需要提醒:各家基准版本与口径不一,本文不做跨版本互比,选型时请对齐同一基准再比。
七、按需求给结论
没有压测数据,本篇不做「谁是第一」的仲裁,把结论挂在需求上。
要现在就能用的长输出工程,落回 Sonnet 5.5 或 Sol。 Argon 的 100 万 token 买不到,日期未公布,规划别押在它身上。当下把长任务跑通的现实选项是已上线的两款,Sonnet 5.5 的长项是单任务效率与多云可达,Sol 的长项是缓存便宜的 agent 管线。
要缓存省钱跑 agent,选 Sol。 缓存 $0.10 意味着上下文反复读取的成本压到最低,DeepSWE 约 1/5 成本对齐 Astra 的口径是它最硬的底气。
要均衡性价比与多云部署,选 Sonnet 5.5。 三朵云同步上线对企业采购是真便利,$2/$10 加缓存 $0.20 的报价单与提速降本口径都完整,是当下最稳的一行。
要开源自部署与最低输入价,选 GLM-5.3。 750GB 权重自己扛,换来数据私有与 $1.40 的输入价,开源 SOTA 的定性也够用。
想第一时间试 100 万输出,只能盯 Argon 的开放节点。 下一阶段是付费 API 客户与 AI Ultra 订阅,先把预算和评测集备好,等门开的那一刻再验证官方数字。
最后补一句方法论:本篇的四个位置是按「可得性」排的,不是按强弱排的。买得到的型号才有资格进你的排期,买不到的只能进观察名单——这条优先级在横评里排在任何基准表之前。
八、常见问题
**Q1:**Gemini 4 Argon 现在能用吗? A:不能。据官方口径,它走受控分阶段发布,目前仅限 Fairwind 计划(650 多家网络安全伙伴)与 Google 内部;下一阶段面向付费 API 客户与 AI Ultra 订阅,日期未公布,普通用户与开发者尚未开放。
**Q2:**表里三款闭源模型的输出上限为什么有的空着? A:因为官方没公布或没强调。Argon 的 100 万 token 是官方口径;Sonnet 5.5 官方未强调输出上限的大数字,Sol 与 GLM-5.3 本篇口径未列。缺的部分本篇一律不编,等官方口径出来再补。
**Q3:**四款的价格谁最便宜? A:看维度。输入价最低是 GLM-5.3 的 $1.40;缓存价最低是 Argon 介绍价与 Sol 并列的 $0.10;Sonnet 5.5 缓存 $0.20。注意 Argon 的 $2/$10 是介绍价,官方预告期后升至 $4/$20。以上均为快照口径,以官方页面为准。
**Q4:**GLM-5.3 和 Sonnet 5.5 谁编程更强? A:不能直接比。GLM-5.3 的成绩来自 Terminal Bench 3.0,Sonnet 5.5 的 70.6% 来自 Terminal-Bench 4.0,不同基准版本的分数不可对表。本篇对 GLM-5.3 只给「开源编程 SOTA」的定性,跨版本比较请等同基准数据。
**Q5:**这些价格是最终价吗? A:不是。本文所有价格均为 2026-10-05 前后的快照口径,Argon 还处于介绍价阶段且官方已预告涨价。签约或下单前一律以官方定价页为准。
互动
你手上的长任务是拆轮喂还是一口气跑完?如果 100 万 token 输出明天就开放,你最想第一个丢给模型的是什么活?评论区聊聊你的任务形态和踩过的上下文坑,高频问题会进后续更新。觉得有用的话,转给正在做模型选型的同事。