2026 年 8 月底到 9 月初,短短一周之内,Google、Alibaba、Meta、Anthropic 四家几乎同时把新一代编码与推理旗舰推到台前:Gemini 3.8 Flash(9 月 2 日)、Qwen3.8-Max-0902(9 月 2 日)、Muse Spark 1.3(9 月 2 日)、Claude Fable 5.1(9 月 1 日);OpenAI 的 GPT-5.6 Sol 则是 7 月 9 日上线、8 月 21 日开启促销的老牌选手。五款同档模型挤在同一窗口,指向同一句潜台词:编码 agent 进入了贴身肉搏。但窗口越近,越要冷静——本文的重心不是复述发布会数字,而是把单价、上下文与基准三件事按可比口径重新摆正,尤其是那个最容易踩的坑:各家 Terminal-Bench 版本根本不一样。
一、同档发布:编码 agent 的一周军备赛
把发布时间排开看,这场齐射的意图就清楚了。Claude Fable 5.1 在 9 月 1 日率先亮相,次日 Google 的 Gemini 3.8 Flash、阿里巴巴的 Qwen3.8-Max-0902、Meta 的 Muse Spark 1.3 几乎一同跟上。四家在一个自然周内把编码与推理旗舰推到台前,在 2026 年还不常见。OpenAI 的 GPT-5.6 Sol 看上去是个例外:它 7 月 9 日已经上线,8 月 21 日又开启了一轮促销,把它也拉进同一档讨论,是因为它的定价窗口与能力定位正好和这波新兵挤在同一个决策区间里。
这个窗口指向的不是单点能力竞赛,而是编码 agent 这条产品线的整体升温。上下文统一拉到百万级、缓存读取被刻意压价、基准清一色瞄准 SWE 与终端操作,说明各家都在抢同一批客户:把模型塞进长循环、多工具、会自我纠错的 agent 链路里跑真实工程任务。对读者来说,结论很直接——评估对象不该是单个模型,而是一组"能不能接住我那条 agent 链路"的候选。完整的能力与定价横向讨论可对照 Claude Fable 5.1 发布解读,成本侧的缓存账见 缓存优先架构下的 agentic 成本账横评。
这场齐射还有一个容易被忽略的细节:它不是五家同时憋出了大招,而是节奏被一个人带着走。Fable 5.1 在 9 月 1 日定调,次日三家立刻跟上,说明大家都把"编码 agent"当成了同一个必须抢的入口。对买家而言,这意味着短期内有五个可替换的选项同时摆在桌上,反而该更挑剔而不是更冲动——先想清楚自己的 agent 链路长什么样,再回来看谁的分数对你有意义,而不是被发布会的先后顺序牵着走。
二、定价哲学:便宜牛马 vs 高端前沿
五款定价可以清楚地切成两派。便宜牛马派以 Gemini 3.8 Flash 与 Muse Spark 1.3 为代表,靠单任务成本抢量;高端前沿派以 Claude Fable 5.1 与 GPT-5.6 Sol 为代表,靠能力上限守价。Qwen3.8-Max-0902 卡在中间,综合价约每百万 token 5 美元。
| 模型 | 输入 $/M | 输出 $/M | 缓存读取 $/M | 备注 |
|---|---|---|---|---|
| Gemini 3.8 Flash | 0.75 | 3.75 | 未单列 | 介绍价至 2026-12-31,之后涨至 1.50 / 7.50 |
| Qwen3.8-Max-0902 | 2.00 | 6.00 | 0.17 | 综合约 $5/M,推理预算 262K |
| Muse Spark 1.3 | 1.25 | 4.25 | 0.15 | Contributor 档 0.10 / 0.20,Meta 训练你的数据 |
| Claude Fable 5.1 | 10.00 | 50.00 | 0.25 | 缓存读取较上代降 75% |
| GPT-5.6 Sol | 4.00 | 20.00 | 未单列 | 促销来自 5/30,至 2026-11-21;输入超 272K 按 2× / 1.5× 计 |
注意几个藏在单价后面的条件。Gemini 的 0.75 是介绍价,年底到期后会翻一倍,做年度预算不能按现价拍板。Fable 的单价纹丝没动,但缓存读取从 1 美元砍到 0.25 美元,降幅 75%,对多轮循环是真金白银的让利。Muse 的 Contributor 档便宜到 0.10 美元输入,代价是 Meta 会用你的数据训练,合规上不能当普通档处理。GPT-5.6 Sol 的促销有窗口,长上下文还要加倍计价,长文档场景账单会明显高于标价。
三、版本陷阱:Terminal-Bench 不能直接摆在一起比
这是本文最想拦住读者的一条坑。Terminal-Bench 这个基准在一年里连跳多个版本,难度与任务集都变了,但各家发布会各取所需,报的版本号根本对不齐:
- Gemini 3.8 Flash、Muse Spark 1.3、GPT-5.6 Sol 报的是 Terminal-Bench 2.1,分数分别是 89.4%、88.8%、88.8%;
- Qwen3.8-Max-0902 报的是 TerminalBench 3.0,分数 29.0%(较上代 11.3% 提升),与 2.1 不是同一份卷子;
- Claude Fable 5.1 报的是 Terminal-Bench 4.0,分数 55.8%,又是一个新版本。
把 29.0%、55.8%、89.4% 并排写进一张表,会立刻读成"Qwen 垫底、Fable 中游、Gemini 第一",这是一个彻头彻尾的错误结论。版本号不同意味着任务难度、评分口径都变了,跨版本比较没有意义。正确的做法要么是同一版本分表,要么直接标"不可比"。下文所有基准表都严格按版本分列,凡是版本对不上的格子,一律写"不同版本 / 不可比",绝不强行凑一列。
四、基准对照表(严格按版本分列)
再强调一次口径:下面每一张表都只把同一版本、同一基准的数字放在同一列。凡是厂商没报、或报了不同版本的,写"未公布"或"不同版本",绝不凑数。读者拿去用的时候,也请保持这个纪律,因为跨版本的一行数字往往比没有数字更危险,它会伪装成可比结论骗过快速浏览。
DeepSWE v1.1(长程 SWE 编码)
| 模型 | DeepSWE v1.1 |
|---|---|
| Gemini 3.8 Flash | 73.7% |
| Qwen3.8-Max-0902 | 69.3% |
| Muse Spark 1.3 | 75.4%(发布时披露的最高值) |
| Claude Fable 5.1 | 未公布 |
| GPT-5.6 Sol | 72.7% |
这一项五家里只有 Fable 5.1 没给数字,Anthropic 没有为 5.1 提供 SWE-bench 类分数。
Terminal-Bench(按版本拆开,切勿跨列比较)
| 模型 | Terminal-Bench 2.1 | Terminal-Bench 3.0 | Terminal-Bench 4.0 |
|---|---|---|---|
| Gemini 3.8 Flash | 89.4% | 不同版本 | 不同版本 |
| Qwen3.8-Max-0902 | 不同版本 | 29.0% | 不同版本 |
| Muse Spark 1.3 | 88.8%(xhigh) | 不同版本 | 不同版本 |
| Claude Fable 5.1 | 不同版本 | 不同版本 | 55.8% |
| GPT-5.6 Sol | 88.8% | 不同版本 | 37.3% |
注意 Terminal-Bench 4.0 这一列只有 Fable 与 GPT 两家可比(55.8% 对 37.3%),Gemini 在 4.0 上只报了 19.1%,难度明显高于 2.1,再次说明跨版本不能并排。
SWE-bench Pro
| 模型 | SWE-bench Pro |
|---|---|
| Gemini 3.8 Flash | 61.6% |
| Qwen3.8-Max-0902 | 不同基准(报 QwenSWEbench V2 = 70.0) |
| Muse Spark 1.3 | 未公布 |
| Claude Fable 5.1 | 81.2% |
| GPT-5.6 Sol | 64.6% |
Qwen 报的是自家 QwenSWEbench V2,不是 SWE-bench Pro,不能和 61.6% / 81.2% 摆在一起。作为参考,Opus 5 在 SWE-bench Verified 约 96%,是另一个基准,此处仅作量级提示。
HLE / HLE-Verified(推理)
| 模型 | HLE |
|---|---|
| Gemini 3.8 Flash | 54.9% |
| Qwen3.8-Max-0902 | 未公布 |
| Muse Spark 1.3 | 未公布 |
| Claude Fable 5.1 | 60.9%(无工具) |
| GPT-5.6 Sol | 54.5% |
Artificial Analysis Intelligence Index(综合)
| 模型 | Intelligence Index |
|---|---|
| Muse Spark 1.3 | 61(xhigh)/ 62(max) |
| GPT-5.6 Sol | 59 – 60.9 |
| Claude Fable 5.1 | 第一梯队(参考 Opus 5 = 63) |
| Gemini 3.8 Flash | 未单列(编码近 Opus 5) |
| Qwen3.8-Max-0902 | 未单列 |
所有分数均出自厂商发布或第三方机构(Artificial Analysis、Code Arena),标注"未公布"的表示厂商未提供、本文未做独立实测,请勿当作零分。
五、性价比之王:Muse 与 Gemini
如果只保留一句话结论,它就是:单任务成本最低的不是绝对能力最强,而是把单价与分数一起看的人赢了。Muse Spark 1.3 的 Intelligence Index 达到 61(xhigh),按官方测算每任务成本约 0.40 美元,是同档里把"能力够用"和"便宜"压得最紧的一个。Gemini 3.8 Flash 的编码分数(DeepSWE 73.7%、Terminal-Bench 2.1 89.4%)已经逼近上次代 Opus 5 的量级,而单价只有上代前沿的七分之一,是典型的"用低价买接近高端的编码力"。
但能力上限仍然握在 Fable 5.1 手里。它在 SWE-bench Pro 拿到 81.2%,在 Terminal-Bench-Science 0.1 拿到 52.6%,是这一组里 agentic 科研与长程软件工程最稳的一个,对应它 10/50 的 premium 定价。Qwen3.8-Max-0902 卡在中段,综合价约 5 美元、上下文与推理预算充足(最大输入 991K、推理预算 262K),适合需要长上下文又不愿付 premium 的团队。Muse 与 Gemini 的发布细节可对照 Gemini 3.8 Flash 热点解读。
把"性价比"说得更具体一点。单任务成本不是单价,而是(单价 × token 分布 + 缓存命中率 × 回读成本)÷ 任务成功率。Muse 与 Gemini 赢在分子小,Fable 赢在分母大——它的任务成功率更高,所以贵出来的单价常被更少的重试轮次摊薄。真正要算的是"把一次完整任务跑通的总花费",而不是每百万 token 的标价;哪家长上下文、哪家长循环,答案很可能会反过来。对中小团队来说,这条账比任何一张分数表都更贴近真实支出。
落到选型,给一条粗略的切线:预算敏感、任务量大、对绝对上限要求不极端的,优先 Muse 与 Gemini;要做 agentic 科研、长程 SWE、且愿意为质量付溢价的,Fable 5.1 仍是天花板;需要百万级上下文但又卡预算的,看 Qwen;已经深度绑定 OpenAI 工具链的,GPT-5.6 Sol 借着促销窗口可以继续用,注意长上下文加倍计价。
六、落地清单
| 动作 | 依据 | 优先级 |
|---|---|---|
| 按版本重读基准,别跨列比 | Terminal-Bench 2.1/3.0/4.0 不可比 | 高 |
| 用自身工作负载重算账单 | Gemini 年底涨价、GPT 长上下文加倍、Muse 数据条款 | 高 |
| 自建评测验证分数 | 全部为厂商口径或第三方,未经本文复现 | 高 |
| 便宜链路优先 Muse / Gemini | 单任务成本最低 | 中 |
| 高端链路用 Fable 5.1 | SWE-bench Pro 与 agentic 科研领先 | 中 |
| 评估 Muse Contributor 档合规 | Meta 训练你的数据 | 中 |
参考来源
- Google 官方模型博客(Gemini 3.8 Flash,2026-09-02)——发布时间、定价 0.75 / 3.75(介绍价至 2026-12-31,之后 1.50 / 7.50)、上下文 1M / 64K、DeepSWE v1.1 73.7%、Terminal-Bench 2.1 89.4%、SWE-bench Pro 61.6%、HLE 54.9%、Terminal-Bench 4.0 19.1%。厂商发布。
- 阿里巴巴官方发布(Qwen3.8-Max-0902,2026-09-02)——定价 2.00 / 6.00、缓存读取 0.17/M、综合约 $5、上下文 1M / 131K(最大输入 991K、推理预算 262K)、DeepSWE v1.1 69.3%、TerminalBench 3.0 29.0%、QwenSWEbench V2 70.0。厂商发布。
- Meta 官方发布(Muse Spark 1.3,2026-09-02)——定价 1.25 / 4.25、缓存命中 0.15/M、Contributor 档 0.10 / 0.20(Meta 训练数据)、上下文 1M、DeepSWE v1.1 75.4%、Terminal-Bench 2.1 88.8%(xhigh)、Intelligence Index 61(xhigh)/ 62(max)。厂商发布。
- Anthropic 官方发布(Claude Fable 5.1,2026-09-01)——定价 10.00 / 50.00、缓存读取降至 0.25/M(降 75%)、上下文 1M / 128K、Terminal-Bench 4.0 55.8%、Terminal-Bench-Science 0.1 52.6%、SWE-bench Pro 81.2%、HLE 60.9%(无工具)。厂商发布。
- OpenAI 官方发布(GPT-5.6 Sol,2026-07-09;促销 2026-08-21 至 2026-11-21)——定价 4.00 / 20.00(促销来自 5/30)、输入超 272K 按 2× 输入 / 1.5× 输出、上下文 1.1M / 128K、DeepSWE v1.1 72.7%、Terminal-Bench 2.1 88.8%、Terminal-Bench 4.0 37.3%、SWE-bench Pro 64.6%、HLE 54.5%、Intelligence Index 59–60.9。厂商发布。
- Artificial Analysis Intelligence Index——Muse 61/62、GPT-5.6 Sol 59–60.9、Opus 5 参考 63 等综合指数。第三方。
- Code Arena leaderboard——编码榜单位次参照。第三方。
- 腾讯新闻、IT之家——国内对 Gemini / Qwen / Muse / Fable 集中发布的报道与交叉印证。第三方媒体。
- DataCamp、AlphaSignal、Beam AI、byteiota——版本号口径与基准解读的第三方整理。第三方媒体。
常见问题
Q1:为什么各家 Terminal-Bench 版本不一样、不能直接摆在一起比? A1:Terminal-Bench 在一年内从 2.1 跳到 3.0 再到 4.0,每次的任务集与难度都变了。Gemini、Muse、GPT 报的是 2.1(89.4% / 88.8% / 88.8%),Qwen 报的是 3.0(29.0%),Fable 报的是 4.0(55.8%)。版本不同等于考卷不同,把 29.0%、55.8%、89.4% 并排会误读成能力排序,所以必须按版本分表,对不上的格子标"不同版本"。
Q2:单看单价 Gemini 最便宜,真实账单该怎么算? A2:Gemini 的 0.75 / 3.75 是介绍价,2026-12-31 之后涨到 1.50 / 7.50,年度预算不能按现价。实际账单还要叠加缓存命中、输出长度、轮次数量:agent 链路大头是反复读长上下文,缓存读取价才是关键。Fable 把缓存读取砍到 0.25/M,GPT 长上下文超 272K 加倍计价,Muse Contributor 档虽便宜但数据会被用于训练。算账时把"标单价 × 预计 token"换成"各档单价 × 真实分布",详见 agentic 成本账横评。
Q3:Fable 5.1 为什么没有 SWE-bench 分数? A3:Anthropic 没有为 Fable 5.1 提供 SWE-bench 类公开分数,DeepSWE v1.1 一栏标注为"未公布"。它披露的是 Terminal-Bench 4.0(55.8%)、Terminal-Bench-Science 0.1(52.6%)与 SWE-bench Pro(81.2%)。"未公布"表示厂商未提供、本文未做独立实测,不等于零分,跨模型比较时这一格应留空而非填零。
Q4:国产/开源模型里谁最适合接 coding agent? A4:按本组数据,Qwen3.8-Max-0902 与 Muse Spark 1.3 是两个候选。Qwen 上下文最大(991K 输入、推理预算 262K)、综合价约 5 美元,适合长上下文任务;Muse 单任务成本最低(约 0.40 美元)、Intelligence Index 61,适合预算敏感的大批量 agent。两者都没公布 HLE 与 SWE-bench Pro,绝对上限未知,落地前建议自建评测。
Q5:这些分数能直接写进技术选型报告吗? A5:不建议直接抄。全部分数来自厂商发布或第三方机构(Artificial Analysis、Code Arena),未经本文独立复现,且带版本与口径差异。写报告时只引用版本对齐、有对照组的项目,并随文标注"厂商口径 / 第三方、未独立复核";版本对不上的格子标"不可比",跨版本数字不要并排。更稳的做法是用 自建 agent 评测 思路搭贴近自身业务的评测集,把官方分数当基线而非结论。