2026 年 9 月底,编程模型市场在同一个星期里落下了两颗棋子。Anthropic 发布 Claude Sonnet 5.5,官方口径称其性能直逼 Opus 5.5,价格只有 Opus 5.5 的一半;紧接着,OpenAI 在旧金山 DevDay 2026 上推出 GPT-6.1 Sol,官方口径称其智能接近旗舰 GPT-6 Astra,API 价格仅为后者的五分之一。两家以旗舰著称的公司,在同一周里做了同一件事:把「接近旗舰的智能」从奢侈品货架上取下来,摆进了平替区。
对每天写代码的人来说,这是今年最值得认真算账的时刻:当「半价」与「两折」同时出现,旗舰和平替之间的距离,究竟是营销话术,还是实打实的钱包差价?本文把 Claude Sonnet 5.5 与 GPT-6.1 Sol 放在主位,以 Claude Opus 5.5 和 DeepSeek V4.1 为两个参照系,拆解这波「旗舰平替」性价比洗牌。
口径边界:什么能比,什么不能比
横评类文章最容易犯的错,是把不同厂商的跑分数字放进同一张表里直接排序。本文从源头拒绝这种做法。各家模型的 benchmark harness 不同、评测集处理方式各异,绝对分之间没有可比性。因此本文不做任何跨厂商的绝对分横比,只做「相对自家旗舰」的相对值比较:价格比(Sonnet 5.5 为 Opus 5.5 的一半、GPT-6.1 Sol 为 Astra 的 1/5)与速度口径(Sonnet 5.5 提速 30% 以上、Sol 的 Ultrafast 付费提速档)。为什么 harness 差异的影响这么大?同名的 benchmark 到了不同团队手里,提示词模板、代理循环的步数上限、终端环境配置、判分脚本都可能不同,同一个模型换一套 harness,成绩差出十几分并不罕见。所以本文涉及跨模型的表述一律退到相对值层面,只在同一厂商的自家坐标系里谈进步与定位。
文中所有数字均标注官方口径经转述(机器之心、量子位、AI工具集),本文不自行跑分,也不对未公布的定价做任何换算。
分工声明:与站内两篇横评的关系
站内已有两篇横评与本文互补。frontier-coding-model-comparison-review-2026-08 是 2026 年 8 月的综合编程模型横评,覆盖面更全;flagship-coding-reasoning-review 聚焦旗舰推理横评。本文则聚焦 9 月底至 10 月初这一波「旗舰平替」的性价比洗牌与时点更新,三篇互为内链、各有分工,不重复占篇幅。如果你需要接入 Sol 系模型的实操步骤,可另见 gpt-6-sol-luna-api-sop。
Sonnet 5.5:半价买到「直逼 Opus」的官方叙事
先看 Anthropic 这边。Claude Sonnet 5.5 是 Claude 5.5 家族的第二款模型,定位与 Opus 5.5 互补。官方口径(经机器之心转述)给出三组关键数字:其一,运行速度提升 30% 以上;其二,Terminal-Bench 4.0 得分从 10.3% 升至 70.6%,注意这是本代 Sonnet 与前代 Sonnet 的自家对比,衡量的是代际进步幅度,不是与任何别家模型的排序;其三,性能直逼 Opus 5.5,而价格仅为 Opus 5.5 的一半。
三组数字合起来,讲的是一个很清晰的故事。Terminal-Bench 4.0 从 10.3% 到 70.6% 的跃升,说明前代 Sonnet 在终端类任务上几乎是缺位的,本代一口气补上了这块短板;对依赖命令行工作流的开发者来说,这一项可能比任何综合分都更有感知——跑测试、改配置、排查环境这类活,体验差异是「基本不可用」与「可以托付」的差别。速度提升 30% 以上,意味着交互式编程里的等待时间被进一步压缩,改一轮、跑一轮的循环会更顺。而「一半的价格」,直接改写了过去「要么贵、要么弱」的单选题。
「与 Opus 5.5 互补」这个定位也值得多看一眼。它说明 Anthropic 有意维持产品分层:旗舰守住智能上限,中端走量摊薄成本。对用户而言,分层意味着选择变清晰——先想清楚任务难度分布,再决定把钱花在哪一层。
价格口径必须说清楚:Sonnet 5.5 的具体美元定价在官方素材中并未给出,本文只能如实写「为 Opus 5.5 的一半(官方口径)」,不做换算。参照锚是 Opus 5.5 本身:其 API 价格为 $4/$20 每百万 tokens(输入/输出,约 ¥29/¥143,转述自 AI工具集对比表口径)。想估算 Sonnet 5.5 的量级,按这个锚折半即可,本文不代算具体数字。关于 Opus 5.5 的更多背景,可读 claude-opus-5-hotspot。
GPT-6.1 Sol:两折的「准 Astra」,外加买得到的速度
再看 OpenAI 这边。GPT-6.1 Sol 亮相于旧金山 DevDay 2026,官方称本次大会共发布 25 项更新。就本文主题相关的口径(官方口径,经量子位转述):GPT-6.1 Sol 的智能接近旗舰 GPT-6 Astra,API 价格仅为其 1/5;同时推出 Ultrafast 付费提速档位。
把 1/5 和「一半」放在一张桌上,你会发现 OpenAI 的刀法更激进:Anthropic 用半价卡位中高端,OpenAI 直接用两折价格去够自家旗舰的智能水平。更值得琢磨的是 Ultrafast 档的设计——它把「速度」变成了一个可购买的维度:默认档位省钱,赶工期、跑批量任务时再为延迟付费。这种把延迟需求显性定价的做法,比单纯标一个快的数字更贴近真实工程场景:不同任务对速度的支付意愿本来就不一样。
围绕 Sol 的工程生态也值得一提,同样为官方口径经量子位转述:Codex 升级为「云端工程团队」,支持多 Agent 并行、代码评审与安全扫描;常驻型 Agent「Dots」可长期跟踪任务、主动汇报、自主操作软件;Agents API 开放 Computer Use 等能力,OpenAI 并与 AWS 达成合作。把这些更新与 Sol 的定价放在一起看,OpenAI 的意图相当明显:用两折的价格入口把开发者拉进 Agent 工程化的完整链条,再靠提速档与云端工程服务承接真实负载。Sol 不只是「便宜的 Astra」,而是整套工程化设施的性价比入口。
照例划红线:GPT-6.1 Sol 的具体美元定价与模型 ID 在本批素材中均未公布,接入步骤以 OpenAI 官方文档为准,本文不做编造。
两个参照系:价格锚与开源路线
横评不能只有主角。第一个参照系是 Claude Opus 5.5:它既是 Sonnet 5.5 价格口径的锚(一半),也是「旗舰上限」的标尺。$4/$20 每百万 tokens 的定价(转述口径)意味着,旗舰的账单在任何用量结构下都摆在那里,平替省下的钱可以精确感知。
第二个参照系是 DeepSeek V4.1。当三家闭源厂商在「价格」维度做平替时,开源路线把平替直接做进了权重里:权重开放意味着私有部署、合规可控,成本结构从按 token 计费转向按硬件折旧计算。FlashMLA 仓库的 README 官方口径明确,其支撑 DeepSeek-V4.1 模型在 NVIDIA GPU 与华为昇腾 NPU 上的推理。更宏观的背景是,9 月 30 日 DeepSeek 开源了面向昇腾平台的算子基础设施:DeepGEMM-Ascend(MIT)、DeepEP-Ascend(根目录暂无 LICENSE 文件,合规待观察)、TileKernels 加入昇腾后端,FlashMLA 发布昇腾注意力算子,prefill 达 410 TFlops、为 95% 硬件峰值(README 官方口径)。开源路线的护城河,正在从「权重」延伸到「算子栈」。V4.1 模型本体的发布背景可读 deepseek-v4-1-flash-open-source-hotspot,开源旗舰的整体格局另见 open-source-flagship-llm-comparison-review。
需要强调:本批素材未给出 V4.1 的 API 定价与 benchmark 数字,下表中相关栏目如实标注「未公布」,不做任何填充。
一张表看懂四个方位
| 模型 | 相对自家旗舰的价格口径 | 官方口径 benchmark | 速度口径 | 开源与否 | 适合谁 |
|---|---|---|---|---|---|
| Claude Sonnet 5.5 | 为 Opus 5.5 的一半(官方口径经机器之心转述) | Terminal-Bench 4.0 从 10.3% 升至 70.6%(本代与前代自家对比) | 运行速度提升 30% 以上 | 闭源 | 预算敏感、追求交互流畅的日常高强度编程 |
| GPT-6.1 Sol | API 价格为 GPT-6 Astra 的 1/5(官方口径经量子位转述) | 未公布 | Ultrafast 付费提速档 | 闭源 | 要 Astra 档智能、用量大且需控成本的团队 |
| Claude Opus 5.5(参照系) | 本体即旗舰,$4/$20 每百万 tokens(转述口径) | 未公布(本批素材) | 未公布 | 闭源 | 要旗舰上限、任务难度不设限的场景 |
| DeepSeek V4.1(开源参照系) | 未公布(本批素材) | 未公布 | 未公布 | 权重开放 | 私有部署与合规敏感场景 |
读这张表时要记住口径边界:四行的 benchmark 栏目不可横向排序,价格比与速度口径只在各自生态内成立。表的价值不在排名,而在帮你对号入座。
相对值的三个坑
第一坑:跨家横比 Terminal-Bench 的 70.6%。这个数字是 Sonnet 本代与前代在同一 harness 下的自家对比,只能说明 Anthropic 中端模型的代际进步幅度。拿它去和任何 GPT 系数字放在一起排序,都是对口径的误用。
第二坑:把宣传价格比当成实际账单。「一半」和「1/5」都是官方宣传口径经转述,真实账单取决于输入输出结构、缓存命中情况,以及是否购买 Ultrafast 这类付费提速档。提速档的重度使用会实质性改变成本结构,选型时要把预期用量分布一起算进去。
第三坑:忽略「直逼」与「接近」的模糊性。官方口径称 Sonnet 5.5「性能直逼 Opus 5.5」、Sol「智能接近 Astra」,但均未给出与自家旗舰的具体分差。本文如实转述这两个形容词,不做量化,也提醒读者在关键项目里留出验证预算。
分场景选型结论
预算敏感的日常编程:Sonnet 5.5 是当前确定性最高的选择——速度提升 30% 以上、Terminal-Bench 4.0 代际跃升到 70.6%、价格为 Opus 5.5 一半,三个口径都指向同一个方向。如果你的工作流深度绑定 OpenAI 生态,或者用量极大,GPT-6.1 Sol 的 1/5 价格加上 Ultrafast 的弹性档位更划算。
要旗舰上限的复杂任务:平替再香也有边界。架构决策、疑难 bug 根因分析、高风险重构这类任务,仍建议交给 Opus 5.5 或 GPT-6 Astra 本尊;把量大面广的常规任务交给平替,两者组合才是钱包友好的正确姿势。
要私有部署的合规场景:DeepSeek V4.1 的权重开放路线是四者中唯一的选择,配合 9 月底开源的昇腾算子栈,国产算力上的部署路径也在补齐。数据不能出内网的团队,闭源 API 的价格再低也不在候选列表里;反过来,愿意走开源路线的团队要接受自建运维的成本,算子栈开源降低了这部分门槛,但工程投入仍然存在。
还有一条务实建议:预算允许时不妨双轨并行。用平替模型承接九成的日常任务,保留少量旗舰额度处理疑难场景,用真实任务而不是跑分去验证「直逼」与「接近」的成色——这也是本文不做自行跑分的原因之一,跑分表代替不了你自己的工作流。
一句话收束这波洗牌:旗舰没有变便宜,但「够用的智能」正在快速变便宜。9 月底到 10 月初这两周,性价比的天平明显向用户倾斜,接下来要看的是这波平替能否在真实工程里坐稳「直逼」与「接近」这两个形容词。
常见问题
Q1: Sonnet 5.5 到底多少钱?
官方素材只说明其价格为 Opus 5.5 的一半(官方口径经机器之心转述),未给出具体美元定价,本文不自行换算。可参照 Opus 5.5 每百万 tokens $4/$20(输入/输出)的口径自行折半估算量级。
Q2: Terminal-Bench 4.0 的 70.6% 能和 GPT-6.1 Sol 的成绩直接比吗?
不能。各家 benchmark harness 不同,跨厂商绝对分不可横比。70.6% 是 Sonnet 5.5 与前代 Sonnet(10.3%)在同一 harness 下的自家对比,只能说明代际进步幅度。
Q3: GPT-6.1 Sol 的 Ultrafast 档是什么?
Ultrafast 是付费提速档位(官方口径经量子位转述),把速度做成可购买的维度:默认档省钱,需要低延迟时再付费提速。该档位的具体价格在官方素材中未公布。
Q4: DeepSeek V4.1 在对比表里为什么很多栏写着未公布?
本文的口径纪律是只写官方口径经转述的数字,不编造。本批素材未给出 V4.1 的定价与 benchmark 数字,因此如实标注未公布。可确认的是其权重开放,以及 FlashMLA 对其在 NVIDIA GPU 与昇腾 NPU 上推理的支撑。
Q5: 本文与站内已有的两篇横评是什么关系?
frontier-coding-model-comparison-review-2026-08 是 2026 年 8 月的综合编程模型横评,flagship-coding-reasoning-review 是旗舰推理横评。本文聚焦 9 月底至 10 月初的「旗舰平替」性价比洗牌与时点更新,三篇互为内链、分工不同。