前沿热点
前沿热点

Claude Sonnet 5.5发布:编程分10跳70,价格不变

Claude Sonnet 5.5 发布(2026-09-28 美东,官方口径):Claude 5.5 系列第二款,定位 Opus 5.5 的更快更低成本互补,Claude 平台与 AWS Bedrock/Google Cloud Vertex/Microsoft Azure 三云同步上线,Claude Code 同日整合。核心数字:Terminal-Bench 4.0 从 Sonnet 5 的 10.3% 跳到 70.6%(同基准不同代,近七倍);CursorBench 4.0 得 55.5%(Opus 5.5 为 57.8%);OSWorld 2.1 57.0% 到 80.1%;GDPval-AA 仅比 Opus 5.5 低 2 分;输出速度提升超 30%、多数工作每任务成本最高降 30%。价格策略:单价与 Sonnet 5 完全持平($2/$10,缓存 $0.20),降价藏在省 token 里。安全:Sonnet 系列首次拿到与 Opus/Fable 同级的网络安全防护,新增防推理提取分类器与高风险请求自动回退。另首款仅凭截图通关《宝可梦 红》的 Sonnet。竞争背景:两天后 Gemini 4 Argon 发布(受控发布,输出 100 万 token),GPT-6.1 Astra 因安全原因推迟;企业客户占 Anthropic 业务约 80%,处于 IPO 前奏(Reuters 口径)。Haiku 5.5 数周内发布(规格未公布不编)。

发布于 2026年10月5日9 分钟阅读
<!-- claude-sonnet-5-5-release-hotspot | hotspot | Claude Sonnet 5.5发布:编程分10跳70,价格不变 -->

2026年9月28日(美东时间),Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 系列的第二款模型——上一款 Opus 5.5 在一周多前刚刚亮相。按官方定位口径,Sonnet 5.5 是 Opus 5.5 的更快、更低成本互补版本,适合范围明确的日常任务:修 bug、写文档、做幻灯片和表格这类高频工程活。发布当天,模型在 Claude 平台与 AWS Bedrock、Google Cloud Vertex、Microsoft Azure 三大云同步上线,Claude Code 也完成同日整合。

这场发布真正值得逐条推敲的是几组数字:Terminal-Bench 4.0 编程得分从上一代 Sonnet 5 的 10.3% 跳到 70.6%,官方称输出速度提升超 30%、多数工作每任务成本最高降 30%,而价格表与 Sonnet 5 完全持平。一款新模型把同基准分数拉开近七倍,却不涨一分钱单价,这背后的策略值得单独拆开算账。这篇文章按热点拆解:官方数字逐条摆出来、10.3 与 70.6 的正确读法、价格策略的算账逻辑、安全与可用性的升级,以及两天后登场的 Gemini 4 Argon 带来的竞争背景。所有数字均为官方口径或明确标注的媒体转述口径,未公布项一律不编。

官方数字逐条摆出来

官方对 Sonnet 5.5 的定位描述很克制:它是 Opus 5.5 的更快、更低成本互补,适合范围明确的日常任务、修 bug、做文档、幻灯片与表格。翻译成大白话:Opus 5.5 管复杂的长任务,Sonnet 5.5 管天天要干的活。真正的信息量落在可量化的数字上,逐条如下。

第一条,速度。官方口径:输出速度比 Sonnet 5 提升超过 30%。对高频调用的编程场景来说,30% 的速度提升直接压缩的是等待时间,一个工程师一天里几十次小调用累积下来,感知会相当明显。

第二条,成本。官方称多数工作每任务成本最高降低 30%,来源不是降价而是 token 更省——同样的任务消耗更少的输出量。这条和后面的价格策略是同一件事的两面,放到价格那节细算。

第三条,编程基准。Terminal-Bench 4.0 得分 70.6%,上一代 Sonnet 5 是 10.3%,同基准不同代,这个近七倍的跳跃是整场发布最大的头条。另一项 CursorBench 4.0 得 55.5%,与 Opus 5.5 的 57.8% 接近——也就是说在编程这块,走量档位已经摸到了自家旗舰的上一次水平。

第四条,其他基准。OSWorld 2.1 从 57.0% 升到 80.1%,涨了 23 个百分点;Chartography 从 15.6% 升到 61.6%,接近四倍;GDPval-AA 仅比 Opus 5.5 低 2 分。这几项拼起来的画像是:与旗舰的差距被全面收窄,部分维度几乎追平。

第五条,第三方口径。据媒体转引 Artificial Analysis 的智能评分,Sonnet 5.5 超过了 GPT-6 Astra 与 Claude Fable 5.1。这里必须标注:这是媒体转引的第三方口径,不是本站实测,理性看待即可。想了解 GPT-6 Astra 这边的能力盘,本站写过一篇评测可以对照,见GPT-6 Astra评测。

第六条,趣味事实。官方与 TechNews 都提到:Sonnet 5.5 是首款仅凭截图通关《宝可梦 红》的 Sonnet 模型。这类成绩不会进采购决策,但它是长程规划与持续决策能力的一个直观侧面:连续几百个决策点不出局,对 agent 类应用是个好兆头。

10.3与70.6:同基准不同代,别读岔了

先把最容易被带偏的地方讲清楚:10.3% 和 70.6% 来自同一个基准 Terminal-Bench 4.0,对比对象分别是上一代 Sonnet 5 与新款 Sonnet 5.5。换句话说,这是同一场考试、两代考生,不是把不同卷子的分数拼在一起凑戏剧性。

这个读法为什么值得强调?因为发布季最常见的数字游戏恰恰是换基准:新款跑新基准,旧款跑旧基准,然后挑好看的数字放头版。这次 Terminal-Bench 4.0 用同一张卷子测了两代模型,跳跃才有真正的可比性。近七倍的差距说明的不是「小幅进步」,而是终端侧编程任务从偶发成功到多数可完成的代际差——上一代做十次可能成一次,这一代十次里能成七次,工程上的可用性完全是两个概念。

反过来也要防另一种误读:市面上陆续出现的对比表,常把不同版本的基准分数放进同一列排序。这里给一个简单的防坑提醒:Terminal-Bench 3.0 与 Terminal-Bench 4.0 是不同版本的基准,难度与评测集都不同,分数不能直接互比;看任何对比表,先查版本号,再看分数。另外,以上基准数字目前都是厂商自报口径,第三方复核要等独立测评铺开,本站不做无压测数据的仲裁。

价格策略:单价不变,把降价藏进token里

价格表是这次发布最耐人寻味的部分。Sonnet 5.5 与 Sonnet 5 完全持平:每百万 token 输入 2 美元、输出 10 美元、缓存读取 0.20 美元。单价一分没降,但官方口径同时给出「多数工作每任务成本最高降 30%」。两句话放在一起,指向同一条策略:降价不靠单价,靠省 token。

这条路线和「直接砍价」有本质区别。直接砍价是把同一份工作收更少的钱,惠及所有存量调用;省 token 是把同一份工作变成更少的工作量——模型更少绕路、更少废话、更少无效重试,账单自然下来。对用户来说,后者往往更实在,因为它是随效率提升自动兑现的,不需要你去谈折扣、换套餐或者改合同。代价则是省钱幅度取决于任务类型:官方说的是「多数工作」最高降 30%,不是所有任务保底降 30%,这一点在估算成本时要留出浮动空间。

作为参照,Opus 5.5 的定价是每百万 token 输入 4 美元、输出 20 美元(官方口径),定位复杂长任务;Sonnet 5.5 用不到一半的价格接住日常工程活,产品线的分层逻辑相当清楚。本站 9 月底写过一篇编程模型价格横评,把 Sonnet 5.5 与 GPT-6.1 Sol 的性价比放在一起算过账,见半价与两折:旗舰平替编程模型洗牌。需要提醒的是,文中价格均为发布时点快照,以官方页面为准。

安全与可用性:Sonnet第一次拿到Opus级防护

这次升级里有两条容易被忽略但分量不轻的线。

第一条是安全。官方口径称,Sonnet 5.5 首次给 Sonnet 系列配上与 Opus、Fable 同级的网络安全防护机制,网络攻防能力与 Opus 5 同水准;生物防护维持 Sonnet 5 的标准(CB-1);新增防推理提取的安全分类器;高风险网络安全请求可自动回退到 Sonnet 5 处理。把旗舰级防护下放到走量档位,传递的判断很明确:这类模型会被大规模用于真实生产环境,防护等级要跟着使用规模走,而不是跟着模型档位走。攻击面最大的恰恰是跑得最多的那款模型。

第二条是可用性。模型 ID 为 claude-sonnet-5-5,知识截止 2026 年 6 月,与 Opus 5.5 相同;发布当天在 Claude 平台与 AWS Bedrock、Google Cloud Vertex、Microsoft Azure 三大云同步上线,Claude Code 同日整合,并提供零数据保留(zero data retention)选项。三云同步的意义在于企业可以直接走自己已有的云协议接入,不必新建账号体系,采购与合规流程都能沿用旧路。具体怎么调用、参数怎么配,本站同期写了一篇上手 SOP,见Claude Sonnet 5.5怎么调用:三朵云API路径与定价。

还有一个预告值得记录:官方称 Claude Haiku 5.5 将在数周内发布,定位高吞吐低成本档。规格尚未公布,本文不替它编,等发布再说。

竞争背景:Gemini 4 Argon同期登场

Sonnet 5.5 发布两天后(9 月 30 日,美东),Google 发布 Gemini 4 Argon,把单次输出上限从 6.4 万 token 拉到 100 万。两条产品线的赌注完全不同:Argon 押注「长任务一口气做完」,Sonnet 5.5 押注「单任务又快又省」。市场同时拿到两份方向相反的答卷,这个季度的看点就在这里——长上下文的终点是输出上限,日常工程的终点是性价比,两条路线还没到正面撞车的时候。

不过要如实交代 Argon 的可用状态:它是受控分阶段发布,目前仅对 Fairwind 计划(650 多家网络安全伙伴)与 Google 内部开放,下一阶段面向付费 API 客户与 AI Ultra 订阅用户,日期未公布。也就是说,普通用户与开发者现在还买不到。独立口径也要两头都写:Artificial Analysis 的独立测评显示 Argon 表现略落后于官方口径,Agent Arena 代码项落后于 Opus 4.8 与 GPT-5.6-Sol。官方与独立口径并存,等它全面开放后再下结论更稳。价格方面,Argon 介绍价为每百万 token 输入 2 美元、输出 10 美元,期后将升至 4 美元、20 美元(官方预告口径)。

再补一句更远的背景:据 Reuters 9 月 28 日报道,GPT-6.1 Astra 因安全原因推迟发布。头部厂商在「发得快」与「发得稳」之间的摇摆,构成了这个九月的主旋律,本站此前写过 OpenAI 安全减速的专文,可以对照着读,见OpenAI安全减速专文。想看几款模型在长输出维度怎么排,本站同期写了百万 token 输出横评,按需求给结论、不做无压测仲裁,见一口气输出100万token横评。

写在最后

最后交代资本背景:据 Reuters 报道,企业客户约占 Anthropic 业务的 80%,媒体口径称其处于 IPO 前奏。这个背景下看 Sonnet 5.5 的打法就很清楚了——不涨单价、把效率做上去、把企业级防护下放到走量档,每一步都在往「企业愿意长期续费」的方向走。上市前的每一份财报,都要靠这种细水长流的调用量撑起来。

我们对这代模型的判断是:它赌的不是跑分第一,而是「同样的价格更好的工程交付」。70.6% 的跳跃和持平的价格表放在一起,是这个判断最好的注脚。分数的最终成色要等独立测评与真实生产环境的反馈;眼下能确定的是,日常编程任务的性价比门槛,被这代 Sonnet 抬高了一截。

同期还有两件事值得顺手一看:NVIDIA 刚刚开源了给 AI agent 上锁的运行时与芯片级看门狗,见NVIDIA给AI agent上锁一文;想在动手前把调用路径摸清,直接看上文的上手 SOP。

互动

你已经开始用 Sonnet 5.5 了吗?70.6% 的编程得分在你手里的真实任务中兑现了几成,每任务成本真的降了 30% 吗?评论区聊聊你的实测感受。

参考来源

  • Anthropic 官网与 transparency 页(一手来源):发布信息、基准分数、定价与安全机制
  • Reuters,2026年9月28日:发布报道、GPT-6.1 Astra 推迟、企业客户占比口径
  • TechNews 台湾,2026年9月29日:三云可用性、《宝可梦 红》口径
  • 机器之心:发布信息交叉核对
  • Artificial Analysis:独立智能评分与 Argon 独立测评(均为媒体转引口径)
  • 说明:基准分数与价格均为发布时点快照口径,以 Anthropic 官方页面为准;Argon 涨价与发布安排为官方预告口径。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-10-05

相关文章

前沿热点

Anthropic 冲 2 万亿估值 IPO:先给华尔街画了张 30 万亿美元的饼

《华尔街日报》8 月 25 日报道:Anthropic 在 IPO 招股书中提出超过 30 万亿美元的潜在市场规模(TAM)预测,超过 SpaceX 的 28.5 万亿美元纪录,成为商业史上最庞大的市场叙事。其测算逻辑不是现有软硬件销售额,而是全球所有「可被 AI 模型替代或完成的工作」的全部经济价值与劳动力成本。计划 2026 年秋季挂牌、目标募资最高 1000 亿美元、估值锚定 2 万亿美元--距 5 月 9000 亿美元私募估值四个月再翻 2.2 倍。底气是 2026 Q2 单季营收 116 亿美元并首次实现调整后营业利润为正;风险是数据中心建设受阻、海外低价模型竞争与二级市场容错率降低。9 月招股书正式披露是下一个节点。

2026年8月26日6 分钟阅读