前沿热点
前沿热点

二十分之一的价格 Haiku 5.5 打响AI小模型价格战

Anthropic 2026-10-07(周三)发布 Claude Haiku 5.5,一个月内 5.5 家族第三款(Opus 5.5、Sonnet 5.5 之后)。定价(官方口径):提示 100K token 以下每百万输入 0.1 美元、输出 0.5 美元——输入价约为 Sonnet 5.5(2 美元)的二十分之一,较 Haiku 4.5 平均降约 75%,与 GPT-6 Luna 短提示档同价;100K 以上档升至 0.5/2.5 美元——此时输入价比 Luna 的 0.2 美元贵 2.5 倍,「同价」只在短提示档成立。上下文从 20 万 token 升至 1M,并成为首个支持可调 effort 档位的 Haiku(同请求内成本与智能二选一)。官方基准表(自报口径):GDPval-AA 1620、OSWorld 72.4%、Terminal-Bench 4.0 39.2%、FrontierCode 46.4%,对标 Haiku 4.5 与 GPT-6 Luna 列在同一张表;SWE-bench 未公布,本篇不编。随发调价:Sonnet 5.5 缓存读取减半至 0.1 美元(官方称多数 agent 任务成本降约 20%),Max/Team 订阅新增月度 API 额度。定位讲得直白:给 Opus/Sonnet 5.5 当编码子代理、跑客服与浏览器操作这类高吞吐低延迟活。路透提及 IPO 前的排兵节奏(据报道口径)。全平台即日可用。

发布于 2026年10月8日9 分钟阅读
<!-- claude-haiku-5-5-release-hotspot | hotspot | 二十分之一的价格 Haiku 5.5 打响AI小模型价格战 -->

2026 年 10 月 7 日周三,Anthropic 正式发布 Claude Haiku 5.5,API 模型 id 为 claude-haiku-5-5,Claude 平台与 AWS Bedrock、Google Cloud、Azure 同日全线上线。按官方口径,这是目前「最便宜、最快、也最能打的小模型」,主打高吞吐、成本敏感的任务,典型场景包括摘要、压缩、数据库查询和分类;同时它也是官方全家桶里速度最快的一档,面向实时客服、浏览器操作这类对延迟苛刻的应用。这篇文章把发布信息逐条拆开:价格怎么读、基准怎么看、与 GPT-6 Luna 怎么对标、以及上线前怎么选。所有数字均为官方口径或明确标注来源的转述口径,未公布项一律不编。

发布信息拆条:四条主线一起看

第一条,价格直接跳水。提示长度不足 100K 的请求,输入 0.1 美元一百万 token、输出 0.5 美元一百万 token;提示达到或超过 100K 之后,价格变为输入 0.5 美元、输出 2.5 美元。官方给了一个很关键的背景数据:此前 Haiku 系列约九成的请求提示长度都在 100K 以下,也就是说绝大多数真实流量都会落进跳水后的最便宜档。与上一代 Haiku 4.5 相比,官方口径称平均能省约 75%,而在 100K 以下这个档位,降幅约达九成。

第二条,上下文一口气拉到 1M token。上一代 Haiku 4.5 还是 200K,这次直接翻五倍。小模型配上百万级上下文,意味着过去必须交给大模型的「读完整代码库再总结」「吞下一整份长文档再抽取」类任务,现在可以用最便宜的一档来跑,成本结构完全不同了。

第三条,可调 effort 档位首次下放到 Haiku 级别。这是首个支持可调 effort 的 Haiku 系模型,档位与 Sonnet、Opus 同款,同一次请求里可以在成本与智能之间二选一:追求响应速度就调低,追求质量就调高,一个模型两头吃。

第四条,安全策略同步更新。官方称 alignment 评估全面改善,出现失准行为的情况更少;它还是首个内置网络安全 safeguards 的 Haiku,整体策略比 Sonnet 5.5 宽松,但渗透测试类用途依然被禁止;生物学能力的安全边界与 Sonnet 5、Sonnet 5.5、Opus 5 持平。同日官方还开放了 Cyber Verification Program 的三个档位。

此外还有一条容易被略过的:Max 与 Team 订阅用户新增了月度 API 额度,订阅与 API 之间的边界又松动了一步,重度用户值得去后台确认自己的额度变化。

定价:二十分之一的价格从哪来,长提示档才是照妖镜

先算 Anthropic 自家内部的账。Sonnet 5.5 目前的价格是输入 2 美元、输出 10 美元,Haiku 5.5 在 100K 以下档位输入 0.1 美元、输出 0.5 美元,输入价正好是 Sonnet 5.5 的二十分之一。这就是「用二十分之一的价格跑 Sonnet 级编码子代理」这个说法的出处,也是本次发布最锋利的一根钩子。

比单价更值得注意的是随发的那条调价:Sonnet 5.5 的缓存读价格直接减半,从 0.2 美元降到 0.1 美元。官方口径称,多数 agentic 任务的整体成本因此下降约 20%。上一批 Sonnet 5.5 发布时我们算过一轮成本账,见Sonnet 5.5发布拆解:编程分与价格策略,当时缓存读 0.2 美元已经是相当激进的定价,这篇拆解现在得更新了。缓存密集型的 agent 工作流是这次减半的最大受益者:子代理每轮回读上下文的成本直接腰斩,而这类回读恰恰是 agent 账单里最沉默也最沉重的一块。

再把镜头拉向竞品。GPT-6 Luna 的完整价格表在那篇GPT-6 Sol与Luna发布拆条里整理过:提示不超过 272K 时输入 0.1 美元、输出 0.5 美元,缓存读仅 0.01 美元;超过 272K 之后变为输入 0.2 美元、输出 0.75 美元,上下文同样是 1M。

对标结论就很有意思了。短提示档,Haiku 5.5 与 Luna 完全同价,0.1 美元对 0.1 美元,正面硬刚;但长提示档一过线,画风立刻反转——Haiku 5.5 在 100K 以上输入收 0.5 美元,Luna 在 272K 以上只收 0.2 美元,同样喂一百万 token 的长提示,Haiku 5.5 反而比 Luna 贵 2.5 倍。所谓「同价」只在提示不超过 100K 的区间内成立。官方那句「九成请求低于 100K」的数据,恰好说明它把重兵布在了自己最舒服的区间,而对手的长提示腹地它并没有去冲。这是本次核真里最值得记住的一处细节:如果你的场景是长文档、长上下文批量处理,0.1 美元这个直觉价签会骗人,先看清楚自己请求的提示长度落在哪一档。

补一笔经济账帮助建立体感:0.1 美元一百万输入 token,换算下来大约一美分可以买十万 token 的输入。千字级文档的分类、抽取、摘要,单次成本被压到接近忽略不计。对每天跑上百万次请求的客服分流、内容分类、日志压缩类业务而言,过去算不过来的账,现在都能算得过来了。

基准成绩:官方口径全在表里,SWE-bench 缺席

老规矩,先立口径:下表全部为厂商自报的官方口径数字,本站未做独立复核;不同基准之间禁止互相比较,只看同一基准内的相对位置。

基准Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5
GDPval-AA v2.1162073514371840
AA-Briefcase v1.1157861413361824
OSWorld 2.1(offline)72.4%15.7%48.9%83.9%
HLE(无工具)45.9%10.2%未列56.9%
HLE(带工具)57.4%18.7%未列64.5%
Terminal-Bench 4.039.2%0.0%16.4%70.6%
FrontierCode 1.1 Main46.4%未列42.4%52.1%(Xhigh 档)
Chartography 视觉推理(无工具)46.4%6.4%29.1%61.6%

几处值得圈出来。Terminal-Bench 4.0 上,Haiku 4.5 是 0.0%,Haiku 5.5 直接跳到 39.2%,代际提升幅度在整张表里最扎眼,终端侧编码任务从几乎不可用变成了多数场景可一试。OSWorld 2.1 的 72.4% 配合「官方最快模型」的定位,指向浏览器操作与桌面自动化这类实时场景。HLE 带工具 57.4%,与 Sonnet 5.5 的 64.5% 差距已经不大,小模型在高难度推理上的下限被明显抬高了。

必须单独拎出来的是缺席者:SWE-bench 官方没有公布 Haiku 5.5 的成绩,第三方媒体 startupfortune 也指出了这一点。这里立一条硬规矩:不要拿 Haiku 4.5 时代的 73.3% 来替 5.5 挡枪,代际不同就是不同,等官方补数再下结论。对把编码能力当作第一决策依据的读者,这是一条暂时的信息缺口,选型时要么自己压测,要么等数据。

客户侧数据方面,Asana 给出了自报口径:接入后任务完成延迟下降 30%,每个 agent 回合的推理速度提升 2.5 倍。注意这是客户自报数据,代表个案权益,不等于基准分数,参考即可。

子代理才是主战场:与 GPT-6 Luna 的明暗两条线

把基准表和定价表叠在一起看,Anthropic 这步棋的意图相当清楚:Haiku 5.5 不是给你拿来日常闲聊的,它是给 agent 大军当兵员的。官方在发布口径里明说了定位——与 Opus 5 和 Sonnet 5.5 搭档,充当编码子代理。主控模型负责架构决策与复杂推理,海量廉价的查找、摘要、分类、抽取任务全部下放给 Haiku 5.5 去跑。这也解释了为什么缓存读减半的调价要跟着一起发:子代理每轮回读上下文的成本,往往比生成新内容还高,减半的缓存读价正是给这套编队作战降补给。

想把这套打法立刻落地,可以直接照着这份Claude Code子代理实战手记配置子代理的 model 字段,把原来填 haiku 的位置原地升级到 5.5;手记里还有社区生产口径的分工经验——查找摘要类交给 Haiku,多文件改动交给 Sonnet,架构决策交给 Opus,而 Haiku 5.5 恰好把第一条线的性价比重新定了一次价。Claude Code 侧也有配套动作:v2.1.292 版本为 Agent 工具新增了 effort 参数,子代理可以在更低的 effort 档位上进一步省成本。发布、调价、工具链三件事节奏对齐,明显是成套设计的。

如果说子代理是暗线,明线就是与 GPT-6 Luna 的贴身肉搏。Luna 在 OpenAI 的定位同样是低价高速档:短提示档两家分毫不差,打成平手;但缓存读是 Luna 的强项,0.01 美元对上 Haiku 5.5 未单列的缓存价,上下文复用率高的 agent 工作流里这个差距会被持续放大。四个小模型摆在同一张桌上的完整比价——包括开源自部署的第三条路线——我们在这篇小模型价格战横评里展开过,结论按需求给出、不做无压测仲裁,选型前值得对照着读一遍:同样的预算,买 API 的便利还是买自主可控,两条路线的成本结构完全不同。

模型家族的价值在梯队而不在单点。Haiku 5.5 把梯队的最底层压到二十分之一的价格,等于把整个 Claude 梯队的使用门槛重新定了一次:主控用 Sonnet 5.5 或 Opus 5,兵员用 Haiku 5.5,整套 agent 编队的月账单可以比上代组合砍掉一大截。这才是「小模型价格战」五个字的真正分量。

据报道:IPO 前的排兵布阵

最后交代背景,以下均为据报道的媒体口径。一个月之内,5.5 家族连发三款,从 Opus 5.5 到 Sonnet 5.5 再到这次的 Haiku 5.5,这样的密集节奏在 Anthropic 历史上没有先例。路透在报道中把这场密集发布与 IPO 议程联系在一起:据报道,Anthropic 已于 6 月 1 日向美国证券交易委员会保密递交上市申请,市场传闻其将在 10 月登陆纳斯达克,估值传闻一度高达约两万亿美元。

报道口径听个意思就好,保密递交与最终挂牌之间隔着完整的审计与路演流程,变量很多。但有一个逻辑是稳的:在向公开市场讲故事之前,把「最便宜最快最强小模型」这张牌打出来,再用随发的缓存减价把整个平台的用云成本拉低一截,价格竞争力这条叙事线确实会完整许多。是不是刻意为之,留给时间验证,但时间点本身就值得记录。

上线前怎么选:一张决策卡

综合以上,选型可以收拢成四句话。

高吞吐、短提示、成本敏感的场景——客服分流、批量分类、数据抽取、日志压缩、摘要生成——Haiku 5.5 现在就是默认答案,0.1 美元的输入价加上 1M 上下文,把过去要精打细算的账变成了随手可跑的账。

编码子代理场景——主控保留 Sonnet 5.5 或 Opus 5,查找、摘要、轻量分析下放给 Haiku 5.5,再叠加缓存读减半,多数 agentic 工作流的成本官方口径能降约 20%。子代理具体怎么写配置、哪些坑要避开,照着上面的子代理手记抄作业即可。

长上下文批量场景要多算一步——提示经常超过 100K 的话,记住 Haiku 5.5 在这个档位输入是 0.5 美元,比 Luna 的 0.2 美元贵 2.5 倍,这时 Luna 的价格表更值得细看,别被短提示档的同价错觉带偏。

最后留一个观察点:SWE-bench 成绩至今未公布,编码能力的关键数据缺口还开着,等官方补上那天,这张决策卡大概还要再更新一版。价格战已经开打,接下来看的,是谁先补齐数据,谁先亮出下一张牌。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-10-08

相关文章

前沿热点

一条回复80万行:谷歌Argon把编程分刷到77.9

谷歌 DeepMind 2026-09-30 发布 Gemini 4 家族首款旗舰 Gemini 4 Argon(官方口径):主打长程复杂工作流——真实软件工程、法律金融知识工作、网络防御。核心变化:输出上限从 64K 拉到 100 万 token(约 16 倍);官方基准表 DeepSWE v1.1 得 77.9% 列 SOTA(对比 GPT-6 Astra 74.1、Claude Opus 5.5 74.2),AutomationBench 51.3% 第一,CWE-bench v1 68% 并列第一,GraphWalks 长上下文 256k-1M 档 84.2%。短板如实写入:FrontierSWE v2 55.0 低于 Astra 65.5,Terminal-bench 4.0 57.4 低于 Opus 5.5 66.4——本篇归因为题型差异(长程卷子赢、终端小步卷子输),官方未解释。内部案例:Fuchsia Zircon 内核 80 万+行 C/C++→Rust 迁移;libgav1 替换 3.2 万行 SIMD 代码快 2.7 倍且逐帧一致;数据中心内存优化释放 300+ TiB。定价:引入期 $2/$10(缓存 95% off),期后 $4/$20。受控发布如实写:Fairwind Program 650+ 合作伙伴先行(受信防御者拿无 guardrails 版本),普通用户与付费 API 暂不可用、无日期。全部分数为谷歌自报。

2026年10月7日9 分钟阅读
前沿热点

Claude Sonnet 5.5发布:编程分10跳70,价格不变

Claude Sonnet 5.5 发布(2026-09-28 美东,官方口径):Claude 5.5 系列第二款,定位 Opus 5.5 的更快更低成本互补,Claude 平台与 AWS Bedrock/Google Cloud Vertex/Microsoft Azure 三云同步上线,Claude Code 同日整合。核心数字:Terminal-Bench 4.0 从 Sonnet 5 的 10.3% 跳到 70.6%(同基准不同代,近七倍);CursorBench 4.0 得 55.5%(Opus 5.5 为 57.8%);OSWorld 2.1 57.0% 到 80.1%;GDPval-AA 仅比 Opus 5.5 低 2 分;输出速度提升超 30%、多数工作每任务成本最高降 30%。价格策略:单价与 Sonnet 5 完全持平($2/$10,缓存 $0.20),降价藏在省 token 里。安全:Sonnet 系列首次拿到与 Opus/Fable 同级的网络安全防护,新增防推理提取分类器与高风险请求自动回退。另首款仅凭截图通关《宝可梦 红》的 Sonnet。竞争背景:两天后 Gemini 4 Argon 发布(受控发布,输出 100 万 token),GPT-6.1 Astra 因安全原因推迟;企业客户占 Anthropic 业务约 80%,处于 IPO 前奏(Reuters 口径)。Haiku 5.5 数周内发布(规格未公布不编)。

2026年10月5日9 分钟阅读
前沿热点

Anthropic 冲 2 万亿估值 IPO:先给华尔街画了张 30 万亿美元的饼

《华尔街日报》8 月 25 日报道:Anthropic 在 IPO 招股书中提出超过 30 万亿美元的潜在市场规模(TAM)预测,超过 SpaceX 的 28.5 万亿美元纪录,成为商业史上最庞大的市场叙事。其测算逻辑不是现有软硬件销售额,而是全球所有「可被 AI 模型替代或完成的工作」的全部经济价值与劳动力成本。计划 2026 年秋季挂牌、目标募资最高 1000 亿美元、估值锚定 2 万亿美元--距 5 月 9000 亿美元私募估值四个月再翻 2.2 倍。底气是 2026 Q2 单季营收 116 亿美元并首次实现调整后营业利润为正;风险是数据中心建设受阻、海外低价模型竞争与二级市场容错率降低。9 月招股书正式披露是下一个节点。

2026年8月26日6 分钟阅读