2026 年 10 月 7 日周三,Anthropic 正式发布 Claude Haiku 5.5,API 模型 id 为 claude-haiku-5-5,Claude 平台与 AWS Bedrock、Google Cloud、Azure 同日全线上线。按官方口径,这是目前「最便宜、最快、也最能打的小模型」,主打高吞吐、成本敏感的任务,典型场景包括摘要、压缩、数据库查询和分类;同时它也是官方全家桶里速度最快的一档,面向实时客服、浏览器操作这类对延迟苛刻的应用。这篇文章把发布信息逐条拆开:价格怎么读、基准怎么看、与 GPT-6 Luna 怎么对标、以及上线前怎么选。所有数字均为官方口径或明确标注来源的转述口径,未公布项一律不编。
发布信息拆条:四条主线一起看
第一条,价格直接跳水。提示长度不足 100K 的请求,输入 0.1 美元一百万 token、输出 0.5 美元一百万 token;提示达到或超过 100K 之后,价格变为输入 0.5 美元、输出 2.5 美元。官方给了一个很关键的背景数据:此前 Haiku 系列约九成的请求提示长度都在 100K 以下,也就是说绝大多数真实流量都会落进跳水后的最便宜档。与上一代 Haiku 4.5 相比,官方口径称平均能省约 75%,而在 100K 以下这个档位,降幅约达九成。
第二条,上下文一口气拉到 1M token。上一代 Haiku 4.5 还是 200K,这次直接翻五倍。小模型配上百万级上下文,意味着过去必须交给大模型的「读完整代码库再总结」「吞下一整份长文档再抽取」类任务,现在可以用最便宜的一档来跑,成本结构完全不同了。
第三条,可调 effort 档位首次下放到 Haiku 级别。这是首个支持可调 effort 的 Haiku 系模型,档位与 Sonnet、Opus 同款,同一次请求里可以在成本与智能之间二选一:追求响应速度就调低,追求质量就调高,一个模型两头吃。
第四条,安全策略同步更新。官方称 alignment 评估全面改善,出现失准行为的情况更少;它还是首个内置网络安全 safeguards 的 Haiku,整体策略比 Sonnet 5.5 宽松,但渗透测试类用途依然被禁止;生物学能力的安全边界与 Sonnet 5、Sonnet 5.5、Opus 5 持平。同日官方还开放了 Cyber Verification Program 的三个档位。
此外还有一条容易被略过的:Max 与 Team 订阅用户新增了月度 API 额度,订阅与 API 之间的边界又松动了一步,重度用户值得去后台确认自己的额度变化。
定价:二十分之一的价格从哪来,长提示档才是照妖镜
先算 Anthropic 自家内部的账。Sonnet 5.5 目前的价格是输入 2 美元、输出 10 美元,Haiku 5.5 在 100K 以下档位输入 0.1 美元、输出 0.5 美元,输入价正好是 Sonnet 5.5 的二十分之一。这就是「用二十分之一的价格跑 Sonnet 级编码子代理」这个说法的出处,也是本次发布最锋利的一根钩子。
比单价更值得注意的是随发的那条调价:Sonnet 5.5 的缓存读价格直接减半,从 0.2 美元降到 0.1 美元。官方口径称,多数 agentic 任务的整体成本因此下降约 20%。上一批 Sonnet 5.5 发布时我们算过一轮成本账,见Sonnet 5.5发布拆解:编程分与价格策略,当时缓存读 0.2 美元已经是相当激进的定价,这篇拆解现在得更新了。缓存密集型的 agent 工作流是这次减半的最大受益者:子代理每轮回读上下文的成本直接腰斩,而这类回读恰恰是 agent 账单里最沉默也最沉重的一块。
再把镜头拉向竞品。GPT-6 Luna 的完整价格表在那篇GPT-6 Sol与Luna发布拆条里整理过:提示不超过 272K 时输入 0.1 美元、输出 0.5 美元,缓存读仅 0.01 美元;超过 272K 之后变为输入 0.2 美元、输出 0.75 美元,上下文同样是 1M。
对标结论就很有意思了。短提示档,Haiku 5.5 与 Luna 完全同价,0.1 美元对 0.1 美元,正面硬刚;但长提示档一过线,画风立刻反转——Haiku 5.5 在 100K 以上输入收 0.5 美元,Luna 在 272K 以上只收 0.2 美元,同样喂一百万 token 的长提示,Haiku 5.5 反而比 Luna 贵 2.5 倍。所谓「同价」只在提示不超过 100K 的区间内成立。官方那句「九成请求低于 100K」的数据,恰好说明它把重兵布在了自己最舒服的区间,而对手的长提示腹地它并没有去冲。这是本次核真里最值得记住的一处细节:如果你的场景是长文档、长上下文批量处理,0.1 美元这个直觉价签会骗人,先看清楚自己请求的提示长度落在哪一档。
补一笔经济账帮助建立体感:0.1 美元一百万输入 token,换算下来大约一美分可以买十万 token 的输入。千字级文档的分类、抽取、摘要,单次成本被压到接近忽略不计。对每天跑上百万次请求的客服分流、内容分类、日志压缩类业务而言,过去算不过来的账,现在都能算得过来了。
基准成绩:官方口径全在表里,SWE-bench 缺席
老规矩,先立口径:下表全部为厂商自报的官方口径数字,本站未做独立复核;不同基准之间禁止互相比较,只看同一基准内的相对位置。
| 基准 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1(offline) | 72.4% | 15.7% | 48.9% | 83.9% |
| HLE(无工具) | 45.9% | 10.2% | 未列 | 56.9% |
| HLE(带工具) | 57.4% | 18.7% | 未列 | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 Main | 46.4% | 未列 | 42.4% | 52.1%(Xhigh 档) |
| Chartography 视觉推理(无工具) | 46.4% | 6.4% | 29.1% | 61.6% |
几处值得圈出来。Terminal-Bench 4.0 上,Haiku 4.5 是 0.0%,Haiku 5.5 直接跳到 39.2%,代际提升幅度在整张表里最扎眼,终端侧编码任务从几乎不可用变成了多数场景可一试。OSWorld 2.1 的 72.4% 配合「官方最快模型」的定位,指向浏览器操作与桌面自动化这类实时场景。HLE 带工具 57.4%,与 Sonnet 5.5 的 64.5% 差距已经不大,小模型在高难度推理上的下限被明显抬高了。
必须单独拎出来的是缺席者:SWE-bench 官方没有公布 Haiku 5.5 的成绩,第三方媒体 startupfortune 也指出了这一点。这里立一条硬规矩:不要拿 Haiku 4.5 时代的 73.3% 来替 5.5 挡枪,代际不同就是不同,等官方补数再下结论。对把编码能力当作第一决策依据的读者,这是一条暂时的信息缺口,选型时要么自己压测,要么等数据。
客户侧数据方面,Asana 给出了自报口径:接入后任务完成延迟下降 30%,每个 agent 回合的推理速度提升 2.5 倍。注意这是客户自报数据,代表个案权益,不等于基准分数,参考即可。
子代理才是主战场:与 GPT-6 Luna 的明暗两条线
把基准表和定价表叠在一起看,Anthropic 这步棋的意图相当清楚:Haiku 5.5 不是给你拿来日常闲聊的,它是给 agent 大军当兵员的。官方在发布口径里明说了定位——与 Opus 5 和 Sonnet 5.5 搭档,充当编码子代理。主控模型负责架构决策与复杂推理,海量廉价的查找、摘要、分类、抽取任务全部下放给 Haiku 5.5 去跑。这也解释了为什么缓存读减半的调价要跟着一起发:子代理每轮回读上下文的成本,往往比生成新内容还高,减半的缓存读价正是给这套编队作战降补给。
想把这套打法立刻落地,可以直接照着这份Claude Code子代理实战手记配置子代理的 model 字段,把原来填 haiku 的位置原地升级到 5.5;手记里还有社区生产口径的分工经验——查找摘要类交给 Haiku,多文件改动交给 Sonnet,架构决策交给 Opus,而 Haiku 5.5 恰好把第一条线的性价比重新定了一次价。Claude Code 侧也有配套动作:v2.1.292 版本为 Agent 工具新增了 effort 参数,子代理可以在更低的 effort 档位上进一步省成本。发布、调价、工具链三件事节奏对齐,明显是成套设计的。
如果说子代理是暗线,明线就是与 GPT-6 Luna 的贴身肉搏。Luna 在 OpenAI 的定位同样是低价高速档:短提示档两家分毫不差,打成平手;但缓存读是 Luna 的强项,0.01 美元对上 Haiku 5.5 未单列的缓存价,上下文复用率高的 agent 工作流里这个差距会被持续放大。四个小模型摆在同一张桌上的完整比价——包括开源自部署的第三条路线——我们在这篇小模型价格战横评里展开过,结论按需求给出、不做无压测仲裁,选型前值得对照着读一遍:同样的预算,买 API 的便利还是买自主可控,两条路线的成本结构完全不同。
模型家族的价值在梯队而不在单点。Haiku 5.5 把梯队的最底层压到二十分之一的价格,等于把整个 Claude 梯队的使用门槛重新定了一次:主控用 Sonnet 5.5 或 Opus 5,兵员用 Haiku 5.5,整套 agent 编队的月账单可以比上代组合砍掉一大截。这才是「小模型价格战」五个字的真正分量。
据报道:IPO 前的排兵布阵
最后交代背景,以下均为据报道的媒体口径。一个月之内,5.5 家族连发三款,从 Opus 5.5 到 Sonnet 5.5 再到这次的 Haiku 5.5,这样的密集节奏在 Anthropic 历史上没有先例。路透在报道中把这场密集发布与 IPO 议程联系在一起:据报道,Anthropic 已于 6 月 1 日向美国证券交易委员会保密递交上市申请,市场传闻其将在 10 月登陆纳斯达克,估值传闻一度高达约两万亿美元。
报道口径听个意思就好,保密递交与最终挂牌之间隔着完整的审计与路演流程,变量很多。但有一个逻辑是稳的:在向公开市场讲故事之前,把「最便宜最快最强小模型」这张牌打出来,再用随发的缓存减价把整个平台的用云成本拉低一截,价格竞争力这条叙事线确实会完整许多。是不是刻意为之,留给时间验证,但时间点本身就值得记录。
上线前怎么选:一张决策卡
综合以上,选型可以收拢成四句话。
高吞吐、短提示、成本敏感的场景——客服分流、批量分类、数据抽取、日志压缩、摘要生成——Haiku 5.5 现在就是默认答案,0.1 美元的输入价加上 1M 上下文,把过去要精打细算的账变成了随手可跑的账。
编码子代理场景——主控保留 Sonnet 5.5 或 Opus 5,查找、摘要、轻量分析下放给 Haiku 5.5,再叠加缓存读减半,多数 agentic 工作流的成本官方口径能降约 20%。子代理具体怎么写配置、哪些坑要避开,照着上面的子代理手记抄作业即可。
长上下文批量场景要多算一步——提示经常超过 100K 的话,记住 Haiku 5.5 在这个档位输入是 0.5 美元,比 Luna 的 0.2 美元贵 2.5 倍,这时 Luna 的价格表更值得细看,别被短提示档的同价错觉带偏。
最后留一个观察点:SWE-bench 成绩至今未公布,编码能力的关键数据缺口还开着,等官方补上那天,这张决策卡大概还要再更新一版。价格战已经开打,接下来看的,是谁先补齐数据,谁先亮出下一张牌。