2026 年 10 月的小模型档位,价格牌在一天之内被摆成了同样的数字。10 月 7 日 Anthropic 发布 Claude Haiku 5.5,输入价直接打到 0.1 美元每百万 token,官方口径称其为「最便宜、最快、能力最强的小模型」;而在 OpenAI 的定价页上,GPT-6 Luna 的短提示档早就写着 0.1 美元输入、0.5 美元输出。两家厂商在小模型这个档位正面撞价,这就是本篇横评的起点。
我们把四款代表性选手拉上同一张表:Claude Haiku 5.5、GPT-6 Luna、Claude Sonnet 5.5,以及走开源自部署路线的 Qwen3.8-27B。
先立纪律,这段话决定全文怎么读。第一,本篇认真比的只有价格与工程属性:单价、上下文、缓存、可调 effort,这些是可以直接对齐的维度。第二,能力基准各引各的官方自报数,跨基准严禁互比,各家评测集与跑法不同,把不同表格里的分数摆在一起排名就是误导。第三,全部价格为 2026 年 10 月 8 日各自官方定价页快照口径,档位阈值随文标注。第四,站内一贯立场:没有自己的压测,就不做能力仲裁,结论按需求给。
一、价格战是怎么打起来的
据 Reuters 与官方发布口径,Haiku 5.5 是 5.5 家族一个月内发布的第三款模型,前有 Opus 5.5,同时随发的还有 Sonnet 5.5 的一次调价。这次随发最值得注意的动作其实不是 Haiku 本身,而是 Sonnet 5.5 的缓存读价格直接减半,从 0.2 美元降到 0.1 美元每百万 token,官方称多数 agentic 任务的推理成本因此下降约 20%。据公开报道,这一轮密集发布被解读为 Anthropic 在上市前的排兵布阵:据报道其已于 6 月保密递交 SEC 文件,市场传闻 10 月在纳斯达克挂牌,估值口径流传至约 2 万亿美元,以上全部是报道口径,不写死。
价格战的另一端是 OpenAI。GPT-6 Luna 不但把短提示档压到与 Haiku 5.5 相同的 0.1 美元,缓存读价格更是低到 0.01 美元每百万 token。第三方开源路线也在这张牌桌上:Qwen3.8-27B 以 Apache-2.0 协议放出权重,把「每百万 token 的价格」直接改写成「一台 GPU 的摊销」。
三方合围之下,小模型的价格竞争已经不是单纯的降价,而是换计价单位。这件事为什么值得单开一篇横评?因为小模型恰恰是token消耗量最大的那一层。真正跑在生产管线里的负载,大头往往不是人跟旗舰模型聊天,而是成千上万次自动发起的小调用:分类一条工单、摘要一份文档、在代码库里找一处引用。这些调用单次便宜到可以忽略,累积起来却常常超过旗舰模型的账单。把这一层的单价从一美元打到一毛美元,等价于把整条自动化管线的预算红线重新画一遍。这正是本篇把三家的价格表并排放在一起逐格核对的原因。
二、对比总表
价格均为各自官方定价页 2026 年 10 月 8 日快照口径,档位阈值随文标注;基准分数为各厂官方自报,跨基准严禁互比。
| 维度 | Claude Haiku 5.5 | GPT-6 Luna | Sonnet 5.5 | Qwen3.8-27B 自部署 |
|---|---|---|---|---|
| 输入/输出美元每百万 token | 0.10/0.50(提示<100K 档);0.50/2.50(≥100K 档) | 0.10/0.50(≤272K 档);0.20/0.75(>272K 档) | 2/10 | 权重免费,Apache-2.0,自备 GPU |
| 上下文 | 100 万 token | 100 万 token,最大输出 12.8 万 | 以官方口径为准 | 262,144 原生,可扩至 100 万 |
| 缓存 | 定价页未单列 | 读 0.01,写 0.125 | 读 0.10(减半后) | 无 API 缓存计费概念 |
| 可调 effort | 有,首个 Haiku 级模型 | 有,none 到 max 多档 | 有 | reasoning_effort 可调,thinking 可关 |
| 视觉 | 发布口径未列 | 图像输入 | 有 | 原生图像与视频理解 |
| 官方自报基准 | TB4 39.2%、OSWorld 72.4%、GDPval 1620 | 以 OpenAI 官方口径为准,本篇不转录 | TB4 70.6%、GDPval 1840 | 无横向同表,以模型卡为准 |
| 适合谁 | 高吞吐子代理、客服、浏览器操作 | 批量分类、抽取、长文档处理 | 主力编码与 agent 主控 | 数据私有、批量离线 |
三、逐款细看:各自说了什么
Claude Haiku 5.5:把子代理的成本打下来
Haiku 5.5 于 10 月 7 日发布,API 标识为 claude-haiku-5-5,官方定位是高吞吐、成本敏感的任务:摘要、压缩、数据库查询、分类,以及与 Opus 和 Sonnet 5.5 搭档充当编码子代理;官方同时称其为自家最快模型,瞄准实时客服与浏览器操作。定价上,提示不足 100K token 的档位输入 0.1 美元、输出 0.5 美元,官方称较 Haiku 4.5 平均省约 75%,该档位降幅约九成;而此前 Haiku 的请求约九成提示都不足 100K,等于绝大多数存量场景直接吃满新价。上下文从 Haiku 4.5 的 20 万 token 升到 100 万,并且成为首个支持可调 effort 的 Haiku 级模型,同一请求内可以在成本与智能之间二选一。这两项放在一起看,工程含义很直接:过去受限于 20 万窗口而不得不拆段处理的长材料,现在可以整段塞进去;而对延迟与成本都敏感的批量任务,可以把 effort 压低换吞吐,遇到难样本再升档,一个模型内部就能分出两条成本线。发布与定价的完整拆解可读站内专文 Claude Haiku 5.5 发布全解。
官方自报的基准成绩包括:GDPval-AA v2.1 得分 1620,Haiku 4.5 同表为 735;OSWorld 2.1 离线口径 72.4%;Terminal-Bench 4.0 为 39.2%;HLE 无工具口径 45.9%;FrontierCode 1.1 Main 为 46.4%。这里要注意两点:这些全部是厂商自报口径;SWE-bench 官方未公布,任何拿 Haiku 4.5 那个 73.3% 来冒充 5.5 的说法都不可信。客户侧,Asana 自报任务完成延迟下降 30%、每个 agent 回合推理快 2.5 倍,客户数据仅作参考。安全侧,官方称这是首个内置网络安全 safeguards 的 Haiku,权限比 Sonnet 5.5 宽松但仍禁渗透测试类用途。可用性上,Claude Platform、AWS Bedrock、Google Cloud、Azure 四个渠道即日同步。
GPT-6 Luna:缓存读 0.01 美元的账
Luna 的定价结构来自 OpenAI 官方页:提示不超过 272K token 时,输入 0.1 美元、输出 0.5 美元;超过 272K 后为 0.2 美元与 0.75 美元。上下文 100 万 token,最大输出 12.8 万。缓存读 0.01 美元、写 0.125 美元,这个读价是本表四款里最低的账面数字,对常驻系统提示很长的 agentic 负载来说,等于把重复计费的那部分几乎抹掉。可调 effort 从 none 到 max 多档,支持图像输入。这里值得注意的是 272K 这个阈值本身的含义:它比 Haiku 5.5 的 100K 分界线宽出一倍多,意味着大量中长文档可以留在短档计费区间里,不用为「够不够长」这件事操心。最大输出 12.8 万 token 对批量抽取类任务也是实打实的余量,一次调用能吐出的结构化结果更多,拆包调用次数就少。接入路径与调用示例可看 GPT-6 Sol 与 Luna 的 API 调用指南。能力数据方面,本篇不转录别家对照表里的 Luna 分数,统一以 OpenAI 官方口径为准,这正是跨基准禁互比纪律的用意。
Sonnet 5.5:减半后的缓存价比牌面价更值得看
Sonnet 5.5 的牌面价格是输入 2 美元、输出 10 美元,比两个小模型高一个数量级,但它在这个横评里的位置不是「更贵的选项」,而是主控与子代理搭配里的那个主控。随 Haiku 5.5 发布,其缓存读价格减半至 0.1 美元,官方称多数 agentic 任务成本下降约 20%,对一个把大量 token 花在重复前缀上的编码主控来说,这一刀砍在最高频的计费项上。官方自报基准包括 Terminal-Bench 4.0 为 70.6%、GDPval 1840、HLE 有工具口径 64.5%。搭配的经济学也值得说透:主控每一步决策都贵,但步数少;子代理每一步便宜,但步数以百计。把查找、摘要、分类这类高频低难度动作路由给 0.1 美元档的子代理,把多文件改动与调试留在 Sonnet 档,是这套搭配成立的前提。发布时的完整口径整理在 Claude Sonnet 5.5 发布专文。
Qwen3.8-27B:把价格表换成电费单
Qwen3.8-27B 走的是另一条路:权重以 Apache-2.0 协议开放,自备 GPU 部署,边际推理成本只剩电费与硬件折旧。显存方面,BF16 口径约 55.6GB,量化后 GGUF Q4_K_M 约 19GB;上下文原生 262,144 token,可扩至 100 万;reasoning_effort 可调,thinking 可关;原生支持图像与视频理解。第三方口径 llm-explorer 与 ggml-org 显示其月下载量约 103 万次,社区活跃度可见一斑。它没有 API 缓存计费的概念,也没有与闭源模型横向同表的基准,能力以官方模型卡为准。自部署路线的账要换一套算法:没有按百万 token 的标价,只有一次性的硬件投入和按月摊销的折旧、电费与人力,调用量越大,单次成本越摊越薄,反之则可能比 API 还贵。想走同系列本地部署路线的读者,Qwen3.8-Flash 本地部署 SOP 里的硬件清单与量化选型方法可以直接复用。
四、核心账目:长提示档的价差
这是全篇最值得较真的一节,因为「同价」两个字有严格的前提。
短提示档,Haiku 5.5 与 Luna 账面打平:前者在提示不足 100K 时收 0.1 美元输入、0.5 美元输出,后者在不超过 272K 时收同样的数字。但两者的档位阈值不同,Haiku 5.5 的分界线在 100K,Luna 在 272K。于是从提示超过 100K 那一刻起,账就分叉了。
提示在 100K 到 272K 之间时,Haiku 5.5 已跳入长提示档,输入 0.5 美元、输出 2.5 美元;Luna 仍按短档收 0.1 与 0.5,此时 Luna 的输入单价只有 Haiku 的五分之一。提示超过 272K 后,Luna 进入其长档,输入 0.2 美元、输出 0.75 美元;对照 Haiku 5.5 的 0.5 与 2.5,输入价差 2.5 倍,输出价差约 3.3 倍。
换句话说,「0.1 美元俱乐部」的会员资格只在提示不超过 100K 时对两家同时有效。处理长文档、长代码库检索这类负载时,Luna 的账面优势会随提示长度放大;而 Haiku 5.5 官方称其约九成请求提示都在 100K 以内,这个价差对它的典型场景影响有限。两家的定价,都精准对着自家的典型负载。
这段价差可以直接复算成钱。假设一份 20 万 token 的代码库检索提示要重复跑 50 次:Haiku 5.5 已进入长档,输入侧每次为 20 万 token 乘以 0.5 美元每百万,即 0.1 美元,50 次合计 5 美元;Luna 未超过 272K,仍按短档计费,每次 0.02 美元,50 次合计 1 美元。同样的活,输入侧账面差 5 倍。这段算术只用两家官方定价页的单价,不涉及任何能力判断,实际支出还会受缓存命中与输出长度影响,但数量级不会变。
缓存维度再补一刀:Luna 缓存读 0.01 美元,Sonnet 5.5 减半后 0.1 美元,同样命中缓存,每百万 token 的读价差 10 倍;Haiku 5.5 的定价页未单列缓存价。对常驻前缀巨大的 agent 负载,这一项对总账的影响可能超过输入单价本身。
五、按需求给结论
高吞吐子代理、实时客服、浏览器操作,选 Haiku 5.5:它的定价结构与官方「最快模型」定位都对着这个场景,Asana 的客户自报也指向低延迟。
批量分类、抽取、长文档处理,选 GPT-6 Luna:长提示档输入 0.2 美元加缓存读 0.01 美元构成账面最低组合,短档同价之下它还多出 172K 的阈值缓冲。
主力编码与 agent 主控,选 Sonnet 5.5:能力档与缓存减半后的 0.1 美元读价是主控位置的合理解,与 Haiku 5.5 组成主从搭配。
数据私有、批量离线、已有 GPU,选 Qwen3.8-27B:免权重加可关 thinking 的组合适合夜间批处理,代价是自己扛运维与吞吐调优。
再强调一次:以上全部基于官方定价页快照与厂商自报数据,本篇没有跑过任何压测,不做能力仲裁。
FAQ
Q1: 四款里到底谁最便宜? A1: 分档看。提示不超过 100K 时,Haiku 5.5 与 Luna 同为输入 0.1 美元、输出 0.5 美元;提示更长时 Luna 明显更便宜,272K 以上输入价差 2.5 倍。Sonnet 5.5 贵一个数量级但能力档不同。Qwen3.8-27B 权重免费,但要自担 GPU、电费与运维,量大且数据敏感才划算。
Q2: Haiku 5.5 的 SWE-bench 成绩是多少? A2: 官方未公布。网上若有引用 73.3% 的说法,那是 Haiku 4.5 的数字,拿来冒充 5.5 均不可信,一切以官方后续公布为准。
Q3: 0.1 美元每百万 token 是什么量级? A3: 按短提示档口径,处理 100 次各 1 万 token 的输入,输入侧合计约 0.1 美元。真正的变量是输出与缓存:长输出按 0.5 美元输出价另算,高频重复前缀按缓存读价另算,这两项对总账的影响往往更大。
Q4: 自部署 Qwen3.8-27B 一定更省吗? A4: 不一定。BF16 需要约 55.6GB 显存,Q4_K_M 量化约 19GB,硬件折旧、电费与人力都要摊进每一次调用。月下载 103 万的社区热度说明生态可用,但只有吞吐量大、数据不出域两个条件同时成立时,自部署的账才算得过来。
Q5: 为什么缓存读价格这么重要? A5: agentic 负载的典型形态是同一份常驻前缀被反复携带计费。缓存命中后,Luna 读价 0.01 美元、Sonnet 5.5 减半后 0.1 美元,每百万 token 差 10 倍;选型时这一项对总账的影响常常超过输入单价本身。各价均为官方定价页快照口径。