硬核横评
硬核横评

0.1美元俱乐部开战:小模型价格战四款横评

小模型价格战横评(2026-10-08 价格快照口径,五列四行):Claude Haiku 5.5、GPT-6 Luna、Sonnet 5.5、Qwen3.8-27B(开源自部署档)。价格行:Haiku 5.5 每百万 0.1/0.5 美元(<100K 提示档)、Luna 0.1/0.5 美元(≤272K)、Sonnet 5.5 单价 2/10 美元但缓存读减半至 0.1、Qwen3.8-27B 权重免费(Apache-2.0)自备 GPU。核心发现:短提示档 Haiku 5.5 与 Luna 同价打平,但 100K 以上 Haiku 5.5 输入价 0.5 美元 vs Luna 0.2 美元——「同价」只在短提示档成立,长文档批量任务账单会反转。基准各引各的官方数并标注(跨基准禁互比):Haiku 5.5 Terminal-Bench 4.0 39.2%、OSWorld 72.4%;Luna 未随文给新基准;Sonnet 5.5 TB4 70.6%;Qwen3.8-27B 无横向同表。可调 effort 档位对比(Haiku 5.5 首次下放 Haiku 级;Luna none→max)、上下文(Haiku/Luna 1M、Qwen 262K 可扩 1M)。结论按需求给:高吞吐子代理、批量分类、主力编码、私有化部署各归各位;本站无压测不仲裁。内链四篇同题专文做深读。

发布于 2026年10月8日10 分钟阅读
<!-- small-model-price-war-comparison-review | review | 0.1美元俱乐部开战:小模型价格战四款横评 -->

2026 年 10 月的小模型档位,价格牌在一天之内被摆成了同样的数字。10 月 7 日 Anthropic 发布 Claude Haiku 5.5,输入价直接打到 0.1 美元每百万 token,官方口径称其为「最便宜、最快、能力最强的小模型」;而在 OpenAI 的定价页上,GPT-6 Luna 的短提示档早就写着 0.1 美元输入、0.5 美元输出。两家厂商在小模型这个档位正面撞价,这就是本篇横评的起点。

我们把四款代表性选手拉上同一张表:Claude Haiku 5.5、GPT-6 Luna、Claude Sonnet 5.5,以及走开源自部署路线的 Qwen3.8-27B。

先立纪律,这段话决定全文怎么读。第一,本篇认真比的只有价格与工程属性:单价、上下文、缓存、可调 effort,这些是可以直接对齐的维度。第二,能力基准各引各的官方自报数,跨基准严禁互比,各家评测集与跑法不同,把不同表格里的分数摆在一起排名就是误导。第三,全部价格为 2026 年 10 月 8 日各自官方定价页快照口径,档位阈值随文标注。第四,站内一贯立场:没有自己的压测,就不做能力仲裁,结论按需求给。

一、价格战是怎么打起来的

据 Reuters 与官方发布口径,Haiku 5.5 是 5.5 家族一个月内发布的第三款模型,前有 Opus 5.5,同时随发的还有 Sonnet 5.5 的一次调价。这次随发最值得注意的动作其实不是 Haiku 本身,而是 Sonnet 5.5 的缓存读价格直接减半,从 0.2 美元降到 0.1 美元每百万 token,官方称多数 agentic 任务的推理成本因此下降约 20%。据公开报道,这一轮密集发布被解读为 Anthropic 在上市前的排兵布阵:据报道其已于 6 月保密递交 SEC 文件,市场传闻 10 月在纳斯达克挂牌,估值口径流传至约 2 万亿美元,以上全部是报道口径,不写死。

价格战的另一端是 OpenAI。GPT-6 Luna 不但把短提示档压到与 Haiku 5.5 相同的 0.1 美元,缓存读价格更是低到 0.01 美元每百万 token。第三方开源路线也在这张牌桌上:Qwen3.8-27B 以 Apache-2.0 协议放出权重,把「每百万 token 的价格」直接改写成「一台 GPU 的摊销」。

三方合围之下,小模型的价格竞争已经不是单纯的降价,而是换计价单位。这件事为什么值得单开一篇横评?因为小模型恰恰是token消耗量最大的那一层。真正跑在生产管线里的负载,大头往往不是人跟旗舰模型聊天,而是成千上万次自动发起的小调用:分类一条工单、摘要一份文档、在代码库里找一处引用。这些调用单次便宜到可以忽略,累积起来却常常超过旗舰模型的账单。把这一层的单价从一美元打到一毛美元,等价于把整条自动化管线的预算红线重新画一遍。这正是本篇把三家的价格表并排放在一起逐格核对的原因。

二、对比总表

价格均为各自官方定价页 2026 年 10 月 8 日快照口径,档位阈值随文标注;基准分数为各厂官方自报,跨基准严禁互比。

维度Claude Haiku 5.5GPT-6 LunaSonnet 5.5Qwen3.8-27B 自部署
输入/输出美元每百万 token0.10/0.50(提示<100K 档);0.50/2.50(≥100K 档)0.10/0.50(≤272K 档);0.20/0.75(>272K 档)2/10权重免费,Apache-2.0,自备 GPU
上下文100 万 token100 万 token,最大输出 12.8 万以官方口径为准262,144 原生,可扩至 100 万
缓存定价页未单列读 0.01,写 0.125读 0.10(减半后)无 API 缓存计费概念
可调 effort有,首个 Haiku 级模型有,none 到 max 多档有reasoning_effort 可调,thinking 可关
视觉发布口径未列图像输入有原生图像与视频理解
官方自报基准TB4 39.2%、OSWorld 72.4%、GDPval 1620以 OpenAI 官方口径为准,本篇不转录TB4 70.6%、GDPval 1840无横向同表,以模型卡为准
适合谁高吞吐子代理、客服、浏览器操作批量分类、抽取、长文档处理主力编码与 agent 主控数据私有、批量离线

三、逐款细看:各自说了什么

Claude Haiku 5.5:把子代理的成本打下来

Haiku 5.5 于 10 月 7 日发布,API 标识为 claude-haiku-5-5,官方定位是高吞吐、成本敏感的任务:摘要、压缩、数据库查询、分类,以及与 Opus 和 Sonnet 5.5 搭档充当编码子代理;官方同时称其为自家最快模型,瞄准实时客服与浏览器操作。定价上,提示不足 100K token 的档位输入 0.1 美元、输出 0.5 美元,官方称较 Haiku 4.5 平均省约 75%,该档位降幅约九成;而此前 Haiku 的请求约九成提示都不足 100K,等于绝大多数存量场景直接吃满新价。上下文从 Haiku 4.5 的 20 万 token 升到 100 万,并且成为首个支持可调 effort 的 Haiku 级模型,同一请求内可以在成本与智能之间二选一。这两项放在一起看,工程含义很直接:过去受限于 20 万窗口而不得不拆段处理的长材料,现在可以整段塞进去;而对延迟与成本都敏感的批量任务,可以把 effort 压低换吞吐,遇到难样本再升档,一个模型内部就能分出两条成本线。发布与定价的完整拆解可读站内专文 Claude Haiku 5.5 发布全解。

官方自报的基准成绩包括:GDPval-AA v2.1 得分 1620,Haiku 4.5 同表为 735;OSWorld 2.1 离线口径 72.4%;Terminal-Bench 4.0 为 39.2%;HLE 无工具口径 45.9%;FrontierCode 1.1 Main 为 46.4%。这里要注意两点:这些全部是厂商自报口径;SWE-bench 官方未公布,任何拿 Haiku 4.5 那个 73.3% 来冒充 5.5 的说法都不可信。客户侧,Asana 自报任务完成延迟下降 30%、每个 agent 回合推理快 2.5 倍,客户数据仅作参考。安全侧,官方称这是首个内置网络安全 safeguards 的 Haiku,权限比 Sonnet 5.5 宽松但仍禁渗透测试类用途。可用性上,Claude Platform、AWS Bedrock、Google Cloud、Azure 四个渠道即日同步。

GPT-6 Luna:缓存读 0.01 美元的账

Luna 的定价结构来自 OpenAI 官方页:提示不超过 272K token 时,输入 0.1 美元、输出 0.5 美元;超过 272K 后为 0.2 美元与 0.75 美元。上下文 100 万 token,最大输出 12.8 万。缓存读 0.01 美元、写 0.125 美元,这个读价是本表四款里最低的账面数字,对常驻系统提示很长的 agentic 负载来说,等于把重复计费的那部分几乎抹掉。可调 effort 从 none 到 max 多档,支持图像输入。这里值得注意的是 272K 这个阈值本身的含义:它比 Haiku 5.5 的 100K 分界线宽出一倍多,意味着大量中长文档可以留在短档计费区间里,不用为「够不够长」这件事操心。最大输出 12.8 万 token 对批量抽取类任务也是实打实的余量,一次调用能吐出的结构化结果更多,拆包调用次数就少。接入路径与调用示例可看 GPT-6 Sol 与 Luna 的 API 调用指南。能力数据方面,本篇不转录别家对照表里的 Luna 分数,统一以 OpenAI 官方口径为准,这正是跨基准禁互比纪律的用意。

Sonnet 5.5:减半后的缓存价比牌面价更值得看

Sonnet 5.5 的牌面价格是输入 2 美元、输出 10 美元,比两个小模型高一个数量级,但它在这个横评里的位置不是「更贵的选项」,而是主控与子代理搭配里的那个主控。随 Haiku 5.5 发布,其缓存读价格减半至 0.1 美元,官方称多数 agentic 任务成本下降约 20%,对一个把大量 token 花在重复前缀上的编码主控来说,这一刀砍在最高频的计费项上。官方自报基准包括 Terminal-Bench 4.0 为 70.6%、GDPval 1840、HLE 有工具口径 64.5%。搭配的经济学也值得说透:主控每一步决策都贵,但步数少;子代理每一步便宜,但步数以百计。把查找、摘要、分类这类高频低难度动作路由给 0.1 美元档的子代理,把多文件改动与调试留在 Sonnet 档,是这套搭配成立的前提。发布时的完整口径整理在 Claude Sonnet 5.5 发布专文。

Qwen3.8-27B:把价格表换成电费单

Qwen3.8-27B 走的是另一条路:权重以 Apache-2.0 协议开放,自备 GPU 部署,边际推理成本只剩电费与硬件折旧。显存方面,BF16 口径约 55.6GB,量化后 GGUF Q4_K_M 约 19GB;上下文原生 262,144 token,可扩至 100 万;reasoning_effort 可调,thinking 可关;原生支持图像与视频理解。第三方口径 llm-explorer 与 ggml-org 显示其月下载量约 103 万次,社区活跃度可见一斑。它没有 API 缓存计费的概念,也没有与闭源模型横向同表的基准,能力以官方模型卡为准。自部署路线的账要换一套算法:没有按百万 token 的标价,只有一次性的硬件投入和按月摊销的折旧、电费与人力,调用量越大,单次成本越摊越薄,反之则可能比 API 还贵。想走同系列本地部署路线的读者,Qwen3.8-Flash 本地部署 SOP 里的硬件清单与量化选型方法可以直接复用。

四、核心账目:长提示档的价差

这是全篇最值得较真的一节,因为「同价」两个字有严格的前提。

短提示档,Haiku 5.5 与 Luna 账面打平:前者在提示不足 100K 时收 0.1 美元输入、0.5 美元输出,后者在不超过 272K 时收同样的数字。但两者的档位阈值不同,Haiku 5.5 的分界线在 100K,Luna 在 272K。于是从提示超过 100K 那一刻起,账就分叉了。

提示在 100K 到 272K 之间时,Haiku 5.5 已跳入长提示档,输入 0.5 美元、输出 2.5 美元;Luna 仍按短档收 0.1 与 0.5,此时 Luna 的输入单价只有 Haiku 的五分之一。提示超过 272K 后,Luna 进入其长档,输入 0.2 美元、输出 0.75 美元;对照 Haiku 5.5 的 0.5 与 2.5,输入价差 2.5 倍,输出价差约 3.3 倍。

换句话说,「0.1 美元俱乐部」的会员资格只在提示不超过 100K 时对两家同时有效。处理长文档、长代码库检索这类负载时,Luna 的账面优势会随提示长度放大;而 Haiku 5.5 官方称其约九成请求提示都在 100K 以内,这个价差对它的典型场景影响有限。两家的定价,都精准对着自家的典型负载。

这段价差可以直接复算成钱。假设一份 20 万 token 的代码库检索提示要重复跑 50 次:Haiku 5.5 已进入长档,输入侧每次为 20 万 token 乘以 0.5 美元每百万,即 0.1 美元,50 次合计 5 美元;Luna 未超过 272K,仍按短档计费,每次 0.02 美元,50 次合计 1 美元。同样的活,输入侧账面差 5 倍。这段算术只用两家官方定价页的单价,不涉及任何能力判断,实际支出还会受缓存命中与输出长度影响,但数量级不会变。

缓存维度再补一刀:Luna 缓存读 0.01 美元,Sonnet 5.5 减半后 0.1 美元,同样命中缓存,每百万 token 的读价差 10 倍;Haiku 5.5 的定价页未单列缓存价。对常驻前缀巨大的 agent 负载,这一项对总账的影响可能超过输入单价本身。

五、按需求给结论

高吞吐子代理、实时客服、浏览器操作,选 Haiku 5.5:它的定价结构与官方「最快模型」定位都对着这个场景,Asana 的客户自报也指向低延迟。

批量分类、抽取、长文档处理,选 GPT-6 Luna:长提示档输入 0.2 美元加缓存读 0.01 美元构成账面最低组合,短档同价之下它还多出 172K 的阈值缓冲。

主力编码与 agent 主控,选 Sonnet 5.5:能力档与缓存减半后的 0.1 美元读价是主控位置的合理解,与 Haiku 5.5 组成主从搭配。

数据私有、批量离线、已有 GPU,选 Qwen3.8-27B:免权重加可关 thinking 的组合适合夜间批处理,代价是自己扛运维与吞吐调优。

再强调一次:以上全部基于官方定价页快照与厂商自报数据,本篇没有跑过任何压测,不做能力仲裁。

FAQ

Q1: 四款里到底谁最便宜? A1: 分档看。提示不超过 100K 时,Haiku 5.5 与 Luna 同为输入 0.1 美元、输出 0.5 美元;提示更长时 Luna 明显更便宜,272K 以上输入价差 2.5 倍。Sonnet 5.5 贵一个数量级但能力档不同。Qwen3.8-27B 权重免费,但要自担 GPU、电费与运维,量大且数据敏感才划算。

Q2: Haiku 5.5 的 SWE-bench 成绩是多少? A2: 官方未公布。网上若有引用 73.3% 的说法,那是 Haiku 4.5 的数字,拿来冒充 5.5 均不可信,一切以官方后续公布为准。

Q3: 0.1 美元每百万 token 是什么量级? A3: 按短提示档口径,处理 100 次各 1 万 token 的输入,输入侧合计约 0.1 美元。真正的变量是输出与缓存:长输出按 0.5 美元输出价另算,高频重复前缀按缓存读价另算,这两项对总账的影响往往更大。

Q4: 自部署 Qwen3.8-27B 一定更省吗? A4: 不一定。BF16 需要约 55.6GB 显存,Q4_K_M 量化约 19GB,硬件折旧、电费与人力都要摊进每一次调用。月下载 103 万的社区热度说明生态可用,但只有吞吐量大、数据不出域两个条件同时成立时,自部署的账才算得过来。

Q5: 为什么缓存读价格这么重要? A5: agentic 负载的典型形态是同一份常驻前缀被反复携带计费。缓存命中后,Luna 读价 0.01 美元、Sonnet 5.5 减半后 0.1 美元,每百万 token 差 10 倍;选型时这一项对总账的影响常常超过输入单价本身。各价均为官方定价页快照口径。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-10-08

常见问题

四款里到底谁最便宜?
分档看。提示不超过 100K 时,Haiku 5.5 与 Luna 同为输入 0.1 美元、输出 0.5 美元;提示更长时 Luna 明显更便宜,272K 以上输入价差 2.5 倍。Sonnet 5.5 贵一个数量级但能力档不同。Qwen3.8-27B 权重免费,但要自担 GPU、电费与运维,量大且数据敏感才划算。
Haiku 5.5 的 SWE-bench 成绩是多少?
官方未公布。网上若有引用 73.3% 的说法,那是 Haiku 4.5 的数字,拿来冒充 5.5 均不可信,一切以官方后续公布为准。
0.1 美元每百万 token 是什么量级?
按短提示档口径,处理 100 次各 1 万 token 的输入,输入侧合计约 0.1 美元。真正的变量是输出与缓存:长输出按 0.5 美元输出价另算,高频重复前缀按缓存读价另算,这两项对总账的影响往往更大。
自部署 Qwen3.8-27B 一定更省吗?
不一定。BF16 需要约 55.6GB 显存,Q4_K_M 量化约 19GB,硬件折旧、电费与人力都要摊进每一次调用。月下载 103 万的社区热度说明生态可用,但只有吞吐量大、数据不出域两个条件同时成立时,自部署的账才算得过来。
为什么缓存读价格这么重要?
agentic 负载的典型形态是同一份常驻前缀被反复携带计费。缓存命中后,Luna 读价 0.01 美元、Sonnet 5.5 减半后 0.1 美元,每百万 token 差 10 倍;选型时这一项对总账的影响常常超过输入单价本身。各价均为官方定价页快照口径。

相关文章

硬核横评

AI连干17小时vs16天:谁能真正替你加班

连续自主干活横评(2026-10-07 口径,与站内 10-05「单次输出容量」横评分轴不重测):看 AI 一次任务能连干多久、干成什么样。四行对比:蚂蚁 Ling-3.1-flash 约 17 小时从零写 Lua→x86-64 编译器(182 项测试过 178,官方自报)+ 约 20 小时 C 图像库移植 Rust 加速 8.015 倍(30 项检查全过);阿里 Qwen3.8-Max 16 天自主工程 oh-my-cli(265 commits/127 PRs/151 issues,GitHub trace 公开可查)+ 约 125 小时复现论文并反超(AIME24 49.58%→52.29%,7600 行代码、33 轮训练);谷歌 Argon 承接 80 万+行 Zircon 内核迁移、libgav1 快 2.7 倍(DeepSWE v1.1 77.9%,普通用户暂不可用);参照行 DeepSeek-V4-Flash-Vision-Exp 同卷 59.3%(MIT 可本地跑)。表格五列:模型/连续案例/可复核性/门槛与价格/口径。架构谱系专节回应「百灵和通义千问哪个好」:Ling 7 层 KDA+1 层 Gated MLA vs Qwen 3 层 Gated DeltaNet+1 层 Gated Attention,均 512 专家系。核真红线如实写:Qwen3.8-Max 开源权重是定制 qwen3.8-max license(收入分成、阈值未定稿)非 Apache 2.0(27B 小弟才是),开源版 text-only/强制 thinking ≠ API 版(视觉/1M/内置工具)——「半开源」争议两头呈现;4.89TB 权重需 24 GPU(BF16)/16(FP8)。全部数字官方自报,DeepSWE v1.1 只与 v1.1 同卷比。

2026年10月7日10 分钟阅读
硬核横评

一口气输出100万token:三款模型谁能接住长任务

四款编程/通用模型横评(2026-10-05 口径,与站内 9 月底价格横评分工不重测):以「单次输出上限」为轴——Gemini 4 Argon 把输出从 6.4 万 token 拉到 100 万(官方称行业第一),长任务战场换了维度。四个位置:受控新旗舰 Argon(9/30 发布,官方 18 项基准 13 项第一、DeepSWE v1.1 77.9% SOTA,但受控发布普通用户未开放,Artificial Analysis 独立口径略落后,介绍价 $2/$10 期后 $4/$20)、现役效率标杆 Sonnet 5.5(9/28,TB 4.0 70.6%,$2/$10,三云同步)、缓存性价比 Sol($2/$0.10/$10,缓存比标准输入便宜 95%)、开源对照 GLM-5.3(ModelScope 约 750GB 权重可自部署,国内 API $1.40/$4.40,开源编程 SOTA/CyberGym 84.5%)。红线执行:GLM 的 Terminal Bench 3.0 与 Sonnet 的 Terminal-Bench 4.0 不同版本严禁互比;Argon 官方与独立口径两头都写。无压测不做仲裁,按需求五路给结论:尝鲜等 Argon 开放、均衡性价比选 Sonnet 5.5、缓存跑 agent 选 Sol、多云部署 Sonnet、开源自部署 GLM-5.3。

2026年10月5日10 分钟阅读
硬核横评

30秒俱乐部开战:可灵4.0、Seedance 2.5谁值得等

四款视频模型横评(2026-10-03 口径,与本站 8 月五款闭源云端横评、Seedance 2.5 vs MiniMax H3 对垒篇分工互补不重测):以「单段 30 秒原生直出已成头部标配」为切入,按云端旗舰/现役标杆/云端性价比/开源自部署四象限选可灵 4.0(10 月上线,10-bit HDR、续拍 2 分钟、15 项参考,规格拉满未验证)、Seedance 2.5(已上线,30 秒直出 + 50 项参考 + 1 秒内局部编辑,徐工/小鹏/微分智飞生产落地)、Wan3.0(8 月 24 日上线,API 每秒 0.3 元起、五种办公文档直传变视频,无 Agent 能力需自做编排)、LTX-2.5(唯一开放权重,66GiB + 8 步蒸馏 + ltx-trainer,自定义社区许可收入门槛 1000 万美元)。无压测数据不做「谁第一」仲裁,按需求给结论:现成旗舰选 Seedance、规格派等可灵、性价比与批量选 Wan3.0、数据私有选 LTX-2.5。Sora 因信源矛盾不入场,Veo 未做一手核真不写。

2026年10月3日10 分钟阅读