首页

硬核横评

主流 AI 工具的真实场景对比测试,含独家数据与对比表格。

Agent长上下文成本横评:只算工具调用的账

本篇不比能力、只算账,主题是 Agent 长上下文与多轮轨迹的上下文成本(与站内 8-26 图像模型能力横评、批次 22 的图像成本账明确分工)。开篇给出可复算的单轮成本公式,并点明常驻前缀是每轮都要重付的那一笔。随后横向对比五根杠杆——前缀缓存、KV Cache 压缩与稀疏注意力、上下文压缩折叠、工具输出裁剪、轨迹重放改增量提交——各自的收益量级、实现成本、风险与适用场景,配五杠杆对照表与三类场景(单任务 10 轮工具调用、长轨迹编程 Agent、批量离线任务)成本结构表,并按个人、小团队、批量三种量级给出杠杆优先级。所有单价一律符号化(P_in / P_out / P_cache)或标注「以官方定价页为准」,量级判断均标注工程估算口径,不伪装成实测。冷思考:厂商的「降本 X%」通常是特定 workload 下的最优值,真正决定账单的是缓存命中率、上下文分布与工具输出长度,建议自建度量而不是采信发布数字。

闭源 API 与开源权重:一张图到底谁更省

ChatGPT Images 2.5 与蚂蚁开源 LLaDA-Image 同周撞车,文生图进入闭源 API 与开源自部署的分野期。本篇不算画质、只算成本与可控性账:闭源 API、开源权重自部署、第三方按秒计费平台、本地消费级硬件、国产云 API 五条路线,按 100 张/天与 10000 张/天两档量级推算单张成本,配对比表与分场景选型(个人玩票/电商批量/数据敏感/需微调品牌风格/追求最强画质),并点名许可证未标注、按秒计费冷启动、中文渲染、数据出境四类坑。与站内 8-26 推理式图像模型能力横评明确分工,代表性对比非亲自压测,价格以官网为准。

英伟达130亿收HF:开源模型托管5强横评与选型

英伟达收购 Hugging Face 后,"开源模型放哪儿、跑哪儿"成为必答题。本篇横评五个模型托管与分发平台:Hugging Face(Hub+Spaces+Inference Providers)、ModelScope 魔搭(国内合规与下载优势)、Replicate(按秒计费一键 API 化)、fal.ai(生成式推理见长)、OpenRouter(多模型聚合路由)。含官网 2026-09 快照价格(HF PRO \$9/月、Replicate T4 \$0.000225/秒、fal Serverless H100 低至 \$1.89/时等)、大对比表与分场景选型;并声明与站内 API 网关横评的上下游分工。代表性对比,非亲自压测。

CodeArena 横评:Fable 5.1 守擂,Qwen 1/8 价逼近

CodeArena 是 LMArena 运营的前端编程榜(端到端生成 Web 应用,人类偏好 Elo)。截至 2026-09-03 真实格局:Claude Fable 5.1 以 1765 领榜(\$40/M),Qwen3.8-Max-0902 首日 1691、现约 1688(\$5/M,仅 1/8 价逼近前排),Gemini 3.8 Flash 1567(廉价版 #18),Kimi K3 约 1674;GPT-6 Astra 刚 9/3 发布、编程分待更新。核心启示:Elo 是偏好非正确率,选模型要看性价比与自身需求。

GPT-6 Astra 登顶后,四大旗舰真实差距

GPT-6 Astra 发布后,把四大同档旗舰放一张表硬核横评:Astra、Claude Fable 5.1、Gemini 3.8 Flash、GPT-5.6 Sol。结论分维度:推理数学 Astra 近乎满分(FrontierMath T4 97.6%、ARC-AGI-3 99.9%),Sol 的 ARC-AGI-3 仅 7.8%;编码 Agent 必须分版本看 Terminal-Bench——Astra 4.0 版 57.9% 居首,Gemini 在 2.1 版 89.4% 但 4.0 版仅 19.1%;SWE-bench Pro 上 Fable 5.1 的 81.2% 最高;计算机使用 OSWorld 2.0 Astra 72.6% 领先;网络安全 ExploitBench Astra 100%;对齐越权率 Astra 0% 对 Sol 48% 是最大鸿沟。性价比:优惠期 Gemini \$0.75/\$3.75 最低,Astra 与 Fable 同为 \$10/\$50。

编码推理旗舰横评:五款同档模型真实差距

2026 年 8 月底至 9 月初,Gemini 3.8 Flash、Qwen3.8-Max-0902、Muse Spark 1.3、Claude Fable 5.1 与 GPT-5.6 Sol 扎堆发布,构成一轮"coding agent"军备竞赛。横评按价格哲学分两档:便宜工作马(Gemini $0.75、Muse $1.25)拼单任务成本;高端前沿(Fable $10/$50、GPT-5.6 Sol $4/$20)。最大陷阱是基准版本碎片化——Qwen 用 TerminalBench 3.0、Fable 用 4.0、其余用 2.1,绝不可摆在一列硬比;本文所有表严格按版本拆分。价值标杆:Muse(智能指数 61、单任务约 $0.40)与 Gemini(近 Opus 5 编码、单价 1/7)最划算;Fable 5.1 拿下 agentic 科学(Terminal-Bench-Science 52.6%)与 SWE-bench Pro(81.2%)。分数均厂商/第三方口径,未确认项已标注。

缓存经济学:命中率如何决定 agentic 真实账单

2026-09-01 Fable 5.1 把 cache read 单价从 $1 降至 $0.25/M(降幅 75%),社群欢呼"agent 更便宜",但账单是单价乘以 token 结构:cache read 占比越低,降幅落到总成本越有限。本文拆 token 为四类(fresh input / cache write / cache read / output),给成本公式,按四种负载档位做敏感性分析——占比 10% 仅省约 7.5%、33% 约 25%、60% 约 45%(基于官方降幅的推演,非实测)。结论:单价只是第四位因素,命中率、布局稳定、轮次与输出长度更关键;六个工程前提把命中率做上去(前缀不变、布局稳定、turn-scoped 指令、服务端裁剪历史、按频率选 TTL、命中率可观测)。跨厂商横向套用须按官网 2026-09-02 快照填六维向量。

一个 agent 被攻破就全盘失守:四套凭证与权限治理方案横评

凭据从配置项变成了攻击面,但绝大多数团队防线还停在"给 agent 套个沙箱"。本文与站内沙箱隔离横评明确分工:沙箱管"代码在哪跑",凭据治理管"密钥怎么用、动作谁批、凭据能不能外带"。对比 OpenClaw 2.0、OpenWorker、OpenHuman 与传统密钥托管四套方案,按凭据生命周期六环节(存/用/批/外带/审计/多 agent)拆:OpenClaw 掩码请求 + opt-in proxy 目标白名单;OpenWorker hard floors + 自主权阶梯 + reviewer model + 熔断器,且无人值守绝不自批;OpenHuman Privacy Mode 在 Rust core 强制 + agent 间 E2E 加密。二手数据(SaaS Sentinel 转述,未找到一手报告)显示 1 个 agent 妥协概率 0.24、7 个升到 0.86,风险随数量超线性增长——前提是"任一 agent 提议即执行"。

涨价之后怎么选:11 个模型的真实 token 成本横评,把峰谷、缓存与 tokenizer 三重口径算进去

模型标价至少套着三层衣服,只看标价等于只看最外面那层:时段(DeepSeek 8 月 17 日起峰谷计价,工作日 9:00–12:00 与 14:00–18:00 为高峰、闲时减半、周末全天闲时,同一模型单价差一倍)、缓存(命中前缀缓存的输入 token 单价远低于标准输入,变量不在厂商手里而在你的提示词结构里)、分词(Sonnet 5 换分词器后相同输入映射 1.0 到 1.35 倍 token 数,且倍数随内容类型浮动)。本文统一口径为「综合单价 =(输入单价 + 输出单价)÷ 2」,即假设输入输出 token 数量相等,作为中立起点,再给三种典型负载比重的重算结果,并覆盖 11 个模型的标价、缓存命中价、峰谷价与分词放大后的实际位置。结论不是「哪个模型最便宜」,而是「不存在最便宜的模型,只存在对你这个负载最便宜的模型」——脱离输入输出比重、缓存命中率与内容类型给出的比价,只是在比标价而非比成本。国内模型价格来自 2026-08-24 逐页复核、8-28 再复核的官方定价页速查表,海外价格来自 2026-08-31 汇总,存在口径冲突的项目文中逐条标注。未做实际调用压测。

稀疏注意力五强横评:QSA 挑 token、GDN 压历史、DSA 复用索引,长上下文用不用得起看这一层

长上下文的注意力成本,各家是用不同办法打下来的——本篇按「架构路线」而非参数或价格给开放权重旗舰分个类。主角 Qwen3.8-Flash-Next 走 GDN 压缩历史 + QSA 微块粒度挑重点的混合路线(125B 主模型 + 51B N-gram embedding,每 token 激活 6B,原生 262,144 可 YaRN 外推到 1M);对照 Hy4 preview 的 Gated DSA 加 IndexCache 跨层索引复用、GLM-5.3-Flash 的稀疏与线性注意力混合、以及 DeepSeek 的 DSA 路线。路线分野归纳为三类:稀疏挑 token、线性/递归压缩、以及两者混合;再用参数、激活比、上下文、许可证与 API 价格快照做辅助列。与站内两篇旧横评分工:那两篇分别算 320B 级 API 价格账与 700B-2.8T 级部署门槛账,本篇只算架构路线账。选型结论给出五条场景路线,并提醒一句:激活比省的是算力,注意力机制决定的是长上下文能不能用得起;协议未确认的模型,商用前先查模型页。