首页

硬核横评

主流 AI 工具的真实场景对比测试,含独家数据与对比表格。

闭源 API 与开源权重:一张图到底谁更省

ChatGPT Images 2.5 与蚂蚁开源 LLaDA-Image 同周撞车,文生图进入闭源 API 与开源自部署的分野期。本篇不算画质、只算成本与可控性账:闭源 API、开源权重自部署、第三方按秒计费平台、本地消费级硬件、国产云 API 五条路线,按 100 张/天与 10000 张/天两档量级推算单张成本,配对比表与分场景选型(个人玩票/电商批量/数据敏感/需微调品牌风格/追求最强画质),并点名许可证未标注、按秒计费冷启动、中文渲染、数据出境四类坑。与站内 8-26 推理式图像模型能力横评明确分工,代表性对比非亲自压测,价格以官网为准。

英伟达130亿收HF:开源模型托管5强横评与选型

英伟达收购 Hugging Face 后,"开源模型放哪儿、跑哪儿"成为必答题。本篇横评五个模型托管与分发平台:Hugging Face(Hub+Spaces+Inference Providers)、ModelScope 魔搭(国内合规与下载优势)、Replicate(按秒计费一键 API 化)、fal.ai(生成式推理见长)、OpenRouter(多模型聚合路由)。含官网 2026-09 快照价格(HF PRO \$9/月、Replicate T4 \$0.000225/秒、fal Serverless H100 低至 \$1.89/时等)、大对比表与分场景选型;并声明与站内 API 网关横评的上下游分工。代表性对比,非亲自压测。

CodeArena 横评:Fable 5.1 守擂,Qwen 1/8 价逼近

CodeArena 是 LMArena 运营的前端编程榜(端到端生成 Web 应用,人类偏好 Elo)。截至 2026-09-03 真实格局:Claude Fable 5.1 以 1765 领榜(\$40/M),Qwen3.8-Max-0902 首日 1691、现约 1688(\$5/M,仅 1/8 价逼近前排),Gemini 3.8 Flash 1567(廉价版 #18),Kimi K3 约 1674;GPT-6 Astra 刚 9/3 发布、编程分待更新。核心启示:Elo 是偏好非正确率,选模型要看性价比与自身需求。

GPT-6 Astra 登顶后,四大旗舰真实差距

GPT-6 Astra 发布后,把四大同档旗舰放一张表硬核横评:Astra、Claude Fable 5.1、Gemini 3.8 Flash、GPT-5.6 Sol。结论分维度:推理数学 Astra 近乎满分(FrontierMath T4 97.6%、ARC-AGI-3 99.9%),Sol 的 ARC-AGI-3 仅 7.8%;编码 Agent 必须分版本看 Terminal-Bench——Astra 4.0 版 57.9% 居首,Gemini 在 2.1 版 89.4% 但 4.0 版仅 19.1%;SWE-bench Pro 上 Fable 5.1 的 81.2% 最高;计算机使用 OSWorld 2.0 Astra 72.6% 领先;网络安全 ExploitBench Astra 100%;对齐越权率 Astra 0% 对 Sol 48% 是最大鸿沟。性价比:优惠期 Gemini \$0.75/\$3.75 最低,Astra 与 Fable 同为 \$10/\$50。

编码推理旗舰横评:五款同档模型真实差距

2026 年 8 月底至 9 月初,Gemini 3.8 Flash、Qwen3.8-Max-0902、Muse Spark 1.3、Claude Fable 5.1 与 GPT-5.6 Sol 扎堆发布,构成一轮"coding agent"军备竞赛。横评按价格哲学分两档:便宜工作马(Gemini $0.75、Muse $1.25)拼单任务成本;高端前沿(Fable $10/$50、GPT-5.6 Sol $4/$20)。最大陷阱是基准版本碎片化——Qwen 用 TerminalBench 3.0、Fable 用 4.0、其余用 2.1,绝不可摆在一列硬比;本文所有表严格按版本拆分。价值标杆:Muse(智能指数 61、单任务约 $0.40)与 Gemini(近 Opus 5 编码、单价 1/7)最划算;Fable 5.1 拿下 agentic 科学(Terminal-Bench-Science 52.6%)与 SWE-bench Pro(81.2%)。分数均厂商/第三方口径,未确认项已标注。

缓存经济学:命中率如何决定 agentic 真实账单

2026-09-01 Fable 5.1 把 cache read 单价从 $1 降至 $0.25/M(降幅 75%),社群欢呼"agent 更便宜",但账单是单价乘以 token 结构:cache read 占比越低,降幅落到总成本越有限。本文拆 token 为四类(fresh input / cache write / cache read / output),给成本公式,按四种负载档位做敏感性分析——占比 10% 仅省约 7.5%、33% 约 25%、60% 约 45%(基于官方降幅的推演,非实测)。结论:单价只是第四位因素,命中率、布局稳定、轮次与输出长度更关键;六个工程前提把命中率做上去(前缀不变、布局稳定、turn-scoped 指令、服务端裁剪历史、按频率选 TTL、命中率可观测)。跨厂商横向套用须按官网 2026-09-02 快照填六维向量。

一个 agent 被攻破就全盘失守:四套凭证与权限治理方案横评

凭据从配置项变成了攻击面,但绝大多数团队防线还停在"给 agent 套个沙箱"。本文与站内沙箱隔离横评明确分工:沙箱管"代码在哪跑",凭据治理管"密钥怎么用、动作谁批、凭据能不能外带"。对比 OpenClaw 2.0、OpenWorker、OpenHuman 与传统密钥托管四套方案,按凭据生命周期六环节(存/用/批/外带/审计/多 agent)拆:OpenClaw 掩码请求 + opt-in proxy 目标白名单;OpenWorker hard floors + 自主权阶梯 + reviewer model + 熔断器,且无人值守绝不自批;OpenHuman Privacy Mode 在 Rust core 强制 + agent 间 E2E 加密。二手数据(SaaS Sentinel 转述,未找到一手报告)显示 1 个 agent 妥协概率 0.24、7 个升到 0.86,风险随数量超线性增长——前提是"任一 agent 提议即执行"。

涨价之后怎么选:11 个模型的真实 token 成本横评,把峰谷、缓存与 tokenizer 三重口径算进去

模型标价至少套着三层衣服,只看标价等于只看最外面那层:时段(DeepSeek 8 月 17 日起峰谷计价,工作日 9:00–12:00 与 14:00–18:00 为高峰、闲时减半、周末全天闲时,同一模型单价差一倍)、缓存(命中前缀缓存的输入 token 单价远低于标准输入,变量不在厂商手里而在你的提示词结构里)、分词(Sonnet 5 换分词器后相同输入映射 1.0 到 1.35 倍 token 数,且倍数随内容类型浮动)。本文统一口径为「综合单价 =(输入单价 + 输出单价)÷ 2」,即假设输入输出 token 数量相等,作为中立起点,再给三种典型负载比重的重算结果,并覆盖 11 个模型的标价、缓存命中价、峰谷价与分词放大后的实际位置。结论不是「哪个模型最便宜」,而是「不存在最便宜的模型,只存在对你这个负载最便宜的模型」——脱离输入输出比重、缓存命中率与内容类型给出的比价,只是在比标价而非比成本。国内模型价格来自 2026-08-24 逐页复核、8-28 再复核的官方定价页速查表,海外价格来自 2026-08-31 汇总,存在口径冲突的项目文中逐条标注。未做实际调用压测。

稀疏注意力五强横评:QSA 挑 token、GDN 压历史、DSA 复用索引,长上下文用不用得起看这一层

长上下文的注意力成本,各家是用不同办法打下来的——本篇按「架构路线」而非参数或价格给开放权重旗舰分个类。主角 Qwen3.8-Flash-Next 走 GDN 压缩历史 + QSA 微块粒度挑重点的混合路线(125B 主模型 + 51B N-gram embedding,每 token 激活 6B,原生 262,144 可 YaRN 外推到 1M);对照 Hy4 preview 的 Gated DSA 加 IndexCache 跨层索引复用、GLM-5.3-Flash 的稀疏与线性注意力混合、以及 DeepSeek 的 DSA 路线。路线分野归纳为三类:稀疏挑 token、线性/递归压缩、以及两者混合;再用参数、激活比、上下文、许可证与 API 价格快照做辅助列。与站内两篇旧横评分工:那两篇分别算 320B 级 API 价格账与 700B-2.8T 级部署门槛账,本篇只算架构路线账。选型结论给出五条场景路线,并提醒一句:激活比省的是算力,注意力机制决定的是长上下文能不能用得起;协议未确认的模型,商用前先查模型页。

腾讯 770B 只激活 49B:五款万亿级开源旗舰横评,决定部署成本的不是总参数

Hy4 preview(770B/49B)发布把开源旗舰的参数军备推到新高,但决定部署成本的不是总参数:激活参数省的是算力,权重驻留吃的是显存。本篇横评五款开放权重旗舰--Hy4 preview、GLM-5.3、Kimi K3(2.8T)、DeepSeek V4(1.6T 口径)、Qwen3.8-Max(2.4T)--按总参/激活比、上下文、许可证、显存门槛(工程估算口径)与 API 价格快照逐项对表。与 8-27 价格横评分工:那篇算 320B 级 API 账,本篇算 700B-2.8T 级参数与部署门槛账。五条按场景结论:追最新选 Hy4(Apache 2.0+MTP 投机解码+FP8 友好)、要参数规模选 K3、要成熟生态选 GLM/DeepSeek、阿里系合规选 Qwen,以及共同一条--先看每 token 成本与稀疏注意力,再看总参。