前沿热点
前沿热点

Claude Opus 5 发布:登顶智能与 Agent 双榜

Anthropic 于 2026-07-24 发布 Claude Opus 5,在 Artificial Analysis 智能指数(61)与 Agent 指数(55.3)双双登顶,定价 $5/$25 与上代持平。它真正的护城河是 agentic 能力(AA-Briefcase/GDPval 大幅领先),但跑得慢、烧 token、幻觉率升至 50%,适合复杂长任务而非简单问答。

发布于 2026年7月31日5 分钟阅读
<!-- claude-opus-5-hotspot | hotspot | Claude Opus 5 发布:登顶智能与 Agent 双榜 -->

2026 年 7 月 24 日,Anthropic 发布 Claude Opus 5。这是它两个月内连发的第四款模型(前面是 Mythos 5、Fable 5、Sonnet 5)。在 Artificial Analysis 的榜单上,它同时拿下两个第一:智能指数 61 分、Agent 指数 55.3 分。一个模型在"聪明"和"能干活"两条线同时登顶,本身值得拆开看。大多数模型是"聪明的不一定能干、能干的不一定聪明"这两条线分开走,Opus 5 把它们叠到一起,是这次发布真正的信号。但"登顶"这个词必须带口径,下面逐条说清。

一、双榜登顶:含金量与口径

先看数字。Artificial Analysis 智能指数(Intelligence Index),Opus 5(max effort)61 分,第一;紧随其后是 Claude Fable 5 的 60 分、GPT-5.6 Sol 的 59 分、Kimi K3 的 57 分、上一代 Opus 4.8 的 56 分。Agent 指数(Agentic Index)上,Opus 5 以 55.3 分登顶,GPT-5.6 Sol 54.0 分第二,Fable 5 52.8 分第三。再往下,GLM-5.2 只有 43.1 分,Gemini 3.6 Flash 38.7 分,和第一梯队差距明显。

要理解这两个分,得先知道它们怎么算。智能指数是把多个 benchmark 归一化后的综合分;Agent 指数由 GDPval-AA v2 和 𝜏³-Banking 等 agentic 评测组成,测的是"模型配进 agent 框架后,能不能独立把一个专业任务跑完"。而 Opus 5 有五档 effort(low、medium、high、xhigh、max),档位越高、token 越多、回合越多,分也越高。上面这些分都标了 max effort,是它能跑出的最高分。

但这个"第一"得打折看。第一,智能指数 61 比 Fable 5 只高 1 分,Artificial Analysis 自己用的词是"narrowly the most intelligent"(险胜)和"effectively tied"(实质并列),不是断层领先。第二,两个榜的分数都是 benchmark 跑出来的,不是 Arena、EQ-Bench 那种人类投票分。截至 2026-07-31,Opus 5 还没进 Arena 和 Scale SEAL 投票榜,所以"登顶"指的是跑分榜,不是口碑榜。榜单实时变动,别把今天的 61 当成定论。

二、Agent 能力:这次真正的头条

比智能指数更值得看的是 agentic(智能体)能力,这是 Opus 5 真正拉开身位的地方。AA-Briefcase(agentic knowledge work 基准),Opus 5 拿到 1720 Elo,比 Fable 5 高 146;GDPval-AA v2 拿到 1861 Elo,比 Fable 5 高 114。Terminal-Bench v2.1(终端任务)89%。Coding Agent Index 上,Opus 5(xhigh)配 Claude Code 并列第一。科学推理上它也很猛:ARC-AGI 3 拿 30%,下一个最好的模型只有 8%,差了将近 4 倍,这条由 ARC Prize 独立确认过。

Anthropic 自己的描述是"thoughtful and proactive"(有判断、主动)。Simon Willison 7 月 24 日的博客里提到,他不在时 Opus 5 会"relentlessly proactive"(不停地主动推进,而不是干等指令)。他还特别点了一句:Opus 5 是"迄今最难被 prompt injection 攻破的模型"。对要把模型接进外部工具链、读不可信网页的团队,这条比跑分更值钱。

但 agentic 能力是有代价的。AA-Briefcase 任务里,Opus 5 在 max effort 下平均要跑 36.2 分钟、103 个回合,比 Opus 4.8 的 24.1 分钟、55 回合长出一半。换句话说,它"能干长活",但干得慢、烧 token。一个直观的对照:effort 从 low 到 max,GDPval-AA v2 的分能跨 407 个 Elo,token 用量相差约 8 倍。这意味着同一个 Opus 5,开 max 和开 low 是两个完全不同的成本曲线。

还有一个诚实的退步:hallucination(幻觉)率比 Opus 4.8 升了 14 个百分点到 50%--模型更爱"不确定也硬答";事实知识(AA-Omniscience)仍落后 Fable 5。所以别把它当百科全书用,它强在"把一件事跑完",不是"每条都答对"。在科学推理上也有短板:物理评测 CritPt 落后于 GPT-5.6 Sol 和 Terra,说明它不是每一科都第一。

三、对手站在哪:GPT-5.6 / Gemini / GLM

把 Opus 5 放回竞争格局里,它的位置是"双榜第一、但每个第一都有人咬得很紧"。智能指数上,GPT-5.6 Sol 59 分只差 2 分,且 token 单价 $2/$8 远低于 Opus 5 的 $5/$25,单算 token 便宜一大截。Fable 5 是 Anthropic 自家更强的旗舰,60 分只差 1 分,但定价 $10/$50 是 Opus 5 的两倍。Opus 5 的卖点正在于:用 Fable 5 一半的 token 价,逼近它的智能,agentic 上还反超它。

真正的对决是 Opus 5 / Fable 5 / GPT-5.6 Sol 三家在前排绞杀,Gemini 和 GLM 暂时还在后排。Coding Agent Index 上要分清:GPT-5.6 Sol 配 Codex 以 80 分独自领先,Opus 5(xhigh)配 Claude Code 是"并列第一"里的那份;Terminal-Bench 的 89% 也只是和 GPT-5.6 Sol 打平,不是反超。所以 coding 这条线上 Opus 5 没有智能和 agent 那么大的领先,更像是和 GPT-5.6 贴身肉搏。关键变量是"每完成一个任务的成本",不是单 token 价。Artificial Analysis 给了一组可对照的数:智能指数上每个任务的平均成本,Opus 5(max)$2.03、Fable 5(带 fallback)$2.75、Opus 4.8(max)$1.80、Sonnet 5(max)$1.53。单看 token 价 Opus 5 贵,但在 high/xhigh effort 下它能以更低单任务成本超过 Opus 4.8 和 Sonnet 5;低 effort 时,GPT-5.6 家族在"智能 vs 单任务成本"前沿上反而更优。简单任务用 Opus 5 是浪费,复杂推理和长 agent 任务才是它的主场。这里还有个省钱的杠杆:缓存命中 $0.50(九折)、Batch API 半价,长上下文和批量跑评测时一定要开。

四、对开发者与普通人的实际影响

对开发者,Opus 5 的意义是"长 agent 任务的可靠上限又抬了一截"。如果你在跑 Claude Code、多步代码维护、长流程知识工作,它值得切上去试。它有 100 万 token 上下文、最多 12.8 万 token 输出,知识截止 2026 年 5 月。定价 $5/$25(输入/输出,每百万 token),和 Opus 4.8 持平;Fast mode $10/$50、约 2.5 倍速,赶时间可选。但一定要在自己的工作负载上测"单任务成本",别被 token 单价误导。

还有一条常被忽略的红利:安全。Anthropic 把 Opus 5 列为"目前最能干的通用科研模型",Fable 5 上被拦的生物学相关请求现在改路由到 Opus 5;再加上它是最难被 prompt injection 攻破的一代,对要接外部数据源、跑长时无人值守 agent 的团队,这两点直接关系到能不能上线。

对普通人,Opus 5 已进 Claude 订阅(Pro $20/月起、Max $100/$200)。日常问答、写作,Sonnet 5($2/$10)甚至 Haiku 4.5($1/$5)就够了,Opus 5 是为"要它自己跑半小时把一件事做完"的那种活准备的。Claude 5 这一代已经铺成 Haiku、Sonnet、Opus、Fable 四档,从最便宜到最强旗舰,判断标准很简单:你这次的活,需要它自己来回跑几十个回合吗?需要,上 Opus 5;不需要,省下钱往下降一档。

一个新模型"双榜登顶"听着唬人,但落地只看一件事:它能不能在你那个最复杂、最耗时的任务上,比上一代少出几次错、少来回几次。能做到,这次升级就值。真正该做的不是刷榜看分,而是挑手里那个最费劲的活,让它和 Opus 4.8 各跑几遍,比出错率和来回次数--这才是榜单翻译成你工作量的唯一办法。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-07-31

相关文章