前沿热点
前沿热点

Meta Muse Spark 1.1:扎克伯格重返 X,1M 上下文 agentic 模型与 Meta 首个付费 API

2026 年 7 月 9 日扎克伯格时隔三年重返 X 发布 Muse Spark 1.1,1M 上下文 agentic 模型,$1.25/$4.25 定价,配 Meta 首个付费 API。agentic 工具使用跑分领先(MCP Atlas 88.1/JobBench 54.7),但独立智能指数仅 51、coding 与长程 GDPval-AA v2 落后;发布半月后 Opus 5/GPT-5.6 上场使其位置被动,真正卖点是极低单价下的 token 效率(每任务约 $0.26)。

发布于 2026年7月31日7 分钟阅读
<!-- muse-spark-1-1-hotspot | hotspot | Meta Muse Spark 1.1:扎克伯格重返 X,1M 上下文 agentic 模型与 Meta 首个付费 API -->

2026 年 7 月 9 日,Meta CEO 马克·扎克伯格时隔三年重返 X(原 Twitter)发帖,宣布发布 Muse Spark 1.1——这是 Meta 超级智能实验室(Superintelligence Labs)挂牌后的首个重大模型,也是 4 月原版 Muse Spark 的升级版。同一天上线的还有 Meta Model API,这是 Meta 有史以来第一个面向开发者的付费商业 API,意味着多年来"免费送 Llama"的路线正式转向。扎克伯格给它的定位是"a strong agentic and coding model at a very low price"(一个低价、强 agentic 和编程能力的模型):1M token 上下文窗口,定价 $1.25/$4.25(每百万输入/输出 token)。但发布两周后 Anthropic 的 Opus 5(7 月 24 日)和 GPT-5.6 相继上场,它的竞争位置被动了。下面拆开看。

一、发布事实与规格

发布本身有两条信号。第一,扎克伯格上一次发 X 是 2023 年 7 月(平台改名 X 前后),这次隔了整整三年回来,只为发这一个模型,说明 Meta 把它当作战略级发布。第二,Muse Spark 1.1 出自 Meta 超级智能实验室,是该实验室成立后的第一个成果,前身是 4 月的原版 Muse Spark,1.1 是大版本升级。TechCrunch 的评价很直白:Meta 在这条线上"略落后于对手",因为 Anthropic 和 OpenAI 早就有同类 agentic 模型,但这不代表 Meta 入场没有威胁。

规格上,Muse Spark 1.1 是多模态推理模型,主打 agentic 任务——即让模型自己规划、调用工具、操作界面、跨应用把一件事做完。核心参数:1M token 上下文窗口,且能主动管理自己的内存(把早期工作压缩、保留后面需要的步骤);支持 computer use(桌面、移动、浏览器三类界面);能作为"主 agent"收集上下文、制定计划,再把执行委托给并行运行的子 agent。定价 $1.25/$4.25(每百万输入/输出 token),低于基本所有前沿对手;新账号送 $20 免费额度;API 兼容 OpenAI 格式,迁移成本低。它在 Meta AI app 和 meta.ai 以"Thinking"模式运行,普通用户也能用上。截至 2026-07-31,公开预览仅限美国开发者,格局仍在实时变动。

二、Agentic 能力与跑分:强项与短板

agentic 是这次真正的卖点,但跑分要分清口径。Meta 自己发布的对比表里,Muse Spark 1.1 在多个 agentic 评测上领先:MCP Atlas(缩放工具使用,覆盖 36 个 MCP 服务器、220 个工具)88.1,高于 Opus 4.8 的 82.2、Gemini 3.1 Pro 的 78.2、GPT-5.5 的 75.3;JobBench(专业工具使用)54.7,高于 Opus 4.8 的 48.4、GPT-5.5 的 38.3;Finance Agent v2 拿 57.2,也高于 Opus 4.8 和 GPT-5.5;Humanity's Last Exam(带工具)62.1,高于 Opus 4.8 的 57.9。这些数字是 Meta 设计并自报的对比,多家第三方都注明"独立复刻当时不可得",读的时候要打折。

独立口径更值得看。Artificial Analysis 给 Muse Spark 1.1 的智能指数是 51,比原版 Muse Spark 1.0 的 43 涨了 8 分(三个月内),增长集中在科学推理、编程和知识。但这个 51 和领先梯队差距明显:Claude Fable 5 是 60、GPT-5.6 Sol 是 59、Claude Opus 4.8 是 56,都在 56-60 区间,Muse 落后约 5-9 分;它实际是与 GLM-5.2、GPT-5.4、GPT-5.6 Luna 在 51 这档"实质并列"。更关键的是 Artificial Analysis 点明的一句:agentic knowledge work 虽然大幅进步,但"在 GDPval-AA v2 上仍落后前沿"——GDPval-AA v2 这个长程 agentic 知识工作评测,Muse 约 1380 Elo,落后 Opus 4.8 的 1600 和 GPT-5.5 的 1494。

编程这条线也不算它的强项。Terminal-Bench 2.1(终端编程)80.0,落后 Opus 4.8 的 82.7 和 GPT-5.5 的 83.4;SWE-Bench Pro(软件工程)61.5,落后 Opus 4.8 的 69.2,但领先 GPT-5.5 的 58.6。一句话总结:它强在"跨工具编排和短程专业工具调用",弱在"长程 agentic 知识工作和纯编程"。榜单截至 2026-07-31 实时变动。

三、竞争位置:发布半月后的新格局

判断 Muse Spark 1.1 的位置,得看它发布时对标谁、以及发布后谁上场了。7 月 9 日发布时,Meta 明确把它对标 GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro——当时的前沿。扎克伯格在 X 上称它超越 Gemini 3.1 Pro,并在某些领域击败 Anthropic 和 OpenAI 的模型。在 Meta 自报的 agentic 工具使用榜上,它确实排在 Opus 4.8 和 GPT-5.5 前面。

但半个月后格局变了。7 月 24 日 Anthropic 发 Opus 5,智能指数 61、Agent 指数 55.3,双榜登顶;GPT-5.6 Sol 也到 59。截至 2026-07-31,Muse Spark 1.1 的智能指数 51 已落后领先梯队约 9-10 分。换句话说,它发布时够着了 7 月初的前沿,但没够着 7 月底的新前沿。

它的真正卖点不在智能顶峰,而在"极低价格下的 token 效率"。Artificial Analysis 给了一组数:跑完整个智能指数,Muse Spark 1.1 用了 94M output token,少于 GPT-5.4 的 109M、GPT-5.6 Luna 的 125M、GLM-5.2 的 141M;按 $1.25/$4.25 算,每智能指数任务约 $0.26,低于 GLM-5.2 的 $0.37,约为 GPT-5.4 的 $0.89 的三分之一。它是"实质并列 51 分那档里最省 token、也最便宜"的一个。这是 Meta 这次发牌的真正杀伤力——不是靠跑分登顶,是靠把前沿 agentic 能力的单价压到地板。

四、对开发者与普通人的实际影响

对开发者,Muse Spark 1.1 的意义首先是 Meta Model API 这个"首个付费开发者产品"本身。多年免费送 Llama 的路线结束了,Meta 正式进场卖 API,而且 OpenAI 兼容格式意味着迁移成本很低,$20 免费额度可以先试。要不要切上去,看你手里的活:如果是跨大量 MCP 工具的编排、短程专业工具调用、需要主 agent 调度并行子 agent,它的 MCP Atlas 和 JobBench 数字是实打实的强项,值得一试;如果是纯代码维护(SWE-Bench Pro 那类)或长程 agentic 知识工作(GDPval-AA v2),Opus 4.8 / Opus 5 和 GPT-5.5 / GPT-5.6 仍更稳。关键是别被 Meta 自报表带跑,要在自己的工作负载上比"每完成一个任务的成本"——这是它唯一真正领先对手的维度。

对普通人,Muse Spark 1.1 已进 Meta AI app 和 meta.ai 的"Thinking"模式,消费端直接能用。这背后是 Meta 的一贯打法:把前沿 agentic 能力塞进大众产品,靠规模摊薄成本。普通人不需要纠结智能指数 51 vs 61 的差距,日常问答、写作哪个便宜模型都够;Muse 的价值在"要它自己跨好几个应用、调好几个工具把一件事做完"的那种活。

一个新模型、扎克伯格三年后重返 X、Meta 首个付费 API,三件事叠在一起听着像大事件,但落地只看一件事:你那个最需要"跨工具跑长流程"的活,它的单价和 token 效率,能不能比现在用的模型更低、出错率可接受。能,这次切换就值;不能,就等它把 GDPval-AA v2 和编程短板补上再回头看。榜单和价格都在实时变动,别把今天的 51 和 $0.26 当成定论。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-07-31

相关文章