2026 年 9 月 28 日,美团新一代大模型 LongCat-2.5-Preview 上线(官方口径,经 AI工具集转述)。参数表上最扎眼的一行是:总参数 1.6 万亿,每次推理仅激活约 480 亿。一个万亿级模型,推理时真正"醒来"的只有 48B,这是 MoE(混合专家)稀疏架构的典型设计:用巨大的总参数撑起知识容量,再用稀疏激活把单次推理的成本压下来。美团把这两件事同时推到了一个相当激进的程度。
但参数表只是开场。这一版 Preview 真正值得关注的,是三件事:原生多模态并入基座、面向 GUI Agent 的长流程定位,以及同时兼容 OpenAI 与 Anthropic 双协议的 API。同样值得写下来的,还有它"没做"的两件事:没有公开 benchmark 分数,没有放出模型权重。本文把这五件事一次讲清楚,规格照单全收,结论保持冷静。
需要先说明的是,名字里的"Preview"不是装饰。官方把它定义为新一代大模型的预览版,延续 LongCat-2.0 的架构路线(官方口径,经 AI工具集转述)。预览版意味着形态未定、后续可能还有正式版与更多能力补全,也意味着现在下任何长期结论都为时过早。下面先看它给了什么,再看它没给什么。
总参 1.6T,激活 48B:稀疏架构的算盘
先把架构这笔账算明白。MoE 架构的核心思路,是把一个巨型模型的参数拆成大量"专家"模块,每次推理只唤醒其中一小部分。总参数决定模型"知道多少",激活参数决定每次推理"动用多少"。LongCat-2.5-Preview 的组合是 1.6T 总参配 48B 激活(官方口径,经 AI工具集转述),属于业内最激进的那一档:容量向上看齐万亿俱乐部,成本向下贴近百亿级模型。
对用户来说,这套设计的实际意义是:你不需要为万亿级的知识容量支付万亿级的推理账单。上下文规格同样亮眼:原生 1M token 的窗口,最大输出 128K tokens(官方口径,经 AI工具集转述)。1M 窗口意味着整仓库代码、数百页文档或成批网页内容可以一次性放进上下文,这对后面要谈的 Agent 长流程是基础设施级的前提。
当然,稀疏架构也不是免费的午餐。总参与激活参之间的比例越大,对路由机制的要求就越高:哪些专家被唤醒、负载是否均衡、专家之间的知识是否冗余,都直接影响实际效果。这些设计细节官方目前没有展开,属于"架构路线确定、内部实现待披露"的状态。对普通用户而言,更实际的验证方式是关注同一任务在不同批次请求上的稳定性,因为稀疏激活的波动往往体现在长尾请求上,而不是跑分峰值上。
多模态并入基座:DiNA 路线
2.0 时代,LongCat 的图像与视频能力是拆在独立仓库里的;到了 2.5-Preview,图片理解被原生并入基座(官方口径,经 AI工具集转述)。路线层面,多模态承袭 LongCat-Next 验证的 DiNA(离散原生自回归)范式:把图像等模态词法化为离散 token,与文本统一建模(转述口径)。
这种做法的价值在于:多模态不再是外挂的"编码器加适配器",而是与文字共享同一套词表和推理路径。对 Agent 场景来说这一点很关键——看懂屏幕截图、表格与设计稿,和读懂自然语言指令,应当在同一个模型内部完成,而不是靠多个模型拼接。拼接式方案每多一次调用,就多一次信息损耗和一处故障点;原生统一建模则把整条感知与决策链路收进一个前向过程。
还有一个容易被忽略的工程红利:原生并入基座之后,图像理解可以直接复用文本侧已有的长上下文、工具调用与流式输出等基础设施,不需要为视觉单独维护一条服务链路。对 API 用户来说,这意味着发图片和发文字走同一套接口约定,集成成本更低。这也是把"多模态并入基座"写进发布要点,而不只是当作功能清单加一项的原因。
1M 上下文与 GUI Agent:瞄准长流程自动化
定位上,LongCat-2.5-Preview 明确面向终端、浏览器、GUI、电子表格、设计工具等长流程自主操作,延续 Agentic Coding 路线(官方口径,经 AI工具集转述)。所谓长流程,指的是几十步甚至上百步的连续操作:打开页面、定位控件、填写表单、核对结果、发现异常、回退重试。这条链路对模型的要求远高于单轮问答,指令跟随、视觉定位、状态记忆与错误恢复,缺一环就会在半路断掉。
GUI Agent 之所以成为各家旗舰的必争之地,是因为它对应着最直接的商业想象:让模型替人操作软件,而不是仅仅回答问题。LongCat-2.5-Preview 把 GUI 长流程写进产品定位,等于公开站到了这条赛道的头排。当然,定位是定位,实战是实战——目前同样没有公开评测能证明它在这条赛道上的名次,这一点下文详谈。
值得强调的是,长流程任务对模型的考验是多维叠加的。单步操作做对不难,难的是第几十步仍然记得第几步的目标;识别一个按钮不难,难的是页面加载失败、弹窗遮挡、控件换位时还能恢复执行。这类任务里,一环出错往往意味着整个流程作废重来,因此可靠的错误恢复能力比单点峰值性能更能决定可用性。评估这类模型,最好的样本不是精心准备的演示视频,而是自己业务里那些最琐碎、最易出错的日常流程。
双协议 API:一套模型,两种接法
接口层面是这次最实用的更新:API 同时兼容 OpenAI 与 Anthropic 双协议。OpenAI 格式的 base_url 为 https://api.longcat.ai/openai,Anthropic 格式的 base_url 为 https://api.longcat.ai/anthropic,模型 ID 均为 LongCat-2.5-Preview,平台入口在 https://longcat.ai/platform/(官方口径,经 AI工具集转述)。
双协议兼容意味着大量既有工具可以零改造接入。以 Claude Code 为例,按官方教程口径,只需设置三个环境变量:
export ANTHROPIC_BASE_URL=https://api.longcat.ai/anthropic
export ANTHROPIC_AUTH_TOKEN=你的令牌
export ANTHROPIC_MODEL=LongCat-2.5-PreviewOpenClaw、OpenCode、Codex、Kilo Code、Hermes 等工具同理,改 base_url 与模型名即可接入(官方教程口径)。对已经习惯 Anthropic 生态的开发者来说,这是门槛最低的试用方式:不换工具链,只换后端。
价格参照:和 Opus 5.5 摆在一起
计费按 token 套餐进行,注册赠送 500 万免费 tokens(转述口径)。作为参照,AI工具集对比表口径给出:Claude Opus 5.5 为每百万 tokens 输入 4 美元、输出 20 美元(约合 29 元与 143 元),上下文同样为 1M、最大输出 128K,但仅支持 Anthropic 协议。
对照下来,LongCat-2.5-Preview 在窗口规格上与 Opus 5.5 持平,协议兼容面更宽,注册赠送的 tokens 也足够跑完一轮中小规模的真实测试。至于模型能力是否处在同一档位,目前没有任何公开数据可以回答——这恰恰是下一篇要说的核心问题。
冷思考一:没有公开 benchmark
这是本文必须泼的一盆冷水:LongCat-2.5-Preview 目前没有公开 benchmark 分数,对比表中明确写着"无官方 benchmark"(AI工具集对比表口径)。
这不是小事。作为对照,Claude Opus 5.5 有公开评测可查,各家发布旗舰模型时通常也会附上成套的成绩单。而 LongCat-2.5-Preview 目前的所有能力描述都停留在官方口径的转述层面:架构是确定的,规格是确定的,但"跑分"完全没有。没有 benchmark 不代表模型不行,但它意味着三件事:第一,你无法把它与同档开源旗舰做定量比较,站内的开源旗舰横评一文之所以能成立,前提正是各家分数公开可查;第二,所有"能力对标"的说法只能存疑待验;第三,最可靠的评估方式只剩亲手实测,好在注册赠送的 500 万 tokens 让实测成本接近于零。
放在国产旗舰的坐标系里看,这件事更有意思。Qwen3 系列的更新节奏是公开发榜、用数据说话;Kimi K3 开放权重是把验证权直接交给社区;MiMo v2.6 则用具体场景的落地来证明自己。相比之下,LongCat-2.5-Preview 选择只发 API、不发分数、不发权重的第三条路,把验证责任完全推给了用户。理性的态度是把它当作一个"待验证的强规格候选",而不是已被证明的强者。
不发布评测,也可能是一种现实权衡:评测体系本身在 Agent 时代正在失真,公开榜单容易过拟合,刷榜与真实可用性之间的裂痕越来越大。美团选择让用户用真实工作流投票,逻辑上说得通,但这套逻辑成立的前提,是产品本身经得起日常使用的检验。换句话说,不发榜不是免检通行证,而是把口碑押注在了留存率上。
冷思考二:权重还没放出
第二个开放边界是开源状态。经 GitHub API 实核(2026-09-29),meituan-longcat 组织下共 30 个仓库,其中没有 LongCat-2.5-Preview 的仓库。组织最新推送是 9 月 24 日的 LongCat-DeepResearch(9 星)与 WBench(240 星)。组织内已有的模型仓包括 LongCat-2.0(565 星,MIT)、LongCat-Flash-Chat(1367 星,MIT)、LongCat-Video(8439 星,MIT)等。
也就是说,2.5-Preview 目前只通过 API 提供,权重未放出,这一点应如实写进所有使用决策里。考虑到 LongCat 系列此前有开源的惯例,2.0、Flash-Chat、Video 三个模型仓均为 MIT 协议,权重后续放出的可能性是存在的。但在官方宣布之前,任何"即将开源"的说法都只是猜测。对需要私有化部署、数据不出域的团队来说,现阶段只能观望,或选择已经开放权重的替代方案。
API-only 的状态对不同人群的意义并不相同。对个人开发者与初创团队,API 恰好是最快能跑起来的形态,配合赠送的 tokens 先验证场景,再决定要不要投入更深,顺序上没有问题。对企业用户则要谨慎:把生产流量接入一个预览版 API,等于把可用性与价格政策的双重不确定性写进依赖链,更稳妥的做法是先在旁路任务上灰度验证,同时保留备选模型的可切换性。这也是双协议兼容在风险层面的另一个价值:切换后端的迁移成本被压到了改两个配置项。
与站内既有文章的分工
站内已有美团 LongCat 2 专题一文,讲的是 LongCat 2 与国产芯片训练线的故事,属于训练基建视角;本文聚焦 2.5 模型本身的架构、接口与开放状态,属于模型视角。两篇互为内链、互不重复,建议搭配阅读:美团 LongCat 2 与国产芯片训练线。
结语
LongCat-2.5-Preview 的规格表足够漂亮:1.6T 总参、48B 激活、原生 1M 上下文、128K 最大输出、多模态并入基座、双协议 API。这些是确定的。不确定的是能力水平:没有 benchmark,没有权重,只有官方口径的描述。
给务实开发者的建议很简单:用赠送的 500 万 tokens 把自己的真实场景完整跑一遍,比等待任何榜单都有价值。Preview 阶段的模型,本来就该用"试用"代替"轻信",这条原则对任何厂商都成立。等权重放出或榜单出现,我们再来补上这篇欠着的下半场。