前沿热点
前沿热点

美团开源 LongCat-2.0:1.6万亿参数全程国产芯片,曾匿名霸榜 OpenRouter

美团开源 1.6T 稀疏 MoE 编码模型 LongCat-2.0,训练全程用国产 ASIC、零英伟达,曾以代号 Owl Alpha 在 OpenRouter 匿名霸榜约两个月,编码基准全面领先 Qwen3.6-27B。给普通开发者三点选型启示。

发布于 2026年7月29日5 分钟阅读
<!-- meituan-longcat2-china-chip-hotspot | hotspot | 美团开源 LongCat-2.0:1.6万亿参数全程国产芯片,曾匿名霸榜 OpenRouter -->

一个外卖公司,开源了一个 1.6 万亿参数的编码大模型,训练全程没用一块英伟达 GPU,还曾匿名在 OpenRouter 上霸榜两个月。这不是段子,是 2026 年 6 月底真发生的事。主角是美团,模型叫 LongCat-2.0。我刚看到这条消息时第一反应是查来源,因为听起来太像营销稿,但多个独立信源对上了。

一、发生了什么:外卖公司开源 1.6T 编码模型

2026 年 6 月 30 日,美团把 LongCat-2.0 开源了。对,就是那个送外卖、做本地生活的超级 App,不是哪家 AI 实验室,也没有"某大厂分拆的 AI 子公司"那种背景。这件事本身就需要先消化一下。

几个硬数字。总参数 1.6 万亿(1.6T),稀疏 MoE 架构。MoE 的意思是模型被分成很多个"专家"子网络,每生成一个 token,路由器只挑一部分专家激活。LongCat-2.0 每 token 激活约 480 亿参数,动态在 330 到 560 亿之间浮动,随查询复杂度变化。这才是推理成本的真正决定因素:你付出的算力对应的是激活量,不是那个吓人的 1.6T 标题数字。简单问题激活得少,难题激活得多,成本跟着任务走。

上下文方面,原生 100 万 token 窗口,靠团队自研的线性复杂度注意力机制实现。线性复杂度意味着上下文变长时算力不是平方级暴涨,这和"硬堆显存把长文本塞进去"是两条技术路线。

最反常识的一点:训练全程用中国国产 AI 芯片(ASIC),零英伟达。这一点多源核实过,不是单方面宣传。在一个英伟达 GPU 几乎是训练大模型默认选项的行业里,这条路走通的意义比参数本身大。

更有意思的是它的"前传"。LongCat-2.0 在正式开源前,曾以代号 "Owl Alpha"(owl-alpha)在 OpenRouter 上匿名服务了大约两个月,悄悄登顶了用量榜。也就是说,不少开发者其实早就用上了,只是不知道背后是美团、是国产芯片训出来的。直到开源那一刻,身份才曝光。定价也狠:每百万 token 0.038 美元,缓存命中免费。把缓存命中做成免费,说明团队想让真实负载成本进一步压低。

二、为什么重要:三件事被同时证明

第一,国产算力能打。过去讨论国产芯片训大模型,结论常停在"中小模型可以,前沿大模型还差点"。这次一个非 AI 实验室的公司,用国产 ASIC 训出 1.6T 的前沿编码模型,这条链路被完整跑通了。不靠英伟达也能进第一梯队,以前是"理论上可以",现在成了"已经发生"。而且跑通的不是玩具,是编码基准能和头部模型对打的前沿模型。

第二,开源编码模型格局变了。LongCat-2.0 匿名霸榜这件事最有说服力的地方在于:用户用脚投票时根本不知道它是谁。他们在 OpenRouter 上选它,不是因为美团的品牌、不是因为国产芯片的故事,纯粹因为编码好用。等身份一曝光,"闭源大厂才能做好编码模型"这个叙事就漏了个大洞。对闭源编码模型的护城河,这是实打实的一击。

第三,编码 agent 是新主战场。看基准别只盯通用推理分数,看 Terminal-Bench、SWE-bench Pro 这种 agent 类任务,才是 2026 年编码模型真正在卷的地方。这些基准测的是模型在真实工程环境里改 bug、跑测试、完成多步任务的能力,比刷一道选择题的含金量高得多。一个模型 GPQA 考得再高,如果在终端里连不上手,对你写代码也没多大帮助。

还有一层是成本。MoE 把激活量压到 480 亿,定价又做到每百万 token 0.038 美元、缓存免费,这意味着编码 agent 那种动辄多轮调用、长上下文的工作流,账单不会爆。模型好不好用是一回事,用不用得起是另一回事,LongCat-2.0 在这两头都给了点东西。

三、基准怎么看:和 Qwen3.6-27B 拉张表

据 Reddit r/LocalLLaMA 与 digitalapplied 的实测,LongCat-2.0 对比 Qwen3.6-27B:

基准LongCat-2.0Qwen3.6-27B
SWE-bench Pro59.553.5
Terminal-Bench 2.170.859.3
SWE-bench Multilingual77.371.3
RWSearch78.877.3
Writing Bench83.885.2
IMO-AnswerBench81.880.8
GPQA-diamond88.987.8

编码和 agent 类任务领先明显。Terminal-Bench 拉开 11.5 分,这是差距最大的一项,也是最能反映"在终端里干活"能力的一项;SWE-bench Pro 领先 6 分,SWE-bench Multilingual 领先 6 分,说明多语言代码也站得住。但 Writing Bench 反而略输 1.4 分,IMO-AnswerBench 和 GPQA-diamond 两家咬得很紧。这说明 LongCat-2.0 是个偏科的编码专精模型,不是万金油。如果你要的是写文章、做数学竞赛,它未必是最优解;但放进编码 agent 工作流,它在前沿任务上的优势才真正拉开。

这里要标清楚来源。据开发者社区与 X 上流传的信息(来自 X 用户 @VaibhavSisinty 的帖子,单一来源,未经多源证实,别当硬事实):训练用了 5 万片以上国产 ASIC;OpenRouter 上月处理 10.1 万亿 token,环比增 242%;它在 Hermes Agent 排名第 1、Claude Code 第 2、OpenClaw 第 3;训练 35 万亿 token,无重大回滚。这些数字听着唬人,但单一来源,当参考就好,尤其是"5 万片芯片"和"35T 训练 token"这种关键数字,等官方或多源确认再信。

四、普通开发者三点启示

第一,别只盯头部闭源。你以为编码模型就是那几家闭源大厂的天下,结果一个外卖公司用国产芯片匿名霸了两个月榜你都没发现。等它开源了你才反应过来,说明你的模型选型雷达可能只对着几家大厂扫。把视野放开,开源阵营里可能早就有够用的选手了,尤其是编码这种任务明确的场景。

第二,开源编码模型已经够用。SWE-bench Pro 59.5、Terminal-Bench 70.8 这种成绩,放在一年前还是闭源旗舰的领地。如果你的编码 agent 工作流还在等"下一个闭源旗舰"才肯动手,可以现在就拿开源模型试。省下 API 费用是其次,关键是本地可控、数据不出域,对处理公司内部代码库这点很重要。

第三,盯真实基准,别盯营销数字。1.6T 参数、35T 训练 token 都是标题党。真正决定你编码体验的是 SWE-bench Pro、Terminal-Bench 这种 agent 任务成绩,以及每 token 激活参数(它决定推理成本)。一个 1.6T 总参数但每 token 只激活 480 亿的模型,和另一个总参数小但全激活的模型,成本曲线完全不一样。下次看模型发布,先翻基准表,别看发布会。

LongCat-2.0 这事最大的信号不是参数,是身份。一个送外卖的,用国产芯片,训出了能匿名霸榜的编码模型。这说明前沿大模型的门槛,正在以一种谁都没想到的方式被拉低。模型和算力的解绑比很多人预想的来得快,下一个从非典型赛道杀出来的玩家可能已经在路上了。下次再有"非 AI 公司"放出前沿模型,别急着划走,多查一眼来源。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-07-29

相关文章