硬核横评
硬核横评

腾讯 770B 只激活 49B:五款万亿级开源旗舰横评,决定部署成本的不是总参数

Hy4 preview(770B/49B)发布把开源旗舰的参数军备推到新高,但决定部署成本的不是总参数:激活参数省的是算力,权重驻留吃的是显存。本篇横评五款开放权重旗舰--Hy4 preview、GLM-5.3、Kimi K3(2.8T)、DeepSeek V4(1.6T 口径)、Qwen3.8-Max(2.4T)--按总参/激活比、上下文、许可证、显存门槛(工程估算口径)与 API 价格快照逐项对表。与 8-27 价格横评分工:那篇算 320B 级 API 账,本篇算 700B-2.8T 级参数与部署门槛账。五条按场景结论:追最新选 Hy4(Apache 2.0+MTP 投机解码+FP8 友好)、要参数规模选 K3、要成熟生态选 GLM/DeepSeek、阿里系合规选 Qwen,以及共同一条--先看每 token 成本与稀疏注意力,再看总参。

发布于 2026年8月29日9 分钟阅读
<!-- open-source-flagship-llm-comparison-review | review | 腾讯 770B 只激活 49B:五款万亿级开源旗舰横评,决定部署成本的不是总参数 -->

8 月 28 日,腾讯混元把新一代旗舰 Hy4 preview 连权重一起放了出来:770B 总参、每 token 只激活 49B。同一个牌桌上还坐着 2.8 万亿的 Kimi K3、约 1.6 万亿的 DeepSeek V4-Pro、2.4T 的 Qwen3.8-Max 和后训练路线的 GLM-5.3。总参数从 770B 滚到 2.8 万亿,差 3.6 倍;但翻开部署账本你会发现,真正决定成本的不是总参数,而是另一个被大多数报道略过的变量--激活比与稀疏注意力

先划边界:本文为代表性对比,非亲自压测;参数、架构与评测数据来自各厂官方发布与公开报道,价格与星数为 2026-08-29 快照,逐项标注口径(官方发布 / 媒体报道 / 换算 / 工程估算 / 厂商内部盲评),以官方仓库与定价页为准,非投资建议。另外说明分工:本站 轻量旗舰价格横评 算的是 320B 级轻量旗舰的 API 单价与缓存账,本文不重复算 API 价格战,算的是 700B-2.8T 级开源旗舰的参数、架构与部署门槛账--两篇文章管两本账,选型时都翻一遍。

一、参数基本盘:五强规格总表

先把五强的规格摆出来(口径逐项标注,快照 2026-08-29):

维度腾讯 Hy4 previewKimi K3(月之暗面)DeepSeek V4-ProQwen3.8-Max(阿里)智谱 GLM-5.3
总参数770B(官方发布)2.8 万亿(官方发布)约 1.6 万亿(站内往期口径)2.4T(站内往期核真口径)未采集
激活参数/token49B(官方发布)未采集未采集未采集未采集
上下文窗口1M(官方发布)1M(官方发布)1M(站内往期口径)1M(站内往期核真口径)未采集
注意力/架构亮点Gated DSA 稀疏注意力 + IndexCache,78 层(1 dense FFN + 77 MoE,256 路由专家+1 共享,top-8+共享)KDA 混合线性注意力 + 注意力残差未采集未采集后训练 Scaling(基座未变)
投机解码原生 MTP 层(官方发布)未采集未采集未采集未采集
权重格式/量化BF16 + FP8 双格式(官方发布)MXFP4 量化权重(官方发布)未采集未采集未采集
开源许可Apache 2.0(官方发布)可商用(条款以官方为准)未采集以官方仓库为准(本批快照未核实)开源(仓库/许可证以官方为准)
权重渠道Hugging Face / ModelScope / GitCode / CNBHugging Face(2026-07-27 放权)未采集未采集智谱官方仓库(THUDM)

三个第一眼结论:

  1. 激活参数被「藏」在了发布稿里。 五强里只有 Hy4 preview 在发布稿里把激活参数(49B)写在最显眼的位置,其余四家的激活参数要么未采集要么口径不一。这不奇怪:激活比(激活参数/总参)是推理成本的命门,Hy4 的 49B/770B ≈ 6.4%,意味着推理时每 token 只跑约 1/16 的网络。总参数决定「这个模型知道多少」,激活参数决定「每 token 烧多少算力」--发布稿爱讲前者,账本关心后者。
  2. 稀疏注意力成了旗舰标配。 Hy4 的 Gated DSA + IndexCache、K3 的 KDA 深度混合线性注意力,都在解决同一个问题:1M 上下文下注意力计算与 KV 缓存爆炸。上一代模型把 1M 上下文跑起来的代价是推理成本翻倍,这一代用稀疏/线性混合把这条曲线压下来。选型时「支持 1M 上下文」这句话背后的真实成本,直接取决于注意力架构。
  3. 许可与量化格式开始分化。 Hy4 是 Apache 2.0 + BF16/FP8 双格式,K3 是 MXFP4 量化权重,GLM 系列开源但许可证以官方为准。量化格式不是细节:它直接决定权重驻留显存的体积(下一节算这笔账)。

二、部署门槛账:激活省的是算力,总参吃的是显存

这批模型最容易被误读的一点:激活参数小 ≠ 显存需求小。本站 GLM-5.3-Flash 接入 SOP 里算过这笔账:激活 18B 省的是每 token 的计算量(吞吐、延迟、电费),但全部总参权重必须驻留显存。770B-2.8T 级旗舰把这条规则放大到了集群级:

模型权重驻留显存(换算/工程估算口径)部署形态关键变量
腾讯 Hy4 previewFP8 约 770GB / BF16 约 1.5TB(按每参数 1/2 byte 换算)多卡集群(官方 vLLM 镜像 TP8 起步)激活 49B 省算力,总参 770B 定显存;MTP 投机解码提吞吐
Kimi K3MXFP4 约 1.4TB(按 4 bit/参数换算)多卡集群(往期口径:H100 级集群起步)总参 2.8T 定显存上限;KDA 压 KV 缓存
DeepSeek V4-Pro未采集未采集未采集
Qwen3.8-Max未采集未采集未采集
智谱 GLM-5.3未采集未采集未采集

注意:上表显存数字全部是换算口径(按位宽×参数量估算,不含 KV 缓存与运行时开销,实际需求还要上浮),实际以各官方仓库的部署文档为准。

  1. 770B 的真实门槛:多卡集群,不是单机 8 卡。 Hy4 preview FP8 权重约 770GB,8×80GB=640GB 显存装不下,至少要 10-12 张 80GB 卡或 16 张 48GB 卡(工程估算口径)。官方给的是 vLLM 预置镜像(vllm/vllm-openai:hy4-preview,TP8 起步)与 SGLang 镜像,README 明确按集群口径写部署文档。个人开发者和中小团队到此为止,自部署不适合你。
  2. 激活参数的收益在吞吐不在显存。 49B 激活意味着每 token 计算量小,配合原生 MTP 投机解码层(官方口径),同样硬件下吞吐显著高于同总参稠密激活模型。反过来说:如果你的负载是离线批处理,激活比小的模型省的是吞吐时间和电费;如果是低延迟在线服务,激活比影响首 token 延迟。总之一句话:激活比省算力,总参定显存,两个账分开算
  3. 稀疏注意力决定 KV 缓存曲线。 1M 上下文下,稠密注意力的 KV 缓存按序列长度线性爆炸;Hy4 的 Gated DSA + IndexCache、K3 的 KDA 混合线性注意力都在压这条曲线。选型时别只看「支持 1M」,要看注意力架构--这决定你长上下文场景的真实显存与成本曲线。
  4. 这批模型共同的真实门槛:没有人能在单卡上自部署五强旗舰。 770B-2.8T 级总参决定了自部署是机构玩家的事。中小团队的现实选项是 API + 开源权重兜底:日常走 API,极端涨价或合规场景再迁移自部署。迁移可行性正是开源的意义--但别忘了迁移目标本身是集群级门槛。

三、能力与价格快照:盲评、聚合平台价与三条口径提醒

能力与价格都先摆快照(均为转引口径,快照 2026-08-29):

维度腾讯 Hy4 previewKimi K3DeepSeek V4-ProQwen3.8-Max智谱 GLM-5.3
代表性能力数据厂商内部盲评 2.99/4.00(163 位专家、203 个工程任务,官方发布口径)Frontend Code Arena 1679 分超 Claude Fable 5 登顶(媒体转引)AA 53 分(媒体转引)未采集Terminal Bench 3.0 等多项开源第一(官方发布)
API 价格OpenRouter 快照:$0.834/M 输入、$2.501/M 输出、$0.042/M 缓存读(第三方聚合平台快照 2026-08-28)输出 100 元/M(官方定价转引,上一代的三倍多)高峰输出 27 元/M(媒体报道 2026-08-27)未采集API 定价以智谱官方为准
缓存价$0.042/M 缓存读(OpenRouter 快照)未采集V4-Flash 闲时 0.05 元/M(媒体报道)缓存命中 1 元 vs 未命中 12 元(站内往期核真口径)未采集

三条口径提醒:

  1. 2.99 分是厂商内部盲评,不是第三方评测。 超过 GLM-5.3 的 2.92(46.8% 胜 / 12.8% 平 / 40.4% 负)与 Kimi K3 的 2.94(51.2% 胜 / 7.9% 平 / 40.9% 负),样本是 163 位专家、203 个工程任务--样本不小,但评测方是厂商自己,选任务、选专家、评分标准都在厂商手里。当参考可以,当结论不行;接入前跑你自己的评测集。
  2. OpenRouter 快照价是聚合平台价,不是腾讯官方牌价。 $0.834/$2.501 每百万 tokens 是 2026-08-28 的第三方聚合快照,聚合平台有加价、有配额、有汇率换算,不是官方定价页数字。要官方牌价去腾讯云官方渠道核价,本文不采集未核实的官方价。
  3. 缓存价碎片化,别拿缓存价直接横向比。 五强的缓存口径五花八门:Hy4 缓存读 $0.042/M(OpenRouter 快照)、DeepSeek V4-Flash 闲时 0.05 元/M(媒体报道)、Qwen3.8-Max 缓存命中 1 元 vs 未命中 12 元(站内往期核真口径)--币种、计费单位、命中规则都不一致。在 Agent 时代缓存命中率决定账单走向(本站轻量旗舰横评里算过:命中超九成时选型结论会反转),换模型前先把自己的缓存账按统一口径算一遍。

四、按场景选:五条结论

  1. 追最新开源旗舰、要架构红利:腾讯 Hy4 preview。Apache 2.0 许可、BF16/FP8 双格式、原生 MTP 投机解码、vLLM/SGLang 官方镜像齐全,开源生态接得住;激活 49B 带来的吞吐红利适合高并发场景。动手路径见本站 Hy4 preview 自部署 SOP(同批)。
  2. 要最大参数规模与能力上限:Kimi K3。2.8 万亿总参(全球首个开源 3 万亿级)、原生视觉、1M 上下文,Frontend Code Arena 1679 分登顶;输出 100 元/M 是能力溢价档,别当性价比选项。
  3. 要成熟度与生态平衡:智谱 GLM-5.3 与 DeepSeek V4-Pro。GLM-5.3 靠后训练 Scaling 拿下 Terminal Bench 3.0 等多项开源第一,还涌现出安全能力(联合发现 2436 个漏洞);V4-Pro 押 1M 上下文 + Anthropic API 兼容,迁移成本低。两家都是「商业 API + 开源权重」双线成熟玩家。
  4. 阿里系合规生态:Qwen3.8-Max。1M 上下文、缓存命中 1 元 vs 未命中 12 元(站内往期核真口径),叠加阿里云生态与企业合规体系;重度缓存场景这套定价有想象力,但本批快照未核实其开源情况与更多定价,采购前以官方为准。
  5. 所有场景共同的一条:770B-2.8T 时代,激活比与稀疏注意力才是部署成本的决定变量。总参数决定权重驻留显存(自部署门槛),激活参数决定每 token 算力(吞吐/延迟),注意力架构决定长上下文成本曲线--三个账分开算,按每 token 实际成本选型,别按总参数排座次。

常见问题

Q1:770B 和 2.8 万亿差 3.6 倍,是不是总参数越大越值得选? A1:不是。总参数决定权重驻留显存(自部署门槛),激活参数决定每 token 算力(吞吐/延迟/电费),稀疏注意力决定长上下文成本曲线,三个变量分开看。Hy4 preview 770B 只激活 49B(约 6.4%),激活比反而占优;单看总参数选型,容易「买大的、跑小的」。正确姿势是把三个变量放进你自己的负载里算每 token 实际成本。

Q2:Hy4 preview 的 2.99 分,能直接当「开源第一」吗? A2:不能直接当。2.99/4.00 出自腾讯厂商内部盲评(163 位专家、203 个工程任务),评测方、任务集、评分标准都在厂商手里;GLM-5.3 的 2.92、Kimi K3 的 2.94 也是同一盲评口径。差距 0.02-0.07 在样本误差范围内,当参考坐标可以,当结论不行--接入前用你自己的评测集跑一轮。

Q3:中小团队能自部署这批旗舰吗? A3:基本不能。770B FP8 权重约 770GB(换算口径)、2.8T MXFP4 约 1.4TB,都远超单机 8 卡 640GB 的显存上限,且不含 KV 缓存与运行时开销。自部署是机构玩家的事。中小团队的现实路径:日常走 API,把开源权重当「极端涨价/合规场景」的迁移兜底,别把自部署写进近期排期。

Q4:OpenRouter 上 $0.834/$2.501 是 Hy4 的官方价吗? A4:不是。那是第三方聚合平台 2026-08-28 的快照价,含平台加价、配额与汇率换算,不是腾讯官方定价页数字。本批快照未核实腾讯官方牌价,故标注未采集;核价请走腾讯云官方渠道。

Q5:五强里哪家值得现在锁价? A5:都不建议锁。本批快照里价格数据口径分散(聚合平台价/媒体转引/未采集),行业处于定价权争夺期,价格表随时会变。正确姿势:按每 token 实际成本加缓存命中率算账,架构上保持多家 API 通道加开源权重兜底,商务上按季度滚动询价。


参考来源


参考来源

本文为代表性横评,基于公开报道与官方发布整理,快照 2026-08-29(OpenRouter 为 2026-08-28 快照),非亲自压测,非投资建议;各家规格、许可与价格随时可能调整,采购前以官方仓库与定价页为准。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-29

常见问题

770B 和 2.8 万亿差 3.6 倍,是不是总参数越大越值得选?
不是。总参数决定权重驻留显存(自部署门槛),激活参数决定每 token 算力(吞吐/延迟/电费),稀疏注意力决定长上下文成本曲线,三个变量分开看。Hy4 preview 770B 只激活 49B(约 6.4%),激活比反而占优;单看总参数选型,容易「买大的、跑小的」。正确姿势是把三个变量放进你自己的负载里算每 token 实际成本。
Hy4 preview 的 2.99 分,能直接当「开源第一」吗?
不能直接当。2.99/4.00 出自腾讯厂商内部盲评(163 位专家、203 个工程任务),评测方、任务集、评分标准都在厂商手里;GLM-5.3 的 2.92、Kimi K3 的 2.94 也是同一盲评口径。差距 0.02-0.07 在样本误差范围内,当参考坐标可以,当结论不行--接入前用你自己的评测集跑一轮。
中小团队能自部署这批旗舰吗?
基本不能。770B FP8 权重约 770GB(换算口径)、2.8T MXFP4 约 1.4TB,都远超单机 8 卡 640GB 的显存上限,且不含 KV 缓存与运行时开销。自部署是机构玩家的事。中小团队的现实路径:日常走 API,把开源权重当「极端涨价/合规场景」的迁移兜底,别把自部署写进近期排期。
OpenRouter 上 $0.834/$2.501 是 Hy4 的官方价吗?
不是。那是第三方聚合平台 2026-08-28 的快照价,含平台加价、配额与汇率换算,不是腾讯官方定价页数字。本批快照未核实腾讯官方牌价,故标注未采集;核价请走腾讯云官方渠道。
五强里哪家值得现在锁价?
都不建议锁。本批快照里价格数据口径分散(聚合平台价/媒体转引/未采集),行业处于定价权争夺期,价格表随时会变。正确姿势:按每 token 实际成本加缓存命中率算账,架构上保持多家 API 通道加开源权重兜底,商务上按季度滚动询价。

相关文章

硬核横评

一个 agent 被攻破就全盘失守:四套凭证与权限治理方案横评

凭据从配置项变成了攻击面,但绝大多数团队防线还停在"给 agent 套个沙箱"。本文与站内沙箱隔离横评明确分工:沙箱管"代码在哪跑",凭据治理管"密钥怎么用、动作谁批、凭据能不能外带"。对比 OpenClaw 2.0、OpenWorker、OpenHuman 与传统密钥托管四套方案,按凭据生命周期六环节(存/用/批/外带/审计/多 agent)拆:OpenClaw 掩码请求 + opt-in proxy 目标白名单;OpenWorker hard floors + 自主权阶梯 + reviewer model + 熔断器,且无人值守绝不自批;OpenHuman Privacy Mode 在 Rust core 强制 + agent 间 E2E 加密。二手数据(SaaS Sentinel 转述,未找到一手报告)显示 1 个 agent 妥协概率 0.24、7 个升到 0.86,风险随数量超线性增长——前提是"任一 agent 提议即执行"。

2026年9月1日11 分钟阅读
硬核横评

涨价之后怎么选:11 个模型的真实 token 成本横评,把峰谷、缓存与 tokenizer 三重口径算进去

模型标价至少套着三层衣服,只看标价等于只看最外面那层:时段(DeepSeek 8 月 17 日起峰谷计价,工作日 9:00–12:00 与 14:00–18:00 为高峰、闲时减半、周末全天闲时,同一模型单价差一倍)、缓存(命中前缀缓存的输入 token 单价远低于标准输入,变量不在厂商手里而在你的提示词结构里)、分词(Sonnet 5 换分词器后相同输入映射 1.0 到 1.35 倍 token 数,且倍数随内容类型浮动)。本文统一口径为「综合单价 =(输入单价 + 输出单价)÷ 2」,即假设输入输出 token 数量相等,作为中立起点,再给三种典型负载比重的重算结果,并覆盖 11 个模型的标价、缓存命中价、峰谷价与分词放大后的实际位置。结论不是「哪个模型最便宜」,而是「不存在最便宜的模型,只存在对你这个负载最便宜的模型」——脱离输入输出比重、缓存命中率与内容类型给出的比价,只是在比标价而非比成本。国内模型价格来自 2026-08-24 逐页复核、8-28 再复核的官方定价页速查表,海外价格来自 2026-08-31 汇总,存在口径冲突的项目文中逐条标注。未做实际调用压测。

2026年8月31日9 分钟阅读