8 月 27 日,腾讯混元官宣新一代旗舰 Hy4 preview 并开源权重:总参数 770B、每 token 激活 49B、上下文 1M,Apache 2.0 协议,BF16 与 FP8 两版权重同步上架 Hugging Face、ModelScope、GitCode、CNB 四个平台。参数规模只是开胃菜——官方发布页里最扎眼的一句话是:Hy4 preview 首次参与了自己训练过程的自动化优化,「建立了早期阶段的递归自我改进循环」。一个旗舰模型开源当天,就带着「它参与训练了它自己」的注脚,这在开源阵营里还是头一回。
先说边界:本文基于腾讯官方新闻稿(2026-08-28)、混元 GitHub README 与公开报道整理(截至 2026-08-29);GitHub 星数为 2026-08-29 API 快照;盲测数据为腾讯内部评测口径;API 价格为快照,以官方页面为准;非投资建议。
一、六个月三次放大招:混元的 preview 打法已经跑顺了
先把节奏摆出来。这是腾讯混元六个月内第三次重大模型发布(Pandaily 口径):5 月的 Hy3 preview 当时在 OpenRouter 上以匿名低价姿态登顶调用量(输入价低至每百万 token 0.066 美元),社区先冲过来用,官方再慢慢揭晓;这一次 Hy4 preview 沿用了同一套「preview 先行、收集真实反馈、再出正式版」的路径——官方新闻稿的原话是「通过 preview 先行、正式版跟进的方式,持续把真实世界反馈纳入研发流程」。
GitHub 仓库 Tencent-Hunyuan/Hy4-preview 创建于 8 月 27 日,截至 8 月 29 日已拿到 245 星、10 fork。对一个 770B 的模型来说,星数不重要,重要的是权重真的全量开放:BF16 与 FP8 两个版本同步上架四个平台,Apache 2.0 协议允许商用。官方还预告「Hy4 系列下一批模型即将推出」——preview 只是开场。
顺带把「preview」这个词说清楚:它不是内测,而是有完整权重、完整部署文档的正式开源版本,只是官方明说后训练仍有较大提升空间、已知问题不回避。换句话说,社区拿到的是一张「可以跑生产的半成品」,官方赌的是先用起来的人越多,正式版打磨得越准。这套打法成立的前提是迭代速度——从 5 月 Hy3 到 8 月 Hy4,三个月一代的节奏,是目前它敢持续 preview 的底气。
二、架构:78 层 MoE,每 token 只激活 49B
用 README 的规格表说话(骨干网络口径,不含 MTP 层):
| 属性 | 数值 |
|---|---|
| 总参数 | 770B |
| 激活参数 | 49B |
| 层数 | 78(首层稠密 FFN + 77 层 MoE) |
| 专家配置 | 每层 256 个路由专家 + 1 个共享专家,每 token 激活 top-8 路由 + 共享 |
| 隐藏维度 | 6144 |
| 注意力 | Gated DSA(64 头),稀疏索引 top-k 2048 |
| 残差流 | 4 路(iHC 超连接) |
| 上下文长度 | 1M |
| 词表 | 120,832 |
三个技术点值得单独说。其一是注意力:采用门控 DeepSeek 稀疏注意力(Gated DSA,arXiv:2512.02556),配合 IndexCache(arXiv:2603.12201)做跨层稀疏索引复用——README 里明说「inspired by DeepSeek and GLM」,直接把同行当老师写进技术报告。其二是残差通路:用 iHC(identity Hyper-Connections)把层间信息流扩成 4 路残差流,让梯度与信息在 78 层深处仍有多条通路可走。其三是原生 MTP 层(总参 10B、激活 0.7B),专为投机解码设计,部署时默认采纳 3 个草稿 token——这也是它能把 770B 的推理成本压下来的关键一环。
对部署者来说,真正的门槛数字是「770B 全量驻显存、每 token 只算 49B」:激活小省的是算力和单 token 延迟,显存账一分不少。本批姊妹篇 SOP 拆了官方预构建镜像的 8 卡部署路径,横评则把开源旗舰们的部署门槛放在一张表里比。
三、盲测:163 位腾讯专家打分,2.99 小胜 GLM-5.3 与 Kimi K3
腾讯这次的评测口径很特别:不是刷榜单,而是请 163 位内部专家(软件工程师、游戏开发、金融分析、安全专家)对 203 个真实工程任务做盲评,Hy4 preview 拿到 2.99/4.00:
| 模型 | 盲测均分(满分 4) | 胜 / 平 / 负 |
|---|---|---|
| Hy4 preview | 2.99 | -- |
| GLM-5.3 | 2.92 | 46.8% / 12.8% / 40.4% |
| Kimi K3 | 2.94 | 51.2% / 7.9% / 40.9% |
赢面不小(对 GLM-5.3 胜率 46.8%、对 Kimi K3 胜率 51.2%),但平负合计也都在四成以上——这是「小幅领先」而非「代差碾压」,官方用词也克制:slightly ahead。更要紧的是评测对象:专家盲评打的是真实工程任务,比学术榜单更贴近「拿来干活」的体感,当然它也永远是腾讯自评口径,交叉验证要等社区跑起来。
README 的 Known Limitations 一节写得罕见地坦诚:承认这是 Hy4 的早期版本,存在「对复杂任务思考时间偏长」「倾向过度验证自己的产出」两个已知问题,并称会快速迭代。发布当天就把短板写进文档,这个姿态本身就是开源旗舰竞赛里新的及格线。
盲测分数背后的训练数据来源也值得一看:官方称 Hy4 preview 的后训练数据是与腾讯内部专家共建的——软件工程、游戏开发、金融、安全等领域的从业者,「围绕他们日常真实交付的工作」构造训练数据。四个重点场景在 README 里各有交代:软件工程强调长程开发任务的理解、规划、调试与验证,前端作品的视觉品味与交互质量也在提升项里;办公与分析主打把散落多文件的杂乱上下文整理成文档、表格、演示文稿等成品;游戏开发可以从一句自然语言生成可玩原型并与游戏引擎协作迭代;科研方向则在 AI 研发、分子动力学、凝聚态物理与基础数学上有明显进步。这套「跟着真实岗位造数据」的思路,和盲测请同一批专家打分,正好构成一个闭环。
四、递归自我改进:模型参与了它自己的训练
这是本次发布真正的钩子。官方新闻稿原文:Hy4 preview 「首次参与训练过程的自动化优化——涵盖训练方法、数据策略、评测框架和底层算子。模型提出方案、跑实验、根据结果迭代,产生的代码、日志与反馈再进入下一轮探索。由此建立了早期阶段的递归自我改进循环(recursive self-improvement loop)」。
拆开看,这个循环里模型扮演的角色是「提案者 + 实验执行者 + 结果评估者」:它对自己参与构建的训练管线提出改进建议,跑出实验数据,再基于数据继续改——产出物反过来喂给下一轮训练。目前官方给出的还是「早期阶段」的定性描述,没有披露这些自动化优化对最终模型能力的量化贡献,边界要划清。
但另一条已量化的证据值得记录:Hy4 preview 还自主分析了自己推理系统的瓶颈,围绕算子融合与通信优化做了多轮优化,端到端吞吐较基线提升 31.8%,且在不同上下文长度与并发水平下收益一致。换句话说,「模型优化自己的推理基础设施」已经从愿景变成了有数字的交付。2026 年 Agent 领域的叙事一直停在「AI 写代码给人审」,这一轮往前挪了半步:AI 写的优化代码,直接服务它自己的运行时。
五、价格与获取:输入 $0.834,WorkBuddy/CodeBuddy 免费两周
API 定价(官方口径,每百万 token):输入 0.834 美元、输出 2.501 美元、缓存命中 0.042 美元。缓存命中价只有输入价的 1/20,对 Agent 类长上下文工作流相当友好。
| 项目(每百万 token) | 价格 |
|---|---|
| 输入 | $0.834 |
| 输出 | $2.501 |
| 缓存命中 | $0.042 |
获取渠道:WorkBuddy、CodeBuddy、元宝、ima 等腾讯产品可直接用;API 走腾讯云 TokenHub 与 OpenRouter。上线起 WorkBuddy 与 CodeBuddy 内免费两周,Hy3 的免费使用也同步延长至 9 月 30 日。对个人开发者,最省事的验证路径是趁免费窗口在 CodeBuddy 里跑一轮真实任务;要自部署的,直接跳到本批 SOP。
六、怎么看:开源旗舰竞赛进入「自己造自己」的下半场
把 Hy4 preview 放回开源旗舰阵营:GLM-5.3、Kimi K3、DeepSeek V4 系列与它同场,各家比拼的已经不只是榜单分数,而是「参数规模 × 部署门槛 × API 牌价 × 工程任务真实表现」的综合题。腾讯这次给出的组合拳是:770B 全量开源展示诚意、49B 激活与 MTP 控制推理成本、专家盲测背书工程能力、免费窗口降低尝鲜门槛。
还有两个背景变量让这次发布更值得盯。一是国内开源旗舰的「一月一大」已成常态——8 月智谱连发 GLM-5.3 与 GLM-5.3-Flash,腾讯跟进 770B,月度级别的迭代速度让「等正式版再用」变成伪命题,选型必须学会跟 preview 共处。二是注意力架构层面的「相互借鉴」已经摆上台面:混元直接引用 DeepSeek 的稀疏注意力论文并写明 inspired by,GLM 的混合注意力路线同样公开——开源阵营的技术底座正在互相渗透,最终受益的是所有部署方:你可以按自己的场景,在不同家公开的技术组件里做排列组合。
而「参与自己的训练」这个叙事,长期看比分数更重要。它标志着旗舰模型的研发流程本身开始被模型改写:评测框架、数据策略、算子这些过去纯靠工程师的环节,现在有了模型自己的一份产出。真伪与含金量留给时间检验,但方向已经写在官方新闻稿里了——「Hy4 系列下一批模型即将推出」,用模型造模型,大概率是下一批的主角。
一句话收尾:当 770B 的权重全量开源、49B 的激活控制成本、专家盲测给出小幅领先的分数,而模型自己还参与了自己的训练,开源旗舰的比拼正式从「谁的分数高」进入「谁先把自我改进循环跑起来」。
参考来源
-
腾讯官方新闻稿(2026-08-28):Tencent Releases and Open-Sources Tencent Hy4 preview,https://www.tencent.com/tencent-releases-and-open-sources-tencent-hy4-preview
-
腾讯混元 GitHub 仓库(Apache 2.0,含架构规格与部署文档):https://github.com/Tencent-Hunyuan/Hy4-preview
-
Hugging Face 模型页(BF16/FP8 权重):https://huggingface.co/tencent/Hy4-preview
-
Pandaily(2026-08):Tencent Hunyuan Hy4 Preview Open Source,https://pandaily.com/tencent-hunyuan-hy4-preview-open-source
-
Gated DSA 论文:https://arxiv.org/abs/2512.02556 ;IndexCache 论文:https://arxiv.org/abs/2603.12201
-
关联阅读:本批姊妹篇 Hy4 preview 自部署 SOP、开源旗舰五强横评;往期 「牛来」真身揭晓:智谱开源 GLM-5.3-Flash、轻量旗舰 API 五强横评、GLM-5.3 深度解析
本文基于官方新闻稿、GitHub README 与公开报道整理(截至 2026-08-29),价格与星数为快照,以官方页面为准,非投资建议。