前沿热点
前沿热点

腾讯开源 770B 旗舰 Hy4 preview:它参与了它自己的训练

腾讯 8 月 28 日发布并开源新一代旗舰 Hy4 preview(770B 总参/49B 激活 MoE,78 层):Gated DSA 稀疏注意力 + IndexCache 跨层索引复用 + iHC 恒等超连接,README 明言架构「inspired by DeepSeek and GLM」,原生 MTP 层支持 3 token 投机解码,1M 上下文,Apache 2.0 开放 BF16+FP8 双版本权重。腾讯内部 163 位专家对 203 个工程任务盲评 2.99/4.00,小胜 GLM-5.3(2.92)与 Kimi K3(2.94,均为内部口径)。最大看点是递归自改进早期闭环:模型首次参与训练方法、数据策略、评测框架与底层算子的自动化优化,自主把推理端到端吞吐提了 31.8%。OpenRouter 快照价输入 $0.834/输出 $2.501 每百万 token,WorkBuddy/CodeBuddy 两周免费。

发布于 2026年8月29日6 分钟阅读
<!-- tencent-hy4-preview-open-source-hotspot | hotspot | 腾讯开源 770B 旗舰 Hy4 preview:它参与了它自己的训练 -->

8 月 27 日,腾讯混元官宣新一代旗舰 Hy4 preview 并开源权重:总参数 770B、每 token 激活 49B、上下文 1M,Apache 2.0 协议,BF16 与 FP8 两版权重同步上架 Hugging Face、ModelScope、GitCode、CNB 四个平台。参数规模只是开胃菜——官方发布页里最扎眼的一句话是:Hy4 preview 首次参与了自己训练过程的自动化优化,「建立了早期阶段的递归自我改进循环」。一个旗舰模型开源当天,就带着「它参与训练了它自己」的注脚,这在开源阵营里还是头一回。

先说边界:本文基于腾讯官方新闻稿(2026-08-28)、混元 GitHub README 与公开报道整理(截至 2026-08-29);GitHub 星数为 2026-08-29 API 快照;盲测数据为腾讯内部评测口径;API 价格为快照,以官方页面为准;非投资建议。

一、六个月三次放大招:混元的 preview 打法已经跑顺了

先把节奏摆出来。这是腾讯混元六个月内第三次重大模型发布(Pandaily 口径):5 月的 Hy3 preview 当时在 OpenRouter 上以匿名低价姿态登顶调用量(输入价低至每百万 token 0.066 美元),社区先冲过来用,官方再慢慢揭晓;这一次 Hy4 preview 沿用了同一套「preview 先行、收集真实反馈、再出正式版」的路径——官方新闻稿的原话是「通过 preview 先行、正式版跟进的方式,持续把真实世界反馈纳入研发流程」。

GitHub 仓库 Tencent-Hunyuan/Hy4-preview 创建于 8 月 27 日,截至 8 月 29 日已拿到 245 星、10 fork。对一个 770B 的模型来说,星数不重要,重要的是权重真的全量开放:BF16 与 FP8 两个版本同步上架四个平台,Apache 2.0 协议允许商用。官方还预告「Hy4 系列下一批模型即将推出」——preview 只是开场。

顺带把「preview」这个词说清楚:它不是内测,而是有完整权重、完整部署文档的正式开源版本,只是官方明说后训练仍有较大提升空间、已知问题不回避。换句话说,社区拿到的是一张「可以跑生产的半成品」,官方赌的是先用起来的人越多,正式版打磨得越准。这套打法成立的前提是迭代速度——从 5 月 Hy3 到 8 月 Hy4,三个月一代的节奏,是目前它敢持续 preview 的底气。

二、架构:78 层 MoE,每 token 只激活 49B

用 README 的规格表说话(骨干网络口径,不含 MTP 层):

属性数值
总参数770B
激活参数49B
层数78(首层稠密 FFN + 77 层 MoE)
专家配置每层 256 个路由专家 + 1 个共享专家,每 token 激活 top-8 路由 + 共享
隐藏维度6144
注意力Gated DSA(64 头),稀疏索引 top-k 2048
残差流4 路(iHC 超连接)
上下文长度1M
词表120,832

三个技术点值得单独说。其一是注意力:采用门控 DeepSeek 稀疏注意力(Gated DSA,arXiv:2512.02556),配合 IndexCache(arXiv:2603.12201)做跨层稀疏索引复用——README 里明说「inspired by DeepSeek and GLM」,直接把同行当老师写进技术报告。其二是残差通路:用 iHC(identity Hyper-Connections)把层间信息流扩成 4 路残差流,让梯度与信息在 78 层深处仍有多条通路可走。其三是原生 MTP 层(总参 10B、激活 0.7B),专为投机解码设计,部署时默认采纳 3 个草稿 token——这也是它能把 770B 的推理成本压下来的关键一环。

对部署者来说,真正的门槛数字是「770B 全量驻显存、每 token 只算 49B」:激活小省的是算力和单 token 延迟,显存账一分不少。本批姊妹篇 SOP 拆了官方预构建镜像的 8 卡部署路径,横评则把开源旗舰们的部署门槛放在一张表里比。

三、盲测:163 位腾讯专家打分,2.99 小胜 GLM-5.3 与 Kimi K3

腾讯这次的评测口径很特别:不是刷榜单,而是请 163 位内部专家(软件工程师、游戏开发、金融分析、安全专家)对 203 个真实工程任务做盲评,Hy4 preview 拿到 2.99/4.00:

模型盲测均分(满分 4)胜 / 平 / 负
Hy4 preview2.99--
GLM-5.32.9246.8% / 12.8% / 40.4%
Kimi K32.9451.2% / 7.9% / 40.9%

赢面不小(对 GLM-5.3 胜率 46.8%、对 Kimi K3 胜率 51.2%),但平负合计也都在四成以上——这是「小幅领先」而非「代差碾压」,官方用词也克制:slightly ahead。更要紧的是评测对象:专家盲评打的是真实工程任务,比学术榜单更贴近「拿来干活」的体感,当然它也永远是腾讯自评口径,交叉验证要等社区跑起来。

README 的 Known Limitations 一节写得罕见地坦诚:承认这是 Hy4 的早期版本,存在「对复杂任务思考时间偏长」「倾向过度验证自己的产出」两个已知问题,并称会快速迭代。发布当天就把短板写进文档,这个姿态本身就是开源旗舰竞赛里新的及格线。

盲测分数背后的训练数据来源也值得一看:官方称 Hy4 preview 的后训练数据是与腾讯内部专家共建的——软件工程、游戏开发、金融、安全等领域的从业者,「围绕他们日常真实交付的工作」构造训练数据。四个重点场景在 README 里各有交代:软件工程强调长程开发任务的理解、规划、调试与验证,前端作品的视觉品味与交互质量也在提升项里;办公与分析主打把散落多文件的杂乱上下文整理成文档、表格、演示文稿等成品;游戏开发可以从一句自然语言生成可玩原型并与游戏引擎协作迭代;科研方向则在 AI 研发、分子动力学、凝聚态物理与基础数学上有明显进步。这套「跟着真实岗位造数据」的思路,和盲测请同一批专家打分,正好构成一个闭环。

四、递归自我改进:模型参与了它自己的训练

这是本次发布真正的钩子。官方新闻稿原文:Hy4 preview 「首次参与训练过程的自动化优化——涵盖训练方法、数据策略、评测框架和底层算子。模型提出方案、跑实验、根据结果迭代,产生的代码、日志与反馈再进入下一轮探索。由此建立了早期阶段的递归自我改进循环(recursive self-improvement loop)」。

拆开看,这个循环里模型扮演的角色是「提案者 + 实验执行者 + 结果评估者」:它对自己参与构建的训练管线提出改进建议,跑出实验数据,再基于数据继续改——产出物反过来喂给下一轮训练。目前官方给出的还是「早期阶段」的定性描述,没有披露这些自动化优化对最终模型能力的量化贡献,边界要划清。

但另一条已量化的证据值得记录:Hy4 preview 还自主分析了自己推理系统的瓶颈,围绕算子融合与通信优化做了多轮优化,端到端吞吐较基线提升 31.8%,且在不同上下文长度与并发水平下收益一致。换句话说,「模型优化自己的推理基础设施」已经从愿景变成了有数字的交付。2026 年 Agent 领域的叙事一直停在「AI 写代码给人审」,这一轮往前挪了半步:AI 写的优化代码,直接服务它自己的运行时。

五、价格与获取:输入 $0.834,WorkBuddy/CodeBuddy 免费两周

API 定价(官方口径,每百万 token):输入 0.834 美元、输出 2.501 美元、缓存命中 0.042 美元。缓存命中价只有输入价的 1/20,对 Agent 类长上下文工作流相当友好。

项目(每百万 token)价格
输入$0.834
输出$2.501
缓存命中$0.042

获取渠道:WorkBuddy、CodeBuddy、元宝、ima 等腾讯产品可直接用;API 走腾讯云 TokenHub 与 OpenRouter。上线起 WorkBuddy 与 CodeBuddy 内免费两周,Hy3 的免费使用也同步延长至 9 月 30 日。对个人开发者,最省事的验证路径是趁免费窗口在 CodeBuddy 里跑一轮真实任务;要自部署的,直接跳到本批 SOP。

六、怎么看:开源旗舰竞赛进入「自己造自己」的下半场

把 Hy4 preview 放回开源旗舰阵营:GLM-5.3、Kimi K3、DeepSeek V4 系列与它同场,各家比拼的已经不只是榜单分数,而是「参数规模 × 部署门槛 × API 牌价 × 工程任务真实表现」的综合题。腾讯这次给出的组合拳是:770B 全量开源展示诚意、49B 激活与 MTP 控制推理成本、专家盲测背书工程能力、免费窗口降低尝鲜门槛。

还有两个背景变量让这次发布更值得盯。一是国内开源旗舰的「一月一大」已成常态——8 月智谱连发 GLM-5.3 与 GLM-5.3-Flash,腾讯跟进 770B,月度级别的迭代速度让「等正式版再用」变成伪命题,选型必须学会跟 preview 共处。二是注意力架构层面的「相互借鉴」已经摆上台面:混元直接引用 DeepSeek 的稀疏注意力论文并写明 inspired by,GLM 的混合注意力路线同样公开——开源阵营的技术底座正在互相渗透,最终受益的是所有部署方:你可以按自己的场景,在不同家公开的技术组件里做排列组合。

而「参与自己的训练」这个叙事,长期看比分数更重要。它标志着旗舰模型的研发流程本身开始被模型改写:评测框架、数据策略、算子这些过去纯靠工程师的环节,现在有了模型自己的一份产出。真伪与含金量留给时间检验,但方向已经写在官方新闻稿里了——「Hy4 系列下一批模型即将推出」,用模型造模型,大概率是下一批的主角。

一句话收尾:当 770B 的权重全量开源、49B 的激活控制成本、专家盲测给出小幅领先的分数,而模型自己还参与了自己的训练,开源旗舰的比拼正式从「谁的分数高」进入「谁先把自我改进循环跑起来」。


参考来源

本文基于官方新闻稿、GitHub README 与公开报道整理(截至 2026-08-29),价格与星数为快照,以官方页面为准,非投资建议。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-29

相关文章

前沿热点

阿里把 Qwen4 的架构提前摊牌了:Qwen3.8-Flash-Next 放出 125B 权重,唯独没放协议文件

阿里 8 月 26 日放出 Qwen3.8-Flash-Next:一个多模态 MoE 模型,更是 Qwen4 架构的早期预览——官方给它定的角色,等同于当年 Qwen3-Next 之于 Qwen3.5。主模型 125B,额外挂 51B N-gram embeddings,每 token 只激活 6B;相比 Qwen3.7-Plus 训练成本约 1/9,coding 与 office 任务反而更强。四维升级逐个拆开:GDN 压缩历史叠加 QSA 用压缩索引器在微块粒度挑重点、Gated Residual 把残差流扩成 4 分支、N-gram Embedding 可卸载到主机内存靠异步预取与计算重叠、优化器换成 Muon。原生 262,144 tokens,YaRN 可外推到 1M。生产版 Qwen3.8-Flash 在 QwenCloud 报价 \$0.16/\$0.47 每百万 token(不同来源口径略有出入,以官网为准)。但真正的悬念是协议:GitHub 仓库没有 LICENSE 文件,license 字段为 None,README 只让读者去 HF/ModelScope 模型页查看,社区已经有人在追问「为什么不是 Apache 2.0」——本文标注为未确认,商用前务必自行核对模型页协议。

2026年8月30日6 分钟阅读