前沿热点
前沿热点

阿里把 Qwen4 的架构提前摊牌了:Qwen3.8-Flash-Next 放出 125B 权重,唯独没放协议文件

阿里 8 月 26 日放出 Qwen3.8-Flash-Next:一个多模态 MoE 模型,更是 Qwen4 架构的早期预览——官方给它定的角色,等同于当年 Qwen3-Next 之于 Qwen3.5。主模型 125B,额外挂 51B N-gram embeddings,每 token 只激活 6B;相比 Qwen3.7-Plus 训练成本约 1/9,coding 与 office 任务反而更强。四维升级逐个拆开:GDN 压缩历史叠加 QSA 用压缩索引器在微块粒度挑重点、Gated Residual 把残差流扩成 4 分支、N-gram Embedding 可卸载到主机内存靠异步预取与计算重叠、优化器换成 Muon。原生 262,144 tokens,YaRN 可外推到 1M。生产版 Qwen3.8-Flash 在 QwenCloud 报价 \$0.16/\$0.47 每百万 token(不同来源口径略有出入,以官网为准)。但真正的悬念是协议:GitHub 仓库没有 LICENSE 文件,license 字段为 None,README 只让读者去 HF/ModelScope 模型页查看,社区已经有人在追问「为什么不是 Apache 2.0」——本文标注为未确认,商用前务必自行核对模型页协议。

发布于 2026年8月30日6 分钟阅读
<!-- qwen3-8-flash-next-multimodal-hotspot | hotspot | 阿里把 Qwen4 的架构提前摊牌了:Qwen3.8-Flash-Next 放出 125B 权重,唯独没放协议文件 -->

2026 年 8 月 26 日,Qwen 官方博客与 GitHub 仓库同步放出 Qwen3.8-Flash-Next。参数配置很有冲击力:主模型 125B,额外挂 51B 的 N-gram embeddings,而每生成一个 token 只激活 6B;官方口径是训练成本约为 Qwen3.7-Plus 的九分之一,coding 与 office 任务能力反而更优。但真正让社区炸锅的不是参数,是仓库状态——GitHub API 的 license 字段返回 None,根目录只有 README.mdtech_report.pdf,没有 LICENSE 文件,而 Hugging Face 讨论区已经出现一条帖子,标题写着「Why isn't it Apache 2.0 licensed?」。权重给了,协议文件没给,这是本次发布最大的悬念。

先说边界:本文事实基于 Qwen 官方博客、QwenLM/Qwen3.8-Flash-Next 仓库 README 与 GitHub API 实测数据(创建 2026-08-24、最近 push 2026-08-27、259 星 / 11 fork)、Hugging Face 与 ModelScope 模型页,以及第三方报道(DataCamp、anotherwrapper、superpowerdaily)整理;信息截至 2026-08-30,仓库与模型页状态可能已变化。价格为 2026-08-30 快照,不同来源口径存在出入,实际以 QwenCloud 官网为准。许可证状态未确认:本文不断言它是或不是 Apache 2.0,商用前请自行核对 HF / ModelScope 模型页随权重发布的协议文件。benchmark 数据凡非官方原表格者均标注来源口径。非投资建议。

一、这次发布到底是什么:Qwen4 架构的早期预览

先校准定位,这是最容易被漏掉的一层。Qwen3.8-Flash-Next 是一个多模态 MoE 模型,但它同时扮演另一个角色——Qwen4 架构的早期预览。官方给出的类比很直白:它的角色等同于当年 Qwen3-Next 之于 Qwen3.5。而那次的结果我们已经知道了:Qwen3-Next 上的 Gated DeltaNet + Gated Attention 混合设计,后来被 Qwen3.5、3.6、3.7、3.8 整个系列沿用下来。

换句话说,「Next」这个后缀在 Qwen 的命名体系里不是编号游戏,而是下代架构的先行验证场:先在中小规模上把新设计的训练稳定性、效率与效果跑通,验证成立后再铺进后续主力型号。所以看这次发布,参数只是入场券,架构那四维改动才是真正要读的东西——它们大概率会出现在你半年后用的主力模型里。

项目Qwen3.8-Flash-Next备注
类型多模态 MoE同时是 Qwen4 架构早期预览
主模型参数125B官方口径
额外 N-gram embeddings51B可卸载到主机内存
每 token 激活6B官方口径
原生上下文262,144 tokensYaRN 可扩展至 1,000,000
模态文本 / 图像 / 视频通过单一 API 处理
训练成本约为 Qwen3.7-Plus 的 1/9官方口径

二、架构四维升级:Attention、Residual、Embedding、Optimization

README 把这次的架构改动归纳为四个维度。我们逐条拆。

第一维:Attention——GDN + QSA 混合。 Gated DeltaNet(GDN)负责高效压缩历史信息,把已经发生过的上下文压成紧凑状态,而不是让每一层都重新算一遍全序列。与之搭配的是全新的 Qwen Sparse Attention(QSA):用一个压缩过的轻量索引器,在微块(micro-block)粒度上挑选出重要上下文,只对被选中的部分做完整 attention。这个组合的直接收益是长序列 attention 成本大幅下降——这也是它能原生撑到 262,144 上下文、还能用 YaRN 拉到 1,000,000 的底层原因。值得注意的是,「稀疏注意力」这两年已经是各家架构竞速的主战场,本批姊妹篇有专门横评,可以对照着看。

第二维:Residual——Gated Residual(GR)。 传统残差流是一条主干通道,GR 把残差流扩展为 4 个分支,并用动态门控控制每个分支的读写强度。这样做的好处有两个:一是跨层信息流有了更多并行通路,浅层特征不必被深层反复覆盖;二是门控可学习,训练时的梯度传播更平滑,官方把这条归到「强化训练稳定性」上。对 MoE 这种本身训练就容易抖的架构,稳定性往往比单点性能更值钱。

第三维:Embedding——N-gram Embedding。 这是最巧妙的一维,下一节单独展开。

第四维:Optimization——Muon 优化器。 官方围绕三件事做了优化:正交化精度、Muon 与 AdamW 之间的分工(哪些参数交给谁更新)、以及融合参数的拆分方式。此外还针对新架构重新拟合了 scaling law。这条最容易被读者跳过,但它其实是前面三维能落地的前提——架构换了,旧的 scaling law 就失效了,超参怎么配、资源怎么分,全得重新算一遍。

三、N-gram Embedding 与那个 1/9:容量可以「外接」到内存

N-gram Embedding 的思路说穿了不复杂:用局部上下文(若干相邻 token 的组合)去查一张大表,拿到额外的嵌入向量补充进主干。它的价值在于以极低的额外计算换取模型容量的扩张——查表几乎不产生浮点运算,却实打实增加了 51B 参数的知识承载空间。这也解释了一个乍看矛盾的配置:主模型 125B、激活只有 6B,那 51B 的 N-gram 表既不常驻计算,也不挤占激活预算。

更关键的是工程实现:官方明确说明这张 embedding 表可以卸载到主机内存,并通过异步预取与模型计算重叠来完成调度。这一点对本地部署的意义极大。显存一直是长上下文和大模型的硬墙——模型权重、KV 缓存、激活值三方抢显存,谁都退让不得。把一张 51B 参数的表挪到内存,等于把显存账本上最大的一笔固定支出搬了家:只要预取足够提前、PCIe 带宽够用,计算侧几乎察觉不到延迟。换句话说,这个设计把「容量」从「显存」里解耦了出来,让你能用消费级显卡跑一个 125B 量级的多模态模型。这是本次发布里对自部署用户最实在的一条。

效率账则更直观:官方口径是相比 Qwen3.7-Plus,训练成本约 1/9,且在 coding 与 office 两类任务上能力更优。九分之一不是靠砍数据或砍步数省出来的——按 README 的表述,它同时来自混合注意力的计算节省、GR 带来的训练稳定、以及 Muon 与重新拟合的 scaling law。三个来源叠加,才有这个量级的降幅。当然,这是官方自述口径,缺少第三方复现,读的时候打个折。

四、上下文、模态与生产版 Qwen3.8-Flash

能力参数上:原生支持 262,144 tokens,用 YaRN 方法可扩展至 1,000,000 tokens。注意区分「原生」和「扩展」——原生窗口是训练时就见过的长度,扩展是靠位置编码插值外推出来的,两者在长文本末段的稳定性上通常有差异;真要跑满 1M,建议先做自己的召回测试。

模态上支持文本、图像、视频,通过单一 API 处理。这个「单一」是重点:过去做多模态要串一条流水线——先过视觉模型抽特征,再把特征喂给语言模型,中间还要自己对齐格式;单一 API 意味着这些环节被收进模型内部,调用方只管把图片或视频帧丢进去。对 Agent 类应用,这省掉的工程复杂度比省下的钱更值钱。

还需要区分两个名字。Qwen3.8-Flash-Next 是开放权重的研究/预览模型,权重发布在 Hugging Face(Qwen/Qwen3.8-Flash-Next)与 ModelScope;而生产版 Qwen3.8-Flash 在 QwenCloud 提供,默认 1M 上下文、带官方内置工具,并兼容 OpenAI 与 Anthropic API 规范——后者意味着老代码改个 base_url 就能迁。另外务必注意:Qwen3.8-Flash 与 Qwen3.8-Max 是不同型号,Max 是 2.4 万亿参数的 MoE 旗舰,定位和价格都不在一个量级,选型时别看串行。

五、最大的悬念:权重给了,协议文件没给

这一节是本次发布最该被记录的部分。三方交叉验证的事实如下:

  1. GitHub API 的 license 字段返回 None——也就是说 GitHub 没有从仓库中识别到任何标准开源协议。
  2. 仓库根目录只有 README.mdtech_report.pdf,没有 LICENSE 文件。
  3. README 原文写着:「Please find the license file released with the model weights on Hugging Face Hub or ModelScope」——协议文件跟权重一起发,在 HF 或 ModelScope 上。
  4. Hugging Face 讨论区已有帖子,标题为「Why isn't it Apache 2.0 licensed?」。

把这四条放一起,结论只能是这样写:这是一个「开放权重(open weights)」发布,但截至 2026-08-30,其开源协议尚未被本文确认。 我们不断言它是 Apache 2.0,也不断言它不是——仓库侧确实没有协议文件,社区确实在追问,但模型页上随权重发布的协议文件本次未能核验到确定结论。

为什么这件事重要?因为「开放权重」和「开源协议」是两件事。前者意味着你能下载、能跑、能在本地改;后者才决定你能不能把它打包进商业产品、能不能做二次分发、要不要履行署名与衍生协议义务。对一家准备把它接进生产系统的公司来说,这一行字的差别可能是法务能否放行的差别。对照着看更清楚:智谱 GLM-5.3-Flash 上线即明确以 MIT 协议开放权重,腾讯 Hy4 preview 的协议条款也是发布时写明的——协议清不清楚,本身就是厂商对商用姿态的一部分。

所以落到行动上只有一句话:在你把它写进商业产品之前,请自行打开 HF 或 ModelScope 的模型页,读一遍随权重发布的协议原文。 本文只负责指出这个文件需要你自己核对,不替你下结论。

六、价格:三个来源,三个口径

这一块必须如实标注分歧。Qwen3.8-Flash 的 API 定价在 2026-08-30 快照下,三个来源给出的数字并不完全一致:

来源输入(每 1M tokens)输出(每 1M tokens)币种口径
阿里官方 X 账号 @AlibabaGroup$0.16$0.47美元
anotherwrapper(2026-08-28 快照)$0.15$0.47美元
superpowerdaily1 元3 元人民币

美元口径下两个来源只在输入价上差一分($0.16 对 $0.15),输出价一致;人民币口径的 1 元 / 3 元 则是另一套计价体系,不能直接与美元数字比较换算。三个来源均为 2026-08-30 前后的快照,实际价格以 QwenCloud 官网为准——聚合站数据常有滞后,促销与区域计价也会造成偏差。

即便按较高口径的 $0.16 / $0.47 粗算,这个价位也落在「轻量旗舰」区间:一个每天消耗 100M tokens、输入输出比 3:1 的团队,日成本约 24 美元(输入 75M 约 12 美元,输出 25M 约 11.75 美元)。这是按公开报价的粗略估算,未计入缓存命中折扣与批量优惠,仅作量级参照。

七、基准与仓库热度:口径要说清

基准部分必须先把话说在前面:DataCamp 的报道属第三方口径,非官方原文。 其表述是——Qwen3.8-Flash-Next 在已发布的每个 benchmark 上都击败了自家 27B 兄弟模型,并在多数实用 coding 与 agent 评测上超过 Claude Opus 4.6 Max,而每 token 只激活 6B。这个说法相当强,但有两个限定条件:一是「已发布的每个 benchmark」这个集合有多大、由谁挑,报道未说明;二是「超过 Claude Opus 4.6 Max」的具体评测项与幅度,同样未在可核验的表格中给出。

更关键的是:Qwen 官方博客的 benchmark 表格为动态渲染,本次未能抓取,因此官方自测数据本文不予转述。benchmark 请以官方 blog 与技术报告 tech_report.pdf(On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability)为准。 拿第三方报道的数字去做选型决策,风险在自己身上。

仓库热度也如实记录:截至 2026-08-30,GitHub API 实测 QwenLM/Qwen3.8-Flash-Next259 星 / 11 fork,创建于 2026-08-24,最近一次 push 为 2026-08-27,homepage 指向 https://qwen.ai 。259 星对阿里这种体量的发布来说不算高——这从侧面说明,本次发布的声量主要还在技术圈内部,尚未扩散到更广的开发者群体,许可证的悬而未决可能也在压制一部分人的转发意愿。

一句话收尾:当一家厂商把 125B 参数压成 6B 激活、把训练成本砍到九分之一、还把 51B 的 embedding 表卸进内存,技术上的摊牌已经相当彻底——唯一没摊开的,是那张写着你能否商用的纸。


参考来源

本文基于公开报道与官方文档整理(截至 2026-08-30),价格与仓库数据为快照,许可证状态未确认,以官方页面与随权重发布的协议文件为准,非投资建议。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-30

相关文章

开源项目

Qwen3.8-Flash-Next 开源:预览 Qwen4 架构的开放权重

阿里 2026-08-26 在 Hugging Face 与 ModelScope 开源 Qwen3.8-Flash-Next:125B MoE 总参数、每 token 激活 6B,是预览 Qwen4 架构的第一个开放权重模型。原生上下文 262K,YaRN 可外推到 1M;API 报价 \$0.16/\$0.47 每百万 token(约旗舰 Qwen3.8-Max 的十二分之一)。评测:DeepSWE 58.7、SWE-bench Pro 62.5、CoWorkBench 73.9、AndroidWorld 84.5、MathVision 95.7,Agent Arena 开放第 7。采用 qwen-community-1.0 许可证(非 Apache 2.0),允许商用与自托管,商用前须以模型页原文核对条款。

2026年9月4日10 分钟阅读
前沿热点

腾讯开源 770B 旗舰 Hy4 preview:它参与了它自己的训练

腾讯 8 月 28 日发布并开源新一代旗舰 Hy4 preview(770B 总参/49B 激活 MoE,78 层):Gated DSA 稀疏注意力 + IndexCache 跨层索引复用 + iHC 恒等超连接,README 明言架构「inspired by DeepSeek and GLM」,原生 MTP 层支持 3 token 投机解码,1M 上下文,Apache 2.0 开放 BF16+FP8 双版本权重。腾讯内部 163 位专家对 203 个工程任务盲评 2.99/4.00,小胜 GLM-5.3(2.92)与 Kimi K3(2.94,均为内部口径)。最大看点是递归自改进早期闭环:模型首次参与训练方法、数据策略、评测框架与底层算子的自动化优化,自主把推理端到端吞吐提了 31.8%。OpenRouter 快照价输入 $0.834/输出 $2.501 每百万 token,WorkBuddy/CodeBuddy 两周免费。

2026年8月29日6 分钟阅读
前沿热点

「牛来」真身揭晓:智谱开源 GLM-5.3-Flash,追平 Claude Opus 4.8 只花四十分之一价钱

匿名模型 Ox-Alpha 8 月 20 日空降 OpenRouter,首日调用量登顶并终结 DeepSeek 56 天霸榜;8 月 26 日晚智谱官宣揭晓:它就是开源的 GLM-5.3-Flash(320B-A18B)。GLM-5 系列首个原生多模态模型(视频/图像/文本/文件输入),稀疏+线性注意力混合架构让注意力计算量降 3 倍、KV 缓存缩小 4.4 倍;Artificial Analysis 综合智能指数 57 分追平 Claude Opus 4.8,定价(输入 0.8/输出 2.8 元每百万 token)约为其四十分之一,全部流量跑在 10 万张国产算力卡上,权重以 MIT 协议开放。一个转折要记住:缓存命中 0.23 元反而高于 DeepSeek V4-Flash 闲时的 0.05 元,缓存命中率超九成的编程 Agent 先算账再换。

2026年8月27日6 分钟阅读