2026 年 8 月 26 日,Qwen 官方博客与 GitHub 仓库同步放出 Qwen3.8-Flash-Next。参数配置很有冲击力:主模型 125B,额外挂 51B 的 N-gram embeddings,而每生成一个 token 只激活 6B;官方口径是训练成本约为 Qwen3.7-Plus 的九分之一,coding 与 office 任务能力反而更优。但真正让社区炸锅的不是参数,是仓库状态——GitHub API 的 license 字段返回 None,根目录只有 README.md 和 tech_report.pdf,没有 LICENSE 文件,而 Hugging Face 讨论区已经出现一条帖子,标题写着「Why isn't it Apache 2.0 licensed?」。权重给了,协议文件没给,这是本次发布最大的悬念。
先说边界:本文事实基于 Qwen 官方博客、QwenLM/Qwen3.8-Flash-Next 仓库 README 与 GitHub API 实测数据(创建 2026-08-24、最近 push 2026-08-27、259 星 / 11 fork)、Hugging Face 与 ModelScope 模型页,以及第三方报道(DataCamp、anotherwrapper、superpowerdaily)整理;信息截至 2026-08-30,仓库与模型页状态可能已变化。价格为 2026-08-30 快照,不同来源口径存在出入,实际以 QwenCloud 官网为准。许可证状态未确认:本文不断言它是或不是 Apache 2.0,商用前请自行核对 HF / ModelScope 模型页随权重发布的协议文件。benchmark 数据凡非官方原表格者均标注来源口径。非投资建议。
一、这次发布到底是什么:Qwen4 架构的早期预览
先校准定位,这是最容易被漏掉的一层。Qwen3.8-Flash-Next 是一个多模态 MoE 模型,但它同时扮演另一个角色——Qwen4 架构的早期预览。官方给出的类比很直白:它的角色等同于当年 Qwen3-Next 之于 Qwen3.5。而那次的结果我们已经知道了:Qwen3-Next 上的 Gated DeltaNet + Gated Attention 混合设计,后来被 Qwen3.5、3.6、3.7、3.8 整个系列沿用下来。
换句话说,「Next」这个后缀在 Qwen 的命名体系里不是编号游戏,而是下代架构的先行验证场:先在中小规模上把新设计的训练稳定性、效率与效果跑通,验证成立后再铺进后续主力型号。所以看这次发布,参数只是入场券,架构那四维改动才是真正要读的东西——它们大概率会出现在你半年后用的主力模型里。
| 项目 | Qwen3.8-Flash-Next | 备注 |
|---|---|---|
| 类型 | 多模态 MoE | 同时是 Qwen4 架构早期预览 |
| 主模型参数 | 125B | 官方口径 |
| 额外 N-gram embeddings | 51B | 可卸载到主机内存 |
| 每 token 激活 | 6B | 官方口径 |
| 原生上下文 | 262,144 tokens | YaRN 可扩展至 1,000,000 |
| 模态 | 文本 / 图像 / 视频 | 通过单一 API 处理 |
| 训练成本 | 约为 Qwen3.7-Plus 的 1/9 | 官方口径 |
二、架构四维升级:Attention、Residual、Embedding、Optimization
README 把这次的架构改动归纳为四个维度。我们逐条拆。
第一维:Attention——GDN + QSA 混合。 Gated DeltaNet(GDN)负责高效压缩历史信息,把已经发生过的上下文压成紧凑状态,而不是让每一层都重新算一遍全序列。与之搭配的是全新的 Qwen Sparse Attention(QSA):用一个压缩过的轻量索引器,在微块(micro-block)粒度上挑选出重要上下文,只对被选中的部分做完整 attention。这个组合的直接收益是长序列 attention 成本大幅下降——这也是它能原生撑到 262,144 上下文、还能用 YaRN 拉到 1,000,000 的底层原因。值得注意的是,「稀疏注意力」这两年已经是各家架构竞速的主战场,本批姊妹篇有专门横评,可以对照着看。
第二维:Residual——Gated Residual(GR)。 传统残差流是一条主干通道,GR 把残差流扩展为 4 个分支,并用动态门控控制每个分支的读写强度。这样做的好处有两个:一是跨层信息流有了更多并行通路,浅层特征不必被深层反复覆盖;二是门控可学习,训练时的梯度传播更平滑,官方把这条归到「强化训练稳定性」上。对 MoE 这种本身训练就容易抖的架构,稳定性往往比单点性能更值钱。
第三维:Embedding——N-gram Embedding。 这是最巧妙的一维,下一节单独展开。
第四维:Optimization——Muon 优化器。 官方围绕三件事做了优化:正交化精度、Muon 与 AdamW 之间的分工(哪些参数交给谁更新)、以及融合参数的拆分方式。此外还针对新架构重新拟合了 scaling law。这条最容易被读者跳过,但它其实是前面三维能落地的前提——架构换了,旧的 scaling law 就失效了,超参怎么配、资源怎么分,全得重新算一遍。
三、N-gram Embedding 与那个 1/9:容量可以「外接」到内存
N-gram Embedding 的思路说穿了不复杂:用局部上下文(若干相邻 token 的组合)去查一张大表,拿到额外的嵌入向量补充进主干。它的价值在于以极低的额外计算换取模型容量的扩张——查表几乎不产生浮点运算,却实打实增加了 51B 参数的知识承载空间。这也解释了一个乍看矛盾的配置:主模型 125B、激活只有 6B,那 51B 的 N-gram 表既不常驻计算,也不挤占激活预算。
更关键的是工程实现:官方明确说明这张 embedding 表可以卸载到主机内存,并通过异步预取与模型计算重叠来完成调度。这一点对本地部署的意义极大。显存一直是长上下文和大模型的硬墙——模型权重、KV 缓存、激活值三方抢显存,谁都退让不得。把一张 51B 参数的表挪到内存,等于把显存账本上最大的一笔固定支出搬了家:只要预取足够提前、PCIe 带宽够用,计算侧几乎察觉不到延迟。换句话说,这个设计把「容量」从「显存」里解耦了出来,让你能用消费级显卡跑一个 125B 量级的多模态模型。这是本次发布里对自部署用户最实在的一条。
效率账则更直观:官方口径是相比 Qwen3.7-Plus,训练成本约 1/9,且在 coding 与 office 两类任务上能力更优。九分之一不是靠砍数据或砍步数省出来的——按 README 的表述,它同时来自混合注意力的计算节省、GR 带来的训练稳定、以及 Muon 与重新拟合的 scaling law。三个来源叠加,才有这个量级的降幅。当然,这是官方自述口径,缺少第三方复现,读的时候打个折。
四、上下文、模态与生产版 Qwen3.8-Flash
能力参数上:原生支持 262,144 tokens,用 YaRN 方法可扩展至 1,000,000 tokens。注意区分「原生」和「扩展」——原生窗口是训练时就见过的长度,扩展是靠位置编码插值外推出来的,两者在长文本末段的稳定性上通常有差异;真要跑满 1M,建议先做自己的召回测试。
模态上支持文本、图像、视频,通过单一 API 处理。这个「单一」是重点:过去做多模态要串一条流水线——先过视觉模型抽特征,再把特征喂给语言模型,中间还要自己对齐格式;单一 API 意味着这些环节被收进模型内部,调用方只管把图片或视频帧丢进去。对 Agent 类应用,这省掉的工程复杂度比省下的钱更值钱。
还需要区分两个名字。Qwen3.8-Flash-Next 是开放权重的研究/预览模型,权重发布在 Hugging Face(Qwen/Qwen3.8-Flash-Next)与 ModelScope;而生产版 Qwen3.8-Flash 在 QwenCloud 提供,默认 1M 上下文、带官方内置工具,并兼容 OpenAI 与 Anthropic API 规范——后者意味着老代码改个 base_url 就能迁。另外务必注意:Qwen3.8-Flash 与 Qwen3.8-Max 是不同型号,Max 是 2.4 万亿参数的 MoE 旗舰,定位和价格都不在一个量级,选型时别看串行。
五、最大的悬念:权重给了,协议文件没给
这一节是本次发布最该被记录的部分。三方交叉验证的事实如下:
- GitHub API 的 license 字段返回 None——也就是说 GitHub 没有从仓库中识别到任何标准开源协议。
- 仓库根目录只有
README.md与tech_report.pdf,没有 LICENSE 文件。 - README 原文写着:「Please find the license file released with the model weights on Hugging Face Hub or ModelScope」——协议文件跟权重一起发,在 HF 或 ModelScope 上。
- Hugging Face 讨论区已有帖子,标题为「Why isn't it Apache 2.0 licensed?」。
把这四条放一起,结论只能是这样写:这是一个「开放权重(open weights)」发布,但截至 2026-08-30,其开源协议尚未被本文确认。 我们不断言它是 Apache 2.0,也不断言它不是——仓库侧确实没有协议文件,社区确实在追问,但模型页上随权重发布的协议文件本次未能核验到确定结论。
为什么这件事重要?因为「开放权重」和「开源协议」是两件事。前者意味着你能下载、能跑、能在本地改;后者才决定你能不能把它打包进商业产品、能不能做二次分发、要不要履行署名与衍生协议义务。对一家准备把它接进生产系统的公司来说,这一行字的差别可能是法务能否放行的差别。对照着看更清楚:智谱 GLM-5.3-Flash 上线即明确以 MIT 协议开放权重,腾讯 Hy4 preview 的协议条款也是发布时写明的——协议清不清楚,本身就是厂商对商用姿态的一部分。
所以落到行动上只有一句话:在你把它写进商业产品之前,请自行打开 HF 或 ModelScope 的模型页,读一遍随权重发布的协议原文。 本文只负责指出这个文件需要你自己核对,不替你下结论。
六、价格:三个来源,三个口径
这一块必须如实标注分歧。Qwen3.8-Flash 的 API 定价在 2026-08-30 快照下,三个来源给出的数字并不完全一致:
| 来源 | 输入(每 1M tokens) | 输出(每 1M tokens) | 币种口径 |
|---|---|---|---|
| 阿里官方 X 账号 @AlibabaGroup | $0.16 | $0.47 | 美元 |
| anotherwrapper(2026-08-28 快照) | $0.15 | $0.47 | 美元 |
| superpowerdaily | 1 元 | 3 元 | 人民币 |
美元口径下两个来源只在输入价上差一分($0.16 对 $0.15),输出价一致;人民币口径的 1 元 / 3 元 则是另一套计价体系,不能直接与美元数字比较换算。三个来源均为 2026-08-30 前后的快照,实际价格以 QwenCloud 官网为准——聚合站数据常有滞后,促销与区域计价也会造成偏差。
即便按较高口径的 $0.16 / $0.47 粗算,这个价位也落在「轻量旗舰」区间:一个每天消耗 100M tokens、输入输出比 3:1 的团队,日成本约 24 美元(输入 75M 约 12 美元,输出 25M 约 11.75 美元)。这是按公开报价的粗略估算,未计入缓存命中折扣与批量优惠,仅作量级参照。
七、基准与仓库热度:口径要说清
基准部分必须先把话说在前面:DataCamp 的报道属第三方口径,非官方原文。 其表述是——Qwen3.8-Flash-Next 在已发布的每个 benchmark 上都击败了自家 27B 兄弟模型,并在多数实用 coding 与 agent 评测上超过 Claude Opus 4.6 Max,而每 token 只激活 6B。这个说法相当强,但有两个限定条件:一是「已发布的每个 benchmark」这个集合有多大、由谁挑,报道未说明;二是「超过 Claude Opus 4.6 Max」的具体评测项与幅度,同样未在可核验的表格中给出。
更关键的是:Qwen 官方博客的 benchmark 表格为动态渲染,本次未能抓取,因此官方自测数据本文不予转述。benchmark 请以官方 blog 与技术报告 tech_report.pdf(On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability)为准。 拿第三方报道的数字去做选型决策,风险在自己身上。
仓库热度也如实记录:截至 2026-08-30,GitHub API 实测 QwenLM/Qwen3.8-Flash-Next 为 259 星 / 11 fork,创建于 2026-08-24,最近一次 push 为 2026-08-27,homepage 指向 https://qwen.ai 。259 星对阿里这种体量的发布来说不算高——这从侧面说明,本次发布的声量主要还在技术圈内部,尚未扩散到更广的开发者群体,许可证的悬而未决可能也在压制一部分人的转发意愿。
一句话收尾:当一家厂商把 125B 参数压成 6B 激活、把训练成本砍到九分之一、还把 51B 的 embedding 表卸进内存,技术上的摊牌已经相当彻底——唯一没摊开的,是那张写着你能否商用的纸。
参考来源
-
Qwen 官方博客(2026-08-26):https://qwen.ai/blog?id=qwen3.8-flash-next
-
GitHub 仓库 QwenLM/Qwen3.8-Flash-Next(README 与 API 实测,2026-08-30 快照):https://github.com/QwenLM/Qwen3.8-Flash-Next
-
技术报告 tech_report.pdf:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
-
Hugging Face 模型页 Qwen/Qwen3.8-Flash-Next:https://huggingface.co/Qwen/Qwen3.8-Flash-Next
-
ModelScope 模型页 Qwen/Qwen3.8-Flash-Next:https://www.modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
-
DataCamp 第三方评测与价格报道:https://www.datacamp.com/blog/qwen3-8-flash-next
-
关联阅读:本批姊妹篇 Qwen3.8-Flash-Next 本地部署 SOP、稀疏注意力架构横评、FlashQLA 开源解析;往期 智谱 GLM-5.3-Flash 开源热点、腾讯 Hy4 preview 开源热点、Qwen3.8-Max 发布(与 Flash 为不同型号)
本文基于公开报道与官方文档整理(截至 2026-08-30),价格与仓库数据为快照,许可证状态未确认,以官方页面与随权重发布的协议文件为准,非投资建议。