2026 年 8 月 26 日,Qwen 同一天放出了两样东西:125B 的多模态 MoE 模型 Qwen3.8-Flash-Next,和一个专门给 GDN 写内核的 FlashQLA。并排看,这一年架构竞速的主战场就露出来了——不是参数,不是榜单分数,而是长上下文的注意力成本。
到 2026 年 8 月,「支持 1M 上下文」已是旗舰入场券:Hy4 preview、Kimi K3、GLM-5.3-Flash、DeepSeek V4 系列、生产版 Qwen3.8-Flash 都写着 1M。但「支持 1M」和「用得起 1M」是两件事——稠密注意力下计算量随序列长度膨胀、KV 缓存按长度线性堆积,把 1M 跑起来的代价曾是推理成本翻倍。各家压这条曲线的方式今年分成三条路线:挑 token(稀疏)、压历史(线性/递归)、复用索引(跨层共享稀疏选择结果)。选哪条,直接决定你长上下文场景的显存与账单曲线。
先划边界:本文为代表性对比,非亲自压测;架构描述、参数与降本幅度来自各家官方博客、README、模型卡与公开报道,逐项标注口径(官方发布 / 媒体转引 / 站内往期核真 / 换算 / 工程估算),信息截至 2026-08-30;激活比等派生数字为换算与工程估算口径,不含 KV 缓存与运行时开销;价格与仓库数据为快照,以各官方定价页与官网为准;官方未披露的字段一律标「未采集」,不做推断与外推;非投资建议。
分工先说清:本站 轻量旗舰 API 五强横评 算的是 320B 级 API 单价与缓存账,开源旗舰五强横评 算的是 700B-2.8T 级参数、激活比与部署门槛账,本文算第三本账——注意力架构路线账:各家怎么把长上下文的注意力成本打下来,路线分野在哪,选型该盯什么。三本账独立,选型都要翻。
一、路线总表:五家旗舰,三条路线
先把五家的路线摆在一张表里(口径逐项标注,快照 2026-08-30):
| 模型 | 注意力路线 | 具体机制 | 已披露的降本幅度 | 口径 |
|---|---|---|---|---|
| Qwen3.8-Flash-Next(阿里) | 混合:线性压缩 + 稀疏挑选 | GDN 压缩历史信息;QSA 用压缩过的轻量索引器在微块粒度挑出重要上下文,只对被选中的部分做完整 attention | 训练成本约为 Qwen3.7-Plus 的 1/9(官方称含混合注意力、Gated Residual 与 Muon 的叠加贡献) | 官方博客 / README |
| 腾讯 Hy4 preview | 稀疏挑选 + 跨层索引复用 | Gated DSA(64 头,稀疏索引 top-k 2048)+ IndexCache 跨层稀疏索引复用;官方 README 明写 inspired by DeepSeek and GLM | 未采集 | 官方 README / 新闻稿 |
| 智谱 GLM-5.3-Flash | 混合:稀疏 + 线性注意力 | 首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,配 mHC 流形约束超连接 | 注意力计算量降 3.01 倍、KV 缓存缩小 4.44 倍(对比 GLM-5.3) | 官方发布 / 媒体转引 |
| Kimi K3(月之暗面) | 混合线性注意力 | KDA 混合线性注意力 + 注意力残差 | 未采集 | 腾讯云开发者社区转引 |
| DeepSeek V4-Flash | 未采集 | 结构与 4 月 Preview 一致(2840 亿 / 130 亿 MoE),本轮仅重做后训练 | 未采集 | 官方更新日志 |
三个第一眼结论:
- 纯稀疏只剩一家,混合成了主流。 明确走混合的有三家(Qwen 的 GDN+QSA、智谱的稀疏+线性、Kimi 的 KDA),纯稀疏只有 Hy4 preview,还有一家未披露。原因不复杂:稀疏解决「算哪些」,线性解决「历史怎么存」,两条成本曲线不重叠,叠加更容易把两端同时压住。
- 降本幅度敢给数字的只有智谱一家。 GLM-5.3-Flash 报了计算量降 3.01 倍、KV 缓存缩小 4.44 倍(对比自家 GLM-5.3),是五家里唯一可核对的量化口径。Qwen 的 1/9 是训练侧账,且是混合架构、GR 与 Muon 三者叠加的结果,不能折算成「注意力成本降 9 倍」。Hy4 与 Kimi K3 的注意力降本幅度未采集。能看到的数字,没有一组可直接横向比。
- 有一家的架构至今没查到官方口径。 DeepSeek V4-Flash 的官方更新日志只说结构与尺寸未变、本轮仅重做后训练,注意力机制未披露。这是选型时一个真实的不透明项——它的价格很有竞争力(见第三节),但你不知道自己买的效率来自哪一层。
二、机制拆解:挑 token、压历史、复用索引
路线一:挑 token(稀疏注意力)——QSA 与 Gated DSA。 承认「不是每个历史 token 都值得当前步认真看」,用轻量索引器先挑出重要的,只对选中部分做完整 attention。Hy4 preview 的 Gated DSA 稀疏索引 top-k 2048——每步最多看 2048 个位置,而不是把 1M 全看一遍;再用 IndexCache 做跨层索引复用,上层挑过的结果下层直接用。Qwen 的 QSA 思路相同,但粒度下沉到微块(micro-block),并强调索引器本身是压缩过的——挑选这一步自己也不能贵,否则省下的 attention 又被索引器吃掉。
路线二:压历史(线性/递归)——GDN 与 KDA。 不再保留完整 KV 序列,把已发生的上下文压成紧凑状态,后面的步直接读状态,Gated DeltaNet(GDN)干的就是这件事。代价是压缩有信息损失、质量依赖门控设计;好处是成本对序列长度不再敏感——这是唯一一条从根本上绕开 KV 缓存线性膨胀的路线。Kimi K3 的 KDA 属同一族,并加了注意力残差做补偿。
路线三:混合——GDN+QSA、稀疏+线性。 用线性压掉大部分历史,留一小段用稀疏或完整 attention 保精度,是当前最主流的工程折中。智谱那组数字最能说明价值:计算量降 3.01 倍、KV 缓存缩小 4.44 倍——KV 缓存降幅大于计算量降幅,那正是「压历史」一半在起作用。
把这三条路线放进一句话:激活比省的是算力,注意力机制决定的是长上下文能不能用得起。 前者影响每个 token 烧多少算力,后者决定成本随长度怎么长。
三、辅助列:参数、激活比、上下文、许可证、价格
架构决定曲线,但这五列决定你能不能真的用上它(快照 2026-08-30,激活比为换算口径):
| 模型 | 总参 / 每 token 激活 | 激活比(换算) | 上下文 | 许可证 | API 价格(每百万 token,快照) |
|---|---|---|---|---|---|
| Qwen3.8-Flash-Next | 125B(另挂 51B N-gram embeddings)/ 6B | 约 4.8%(6B/125B);若把 51B N-gram 表计入总参约 3.4% | 原生 262,144,YaRN 扩展至 1,000,000 | 未确认:GitHub API license 字段为 None,仓库无 LICENSE 文件,需在 HF / ModelScope 模型页核对随权重发布的协议 | 生产版 Qwen3.8-Flash:$0.16/$0.47(官方 X 口径);$0.15/$0.47(第三方聚合站 8-28);1 元/3 元(人民币口径)。以 QwenCloud 官网为准 |
| 腾讯 Hy4 preview | 770B / 49B | 约 6.4% | 1M | Apache 2.0 | $0.834/$2.501、缓存读 $0.042(OpenRouter 第三方聚合快照 2026-08-28,非官方牌价) |
| 智谱 GLM-5.3-Flash | 320B / 18B | 约 5.6% | 1M(最大输出 128K) | MIT | 0.8 元 / 2.8 元、缓存命中 0.23 元(官方定价,2026-08-26 上线) |
| Kimi K3 | 2.8 万亿 / 未采集 | 未采集 | 1M | 可商用(条款以官方为准,站内往期口径) | 输出 100 元/M(官方定价转引) |
| DeepSeek V4-Flash | 2840 亿 / 130 亿 | 约 4.6% | 1M | MIT | $0.14/$0.28、缓存命中 $0.0028(官方定价页);国内另有峰谷分时计价 |
三处必须点出来的地方:
- 激活比全落在 5%-6.5% 的窄带里。 换算下来 Qwen 约 4.8%(计入 51B N-gram 表则约 3.4%)、DeepSeek 约 4.6%、智谱约 5.6%、Hy4 约 6.4%。这个维度五家已打不出差距——它是入场券,不是差异化变量。分野回到注意力架构:同样 5% 的激活比,稠密注意力与 GDN+QSA 在 1M 下是完全两条成本曲线。
- Qwen 的 51B N-gram embeddings 是设计上的异类。 它不参与每 token 计算(激活只有 6B),可卸载到主机内存,靠异步预取与计算重叠调度——等于把「容量」从「显存」解耦出去。代价是多一条 PCIe 带宽依赖,收益是 125B 量级模型有了上消费级显卡的可能。
- 许可证是本文唯一标红的一格。 Qwen3.8-Flash-Next 仓库无 LICENSE 文件,GitHub API 的 license 字段返回 None,社区已在追问。我们不断言它是或不是 Apache 2.0,只写未确认。对照着看:Hy4 preview 是 Apache 2.0,GLM-5.3-Flash 与 DeepSeek V4-Flash 是 MIT。开放权重 ≠ 开源协议——前者能下载能跑,后者才决定能否打包进商业产品。商用前请自己打开模型页读一遍协议原文。
四、工程现实:架构成立不等于跑得快
这一节最容易踩坑。
| 维度 | Qwen3.8-Flash-Next | Hy4 preview | GLM-5.3-Flash | Kimi K3 | DeepSeek V4-Flash |
|---|---|---|---|---|---|
| 内核 / 配套工程 | FlashQLA 同日开源(GDN kernel 库,MIT);安装要求 SM90 起跳、CUDA 12.8+、PyTorch 2.8+ | 官方 vLLM / SGLang 预置镜像,TP8 起步;原生 MTP 投机解码层,默认采纳 3 个草稿 token | 自研 SGLang 推理引擎:W8A8 量化 + INT8/FP8/BF16 混合缓存量化 + EPD 三段分离调度,官方称端到端 3 倍 | MXFP4 量化权重(4 bit/参数) | 未采集 |
| 内核提速幅度 | 前向 2-3 倍、反向 2 倍(对比 FLA Triton kernel,官方自评,非第三方复现) | 未采集 | 未采集 | 未采集 | 未采集 |
| 上下文口径 | 原生 262,144,靠 YaRN 外推至 1,000,000 | 原生 1M | 原生 1M | 原生 1M | 原生 1M |
| 权重 / 量化格式 | 未采集 | BF16 + FP8 双格式 | 未采集 | MXFP4 | 未采集 |
四条读法:
- 「原生」和「外推」不是一个意思。 五家里只有 Qwen3.8-Flash-Next 的 1M 是靠 YaRN 从原生 262,144 外推出来的,其余四家标的都是原生 1M。原生窗口是训练时见过的长度,外推是位置编码插值,长文本末段稳定性通常有差异。这不是说外推不能用,是提醒你:真要跑满 1M,先做自己的召回测试,别拿标称数字做容量规划。
- 新架构的速度债,得有人写内核来还。 Qwen 把模型与 GDN 内核库同日放出,这个动作本身就是答案。但要咬准 FlashQLA 那 2-3 倍的参照系——基线是 FLA Triton kernel,不是所有后端,也不是手写 CUDA 版;官方点名的收益场景是预训练与端侧 agentic 推理。
- 内核门槛可能比模型门槛更高。 FlashQLA 要求 SM90 起跳,即需要 Hopper(H100/H800 一代)或 Blackwell 世代的卡,A100(SM80)与消费级 RTX 30/40 系(SM86/SM89)不在支持列表;CUDA 12.8 与 PyTorch 2.8 是硬线。想让 GDN 跑出官方那个速度,硬件门槛比跑起模型本身更硬。
- Hy4 与 GLM 给的是另一条解法:官方预置镜像。 Hy4 直接给 vLLM / SGLang 镜像,部署文档按集群口径写;GLM 自研 SGLang 推理引擎,量化与调度一起交付。对没有内核团队的部署方,有没有官方镜像比架构多先进更影响落地周期。
五、按场景选:五条结论
- 要长上下文成本曲线最可控、且能接受协议待确认:Qwen3.8-Flash-Next。GDN+QSA 把「压历史」与「挑 token」两端都占住,6B 激活(约 4.8%)加上可卸载到内存的 51B N-gram 表,是自部署友好度最高的一套设计;FlashQLA 同日开源说明内核不是空头支票。但协议未确认,商用前必须先去 HF / ModelScope 模型页核对,动手见本站 Qwen3.8-Flash-Next 本地部署 SOP(同批)。
- 要协议干净 + 降本有量化数字:智谱 GLM-5.3-Flash。MIT、1M 上下文、计算量降 3.01 倍与 KV 缓存缩小 4.44 倍(官方口径,对比 GLM-5.3)、320B/18B。五家里唯一把架构降本报成可核对数字的一家,低价不是烧钱,是新架构给的底气。
- 要协议干净 + 官方镜像齐全 + 极致稀疏路线:腾讯 Hy4 preview。Apache 2.0、BF16/FP8 双格式、Gated DSA + IndexCache、原生 MTP 投机解码、vLLM/SGLang 镜像。挑 token 路线的代表,适合想直接吃稀疏红利、不想折腾内核的团队;代价是 770B 全量驻显存。
- 要规模上限、注意力降本不是第一优先级:Kimi K3。2.8 万亿总参、KDA 混合线性注意力、MXFP4 压显存、1M 上下文。它解决的是能力天花板,输出 100 元/M 是溢价档,不是性价比选项。
- 所有场景共同的一条:2026 年选旗舰,先把注意力架构当一等公民再谈参数。激活比已收敛到 5%-6.5% 的窄带,打不出差距;真正决定长上下文账单的是注意力路线、上下文是原生还是外推、有没有配套内核与官方镜像。三本账都要翻——参数与部署门槛账 与 API 价格与缓存账 看另外两篇;最后一条:协议未确认的模型,商用前务必先查模型页。
一句话收尾:当激活比卷到 5% 上下、1M 上下文人人都有,旗舰之分不再是参数大小,而是谁的注意力让长上下文真的用得起——至于那张写着你能否商用的纸,比任何 3.01 倍都该先翻开。
常见问题
Q1:稀疏注意力和线性注意力到底差在哪? A1:差在省的是哪一笔账。稀疏注意力(QSA、Gated DSA)是「挑 token」:仍保留完整 KV 序列,但每步只对索引器挑出的重要位置做完整 attention,省的是计算量。线性/递归注意力(GDN、KDA)是「压历史」:把已发生的上下文压成紧凑状态,省的是KV 缓存与随长度增长的那部分开销,代价是压缩损失。前者优化算多少,后者优化存多少,混合架构就是把两笔一起省。
Q2:「支持 1M 上下文」就能直接跑满 1M 吗? A2:不一定,先看是原生还是外推。Hy4 preview、GLM-5.3-Flash、Kimi K3、DeepSeek V4-Flash 标的都是原生 1M;Qwen3.8-Flash-Next 原生窗口是 262,144,1,000,000 靠 YaRN 插值外推(生产版 Qwen3.8-Flash 默认 1M,以官网为准)。外推在长文本末段的稳定性通常与原生有差异,跑满 1M 前建议先做自己的召回测试。
Q3:激活比和注意力架构,哪个对成本影响更大? A3:看上下文有多长。激活比决定每 token 烧多少算力,但它已收敛——五家换算下来落在约 4.6%-6.4% 的窄带(Qwen 计入 51B N-gram 表约 3.4%),打不出差距。注意力架构决定成本随序列长度怎么长:短上下文(几万 token 内)激活比更主导,长上下文(几十万到 1M)注意力架构立刻变成第一变量。Agent、整仓代码、长研报这类场景,先问路线再问参数。
Q4:Qwen3.8-Flash-Next 的许可证到底能不能商用?
A4:本文标注为未确认,不替你下结论。可核对的事实:GitHub API 的 license 字段返回 None,仓库根目录只有 README.md 与 tech_report.pdf;README 原话是协议文件随权重发布在 Hugging Face Hub 或 ModelScope,HF 讨论区已有帖子在追问。开放权重(能下载、能跑、能改)与开源协议(能否商用、能否二次分发)是两件事,商用前请自行打开模型页读一遍协议原文。
Q5:自部署的话,光看架构够不够? A5:不够,还得看内核、硬件门槛和官方镜像。新架构的速度债要有人还——Qwen 用同日开源的 FlashQLA 还,但它要求 SM90 起跳、CUDA 12.8+、PyTorch 2.8+,A100 与消费级 RTX 30/40 系不在支持列表;Hy4 preview 与 GLM-5.3-Flash 走另一条路,直接给 vLLM/SGLang 镜像与自研推理引擎。另外总参决定权重驻留显存,770B 与 2.8 万亿都是集群级门槛。
参考来源
-
Qwen 官方博客(2026-08-26):125B + 51B N-gram embeddings、6B 激活、GDN + QSA、Gated Residual、Muon、原生 262,144 / YaRN 1M、训练成本约 Qwen3.7-Plus 的 1/9:https://qwen.ai/blog?id=qwen3.8-flash-next
-
GitHub 仓库 QwenLM/Qwen3.8-Flash-Next(README 与 API 实测,2026-08-30 快照:259 星 / 11 fork,license 字段为 None):https://github.com/QwenLM/Qwen3.8-Flash-Next
-
技术报告 tech_report.pdf(On the Design of Qwen3.8-Next Architecture):https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
-
Hugging Face 模型页 Qwen/Qwen3.8-Flash-Next(协议以随权重发布者为准):https://huggingface.co/Qwen/Qwen3.8-Flash-Next
-
ModelScope 模型页 Qwen/Qwen3.8-Flash-Next:https://www.modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
-
DataCamp 第三方报道(benchmark 与价格口径,非官方原表):https://www.datacamp.com/blog/qwen3-8-flash-next
-
QwenLM/FlashQLA(GDN 内核库,MIT;前向 2-3 倍 / 反向 2 倍对比 FLA Triton kernel 为官方自评;SM90 起跳、CUDA 12.8+、PyTorch 2.8+):https://github.com/QwenLM/FlashQLA
-
腾讯官方新闻稿(2026-08-28)与混元 Hy4 preview 仓库:770B/49B、Gated DSA(top-k 2048)+ IndexCache、1M、Apache 2.0、BF16/FP8:https://www.tencent.com/tencent-releases-and-open-sources-tencent-hy4-preview ;https://github.com/Tencent-Hunyuan/Hy4-preview
-
Gated DSA 论文:https://arxiv.org/abs/2512.02556 ;IndexCache 论文:https://arxiv.org/abs/2603.12201
-
OpenRouter Hy4 preview 页面(第三方聚合快照 2026-08-28,$0.834/$2.501、缓存读 $0.042):https://openrouter.ai/tencent/hy4-preview
-
腾讯云开发者社区(2026-07-17):Kimi K3 2.8 万亿参数、KDA 混合线性注意力、MXFP4:https://cloud.tencent.com/developer/news/4268105
-
智谱 AI 开放文档 GLM-5.3-Flash 模型卡(320B/18B、稀疏+线性混合、mHC、1M、MIT):https://docs.bigmodel.cn/cn/guide/models/vlm/glm-5.3-flash
-
财联社/科创板日报(2026-08-27):注意力计算量降 3.01 倍、KV 缓存缩小 4.44 倍、定价 0.8 元 / 2.8 元、10 万张国产卡:https://baijiahao.baidu.com/s?id=1874642322871069438
-
蓝鲸新闻(2026-08-27):https://baijiahao.baidu.com/s?id=1874660001676882489
-
DeepSeek API 官方更新日志(2026-07-31,V4-Flash 正式版 2840 亿 / 130 亿 MoE、仅重做后训练):https://api-docs.deepseek.com/zh-cn/updates
-
DeepSeek 官方定价页(V4-Flash $0.14/$0.28、缓存命中 $0.0028):https://deepseek.ai/pricing
-
Morph(V4-Flash 284B MoE、1M 上下文、MIT):https://www.morphllm.com/deepseek-v4-flash
-
关联阅读:本站 Qwen3.8-Flash-Next 多模态热点(同批主角解析)、Qwen3.8-Flash-Next 本地部署 SOP(同批)、FlashQLA 开源解析(同批内核篇);往期 开源旗舰五强横评(参数与部署门槛账)、轻量旗舰 API 五强横评(价格与缓存账)、智谱 GLM-5.3-Flash 开源热点、腾讯 Hy4 preview 开源热点、DeepSeek V4-Flash 上线热点
本文为代表性横评,基于公开报道与官方发布整理,快照 2026-08-30,非亲自压测,非投资建议;架构与降本幅度以各家官方口径为准,激活比等派生数字为换算或工程估算口径;Qwen3.8-Flash-Next 许可证状态未确认,商用前请以 HF / ModelScope 模型页随权重发布的协议文件为准;价格与仓库数据随时可能调整,采购前以各官方定价页为准。