硬核横评
硬核横评

稀疏注意力五强横评:QSA 挑 token、GDN 压历史、DSA 复用索引,长上下文用不用得起看这一层

长上下文的注意力成本,各家是用不同办法打下来的——本篇按「架构路线」而非参数或价格给开放权重旗舰分个类。主角 Qwen3.8-Flash-Next 走 GDN 压缩历史 + QSA 微块粒度挑重点的混合路线(125B 主模型 + 51B N-gram embedding,每 token 激活 6B,原生 262,144 可 YaRN 外推到 1M);对照 Hy4 preview 的 Gated DSA 加 IndexCache 跨层索引复用、GLM-5.3-Flash 的稀疏与线性注意力混合、以及 DeepSeek 的 DSA 路线。路线分野归纳为三类:稀疏挑 token、线性/递归压缩、以及两者混合;再用参数、激活比、上下文、许可证与 API 价格快照做辅助列。与站内两篇旧横评分工:那两篇分别算 320B 级 API 价格账与 700B-2.8T 级部署门槛账,本篇只算架构路线账。选型结论给出五条场景路线,并提醒一句:激活比省的是算力,注意力机制决定的是长上下文能不能用得起;协议未确认的模型,商用前先查模型页。

发布于 2026年8月30日9 分钟阅读
<!-- sparse-attention-architecture-comparison-review | review | 稀疏注意力五强横评:QSA 挑 token、GDN 压历史、DSA 复用索引,长上下文用不用得起看这一层 -->

2026 年 8 月 26 日,Qwen 同一天放出了两样东西:125B 的多模态 MoE 模型 Qwen3.8-Flash-Next,和一个专门给 GDN 写内核的 FlashQLA。并排看,这一年架构竞速的主战场就露出来了——不是参数,不是榜单分数,而是长上下文的注意力成本

到 2026 年 8 月,「支持 1M 上下文」已是旗舰入场券:Hy4 preview、Kimi K3、GLM-5.3-Flash、DeepSeek V4 系列、生产版 Qwen3.8-Flash 都写着 1M。但「支持 1M」和「用得起 1M」是两件事——稠密注意力下计算量随序列长度膨胀、KV 缓存按长度线性堆积,把 1M 跑起来的代价曾是推理成本翻倍。各家压这条曲线的方式今年分成三条路线:挑 token(稀疏)、压历史(线性/递归)、复用索引(跨层共享稀疏选择结果)。选哪条,直接决定你长上下文场景的显存与账单曲线。

先划边界:本文为代表性对比,非亲自压测;架构描述、参数与降本幅度来自各家官方博客、README、模型卡与公开报道,逐项标注口径(官方发布 / 媒体转引 / 站内往期核真 / 换算 / 工程估算),信息截至 2026-08-30;激活比等派生数字为换算与工程估算口径,不含 KV 缓存与运行时开销;价格与仓库数据为快照,以各官方定价页与官网为准;官方未披露的字段一律标「未采集」,不做推断与外推;非投资建议。

分工先说清:本站 轻量旗舰 API 五强横评 算的是 320B 级 API 单价与缓存账开源旗舰五强横评 算的是 700B-2.8T 级参数、激活比与部署门槛账本文算第三本账——注意力架构路线账:各家怎么把长上下文的注意力成本打下来,路线分野在哪,选型该盯什么。三本账独立,选型都要翻。

一、路线总表:五家旗舰,三条路线

先把五家的路线摆在一张表里(口径逐项标注,快照 2026-08-30):

模型注意力路线具体机制已披露的降本幅度口径
Qwen3.8-Flash-Next(阿里)混合:线性压缩 + 稀疏挑选GDN 压缩历史信息;QSA 用压缩过的轻量索引器在微块粒度挑出重要上下文,只对被选中的部分做完整 attention训练成本约为 Qwen3.7-Plus 的 1/9(官方称含混合注意力、Gated Residual 与 Muon 的叠加贡献)官方博客 / README
腾讯 Hy4 preview稀疏挑选 + 跨层索引复用Gated DSA(64 头,稀疏索引 top-k 2048)+ IndexCache 跨层稀疏索引复用;官方 README 明写 inspired by DeepSeek and GLM未采集官方 README / 新闻稿
智谱 GLM-5.3-Flash混合:稀疏 + 线性注意力首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,配 mHC 流形约束超连接注意力计算量降 3.01 倍、KV 缓存缩小 4.44 倍(对比 GLM-5.3)官方发布 / 媒体转引
Kimi K3(月之暗面)混合线性注意力KDA 混合线性注意力 + 注意力残差未采集腾讯云开发者社区转引
DeepSeek V4-Flash未采集结构与 4 月 Preview 一致(2840 亿 / 130 亿 MoE),本轮仅重做后训练未采集官方更新日志

三个第一眼结论:

  1. 纯稀疏只剩一家,混合成了主流。 明确走混合的有三家(Qwen 的 GDN+QSA、智谱的稀疏+线性、Kimi 的 KDA),纯稀疏只有 Hy4 preview,还有一家未披露。原因不复杂:稀疏解决「算哪些」,线性解决「历史怎么存」,两条成本曲线不重叠,叠加更容易把两端同时压住。
  2. 降本幅度敢给数字的只有智谱一家。 GLM-5.3-Flash 报了计算量降 3.01 倍、KV 缓存缩小 4.44 倍(对比自家 GLM-5.3),是五家里唯一可核对的量化口径。Qwen 的 1/9 是训练侧账,且是混合架构、GR 与 Muon 三者叠加的结果,不能折算成「注意力成本降 9 倍」。Hy4 与 Kimi K3 的注意力降本幅度未采集。能看到的数字,没有一组可直接横向比。
  3. 有一家的架构至今没查到官方口径。 DeepSeek V4-Flash 的官方更新日志只说结构与尺寸未变、本轮仅重做后训练,注意力机制未披露。这是选型时一个真实的不透明项——它的价格很有竞争力(见第三节),但你不知道自己买的效率来自哪一层。

二、机制拆解:挑 token、压历史、复用索引

路线一:挑 token(稀疏注意力)——QSA 与 Gated DSA。 承认「不是每个历史 token 都值得当前步认真看」,用轻量索引器先挑出重要的,只对选中部分做完整 attention。Hy4 preview 的 Gated DSA 稀疏索引 top-k 2048——每步最多看 2048 个位置,而不是把 1M 全看一遍;再用 IndexCache 做跨层索引复用,上层挑过的结果下层直接用。Qwen 的 QSA 思路相同,但粒度下沉到微块(micro-block),并强调索引器本身是压缩过的——挑选这一步自己也不能贵,否则省下的 attention 又被索引器吃掉。

路线二:压历史(线性/递归)——GDN 与 KDA。 不再保留完整 KV 序列,把已发生的上下文压成紧凑状态,后面的步直接读状态,Gated DeltaNet(GDN)干的就是这件事。代价是压缩有信息损失、质量依赖门控设计;好处是成本对序列长度不再敏感——这是唯一一条从根本上绕开 KV 缓存线性膨胀的路线。Kimi K3 的 KDA 属同一族,并加了注意力残差做补偿。

路线三:混合——GDN+QSA、稀疏+线性。 用线性压掉大部分历史,留一小段用稀疏或完整 attention 保精度,是当前最主流的工程折中。智谱那组数字最能说明价值:计算量降 3.01 倍、KV 缓存缩小 4.44 倍——KV 缓存降幅大于计算量降幅,那正是「压历史」一半在起作用。

把这三条路线放进一句话:激活比省的是算力,注意力机制决定的是长上下文能不能用得起。 前者影响每个 token 烧多少算力,后者决定成本随长度怎么长。

三、辅助列:参数、激活比、上下文、许可证、价格

架构决定曲线,但这五列决定你能不能真的用上它(快照 2026-08-30,激活比为换算口径):

模型总参 / 每 token 激活激活比(换算)上下文许可证API 价格(每百万 token,快照)
Qwen3.8-Flash-Next125B(另挂 51B N-gram embeddings)/ 6B约 4.8%(6B/125B);若把 51B N-gram 表计入总参约 3.4%原生 262,144,YaRN 扩展至 1,000,000未确认:GitHub API license 字段为 None,仓库无 LICENSE 文件,需在 HF / ModelScope 模型页核对随权重发布的协议生产版 Qwen3.8-Flash:$0.16/$0.47(官方 X 口径);$0.15/$0.47(第三方聚合站 8-28);1 元/3 元(人民币口径)。以 QwenCloud 官网为准
腾讯 Hy4 preview770B / 49B约 6.4%1MApache 2.0$0.834/$2.501、缓存读 $0.042(OpenRouter 第三方聚合快照 2026-08-28,非官方牌价)
智谱 GLM-5.3-Flash320B / 18B约 5.6%1M(最大输出 128K)MIT0.8 元 / 2.8 元、缓存命中 0.23 元(官方定价,2026-08-26 上线)
Kimi K32.8 万亿 / 未采集未采集1M可商用(条款以官方为准,站内往期口径)输出 100 元/M(官方定价转引)
DeepSeek V4-Flash2840 亿 / 130 亿约 4.6%1MMIT$0.14/$0.28、缓存命中 $0.0028(官方定价页);国内另有峰谷分时计价

三处必须点出来的地方:

  1. 激活比全落在 5%-6.5% 的窄带里。 换算下来 Qwen 约 4.8%(计入 51B N-gram 表则约 3.4%)、DeepSeek 约 4.6%、智谱约 5.6%、Hy4 约 6.4%。这个维度五家已打不出差距——它是入场券,不是差异化变量。分野回到注意力架构:同样 5% 的激活比,稠密注意力与 GDN+QSA 在 1M 下是完全两条成本曲线。
  2. Qwen 的 51B N-gram embeddings 是设计上的异类。 它不参与每 token 计算(激活只有 6B),可卸载到主机内存,靠异步预取与计算重叠调度——等于把「容量」从「显存」解耦出去。代价是多一条 PCIe 带宽依赖,收益是 125B 量级模型有了上消费级显卡的可能。
  3. 许可证是本文唯一标红的一格。 Qwen3.8-Flash-Next 仓库无 LICENSE 文件,GitHub API 的 license 字段返回 None,社区已在追问。我们不断言它是或不是 Apache 2.0,只写未确认。对照着看:Hy4 preview 是 Apache 2.0,GLM-5.3-Flash 与 DeepSeek V4-Flash 是 MIT。开放权重 ≠ 开源协议——前者能下载能跑,后者才决定能否打包进商业产品。商用前请自己打开模型页读一遍协议原文。

四、工程现实:架构成立不等于跑得快

这一节最容易踩坑。

维度Qwen3.8-Flash-NextHy4 previewGLM-5.3-FlashKimi K3DeepSeek V4-Flash
内核 / 配套工程FlashQLA 同日开源(GDN kernel 库,MIT);安装要求 SM90 起跳、CUDA 12.8+、PyTorch 2.8+官方 vLLM / SGLang 预置镜像,TP8 起步;原生 MTP 投机解码层,默认采纳 3 个草稿 token自研 SGLang 推理引擎:W8A8 量化 + INT8/FP8/BF16 混合缓存量化 + EPD 三段分离调度,官方称端到端 3 倍MXFP4 量化权重(4 bit/参数)未采集
内核提速幅度前向 2-3 倍、反向 2 倍(对比 FLA Triton kernel,官方自评,非第三方复现未采集未采集未采集未采集
上下文口径原生 262,144,靠 YaRN 外推至 1,000,000原生 1M原生 1M原生 1M原生 1M
权重 / 量化格式未采集BF16 + FP8 双格式未采集MXFP4未采集

四条读法:

  1. 「原生」和「外推」不是一个意思。 五家里只有 Qwen3.8-Flash-Next 的 1M 是靠 YaRN 从原生 262,144 外推出来的,其余四家标的都是原生 1M。原生窗口是训练时见过的长度,外推是位置编码插值,长文本末段稳定性通常有差异。这不是说外推不能用,是提醒你:真要跑满 1M,先做自己的召回测试,别拿标称数字做容量规划。
  2. 新架构的速度债,得有人写内核来还。 Qwen 把模型与 GDN 内核库同日放出,这个动作本身就是答案。但要咬准 FlashQLA 那 2-3 倍的参照系——基线是 FLA Triton kernel,不是所有后端,也不是手写 CUDA 版;官方点名的收益场景是预训练与端侧 agentic 推理。
  3. 内核门槛可能比模型门槛更高。 FlashQLA 要求 SM90 起跳,即需要 Hopper(H100/H800 一代)或 Blackwell 世代的卡,A100(SM80)与消费级 RTX 30/40 系(SM86/SM89)不在支持列表;CUDA 12.8 与 PyTorch 2.8 是硬线。想让 GDN 跑出官方那个速度,硬件门槛比跑起模型本身更硬。
  4. Hy4 与 GLM 给的是另一条解法:官方预置镜像。 Hy4 直接给 vLLM / SGLang 镜像,部署文档按集群口径写;GLM 自研 SGLang 推理引擎,量化与调度一起交付。对没有内核团队的部署方,有没有官方镜像比架构多先进更影响落地周期

五、按场景选:五条结论

  1. 要长上下文成本曲线最可控、且能接受协议待确认:Qwen3.8-Flash-Next。GDN+QSA 把「压历史」与「挑 token」两端都占住,6B 激活(约 4.8%)加上可卸载到内存的 51B N-gram 表,是自部署友好度最高的一套设计;FlashQLA 同日开源说明内核不是空头支票。但协议未确认,商用前必须先去 HF / ModelScope 模型页核对,动手见本站 Qwen3.8-Flash-Next 本地部署 SOP(同批)。
  2. 要协议干净 + 降本有量化数字:智谱 GLM-5.3-Flash。MIT、1M 上下文、计算量降 3.01 倍与 KV 缓存缩小 4.44 倍(官方口径,对比 GLM-5.3)、320B/18B。五家里唯一把架构降本报成可核对数字的一家,低价不是烧钱,是新架构给的底气。
  3. 要协议干净 + 官方镜像齐全 + 极致稀疏路线:腾讯 Hy4 preview。Apache 2.0、BF16/FP8 双格式、Gated DSA + IndexCache、原生 MTP 投机解码、vLLM/SGLang 镜像。挑 token 路线的代表,适合想直接吃稀疏红利、不想折腾内核的团队;代价是 770B 全量驻显存。
  4. 要规模上限、注意力降本不是第一优先级:Kimi K3。2.8 万亿总参、KDA 混合线性注意力、MXFP4 压显存、1M 上下文。它解决的是能力天花板,输出 100 元/M 是溢价档,不是性价比选项。
  5. 所有场景共同的一条:2026 年选旗舰,先把注意力架构当一等公民再谈参数。激活比已收敛到 5%-6.5% 的窄带,打不出差距;真正决定长上下文账单的是注意力路线、上下文是原生还是外推、有没有配套内核与官方镜像。三本账都要翻——参数与部署门槛账API 价格与缓存账 看另外两篇;最后一条:协议未确认的模型,商用前务必先查模型页。

一句话收尾:当激活比卷到 5% 上下、1M 上下文人人都有,旗舰之分不再是参数大小,而是谁的注意力让长上下文真的用得起——至于那张写着你能否商用的纸,比任何 3.01 倍都该先翻开。

常见问题

Q1:稀疏注意力和线性注意力到底差在哪? A1:差在省的是哪一笔账。稀疏注意力(QSA、Gated DSA)是「挑 token」:仍保留完整 KV 序列,但每步只对索引器挑出的重要位置做完整 attention,省的是计算量。线性/递归注意力(GDN、KDA)是「压历史」:把已发生的上下文压成紧凑状态,省的是KV 缓存与随长度增长的那部分开销,代价是压缩损失。前者优化算多少,后者优化存多少,混合架构就是把两笔一起省。

Q2:「支持 1M 上下文」就能直接跑满 1M 吗? A2:不一定,先看是原生还是外推。Hy4 preview、GLM-5.3-Flash、Kimi K3、DeepSeek V4-Flash 标的都是原生 1M;Qwen3.8-Flash-Next 原生窗口是 262,144,1,000,000 靠 YaRN 插值外推(生产版 Qwen3.8-Flash 默认 1M,以官网为准)。外推在长文本末段的稳定性通常与原生有差异,跑满 1M 前建议先做自己的召回测试。

Q3:激活比和注意力架构,哪个对成本影响更大? A3:看上下文有多长。激活比决定每 token 烧多少算力,但它已收敛——五家换算下来落在约 4.6%-6.4% 的窄带(Qwen 计入 51B N-gram 表约 3.4%),打不出差距。注意力架构决定成本随序列长度怎么长:短上下文(几万 token 内)激活比更主导,长上下文(几十万到 1M)注意力架构立刻变成第一变量。Agent、整仓代码、长研报这类场景,先问路线再问参数。

Q4:Qwen3.8-Flash-Next 的许可证到底能不能商用? A4:本文标注为未确认,不替你下结论。可核对的事实:GitHub API 的 license 字段返回 None,仓库根目录只有 README.mdtech_report.pdf;README 原话是协议文件随权重发布在 Hugging Face Hub 或 ModelScope,HF 讨论区已有帖子在追问。开放权重(能下载、能跑、能改)与开源协议(能否商用、能否二次分发)是两件事,商用前请自行打开模型页读一遍协议原文。

Q5:自部署的话,光看架构够不够? A5:不够,还得看内核、硬件门槛和官方镜像。新架构的速度债要有人还——Qwen 用同日开源的 FlashQLA 还,但它要求 SM90 起跳、CUDA 12.8+、PyTorch 2.8+,A100 与消费级 RTX 30/40 系不在支持列表;Hy4 preview 与 GLM-5.3-Flash 走另一条路,直接给 vLLM/SGLang 镜像与自研推理引擎。另外总参决定权重驻留显存,770B 与 2.8 万亿都是集群级门槛。


参考来源

本文为代表性横评,基于公开报道与官方发布整理,快照 2026-08-30,非亲自压测,非投资建议;架构与降本幅度以各家官方口径为准,激活比等派生数字为换算或工程估算口径;Qwen3.8-Flash-Next 许可证状态未确认,商用前请以 HF / ModelScope 模型页随权重发布的协议文件为准;价格与仓库数据随时可能调整,采购前以各官方定价页为准。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-30

常见问题

稀疏注意力和线性注意力到底差在哪?
差在省的是哪一笔账。稀疏注意力(QSA、Gated DSA)是「挑 token」:仍保留完整 KV 序列,但每步只对索引器挑出的重要位置做完整 attention,省的是**计算量**。线性/递归注意力(GDN、KDA)是「压历史」:把已发生的上下文压成紧凑状态,省的是**KV 缓存与随长度增长的那部分开销**,代价是压缩损失。前者优化算多少,后者优化存多少,混合架构就是把两笔一起省。
「支持 1M 上下文」就能直接跑满 1M 吗?
不一定,先看是原生还是外推。Hy4 preview、GLM-5.3-Flash、Kimi K3、DeepSeek V4-Flash 标的都是原生 1M;Qwen3.8-Flash-Next 原生窗口是 262,144,1,000,000 靠 YaRN 插值外推(生产版 Qwen3.8-Flash 默认 1M,以官网为准)。外推在长文本末段的稳定性通常与原生有差异,跑满 1M 前建议先做自己的召回测试。
激活比和注意力架构,哪个对成本影响更大?
看上下文有多长。激活比决定每 token 烧多少算力,但它已收敛——五家换算下来落在约 4.6%-6.4% 的窄带(Qwen 计入 51B N-gram 表约 3.4%),打不出差距。注意力架构决定成本随序列长度怎么长:短上下文(几万 token 内)激活比更主导,长上下文(几十万到 1M)注意力架构立刻变成第一变量。Agent、整仓代码、长研报这类场景,先问路线再问参数。
Qwen3.8-Flash-Next 的许可证到底能不能商用?
本文标注为**未确认**,不替你下结论。可核对的事实:GitHub API 的 license 字段返回 None,仓库根目录只有 `README.md` 与 `tech_report.pdf`;README 原话是协议文件随权重发布在 Hugging Face Hub 或 ModelScope,HF 讨论区已有帖子在追问。开放权重(能下载、能跑、能改)与开源协议(能否商用、能否二次分发)是两件事,商用前请自行打开模型页读一遍协议原文。
自部署的话,光看架构够不够?
不够,还得看内核、硬件门槛和官方镜像。新架构的速度债要有人还——Qwen 用同日开源的 FlashQLA 还,但它要求 SM90 起跳、CUDA 12.8+、PyTorch 2.8+,A100 与消费级 RTX 30/40 系不在支持列表;Hy4 preview 与 GLM-5.3-Flash 走另一条路,直接给 vLLM/SGLang 镜像与自研推理引擎。另外总参决定权重驻留显存,770B 与 2.8 万亿都是集群级门槛。

相关文章

硬核横评

闭源 API 与开源权重:一张图到底谁更省

ChatGPT Images 2.5 与蚂蚁开源 LLaDA-Image 同周撞车,文生图进入闭源 API 与开源自部署的分野期。本篇不算画质、只算成本与可控性账:闭源 API、开源权重自部署、第三方按秒计费平台、本地消费级硬件、国产云 API 五条路线,按 100 张/天与 10000 张/天两档量级推算单张成本,配对比表与分场景选型(个人玩票/电商批量/数据敏感/需微调品牌风格/追求最强画质),并点名许可证未标注、按秒计费冷启动、中文渲染、数据出境四类坑。与站内 8-26 推理式图像模型能力横评明确分工,代表性对比非亲自压测,价格以官网为准。

2026年9月9日9 分钟阅读
硬核横评

英伟达130亿收HF:开源模型托管5强横评与选型

英伟达收购 Hugging Face 后,"开源模型放哪儿、跑哪儿"成为必答题。本篇横评五个模型托管与分发平台:Hugging Face(Hub+Spaces+Inference Providers)、ModelScope 魔搭(国内合规与下载优势)、Replicate(按秒计费一键 API 化)、fal.ai(生成式推理见长)、OpenRouter(多模型聚合路由)。含官网 2026-09 快照价格(HF PRO \$9/月、Replicate T4 \$0.000225/秒、fal Serverless H100 低至 \$1.89/时等)、大对比表与分场景选型;并声明与站内 API 网关横评的上下游分工。代表性对比,非亲自压测。

2026年9月8日9 分钟阅读
硬核横评

CodeArena 横评:Fable 5.1 守擂,Qwen 1/8 价逼近

CodeArena 是 LMArena 运营的前端编程榜(端到端生成 Web 应用,人类偏好 Elo)。截至 2026-09-03 真实格局:Claude Fable 5.1 以 1765 领榜(\$40/M),Qwen3.8-Max-0902 首日 1691、现约 1688(\$5/M,仅 1/8 价逼近前排),Gemini 3.8 Flash 1567(廉价版 #18),Kimi K3 约 1674;GPT-6 Astra 刚 9/3 发布、编程分待更新。核心启示:Elo 是偏好非正确率,选模型要看性价比与自身需求。

2026年9月5日9 分钟阅读