导语:开放与闭源之间的新一轮较量
过去两年,大模型领域最显著的张力之一,来自开放权重与闭源服务两条路线的并立。以 OpenAI、Anthropic 为代表的厂商,主要通过付费 API 对外输出能力,模型权重始终不公开;而以 Meta 的 Llama、Mistral,以及阿里 Qwen 系列为首的阵营,则长期坚持开放权重,允许开发者把模型下载到本地、做微调、并部署在自有服务器上。两条路线各有取舍:闭源服务往往代表当下最强峰值能力,开放权重则把控制权交还给社区。
2026 年 8 月底,阿里在开放权重一侧投下一枚重弹。它在 Hugging Face 与 ModelScope 上发布了 Qwen3.8-Flash-Next,并明确指出:这是预览 Qwen4 架构的首个开放权重模型。换句话说,社区不必等到 Qwen4 正式发布,就已经可以通过一个可下载、可商用的开放权重模型,提前感知下一代架构的设计取向。对于那些既想布局新架构、又不愿被单一闭源供应商绑定的团队来说,这件事本身就有相当的分量。
开放权重模型的另一个价值,在于它让研究者和中小企业也能站在巨人的肩膀上做二次创新。当权重可被自由下载,微调、蒸馏、量化、私有部署都成为可能,整个上下游工具链会围绕它快速生长。
发布与定位:预览 Qwen4 架构的第一个开放权重模型
阿里于 2026-08-26 在 Hugging Face 与 ModelScope 同步放出 Qwen3.8-Flash-Next 的开放权重。许可证采用自定义的 qwen-community-1.0,允许商用与自托管,但并非 Apache 2.0。随后在 2026-09-01,阿里开放了对应的开发者 API,名为 QwenCloud,方便不希望自建基础设施的团队直接调用。
在阿里内部的模型序列里,Qwen3.8-Flash-Next 的位置非常清晰:它是 Qwen4 架构的轻量预览版,而非旗舰。真正的旗舰是 Qwen3.8-Max,一个参数规模达到 2.4T 的 MoE 模型,我们已经在另一篇文章中单独覆盖。Flash-Next 与 Max 是两个不同的模型,前者面向的是希望提前试验新架构、并且需要把权重握在自己手里的开发者。
官方对它的定位有三个关键词:开放权重、预览 Qwen4、轻量可用。它不追求在绝对算力上压过闭源旗舰,而是试图证明——新的架构思路,可以在一个相对精简、可自托管的形态下,取得有竞争力的表现。这种"先开放预览、后正式发布"的节奏,也让社区有机会尽早参与生态共建。从战略层面看,提前放出开放权重预览,既能收集社区反馈反哺正式版,也能在竞争对手密集发布的时间窗口里抢占开发者心智,为后续生态绑定打下基础。
架构亮点:125B 总参数下的高效设计
Qwen3.8-Flash-Next 的核心是一套 125B 总参数的混合专家(MoE)结构,但每个 token 实际只激活 6B 参数。这意味着推理时真正参与计算的参数量远小于总规模,从而在保持模型容量的同时,把单步推理成本压下来。对于需要在自有硬件上跑模型的团队,低激活参数直接转化为更低的显存与算力占用。
注意力机制上,它采用了 GDN 与 QSA 的混合方案。GDN(一类归一化分组点积注意力)与 QSA(一类查询稀疏注意力)的组合,目标是缓解长上下文下注意力的算力与显存压力,让模型在更长的序列上保持稳定的注意力质量。在大海捞针、长程依赖这类任务里,注意力机制的效率往往决定了模型能不能真正用好超长上下文,而不只是把窗口数字写得很长。
一个值得注意的工程取舍,是它额外包含了一层 51B 的 N-gram embedding 层,而这一层被设计跑在系统内存(CPU 侧的普通内存)上,而非 GPU 显存里。把这部分放到系统内存,可以释放宝贵的显存给真正的 transformer 计算,代价是需要在内存与显存之间做数据搬运。对于拥有大容量内存、但显卡显存有限的开发者来说,这是一种务实的折中。
此外,模型还带有一个 4B 参数的多 token 预测(MTP)头。多 token 预测头可以在一次前向传播中并行预测多个后续 token,既有助于提升推理吞吐,也为后续 speculative decoding 之类的加速手段提供了原生支持。把这些放在一起看,Qwen3.8-Flash-Next 的架构表达了一个明确的信号:Qwen4 的演进方向,是在参数效率、长上下文与推理成本之间做系统级的再平衡,而不是单纯堆大总参数。对于关注推理成本与落地可行性的团队,这种取舍比纸面参数更值得留意,因为它直接决定了模型能不能在真实业务里跑得动、跑得起。
上下文窗口与定价
在上下文方面,Qwen3.8-Flash-Next 的原生窗口为 262K token,并可通过 YaRN 进一步扩展到 100 万 token。这意味着它既适合长文档、代码仓库级别的任务,也能在需要超长上下文的研究场景中发挥作用,比如整本代码库问答、超长合同审查或大规模日志分析。
定价方面,通过 QwenCloud 开放的 API 具有以下水平:输入为每百万 token 0.16 美元,输出为每百万 token 0.47 美元。作为对照,同门的旗舰 Qwen3.8-Max API 定价为输入 2 美元、输出 6 美元每百万 token。换言之,Flash-Next 的 API 价格大约只有旗舰的十二分之一,这对于高频调用、批量处理、对峰值能力要求又不极致的业务来说,是一笔相当可观的成本节约。
| 项目 | Qwen3.8-Flash-Next | Qwen3.8-Max(旗舰) |
|---|---|---|
| 开放权重发布 | 2026-08-26 | 已另文覆盖 |
| 开发者 API 开放 | 2026-09-01 | — |
| 输入价格(每百万 token) | 0.16 美元 | 2 美元 |
| 输出价格(每百万 token) | 0.47 美元 | 6 美元 |
| 原生上下文 | 262K | — |
| YaRN 扩展上下文 | 100 万 | — |
需要提醒的是,YaRN 扩展后的百万级上下文会带来额外的算力与延迟开销,实际可用的有效上下文长度,往往还取决于检索、分块与提示工程是否到位。窗口数字代表上限,而非开箱即用的体验。
评测表现
根据阿里官方公布的基准,Qwen3.8-Flash-Next 在多个面向智能体与代码的评测中表现突出:DeepSWE 1.1 得分 58.7,SWE-bench Pro 得分 62.5,CoWorkBench 得分 73.9,AndroidWorld 得分 84.5,MathVision 得分 95.7。这些数字覆盖的是代码智能体、协作工作流、移动端操作与数学视觉等典型场景。
在 Agent Arena 中,它位列开放模型第 7、总榜第 24,排名基于 8700 个真实 agentic sessions。在任务完成确认成功率这一更硬的指标上,它达到 12.3%,在开放模型中排第 5、总榜排第 7。相比单纯的榜单分数,真实会话里的任务成功率更能反映一个模型在实际智能体工作流里的可用性。
横向对比更能说明问题。在 CoWorkBench 上,Qwen3.8-Flash-Next 的 73.9 分明显高于 DeepSeek-V4-Flash 的 45.1 分;在 SWE-bench Pro 上,它以 62.5 分超过 DeepSeek-V4-Flash 的 56.0 分,也高于 Claude Opus 4.6 Max 的 53.4 分。值得一提的是,DeepSeek-V4-Flash 是一个 284B 总参数、13B 激活的模型,体量比 Flash-Next 更大,却在上述两项上落后。这从侧面印证了架构效率,而非单纯参数规模,正在成为新一代模型竞争的关键。
当然,基准分数从来不是全部。评测集的选取、测试方式、以及是否启用工具调用,都会影响最终成绩。但多个独立维度同时指向同一结论,仍具有较强的参考意义。对开发者而言,更务实的做法是拿自己的真实任务做小样本验证,再决定是否上量。
| 基准 | Qwen3.8-Flash-Next | DeepSeek-V4-Flash | Claude Opus 4.6 Max |
|---|---|---|---|
| 总参数 / 激活 | 125B / 6B | 284B / 13B | — |
| DeepSWE 1.1 | 58.7 | — | — |
| SWE-bench Pro | 62.5 | 56.0 | 53.4 |
| CoWorkBench | 73.9 | 45.1 | — |
| AndroidWorld | 84.5 | — | — |
| MathVision | 95.7 | — | — |
从训练成本看,Qwen3.8-Flash-Next 的花费约为 Qwen3.7-Plus 的九分之一,这与其轻量预览的定位一致,也说明小体量模型通过架构优化,完全可以在单位成本上拿到更优的性价比。
许可证与自托管
Qwen3.8-Flash-Next 采用 qwen-community-1.0 许可证。这是阿里自定义的一份许可证,允许商用与自托管,但它在条款细节上不同于 Apache 2.0。需要特别强调:它并非 Apache 许可证。
这一点对开发者很重要。Apache 2.0 以宽松著称,几乎不对使用场景设限,并明确保障专利授权;而 qwen-community-1.0 属于自定义许可证,虽然允许商用和自托管,但具体的使用边界、商标与再分发要求,需要以许可证原文为准。如果团队计划把模型用于商业产品,尤其是再分发或托管服务,建议先逐条核对该许可证的限制,必要时咨询法务,避免后续合规风险。
自托管层面,开发者可以从 Hugging Face 或 ModelScope 拉取权重,在自有 GPU 集群上部署。考虑到它把 51B 的 N-gram embedding 层放在系统内存,自托管机器最好具备足够大的内存容量,以容纳这部分参数,避免成为部署瓶颈。显存方面,由于每个 token 仅激活 6B 参数,实际推理对显卡显存的需求相对友好,这也是它适合中小团队落地的关键原因。
适用场景与局限
Qwen3.8-Flash-Next 适合几类场景。其一是需要把权重掌握在手中的企业,尤其是数据合规要求高、不能把请求发往第三方云的场景。其二是智能体与代码类任务,官方基准与 Agent Arena 表现都指向它在 agentic 工作流里有不错的成功率。其三是成本敏感的大规模调用,API 价格约为旗舰的十二分之一,适合高频、批量、对峰值能力要求不极致的业务。
它也有局限。首先,它是预览版,定位轻量,不是阿里当前的绝对旗舰,极限任务上仍可能与闭源顶级模型存在差距。其次,自定义许可证 qwen-community-1.0 对商用边界有具体约束,不如 Apache 那样一目了然。再次,N-gram embedding 层占用系统内存,对内存不足的机器不友好。最后,作为 Qwen4 的预览,架构与生态仍在演进,后续正式版可能带来接口与能力的变动。如果想了解同期其他厂商的动向,也可以参考我们的 GPT-6 Astra 热点速览、GPT-6 Astra 旗舰评测 与 GPT-6 Astra 智能体 SOP。
从落地节奏看,Flash-Next 更适合作为"主力候选"进入试点,而非一次性替换已有生产模型。建议先在内部评测集上跑通,再逐步扩展到对准确率要求较低的批量场景,待 Qwen4 正式版发布后再评估是否迁移。
结语
Qwen3.8-Flash-Next 的意义,不在于它是否是当下最强的模型,而在于它把 Qwen4 架构的设计取向,以开放权重的形式提前交到了社区手里。在开放与闭源长期并立的格局里,这种"可下载、可商用、可自托管"的预览,既降低了开发者试错下一代架构的门槛,也为整个开放权重阵营增添了一个有分量的新选项。对于想提前布局 Qwen4 生态、又不愿被单一闭源供应商绑定的团队来说,它值得认真一试。
常见问题
Q1:能否商用自托管? 可以。Qwen3.8-Flash-Next 采用 qwen-community-1.0 许可证,允许商用与自托管。但它不是 Apache 2.0,商用前请逐条核对许可证条款,必要时咨询法务。
Q2:它和 Qwen3.8-Max 有什么区别? 两者是不同的模型。Qwen3.8-Max 是 2.4T 参数的 MoE 旗舰,已于另文覆盖;Flash-Next 是预览 Qwen4 架构的轻量开放权重版,125B 总参数、每 token 激活 6B,更适合自托管与成本敏感场景。
Q3:上下文窗口有多长? 原生上下文为 262K token,可通过 YaRN 扩展到 100 万 token。
Q4:API 价格为什么这么便宜? Flash-Next 是轻量预览版,架构上通过 MoE 低激活、N-gram 内存层等方式压低推理成本;其 API 输入 0.16 美元、输出 0.47 美元每百万 token,约为旗舰 Qwen3.8-Max 的十二分之一。
Q5:许可证是 Apache 吗? 不是。它使用的是阿里自定义的 qwen-community-1.0 许可证,允许商用与自托管,但条款与 Apache 2.0 不同,使用前需以原文为准。