「Flash」这个名字,正在成为本地部署圈最大的误导。看到 GLM-5.3-Flash 带着个轻巧的后缀,很多人以为又是一张 8GB 卡就能拉起来的小钢炮——结果它的检查点 FP8 口径约 306GiB,比两张 H200 的 282GB 总显存还大,现实底线是一台 8 卡 Hopper 节点。另一边,真正适合消费级显卡的两个选手,名字里反而没有一个「Flash」。这批四强横评,就是要撕掉名字滤镜,按部署门槛把 JetBrains Mellum2.1-12B、Qwen3.5-9B、DeepSeek-V4.1-Flash、GLM-5.3-Flash 各归其位。
为什么这时候做这期横评?因为「本地部署编程模型」这个决策,在 2026 年秋天第一次同时出现了四个不同量级的正经选项。以前你要么接受 7B 级稠密模型的能力天花板,要么直接上 API 交月费。现在 12B 的 agent 专用 MoE、9.7B 的稠密全能选手、三百多 B 的节点级 MoE 同时开源,加上一张 8GB 消费卡到一间小型机房之间的完整硬件阶梯,选择第一次比问题还多。选错了,轻则显存爆掉白下 500GB,重则买错整机预算打水漂——这正是横评要解决的问题。
先说清楚:比什么,不比什么
这批横评只比部署门槛,不比能力排名。原因很简单:各家自测基准的环境、harness、题目集都不同,跨表排名是自测数据最常见的滥用方式。JetBrains 官方对比 Qwen3.5-9B 的表格只在该表内成立,我们逐轴引用,绝不合成一张「谁更强」的总榜。
我们固定五个轴:参数规模、开源许可、上下文长度、硬件门槛、运行支持。选这五轴是有讲究的——参数决定量化空间,许可决定能不能商用和二开,上下文决定能不能塞进整个代码仓库,硬件门槛决定你要花多少钱,运行支持决定你今天能不能真的跑起来。五轴合在一起,就是一张部署可行性清单。
每轴数值都标来源口径——官方就是官方,第三方整理就是第三方整理,未公布就写未公布,不编。许可和下载量是我们自己实核的,会标实核日期。
五轴大表
| 轴 | Mellum2.1-12B-A2.5B-Thinking | Qwen3.5-9B | DeepSeek-V4.1-Flash | GLM-5.3-Flash |
|---|---|---|---|---|
| 参数 | 12B MoE / 2.5B 激活 | 9.7B 稠密(96.5 亿口径,官方口径) | 未公布统一口径,不编;检查点约 510GB(第三方整理口径) | 321.3B MoE / 18B 激活(288 experts) |
| 许可 | Apache 2.0,ungated | Apache 2.0,ungated | MIT,ungated | MIT,ungated |
| 上下文 | 131,072 | 262,144(256K) | 未公布,不编 | 1,048,576(1M,Z.ai 自评 300K+ 上下文管理) |
| 硬件门槛 | BF16 约 24GB 级(第三方估算口径),vLLM 单卡可跑 | Q4 量化约 6GB,8GB 卡甜点;FP16 约 18GB | 节点级:两张 H200 装 V4-Flash 都够呛,V4.1-Flash 检查点约 510GB | 节点级:FP8 约 306GiB,大于两张 H200 的 282GB,无两卡入口,现实底线 8 卡 Hopper;Q4 约 194.6GB |
| 运行支持 | vLLM 即日支持;GGUF/Ollama/LM Studio 尚未放出;MTP head 未随权重发布 | Ollama/GGUF/vLLM 全生态现成 | vLLM,节点级部署 | vLLM;另有第三方托管(Baseten/DeepInfra/Fireworks/Novita/Together,约 $0.15/$0.50 每百万) |
许可一栏是我们 2026-10-10 通过 HF API 经 hf-mirror 逐仓实核的:四仓全部 ungated,许可即时生效可商用。下载量同日口径:Mellum2.1 上架两天 198 次下载、77 likes;Qwen3.5-9B 838.6 万;DeepSeek-V4.1-Flash 131.6 万;GLM-5.3-Flash 639 万。新模型和成熟模型的生态热度差距一目了然,也提醒一句:Mellum 的下载量是上架 48 小时内的数字,拿它和沉淀一年的模型直接比热度没有意义。
四个仓库地址,链接加明文各列一次:
- huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking
- huggingface.co/Qwen/Qwen3.5-9B
- huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- huggingface.co/zai-org/GLM-5.3-Flash
明文再记一遍,方便复制:huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking、huggingface.co/Qwen/Qwen3.5-9B、huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash、huggingface.co/zai-org/GLM-5.3-Flash。
各家短评:谁该用哪个
Mellum2.1-12B-A2.5B-Thinking:唯一一张卡能跑的 agent 专用模型
JetBrains 2026-10-08 上架 HF,是 Mellum2 的训练配方升级版:RL 从收尾环节变成训练主体,数千环境数百万沙盒 run,还新增数学、竞赛、科学、工具使用和软件工程任务。架构不变:12B MoE 总参、2.5B 激活、131K 上下文、纯代码定位(不支持图像输入)。
这次升级的重点在数据侧。JetBrains 对外说得挺直:开源训练数据常带坏测试和不可验证答案,所以他们做了源数据过滤,宁可少也要干净。这套配方在自测里的回报是思考模式能力的整体抬升,而不是单点刷榜。
JetBrains 自测口径(Pi harness v0.73.1、thinking mode、第三方未复跑)里有两个反差点:SWE-bench Verified 47.0 对 Qwen3.5-9B 的 50.0,真实仓库长任务落后;SWE-bench Pro 28.0 对 38.0、Terminal-Bench 2.1 17.4 对 21.7、GPQA Diamond 64.6 对 77.8,同样是 Qwen 占优。反过来 LiveCodeBench v6 82.0 对 75.4、BFCL v4 62.3 对 58.5,短任务竞赛和工具调用是 Mellum 领先。同一张自测表内的判读就到这为止——固定 GPU 预算下的高吞吐 agent 密度加上数据不出域,才是它的真实卖点。官方还提了一个速度口径:H200 上重负载吞吐接近 Qwen3.5-9B 的两倍,具体数值只给了图表,我们如实转述不引申。
三个坑要提前知道:其一,MTP head 未随权重发布,官方说的 1.6x 单请求提速现在复现不了,看到「装完就快 1.6 倍」的教程可以直接关掉;其二,GGUF 还在 coming soon,Ollama 和 LM Studio 用户暂时拉不到,别信来路不明的整合包;其三,BF16 权重约 24GB 级是估算口径,12GB 卡跑不动全量,要么等 GGUF 量化,要么上 24GB 卡。另外它是 thinking 模型,vLLM 部署要配 reasoning-parser qwen3,否则思考串会混进输出。部署细节我们另写了 Mellum2.1 本地部署 SOP,开源背景与生态信息见 Mellum2.1 开源资源篇。
谁该用:有固定 24GB 级 GPU、要批量跑 agent 工作流、对数据出域敏感的团队。个人玩家一张 4090 也可以先拉起来尝鲜,但要有心理准备:这是 agent 专用模型,让它写周报会失望。
Qwen3.5-9B:8GB 卡之王
四强里唯一真正意义上的消费卡甜点。官方口径 9.7B 稠密、262K 上下文,Q4 量化约 6GB 就能进显存,8GB 卡留出 KV cache 和系统占用后依然从容。262K 上下文意味着中等规模的单仓库可以整个塞进去做分析,这在两年前是不可想象的。Ollama、GGUF、vLLM 全生态现成支持,是四强里今天就能五分钟拉起来的那个。
能力侧只说自测表内事实:在 JetBrains 的对比表里,它在真实仓库任务上分数更高(SWE-bench Verified 50.0 对 47.0、SWE-bench Pro 38.0 对 28.0),同时支持图像输入,定位比 Mellum 更通用。换句话说,如果你的场景是「日常改仓库、修 bug、看图调 UI」,它大概率比 agent 专用的 Mellum 更顺手;如果是「固定显卡批量跑自动化 agent」,吞吐才是 Mellum 的地盘。
之前我们已经写过 Qwen3.8 Flash 本地部署 SOP,Qwen 系的本地化路径是一脉相承的,Ollama 一条命令的事。
谁该用:一张 8GB 到 24GB 卡写代码、跑日常工单、想零成本试错的个人开发者。没有悬念,就是它。
DeepSeek-V4.1-Flash:节点级选手,参数未公布
纪律先行:DeepSeek-V4.1-Flash 没有公布统一参数口径,我们不编。这是这篇横评里唯一一个「连参数轴都要留白」的模型,也正好演示了我们的口径纪律——没数据就是没数据,用检查点体积反推参数量是坊间惯用戏法,我们不玩。
能确认的硬事实:第三方整理的检查点规模约 510GB。作为参照,两张 H200 共 282GB 显存,装 V4-Flash 都够呛,V4.1-Flash 只能上节点。上下文也未公布。许可 MIT、ungated 是实核过的,下载量 131.6 万说明生态真实存在。运行支持是 vLLM 节点级部署,适合已经自建推理集群的团队。
一个务实的判断方法:如果你现在的账单里 DeepSeek API 占大头、且对数据出域有硬要求,节点级自托管才有讨论价值;否则它的性价比远不如继续用官方 API,因为节点硬件折旧和运维成本不是小数目。
谁该用:深度使用 DeepSeek 系 API、想要权重自治的机构,且预算里本来就有节点级推理机。8GB 卡用户请直接跳过。
GLM-5.3-Flash:全文灵魂——「Flash」不等于小
这是四强里反差最大的一个。321.3B MoE 总参、18B 激活、288 个专家,名字里的「Flash」指的是激活效率,不是体积。FP8 权重约 306GiB,超过两张 H200 的 282GB 总和,官方没有给两卡入口,现实底线是 8 卡 Hopper 节点;Q4 量化后约 194.6GB,仍然远超单机四卡的主流配置。
为什么会做成这样?因为它的设计目标是另一种东西:四强唯一的 1M 上下文(Z.ai 自评 300K+ 上下文管理能力)加上图像输入支持。要在一个请求里吃下整个大型 monorepo 或者上百份文档,参数规模和专家数量就压不下来。「Flash」省的是每次前向计算的成本——18B 激活意味着推理时的算力开销接近一个 18B 模型,只是权重你得先放得下。
不想建节点的,第三方托管(Baseten、DeepInfra、Fireworks、Novita、Together)约 $0.15/$0.50 每百万 token,算是折中路线。许可 MIT、ungated,HF 下载量 639 万。
谁该用:机构级场景——超长文档代码库分析、多模态输入、1M 上下文是刚需,且节点预算到位。个人开发者看个热闹就好,这不是你的战场。
显存阶梯速查
- 8GB 卡:Qwen3.5-9B Q4 约 6GB,唯一甜点。其余三家不用想,连讨论的必要都没有。
- 24GB 卡(4090/3090 级):Mellum2.1 BF16 约 24GB 级(估算口径)起步可行,多卡或更大显存给 131K 上下文留 KV 余量;Qwen3.5-9B FP16 约 18GB 全量无压力,还能再开 256K 长上下文。这一档是个人玩家和小团队的主战场。
- 单机 2-4 卡:尴尬区间。GLM-5.3-Flash 无两卡入口,DeepSeek-V4.1-Flash 检查点约 510GB 也远超,两张 H200 都不够。这个层级建议继续用 Qwen 或 Mellum,别为了追大参数硬上多机推理,网络开销会吃掉所有收益。
- 8 卡 Hopper 节点:GLM-5.3-Flash FP8 约 306GiB 和 DeepSeek-V4.1-Flash 约 510GB 的主战场,vLLM 部署。到了这一层,模型之间比的已经不是能不能跑,而是每 token 成本和并发密度。
一句话总结这张阶梯:名字最响的「Flash」住在最贵的楼层,真正住得起的都是低调的中小杯。
还有两个实务提醒。第一,量化版本的性能损耗没有出现在这张表里——Q4 量化对 MoE 模型的影响和稠密模型不同,GLM-5.3-Flash 的 Q4 约 194.6GB 是体积数字,不代表质量不打折,节点预算紧张的团队落地前最好自己跑一轮评测对账。第二,下载量是活跃度的参考而非质量的证明,Qwen3.5-9B 八百多万的下载量里包含大量一键拉取的试用量,真实留存要看各自社区的 issue 区。数据会说话,但只说它想说的那部分,交叉验证永远是必要的。
常见问题
Q1: 四个模型哪个最强? 不建议跨表排名。各家自测基准的 harness 和题目集不同,JetBrains 的自测表只在其表内成立,把不同表里的分数拉到一起排名是数据滥用。本篇横评按部署门槛和场景选型:8GB 卡选 Qwen3.5-9B,固定 GPU 跑 agent 选 Mellum2.1,机构级 1M 上下文选 GLM-5.3-Flash,DeepSeek 生态选 V4.1-Flash。
Q2: GLM-5.3-Flash 带个「Flash」是不是小模型,8GB 卡能跑吗? 不能。Flash 指激活效率而非体积:321.3B 总参、FP8 权重约 306GiB,超过两张 H200 的显存总和,现实底线是 8 卡 Hopper 节点,Q4 量化也要约 194.6GB。四强里 8GB 卡唯一甜点是 Qwen3.5-9B(Q4 约 6GB,官方口径)。
Q3: Mellum2.1 的 1.6x 提速和 Ollama 支持现在能用吗? 都不能。MTP head 未随权重发布,官方口径的 1.6x 单请求提速目前无法复现;GGUF 尚未放出,Ollama/LM Studio 支持 coming soon。现阶段只有 vLLM 可跑,且需配置 reasoning parser qwen3,否则思考串会混进输出。
Q4: DeepSeek-V4.1-Flash 到底多少参数? 官方未公布统一口径,我们不编。第三方整理的检查点规模约 510GB,据此判断为节点级模型——两张 H200(282GB)装不下,需要 8 卡节点加 vLLM 部署。许可 MIT、ungated 已于 2026-10-10 实核。
Q5: 这些模型的许可真的可以商用吗? 可以。我们 2026-10-10 通过 HF API 经 hf-mirror 逐仓实核:Mellum2.1 和 Qwen3.5-9B 为 Apache 2.0,DeepSeek-V4.1-Flash 和 GLM-5.3-Flash 为 MIT,四仓全部 ungated、无附加限制。下载量同日分别为 198 次、838.6 万、131.6 万、639 万。
收尾
四强横评看下来,结论其实很朴素:不是选最强的模型,是选住得进你显存的模型。8GB 卡用户闭眼 Qwen3.5-9B;24GB 卡跑 agent 密度看 Mellum2.1;节点预算到位再谈 GLM-5.3-Flash 和 DeepSeek-V4.1-Flash。四个选项没有高低,只有各归其位。
你现在是几卡配置?打算落哪一个?评论区聊聊。如果你在工具侧还没定,可以先看我们的本地 LLM 部署工具横评,Ollama 和 LM Studio 怎么选写得明明白白——那是比工具的横评,这篇是比模型的,两篇搭配着看正好。