硬核横评
硬核横评

本地编程模型四强:8GB卡到8卡机各归其位

开源编程模型四强本地部署横评,比部署门槛五轴(参数/许可/上下文/硬件/运行支持),不比质量排名、无横向跑分:Mellum2.1-12B(12B MoE/2.5B 激活、Apache 2.0、131K、BF16 约 24GB 估算、vLLM 即日 GGUF 未放出);Qwen3.5-9B(9.7B 稠密、Apache 2.0、262K、Q4 约 6GB 是 8GB 卡甜点、Ollama/GGUF 全生态现成);DeepSeek-V4.1-Flash(MIT、检查点约 510GB 第三方整理口径、参数未公布不编、节点级);GLM-5.3-Flash(321.3B MoE/18B 激活、MIT、1M 上下文、FP8 约 306GiB 超两 H200 282GB、无两卡入口、8 卡 Hopper 底线、第三方托管 $0.15/$0.50 每百万)。四仓许可均 HF API 经 hf-mirror 实核 2026-10-10 全 ungated(下载量 198/838.6 万/131.6 万/639 万标日期)。全文灵魂反差:Flash 不等于小——GLM-5.3-Flash 是节点级巨兽,12B 的 Mellum 反而是四强里唯一消费卡可跑的 agent 专用模型。JetBrains 自测分各引各表严禁跨表排名,结论按场景:8GB 卡写代码选 Qwen3.5-9B、固定 GPU agent 农场选 Mellum2.1、机构级 1M 上下文选 GLM-5.3-Flash、DeepSeek 系生态选 V4.1-Flash(后两者节点预算)。

发布于 2026年10月10日9 分钟阅读
<!-- local-coding-model-comparison-review | review | 本地编程模型四强:8GB卡到8卡机各归其位 -->

「Flash」这个名字,正在成为本地部署圈最大的误导。看到 GLM-5.3-Flash 带着个轻巧的后缀,很多人以为又是一张 8GB 卡就能拉起来的小钢炮——结果它的检查点 FP8 口径约 306GiB,比两张 H200 的 282GB 总显存还大,现实底线是一台 8 卡 Hopper 节点。另一边,真正适合消费级显卡的两个选手,名字里反而没有一个「Flash」。这批四强横评,就是要撕掉名字滤镜,按部署门槛把 JetBrains Mellum2.1-12B、Qwen3.5-9B、DeepSeek-V4.1-Flash、GLM-5.3-Flash 各归其位。

为什么这时候做这期横评?因为「本地部署编程模型」这个决策,在 2026 年秋天第一次同时出现了四个不同量级的正经选项。以前你要么接受 7B 级稠密模型的能力天花板,要么直接上 API 交月费。现在 12B 的 agent 专用 MoE、9.7B 的稠密全能选手、三百多 B 的节点级 MoE 同时开源,加上一张 8GB 消费卡到一间小型机房之间的完整硬件阶梯,选择第一次比问题还多。选错了,轻则显存爆掉白下 500GB,重则买错整机预算打水漂——这正是横评要解决的问题。

先说清楚:比什么,不比什么

这批横评只比部署门槛,不比能力排名。原因很简单:各家自测基准的环境、harness、题目集都不同,跨表排名是自测数据最常见的滥用方式。JetBrains 官方对比 Qwen3.5-9B 的表格只在该表内成立,我们逐轴引用,绝不合成一张「谁更强」的总榜。

我们固定五个轴:参数规模、开源许可、上下文长度、硬件门槛、运行支持。选这五轴是有讲究的——参数决定量化空间,许可决定能不能商用和二开,上下文决定能不能塞进整个代码仓库,硬件门槛决定你要花多少钱,运行支持决定你今天能不能真的跑起来。五轴合在一起,就是一张部署可行性清单。

每轴数值都标来源口径——官方就是官方,第三方整理就是第三方整理,未公布就写未公布,不编。许可和下载量是我们自己实核的,会标实核日期。

五轴大表

轴Mellum2.1-12B-A2.5B-ThinkingQwen3.5-9BDeepSeek-V4.1-FlashGLM-5.3-Flash
参数12B MoE / 2.5B 激活9.7B 稠密(96.5 亿口径,官方口径)未公布统一口径,不编;检查点约 510GB(第三方整理口径)321.3B MoE / 18B 激活(288 experts)
许可Apache 2.0,ungatedApache 2.0,ungatedMIT,ungatedMIT,ungated
上下文131,072262,144(256K)未公布,不编1,048,576(1M,Z.ai 自评 300K+ 上下文管理)
硬件门槛BF16 约 24GB 级(第三方估算口径),vLLM 单卡可跑Q4 量化约 6GB,8GB 卡甜点;FP16 约 18GB节点级:两张 H200 装 V4-Flash 都够呛,V4.1-Flash 检查点约 510GB节点级:FP8 约 306GiB,大于两张 H200 的 282GB,无两卡入口,现实底线 8 卡 Hopper;Q4 约 194.6GB
运行支持vLLM 即日支持;GGUF/Ollama/LM Studio 尚未放出;MTP head 未随权重发布Ollama/GGUF/vLLM 全生态现成vLLM,节点级部署vLLM;另有第三方托管(Baseten/DeepInfra/Fireworks/Novita/Together,约 $0.15/$0.50 每百万)

许可一栏是我们 2026-10-10 通过 HF API 经 hf-mirror 逐仓实核的:四仓全部 ungated,许可即时生效可商用。下载量同日口径:Mellum2.1 上架两天 198 次下载、77 likes;Qwen3.5-9B 838.6 万;DeepSeek-V4.1-Flash 131.6 万;GLM-5.3-Flash 639 万。新模型和成熟模型的生态热度差距一目了然,也提醒一句:Mellum 的下载量是上架 48 小时内的数字,拿它和沉淀一年的模型直接比热度没有意义。

四个仓库地址,链接加明文各列一次:

明文再记一遍,方便复制:huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking、huggingface.co/Qwen/Qwen3.5-9B、huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash、huggingface.co/zai-org/GLM-5.3-Flash。

各家短评:谁该用哪个

Mellum2.1-12B-A2.5B-Thinking:唯一一张卡能跑的 agent 专用模型

JetBrains 2026-10-08 上架 HF,是 Mellum2 的训练配方升级版:RL 从收尾环节变成训练主体,数千环境数百万沙盒 run,还新增数学、竞赛、科学、工具使用和软件工程任务。架构不变:12B MoE 总参、2.5B 激活、131K 上下文、纯代码定位(不支持图像输入)。

这次升级的重点在数据侧。JetBrains 对外说得挺直:开源训练数据常带坏测试和不可验证答案,所以他们做了源数据过滤,宁可少也要干净。这套配方在自测里的回报是思考模式能力的整体抬升,而不是单点刷榜。

JetBrains 自测口径(Pi harness v0.73.1、thinking mode、第三方未复跑)里有两个反差点:SWE-bench Verified 47.0 对 Qwen3.5-9B 的 50.0,真实仓库长任务落后;SWE-bench Pro 28.0 对 38.0、Terminal-Bench 2.1 17.4 对 21.7、GPQA Diamond 64.6 对 77.8,同样是 Qwen 占优。反过来 LiveCodeBench v6 82.0 对 75.4、BFCL v4 62.3 对 58.5,短任务竞赛和工具调用是 Mellum 领先。同一张自测表内的判读就到这为止——固定 GPU 预算下的高吞吐 agent 密度加上数据不出域,才是它的真实卖点。官方还提了一个速度口径:H200 上重负载吞吐接近 Qwen3.5-9B 的两倍,具体数值只给了图表,我们如实转述不引申。

三个坑要提前知道:其一,MTP head 未随权重发布,官方说的 1.6x 单请求提速现在复现不了,看到「装完就快 1.6 倍」的教程可以直接关掉;其二,GGUF 还在 coming soon,Ollama 和 LM Studio 用户暂时拉不到,别信来路不明的整合包;其三,BF16 权重约 24GB 级是估算口径,12GB 卡跑不动全量,要么等 GGUF 量化,要么上 24GB 卡。另外它是 thinking 模型,vLLM 部署要配 reasoning-parser qwen3,否则思考串会混进输出。部署细节我们另写了 Mellum2.1 本地部署 SOP,开源背景与生态信息见 Mellum2.1 开源资源篇。

谁该用:有固定 24GB 级 GPU、要批量跑 agent 工作流、对数据出域敏感的团队。个人玩家一张 4090 也可以先拉起来尝鲜,但要有心理准备:这是 agent 专用模型,让它写周报会失望。

Qwen3.5-9B:8GB 卡之王

四强里唯一真正意义上的消费卡甜点。官方口径 9.7B 稠密、262K 上下文,Q4 量化约 6GB 就能进显存,8GB 卡留出 KV cache 和系统占用后依然从容。262K 上下文意味着中等规模的单仓库可以整个塞进去做分析,这在两年前是不可想象的。Ollama、GGUF、vLLM 全生态现成支持,是四强里今天就能五分钟拉起来的那个。

能力侧只说自测表内事实:在 JetBrains 的对比表里,它在真实仓库任务上分数更高(SWE-bench Verified 50.0 对 47.0、SWE-bench Pro 38.0 对 28.0),同时支持图像输入,定位比 Mellum 更通用。换句话说,如果你的场景是「日常改仓库、修 bug、看图调 UI」,它大概率比 agent 专用的 Mellum 更顺手;如果是「固定显卡批量跑自动化 agent」,吞吐才是 Mellum 的地盘。

之前我们已经写过 Qwen3.8 Flash 本地部署 SOP,Qwen 系的本地化路径是一脉相承的,Ollama 一条命令的事。

谁该用:一张 8GB 到 24GB 卡写代码、跑日常工单、想零成本试错的个人开发者。没有悬念,就是它。

DeepSeek-V4.1-Flash:节点级选手,参数未公布

纪律先行:DeepSeek-V4.1-Flash 没有公布统一参数口径,我们不编。这是这篇横评里唯一一个「连参数轴都要留白」的模型,也正好演示了我们的口径纪律——没数据就是没数据,用检查点体积反推参数量是坊间惯用戏法,我们不玩。

能确认的硬事实:第三方整理的检查点规模约 510GB。作为参照,两张 H200 共 282GB 显存,装 V4-Flash 都够呛,V4.1-Flash 只能上节点。上下文也未公布。许可 MIT、ungated 是实核过的,下载量 131.6 万说明生态真实存在。运行支持是 vLLM 节点级部署,适合已经自建推理集群的团队。

一个务实的判断方法:如果你现在的账单里 DeepSeek API 占大头、且对数据出域有硬要求,节点级自托管才有讨论价值;否则它的性价比远不如继续用官方 API,因为节点硬件折旧和运维成本不是小数目。

谁该用:深度使用 DeepSeek 系 API、想要权重自治的机构,且预算里本来就有节点级推理机。8GB 卡用户请直接跳过。

GLM-5.3-Flash:全文灵魂——「Flash」不等于小

这是四强里反差最大的一个。321.3B MoE 总参、18B 激活、288 个专家,名字里的「Flash」指的是激活效率,不是体积。FP8 权重约 306GiB,超过两张 H200 的 282GB 总和,官方没有给两卡入口,现实底线是 8 卡 Hopper 节点;Q4 量化后约 194.6GB,仍然远超单机四卡的主流配置。

为什么会做成这样?因为它的设计目标是另一种东西:四强唯一的 1M 上下文(Z.ai 自评 300K+ 上下文管理能力)加上图像输入支持。要在一个请求里吃下整个大型 monorepo 或者上百份文档,参数规模和专家数量就压不下来。「Flash」省的是每次前向计算的成本——18B 激活意味着推理时的算力开销接近一个 18B 模型,只是权重你得先放得下。

不想建节点的,第三方托管(Baseten、DeepInfra、Fireworks、Novita、Together)约 $0.15/$0.50 每百万 token,算是折中路线。许可 MIT、ungated,HF 下载量 639 万。

谁该用:机构级场景——超长文档代码库分析、多模态输入、1M 上下文是刚需,且节点预算到位。个人开发者看个热闹就好,这不是你的战场。

显存阶梯速查

  • 8GB 卡:Qwen3.5-9B Q4 约 6GB,唯一甜点。其余三家不用想,连讨论的必要都没有。
  • 24GB 卡(4090/3090 级):Mellum2.1 BF16 约 24GB 级(估算口径)起步可行,多卡或更大显存给 131K 上下文留 KV 余量;Qwen3.5-9B FP16 约 18GB 全量无压力,还能再开 256K 长上下文。这一档是个人玩家和小团队的主战场。
  • 单机 2-4 卡:尴尬区间。GLM-5.3-Flash 无两卡入口,DeepSeek-V4.1-Flash 检查点约 510GB 也远超,两张 H200 都不够。这个层级建议继续用 Qwen 或 Mellum,别为了追大参数硬上多机推理,网络开销会吃掉所有收益。
  • 8 卡 Hopper 节点:GLM-5.3-Flash FP8 约 306GiB 和 DeepSeek-V4.1-Flash 约 510GB 的主战场,vLLM 部署。到了这一层,模型之间比的已经不是能不能跑,而是每 token 成本和并发密度。

一句话总结这张阶梯:名字最响的「Flash」住在最贵的楼层,真正住得起的都是低调的中小杯。

还有两个实务提醒。第一,量化版本的性能损耗没有出现在这张表里——Q4 量化对 MoE 模型的影响和稠密模型不同,GLM-5.3-Flash 的 Q4 约 194.6GB 是体积数字,不代表质量不打折,节点预算紧张的团队落地前最好自己跑一轮评测对账。第二,下载量是活跃度的参考而非质量的证明,Qwen3.5-9B 八百多万的下载量里包含大量一键拉取的试用量,真实留存要看各自社区的 issue 区。数据会说话,但只说它想说的那部分,交叉验证永远是必要的。

常见问题

Q1: 四个模型哪个最强? 不建议跨表排名。各家自测基准的 harness 和题目集不同,JetBrains 的自测表只在其表内成立,把不同表里的分数拉到一起排名是数据滥用。本篇横评按部署门槛和场景选型:8GB 卡选 Qwen3.5-9B,固定 GPU 跑 agent 选 Mellum2.1,机构级 1M 上下文选 GLM-5.3-Flash,DeepSeek 生态选 V4.1-Flash。

Q2: GLM-5.3-Flash 带个「Flash」是不是小模型,8GB 卡能跑吗? 不能。Flash 指激活效率而非体积:321.3B 总参、FP8 权重约 306GiB,超过两张 H200 的显存总和,现实底线是 8 卡 Hopper 节点,Q4 量化也要约 194.6GB。四强里 8GB 卡唯一甜点是 Qwen3.5-9B(Q4 约 6GB,官方口径)。

Q3: Mellum2.1 的 1.6x 提速和 Ollama 支持现在能用吗? 都不能。MTP head 未随权重发布,官方口径的 1.6x 单请求提速目前无法复现;GGUF 尚未放出,Ollama/LM Studio 支持 coming soon。现阶段只有 vLLM 可跑,且需配置 reasoning parser qwen3,否则思考串会混进输出。

Q4: DeepSeek-V4.1-Flash 到底多少参数? 官方未公布统一口径,我们不编。第三方整理的检查点规模约 510GB,据此判断为节点级模型——两张 H200(282GB)装不下,需要 8 卡节点加 vLLM 部署。许可 MIT、ungated 已于 2026-10-10 实核。

Q5: 这些模型的许可真的可以商用吗? 可以。我们 2026-10-10 通过 HF API 经 hf-mirror 逐仓实核:Mellum2.1 和 Qwen3.5-9B 为 Apache 2.0,DeepSeek-V4.1-Flash 和 GLM-5.3-Flash 为 MIT,四仓全部 ungated、无附加限制。下载量同日分别为 198 次、838.6 万、131.6 万、639 万。

收尾

四强横评看下来,结论其实很朴素:不是选最强的模型,是选住得进你显存的模型。8GB 卡用户闭眼 Qwen3.5-9B;24GB 卡跑 agent 密度看 Mellum2.1;节点预算到位再谈 GLM-5.3-Flash 和 DeepSeek-V4.1-Flash。四个选项没有高低,只有各归其位。

你现在是几卡配置?打算落哪一个?评论区聊聊。如果你在工具侧还没定,可以先看我们的本地 LLM 部署工具横评,Ollama 和 LM Studio 怎么选写得明明白白——那是比工具的横评,这篇是比模型的,两篇搭配着看正好。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-10-10

常见问题

四个模型哪个最强?
不建议跨表排名。各家自测基准的 harness 和题目集不同,JetBrains 的自测表只在其表内成立,把不同表里的分数拉到一起排名是数据滥用。本篇横评按部署门槛和场景选型:8GB 卡选 Qwen3.5-9B,固定 GPU 跑 agent 选 Mellum2.1,机构级 1M 上下文选 GLM-5.3-Flash,DeepSeek 生态选 V4.1-Flash。
GLM-5.3-Flash 带个「Flash」是不是小模型,8GB 卡能跑吗?
不能。Flash 指激活效率而非体积:321.3B 总参、FP8 权重约 306GiB,超过两张 H200 的显存总和,现实底线是 8 卡 Hopper 节点,Q4 量化也要约 194.6GB。四强里 8GB 卡唯一甜点是 Qwen3.5-9B(Q4 约 6GB,官方口径)。
Mellum2.1 的 1.6x 提速和 Ollama 支持现在能用吗?
都不能。MTP head 未随权重发布,官方口径的 1.6x 单请求提速目前无法复现;GGUF 尚未放出,Ollama/LM Studio 支持 coming soon。现阶段只有 vLLM 可跑,且需配置 reasoning parser qwen3,否则思考串会混进输出。
DeepSeek-V4.1-Flash 到底多少参数?
官方未公布统一口径,我们不编。第三方整理的检查点规模约 510GB,据此判断为节点级模型——两张 H200(282GB)装不下,需要 8 卡节点加 vLLM 部署。许可 MIT、ungated 已于 2026-10-10 实核。
这些模型的许可真的可以商用吗?
可以。我们 2026-10-10 通过 HF API 经 hf-mirror 逐仓实核:Mellum2.1 和 Qwen3.5-9B 为 Apache 2.0,DeepSeek-V4.1-Flash 和 GLM-5.3-Flash 为 MIT,四仓全部 ungated、无附加限制。下载量同日分别为 198 次、838.6 万、131.6 万、639 万。

相关文章

硬核横评

开源视频模型对比:许可显存地区三道坎

开源视频模型四强横评,比「本地部署门槛」五轴:许可/显存/音频/时长与分辨率/地区限制,不比生成质量、无横向跑分不排名。LTX-2.5(22B,distilled/FP8 12GB 起步,24kHz 立体声同步,LTX Community 许可 $10M 门槛 gated=auto);Wan 2.2(TI2V-5B,8GB+offload,Apache 2.0 最宽松,短片 480p-720p,无原生音频);HunyuanVideo 1.5(8.3B,14GB 起,4090 step-distilled 约 75 秒/条,腾讯社区许可不适用 EU/UK/南韩、1 亿 MAU 需另谈,无原生音频);MiniMax H3(33B dense,32kHz 立体声+对白 11 语言,15s/768p 默认而 2K 需未开源 regenerator,社区许可排除 EU/UK/南韩/美国、超 $20M 需书面授权,显存无统一口径不编)。各家数据标来源(bestfreewebresources/pinggy 整理+官方模型卡口径);fal H3 Max i2v with audio 榜 #1 为第三方口径。选型结论按场景给不仲裁:要最宽松许可选 Wan 2.2,要音画一体选 LTX-2.5,24GB 卡且不受地区限制选 HunyuanVideo 1.5,要参考音频/多语对白选 H3(在许可适用区内)。

2026年10月10日9 分钟阅读
硬核横评

半价与两折:旗舰平替编程模型洗牌,谁最值?

旗舰平替性价比横评(2026 年 10 月时点):Claude Sonnet 5.5(官方口径经机器之心转述:速度提升 30% 以上、Terminal-Bench 4.0 从 10.3% 升至 70.6%、价格为 Opus 5.5 一半) vs GPT-6.1 Sol(官方口径经量子位转述:智能接近 GPT-6 Astra、API 价格仅 1/5、Ultrafast 付费提速档) vs Claude Opus 5.5(参照系,$4/$20 每百万 tokens) vs DeepSeek V4.1(开源参照系,权重开放)。口径纪律:各家 harness 不同不可横比,本文只做相对自家旗舰的相对值比较,不自行跑分;Sonnet 5.5 具体美元定价官方未公布,不自行换算。四条场景结论:预算敏感日常编程、要旗舰上限的复杂任务、要私有部署的合规场景各有所归。与站内 2026-08 综合横评、旗舰推理横评分工互补。

2026年10月1日10 分钟阅读