如果你问一个工程师「AI 能不能替你加班」,过去一年的答案是:能,但只能替你加十分钟的班—— prompt 发出去,模型吐两万 token,然后停下来等你。而最近一个月,几家的官方口径不约而同把战线拉长到了「小时」和「天」这个量级:蚂蚁的 Ling-3.1-flash 号称连干 17 小时从零写出一个编译器,阿里的 Qwen3.8-Max 晒出了连续 16 天自主维护一个代码仓库的全过程 trace,谷歌 Argon 则一口气迁移了 80 万行内核代码。
这些数字到底是营销话术,还是真能对上「替你加班」的想象?这篇横评把它们放在同一张桌子上比一比。
横评的轴:不看单题分数,看连续干活
先把口径说清楚。上一期我们做过一篇百万 token 输出横评,那条轴量的是「一次回复最多能吐多少字」,本质是输出容量的天花板。这一篇换一条轴:一次任务里,模型能连续自主干多久、干成了什么样。
这两条轴不是一回事。输出容量大,可能只是话多;连续自主执行,考的是任务拆解、中途自检、出错回滚、断点续跑这一整套工程能力。打个比方:前者是肺活量,后者是马拉松。一个模型可以输出上限很高,但跑两步就要人扶;也可以输出上限一般,却能自己跑完全程。
也要提前打一针预防剂:本篇引用的所有案例和分数,全部来自各家官方一手材料,口径统一标注为「官方自报」。目前没有一个案例经过了完全独立的第三方复现,我们自己也没法在 editorial 层面重跑 17 小时的编译器任务。所以这篇横评比的是「各家敢对外承诺什么、拿什么证据承诺」,而不是裁判谁在撒谎。
四个选手的连续作战记录
选手一:蚂蚁 Ling-3.1-flash,17 小时写编译器。 官方博客给出的案例是:从零编写 Lua 到 x86-64 ELF 的编译器,连续运行约 17 小时,182 项测试通过 178 项,通过率 97.8%。另一个案例是把一个 C 图像库移植到 Rust,连续约 20 小时,移植后加速 8.015 倍,30 项正确性检查全部通过。验证方式是官方博客附带的测试集,理论上可以复跑。这是四个案例里时间跨度最「亲民」的——一天以内,普通开发者可以想象自己挂一个这样的任务过夜。
选手二:阿里 Qwen3.8-Max,16 天自主工程。 这是本篇跨度最长的案例:模型自主维护一个叫 oh-my-cli 的代码仓库,截至 7 月 30 日的公开数据是 265 次 commits、127 个 PRs、151 个 issues,而且不是乱提交——官方描述里有 issue 状态机、看门狗和 CI 自愈闭环,自测会触发 Build、Unit、E2E 三层。另一个案例是论文复现:约 5 天 125 小时,写了 7600 行代码、执行 1100 多个动作、跑了 33 轮 GPU 训练,把 AIME24 成绩从 49.58% 提到 52.29%,四轮迭代里自己提出 18 个想法,比原论文方法多 2.7 分。最关键的是,GitHub 上有全过程 trace 可查(qwen-code-dev-bot/oh-my-cli),这是四个选手里可复核性最强的。
选手三:谷歌 Argon,80 万行内核迁移。 Gemini 4 家族的第一款模型,2026 年 9 月 30 日官宣,定位就是长程复杂工作流。官方案例里最唬人的是 Fuchsia Zircon 内核最大 80 万行以上 C/C++ 代码到 Rust 的迁移;另有 libgav1 的 3.2 万行 SIMD 代码重写,比原 Rust 移植版快 2.7 倍且输出逐帧一致。基准方面,DeepSWE v1.1(长程软件工程)77.9% 排第一,对比同卷的 GPT-6 Astra 74.1%、Claude Opus 5.5 74.2%、Claude Fable 5.1 67.4%。官方称这些迁移经过自动化测试、仿真加人工评审三道关后才部署。
参照行:DeepSeek-V4-Flash-Vision-Exp。 放它进来不是为了凑数,而是给 DeepSWE v1.1 这张卷子一个锚点:它是同卷 59.3%,MIT 开源、可以本地跑。Argon 的 77.9% 有多强,跟 59.3% 一对就有感觉了——这是目前普通用户唯一能亲手摸到的 DeepSWE 同卷参照物。我们之前在V4 Flash 基准横评里分析过 DeepSeek 这条产品线的得分风格,可以对照着看。
对比总表
<table> <thead> <tr><th>模型</th><th>连续案例</th><th>可复核性</th><th>门槛与价格</th><th>口径</th></tr> </thead> <tbody> <tr> <td>蚂蚁 Ling-3.1-flash</td> <td>约 17 小时从零写 Lua 到 x86-64 ELF 编译器,182 项测试过 178(97.8%);约 20 小时 C 图像库移植 Rust,加速 8.015 倍,30 项正确性检查全过</td> <td>官方博客,测试集可复跑</td> <td>免费体验两周(至 10 月 13 日前后),体验期上下文 256K</td> <td>官方自报</td> </tr> <tr> <td>阿里 Qwen3.8-Max</td> <td>16 天自主工程 oh-my-cli:265 commits、127 PRs、151 issues,issue 状态机加看门狗加 CI 自愈闭环;论文复现约 5 天 125 小时,7600 行代码,AIME24 从 49.58% 到 52.29%</td> <td>GitHub 全过程 trace 公开(qwen-code-dev-bot/oh-my-cli)</td> <td>开源权重 4.89TB,需 24 GPU(BF16)/16(FP8);API 新加坡 $2/M 输入、$6/M 输出</td> <td>官方自报加 trace 可查</td> </tr> <tr> <td>谷歌 Argon(Gemini 4 首款)</td> <td>80 万行以上 Fuchsia Zircon 内核 C/C++ 迁移 Rust;libgav1 3.2 万行 SIMD 重写快 2.7 倍;DeepSWE v1.1 77.9%(SOTA)</td> <td>官方博客,称经自动化测试、仿真、人工评审后才部署</td> <td>普通用户暂不可用(Fairwind 计划 650 家以上伙伴先行,无公开日期)</td> <td>官方自报</td> </tr> <tr> <td>参照:DeepSeek-V4-Flash-Vision-Exp</td> <td>DeepSWE v1.1 同卷 59.3%</td> <td>HF model card</td> <td>MIT 开源,可本地跑</td> <td>官方自报</td> </tr> </tbody> </table>读这张表注意两点。第一,三家的「连续」不是一个量级:Ling 是小时级,Qwen 是天级,Argon 没给时长只给了工程量级,直接拿 17 小时和 16 天比快慢是没有意义的,任务难度和验证方式都不同。第二,可复核性差距比分数差距更值得看:Qwen 的 GitHub trace 是三者中唯一能逐条翻的,Ling 附了可复跑测试集,Argon 则只能信任官方描述。
时长之外:自愈机制才是「替你加班」的入场券
连续干 16 天,最难的不是起步,而是半夜三点测试挂了怎么办。这恰恰是各家方案分化最大的地方。
Qwen3.8-Max 的案例里最有信息量的不是 commit 数,而是那套机制:issue 状态机管任务生命周期,看门狗负责发现卡死,CI 自愈闭环负责失败重试,自测会触发 Build、Unit、E2E 三层验证。翻译成人话就是:它不光会干活,还会自己发现干错了并且回头修。这是「无人值守」能成立的技术前提。
Ling 的 17 小时案例官方没有披露中途自检机制的细节,我们不作推测,但 182 项测试过 178 项这个结果本身说明任务末端有一套完整的验收标准在那儿等着,而不是模型自己说完成就算完成。
Argon 的路径是另一个极端:官方称间接提示注入的防御最有韧性,CoT 与动作可被监控、执行可中止,外加沙箱隔离,迁移代码要过自动化测试、仿真、人工评审三道关才部署。换句话说,它不是「没人管地干」,而是「人管得少但管在关键处」。这套流程在企业级场景里可能是加分项,但也意味着它的「自主」是戴着镣铐的。
顺带如实记一笔短板:Argon 在 FrontierSWE v2 上 55.0%,低于 GPT-6 Astra 的 65.5%;Terminal-bench 4.0 上 57.4%,低于 Claude Opus 5.5 的 66.4%。注意这两个基准和 DeepSWE v1.1 是不同的卷子,版本之间严禁跨卷比较——只能说 Argon 并非全线碾压,长程软件工程这一项恰好是它的主场。
百灵和通义千问哪个好:架构谱系先说清
这是本篇最值得正面回答的问题,因为搜索联想里它排第一,而且网上现成答案很少。先给结论:两者是同一时代思路下走了相反方向的两条路,没有绝对的好坏,只有场景匹配。
从架构谱系看,方向确实相反。Ling-3.1-flash 是 560B 总参数、25B 激活的 MoE,注意力层的配比是 7 层 KDA(Kimi Delta Attention 一系的线性注意力)加 1 层 Gated MLA,明显在提高线性注意力的占比,目标指向超长上下文下的推理成本——官方给它 1M 上下文上限,长任务 feed 得起。Qwen3.8 这边是 3 层 Gated DeltaNet 加 1 层 Gated Attention,线性注意力占比低一些,保留的传统注意力更多,更像一个均衡取向;顶配版 Qwen3.8-2.4T-A95B 是 2.4 万亿总参数、95B 激活。两家都是 512 个专家的 MoE 路由系(Ling 是 512 选 8 加 1 共享)。
落到「替你加班」这个场景,差异就具体了。Ling 的免费体验窗口(Vercel AI Gateway 明示免费至 10 月 13 日)是目前零成本试「长任务连续执行」的最低门槛入口,虽然体验期上下文只有 256K,完整 1M 未开放;它的 17 小时编译器案例也说明小时级任务是它的舒适区。Qwen3.8-Max 的 16 天案例则证明它在天级、周级的仓库维护上有实测记录,且 trace 公开可查;代价是要么走 API 付费(新加坡标准价 $2/M 输入、$6/M 输出,约为 Claude Opus 5 输入价的 40%、输出价的 24%),要么自己拉 4.89TB 的开源权重。
所以「哪个好」的答案取决于你的任务长度和预算结构:过夜级任务、想先免费试水,Ling 顺手;周级仓库维护、需要可查证据链,Qwen 更有底。至于编码之外的综合推理对比,可以参考我们此前的旗舰编码与推理横评,那篇的轴更偏单题能力。
Qwen3.8-Max 的「半开源」争议:两头都得说
Qwen3.8-Max 的开源是这次横评里争议最大的部分,两边的说法我们都要如实呈现。
说它「真开源」的一方的依据是:权重确实放出来了,Qwen3.8-2.4T-A95B 共 213 个 shard、BF16 精度 4.89TB,社区按官方指引可以用 24 卡 GPU 跑 BF16、16 卡跑 FP8、8 卡跑 NVFP4,部署路径是通的。GitHub 上 oh-my-cli 的全过程 trace 也公开可查,这在头部模型里并不多见。
说它「半开源」的一方的依据则更硬:第一,License 不是 Apache 2.0,而是定制的 qwen3.8-max 许可——大商业用途要收入分成,且分成阈值和比例官方明确说仍在敲定,等于商业合规成本目前是悬着的(真正的 Apache-2.0 是 27B 的小弟,8 月 15 日开源当天冲上 HN 第一)。第二,开源版和 API 版能力不对等:开源版是 text-only、原生 262,144 上下文、强制 thinking(enable_thinking 设为 false 会直接抛异常);视觉能力、默认 1M 上下文、内置工具这些只在 API 版有。你拉下来的 4.89TB,并不是你在 API 里调到的那个完整形态。
我们的看法是:这不是非黑即白的问题。从权重可得性和 trace 透明度看,Qwen3.8-Max 的开源诚意在闭源为主的头部阵营里属于第一梯队;但从许可确定性和版本一致性看,把它当「完全体开源模型」直接写进商业方案是有风险的。在分成条款定稿之前,谨慎的做法是研发验证用开源版、生产商业部署要么等条款落地、要么直接走 API。
怎么选:三种人群三种答案
想先白嫖试试长任务的:Ling-3.1-flash 的两周免费窗口(至 10 月 13 日前后)是当下唯一零成本的官方入口,过夜挂一个编译器或文档处理任务正合适。体验入口的选择,见本文「怎么选」一节;256K 窗口的分段喂法我们会在后续 SOP 里展开。
要证据链和可运维性的团队:Qwen3.8-Max 的 GitHub trace 是目前唯一能逐条审计的连续自主工程记录,API 价格也只有旗舰竞品的两到四成。预算敏感的团队可以直接从 API 版切入。
等 Argon 的:继续等。Fairwind 计划 650 家以上合作伙伴先行,普通用户和付费 API 暂不可用,官方没有给日期。在此之前,想体验 DeepSWE 同卷水平的开源替代,MIT 协议的 DeepSeek-V4-Flash-Vision-Exp 可以本地跑,59.3% 与 77.9% 的差距就是目前开源与受控闭源在长程软件工程上的大致水位差。另外,如果你想理解 Argon 这类长输出模型和单次输出容量轴的取舍,可以再看一眼百万 token 输出横评和Sonnet 5.5 发布分析。
主攻搜索词
本篇覆盖三个真实搜索需求,正文均有对应解答:
- 百灵大模型和通义千问哪个好:见「架构谱系先说清」一节——Ling 走高线性注意力占比路线(7 层 KDA 加 1 层 Gated MLA)主打超长上下文低成本,Qwen 走均衡路线(3 层 Gated DeltaNet 加 1 层 Gated Attention),按任务长度和预算选。
- ai 连续工作 16 天什么水平:Qwen3.8-Max 的 oh-my-cli 案例(265 commits、127 PRs、151 issues)是目前公开记录里最长的连续自主工程,属于天级无人值守的第一梯队水平,且 trace 可查。
- ling 3.1 flash 和 qwen3.8 怎么选:小时级任务、免费试水选 Ling;天级仓库维护、需要证据链和 API 稳定性选 Qwen3.8-Max,详见「怎么选」一节。
FAQ
**Q1:**AI 连续工作 16 天是什么水平?
A1: 指的是阿里 Qwen3.8-Max 在 oh-my-cli 仓库上的自主工程记录:16 天里 265 次 commits、127 个 PRs、151 个 issues,配套 issue 状态机、看门狗和 CI 自愈闭环,GitHub 全过程 trace 公开。这是目前公开口径里最长的连续自主执行案例,属于天级无人值守的第一梯队。注意它是官方自报口径,但相比其他家多了可逐条翻查的 trace。
**Q2:**百灵大模型和通义千问哪个好?
A2: 架构上两条相反的路线:Ling-3.1-flash 用 7 层 KDA 加 1 层 Gated MLA,线性注意力占比高,主打超长上下文的成本效率;Qwen3.8 用 3 层 Gated DeltaNet 加 1 层 Gated Attention,更均衡。场景上,小时级任务和免费试水选 Ling(免费窗口至 10 月 13 日前后),天级仓库维护和需要可查证据链选 Qwen3.8-Max。
**Q3:**Ling-3.1-flash 和 Qwen3.8-Max 怎么选?
A3: 看三点:任务时长(过夜级选 Ling,周级选 Qwen)、预算(Ling 免费期零成本,Qwen API 为 $2/M 输入、$6/M 输出,或自备 24 卡 GPU 跑开源权重)、合规需求(Qwen 商业部署有收入分成条款且阈值未定稿,Ling 付费价格与开源计划官方尚未公布)。
**Q4:**Qwen3.8-Max 开源了吗?能随便商用吗?
A4: 权重开源是真的(4.89TB、213 个 shard),但 License 是定制的 qwen3.8-max 许可,不是 Apache 2.0,大商业用途涉及收入分成且阈值比例仍在敲定。另外开源版 text-only 且强制 thinking,与 API 版能力不对等。商用前建议等分成条款定稿,或直接走 API 授权路径。
**Q5:**谷歌 Argon 现在能用吗?
A5: 暂时不能。Argon 通过 Fairwind 计划向 650 家以上合作伙伴先行开放,普通用户和付费 API 均暂不可用,官方未给出开放日期。想先体验长程软件工程基准的开源替代,可以用 MIT 协议的 DeepSeek-V4-Flash-Vision-Exp 本地跑,它是 DeepSWE v1.1 同卷 59.3% 的参照锚点。
本文由 AI 辅助生成,经人工审核编辑。