DeepSeek Harness 两天 10 万星,把「agent harness」从测试术语变成了一个新品类:包裹模型的那层执行脚手架,正在和模型本身一样成为选型对象。这一篇把当前最值得关注的四款拉到同一张桌子上:DeepSeek Harness(dsh)、Anthropic Claude Code、OpenCode、OpenAI Codex CLI。结论先行:这不是四选一的替代关系,而是三种需求--开箱生产力、模型无关日用、可改造底座--各有最优解。
先说清边界:本文为代表性对比(基于各官方仓库与文档,截至 2026-08-15),非同一环境亲自压测;星数为 GitHub API 快照,功能迭代快,以官方文档为准。DeepSeek Harness 的新闻背景见本站 Harness 热点,接 Claude Code 用 DeepSeek 模型的实操见 DeepSeek 接 Claude Code SOP。
一、四款横评总表
| 维度 | DeepSeek Harness (dsh) | Claude Code | OpenCode | Codex CLI |
|---|---|---|---|---|
| 定位 | 可组合 agent 运行时(底座) | 终端编码智能体(产品) | 终端编码智能体(开源日用) | 终端编码智能体(OpenAI 官方) |
| GitHub 星数 | 101,905(上线两天) | 141,500 | 197,583 | 106,006 |
| 语言 | TypeScript | Python(CLI 分发) | TypeScript | Rust |
| 开源协议 | MIT | 仓库开源、服务闭源 | 开源 | Apache-2.0(CLI) |
| 模型绑定 | 无(模型是插件,任意后端) | Claude 系(可经兼容层换) | 无(多 provider) | OpenAI 系为主 |
| 扩展模型 | 一切皆插件(内核到 UI 全可换) | Skills/MCP(边缘扩展) | 插件/供应商配置 | 配置有限 |
| 可观测性 | append-only 轨迹,恢复/分叉/回放 | 会话记录 | TUI 内会话管理 | 会话记录 |
| 界面 | 本地 Web UI(127.0.0.1:3080) | 终端原生 | 终端 TUI | 终端原生 |
| 成熟度 | v0.1 开发者预览(破坏性变更警告) | 商业成熟 | 社区成熟 | 商业成熟 |
数据快照说明:OpenCode 19.7 万星为四者最高(社区项目长期积累);dsh 10 万星只用两天,是热度的速度纪录而非存量比拼;Claude Code 与 Codex 的星数含品牌效应,实际能力以各官方文档为准。
二、逐款最佳射程
DeepSeek Harness:要改造 agent 的人的底座。 它赢在「可拆」:模型、工具、沙箱、循环、编排、UI 全是 Cordis 插件,换任何一层不用 fork 源码;Minimal 模式还是官方跑模型基准的环境,做模型评测的人可以直接复用。输在成熟度:v0.1 预览版、破坏性变更警告、插件生态约 300 个且无审核、界面朴素。判断:适合构建者、研究者、要自托管完整开源栈(MIT 权重 + MIT 运行时)的团队;不适合只想今天就开始干活的人。
Claude Code:开箱生产力天花板。 终端原生体验、任务编排与 skills 生态最成熟,配合 Claude 系模型的长任务可靠性,是「付费买确定性」的代表。代价:深度绑定 Anthropic 模型与订阅;想用 DeepSeek 等便宜模型,得走 Anthropic 兼容层(本站有 SOP)。判断:预算允许、要最高完成度的团队与重度用户。
OpenCode:模型无关的日用开源首选。 19.7 万星、TypeScript、多 provider 即插即用,社区活跃度是四者最高的存量。它和 dsh 同为开源,但路线不同:OpenCode 是「更好的编码 agent 产品」,dsh 是「可以长出任何 agent 的运行时」。判断:不想绑定任何厂商、要一个稳定能用的开源终端 agent,选它。
Codex CLI:OpenAI 生态正选。 Rust 实现、Apache-2.0、与 OpenAI 模型和云沙箱深度协同。如果你的工作流已经在 ChatGPT/Codex 订阅生态里,它是最顺滑的一条线;跨厂商灵活性是四者中最弱的。判断:OpenAI 订阅用户的默认答案。
三、分层选型与组合
| 你的需求 | 推荐 | 组合建议 |
|---|---|---|
| 今天就要高效干活,预算无所谓 | Claude Code | 搭配 skills 沉淀团队资产 |
| 开源日用,多模型切换省钱 | OpenCode | DeepSeek-V4 做主力,Claude 做难题 |
| 构建/改造自己的 agent,或自托管全开源栈 | DeepSeek Harness | MIT 权重 + dsh 运行时,端到端无专有依赖 |
| 已在 OpenAI 生态内 | Codex CLI | 配合 Codex 云沙箱 |
三层视角看这场竞争更有意思:模型层正在同质化(可替换),护城河向「跑模型的那层基础设施」迁移;dsh 把编排范式做成了可组合积木,但范式本身(循环、工具、轨迹)并未突破;对普通开发者,未来一年的现实是多 harness 并存--用 Claude Code 干活,用 OpenCode 省钱,盯着 dsh 长大。
常见问题
Q1:四款里哪个「最强」? A1:没有单一答案。论开箱生产力与任务完成度,Claude Code 商业成熟度最高;论开源生态存量与模型无关日用,OpenCode(197,583★)最稳;论架构可组合性与自托管开放栈,dsh 最激进;论 OpenAI 生态协同,Codex 最顺。「最强」取决于你是用户、省钱者、构建者还是生态绑定者。
Q2:DeepSeek Harness 能替代 Claude Code 吗? A2:短期内不能。dsh 是 v0.1 开发者预览(官方警告破坏性兼容变更),插件无审核、界面朴素、部署有门槛;它的对手不是 Claude Code 的今天,而是「可组合 agent 运行时」这个新品类的明天。想省钱用 DeepSeek 模型配成熟 harness,当下更稳的是 OpenCode 或 Claude Code + 兼容层。
Q3:为什么说 dsh 的「一切皆插件」和普通插件机制不同? A3:普通工具(含 Claude Code/OpenCode/Codex)的扩展点是外围的:加工具、接 MCP、装 skills,内核循环、编排、UI 焊死。dsh 建在 Cordis 元框架上,模型/工具/技能/会话/沙箱/存储/循环/编排/UI 九类组件全是插件,替换任意一层都不需要改框架源码--这是「边缘可扩展」与「全系统可组合」的区别。
Q4:OpenCode 和 DeepSeek Harness 都是开源,怎么选? A4:看你要产品还是底座。OpenCode 是打磨好的终端编码 agent,装上就用、多 provider 切换,定位「日用」;dsh 是运行时底座,价值在可拆可换可研究(Minimal 模式做模型评测、Creator 模式做插件实验),定位「构建」。绝大多数开发者今天该选 OpenCode,等 dsh 接口稳定再评估迁移。
Q5:harness 选型会影响模型基准分数的解读吗? A5:会,而且影响很大。DeepSeek 官方就是在 Harness Minimal 模式(仅 bash + 文件编辑两工具)下跑 Code Agent 基准的--同一模型在不同 harness、不同工具脚手架下的生产表现可以差出一个档位。看到任何「XX 模型 Coding 第一」时,先问一句:在哪个 harness、哪种模式下测的。
参考来源
- GitHub API 实测(2026-08-15):deepseek-ai/deepseek-harness 101,905★/MIT/TypeScript;anthropics/claude-code 141,500★;anomalyco/opencode 197,583★/TypeScript;openai/codex 106,006★/Rust
- DeepSeek 官方:Harness 发布页(一切皆插件、四种模式、Minimal 与基准测试)
- 网易科技/Eigent AI/AI Reading Hub(InfoQ):dsh 发布报道与解析(2026-08-13/14)
- 各项目官方文档:Claude Code、OpenCode、Codex CLI 功能与协议说明
本文为代表性对比(2026-08-15),非亲自压测;星数与功能以官方为准。相关阅读:DeepSeek Harness 热点 | DeepSeek Harness 上手 SOP | DeepSeek 接 Claude Code SOP | 前沿编码模型横评