硬核横评
硬核横评

Agent Harness 横评:DeepSeek Harness vs Claude Code vs OpenCode vs Codex,编码智能体四强怎么选

编码智能体 harness 四强横评:DeepSeek Harness(101,905★ MIT 一切皆插件,可组合底座)vs Claude Code(141,500★ 开箱生产力)vs OpenCode(197,583★ 模型无关日用)vs Codex CLI(106,006★ OpenAI 生态)。2 对比表+逐款最佳射程+分层选型+5 FAQ。代表性对比非亲自压测,星数为 API 快照,以官方为准。

发布于 2026年8月15日9 分钟阅读
<!-- agent-harness-comparison-review | review | Agent Harness 横评:DeepSeek Harness vs Claude Code vs OpenCode vs Codex,编码智能体四强怎么选 -->

DeepSeek Harness 两天 10 万星,把「agent harness」从测试术语变成了一个新品类:包裹模型的那层执行脚手架,正在和模型本身一样成为选型对象。这一篇把当前最值得关注的四款拉到同一张桌子上:DeepSeek Harness(dsh)、Anthropic Claude Code、OpenCode、OpenAI Codex CLI。结论先行:这不是四选一的替代关系,而是三种需求--开箱生产力、模型无关日用、可改造底座--各有最优解

先说清边界:本文为代表性对比(基于各官方仓库与文档,截至 2026-08-15),非同一环境亲自压测;星数为 GitHub API 快照,功能迭代快,以官方文档为准。DeepSeek Harness 的新闻背景见本站 Harness 热点,接 Claude Code 用 DeepSeek 模型的实操见 DeepSeek 接 Claude Code SOP

一、四款横评总表

维度DeepSeek Harness (dsh)Claude CodeOpenCodeCodex CLI
定位可组合 agent 运行时(底座)终端编码智能体(产品)终端编码智能体(开源日用)终端编码智能体(OpenAI 官方)
GitHub 星数101,905(上线两天)141,500197,583106,006
语言TypeScriptPython(CLI 分发)TypeScriptRust
开源协议MIT仓库开源、服务闭源开源Apache-2.0(CLI)
模型绑定无(模型是插件,任意后端)Claude 系(可经兼容层换)无(多 provider)OpenAI 系为主
扩展模型一切皆插件(内核到 UI 全可换)Skills/MCP(边缘扩展)插件/供应商配置配置有限
可观测性append-only 轨迹,恢复/分叉/回放会话记录TUI 内会话管理会话记录
界面本地 Web UI(127.0.0.1:3080)终端原生终端 TUI终端原生
成熟度v0.1 开发者预览(破坏性变更警告)商业成熟社区成熟商业成熟

数据快照说明:OpenCode 19.7 万星为四者最高(社区项目长期积累);dsh 10 万星只用两天,是热度的速度纪录而非存量比拼;Claude Code 与 Codex 的星数含品牌效应,实际能力以各官方文档为准。

二、逐款最佳射程

DeepSeek Harness:要改造 agent 的人的底座。 它赢在「可拆」:模型、工具、沙箱、循环、编排、UI 全是 Cordis 插件,换任何一层不用 fork 源码;Minimal 模式还是官方跑模型基准的环境,做模型评测的人可以直接复用。输在成熟度:v0.1 预览版、破坏性变更警告、插件生态约 300 个且无审核、界面朴素。判断:适合构建者、研究者、要自托管完整开源栈(MIT 权重 + MIT 运行时)的团队;不适合只想今天就开始干活的人。

Claude Code:开箱生产力天花板。 终端原生体验、任务编排与 skills 生态最成熟,配合 Claude 系模型的长任务可靠性,是「付费买确定性」的代表。代价:深度绑定 Anthropic 模型与订阅;想用 DeepSeek 等便宜模型,得走 Anthropic 兼容层(本站有 SOP)。判断:预算允许、要最高完成度的团队与重度用户。

OpenCode:模型无关的日用开源首选。 19.7 万星、TypeScript、多 provider 即插即用,社区活跃度是四者最高的存量。它和 dsh 同为开源,但路线不同:OpenCode 是「更好的编码 agent 产品」,dsh 是「可以长出任何 agent 的运行时」。判断:不想绑定任何厂商、要一个稳定能用的开源终端 agent,选它。

Codex CLI:OpenAI 生态正选。 Rust 实现、Apache-2.0、与 OpenAI 模型和云沙箱深度协同。如果你的工作流已经在 ChatGPT/Codex 订阅生态里,它是最顺滑的一条线;跨厂商灵活性是四者中最弱的。判断:OpenAI 订阅用户的默认答案。

三、分层选型与组合

你的需求推荐组合建议
今天就要高效干活,预算无所谓Claude Code搭配 skills 沉淀团队资产
开源日用,多模型切换省钱OpenCodeDeepSeek-V4 做主力,Claude 做难题
构建/改造自己的 agent,或自托管全开源栈DeepSeek HarnessMIT 权重 + dsh 运行时,端到端无专有依赖
已在 OpenAI 生态内Codex CLI配合 Codex 云沙箱

三层视角看这场竞争更有意思:模型层正在同质化(可替换),护城河向「跑模型的那层基础设施」迁移;dsh 把编排范式做成了可组合积木,但范式本身(循环、工具、轨迹)并未突破;对普通开发者,未来一年的现实是多 harness 并存--用 Claude Code 干活,用 OpenCode 省钱,盯着 dsh 长大。

常见问题

Q1:四款里哪个「最强」? A1:没有单一答案。论开箱生产力与任务完成度,Claude Code 商业成熟度最高;论开源生态存量与模型无关日用,OpenCode(197,583★)最稳;论架构可组合性与自托管开放栈,dsh 最激进;论 OpenAI 生态协同,Codex 最顺。「最强」取决于你是用户、省钱者、构建者还是生态绑定者。

Q2:DeepSeek Harness 能替代 Claude Code 吗? A2:短期内不能。dsh 是 v0.1 开发者预览(官方警告破坏性兼容变更),插件无审核、界面朴素、部署有门槛;它的对手不是 Claude Code 的今天,而是「可组合 agent 运行时」这个新品类的明天。想省钱用 DeepSeek 模型配成熟 harness,当下更稳的是 OpenCode 或 Claude Code + 兼容层。

Q3:为什么说 dsh 的「一切皆插件」和普通插件机制不同? A3:普通工具(含 Claude Code/OpenCode/Codex)的扩展点是外围的:加工具、接 MCP、装 skills,内核循环、编排、UI 焊死。dsh 建在 Cordis 元框架上,模型/工具/技能/会话/沙箱/存储/循环/编排/UI 九类组件全是插件,替换任意一层都不需要改框架源码--这是「边缘可扩展」与「全系统可组合」的区别。

Q4:OpenCode 和 DeepSeek Harness 都是开源,怎么选? A4:看你要产品还是底座。OpenCode 是打磨好的终端编码 agent,装上就用、多 provider 切换,定位「日用」;dsh 是运行时底座,价值在可拆可换可研究(Minimal 模式做模型评测、Creator 模式做插件实验),定位「构建」。绝大多数开发者今天该选 OpenCode,等 dsh 接口稳定再评估迁移。

Q5:harness 选型会影响模型基准分数的解读吗? A5:会,而且影响很大。DeepSeek 官方就是在 Harness Minimal 模式(仅 bash + 文件编辑两工具)下跑 Code Agent 基准的--同一模型在不同 harness、不同工具脚手架下的生产表现可以差出一个档位。看到任何「XX 模型 Coding 第一」时,先问一句:在哪个 harness、哪种模式下测的。


参考来源

  • GitHub API 实测(2026-08-15):deepseek-ai/deepseek-harness 101,905★/MIT/TypeScript;anthropics/claude-code 141,500★;anomalyco/opencode 197,583★/TypeScript;openai/codex 106,006★/Rust
  • DeepSeek 官方:Harness 发布页(一切皆插件、四种模式、Minimal 与基准测试)
  • 网易科技/Eigent AI/AI Reading Hub(InfoQ):dsh 发布报道与解析(2026-08-13/14)
  • 各项目官方文档:Claude Code、OpenCode、Codex CLI 功能与协议说明

本文为代表性对比(2026-08-15),非亲自压测;星数与功能以官方为准。相关阅读:DeepSeek Harness 热点DeepSeek Harness 上手 SOPDeepSeek 接 Claude Code SOP前沿编码模型横评

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-15

常见问题

四款里哪个「最强」?
没有单一答案。论开箱生产力与任务完成度,Claude Code 商业成熟度最高;论开源生态存量与模型无关日用,OpenCode(197,583★)最稳;论架构可组合性与自托管开放栈,dsh 最激进;论 OpenAI 生态协同,Codex 最顺。「最强」取决于你是用户、省钱者、构建者还是生态绑定者。
DeepSeek Harness 能替代 Claude Code 吗?
短期内不能。dsh 是 v0.1 开发者预览(官方警告破坏性兼容变更),插件无审核、界面朴素、部署有门槛;它的对手不是 Claude Code 的今天,而是「可组合 agent 运行时」这个新品类的明天。想省钱用 DeepSeek 模型配成熟 harness,当下更稳的是 OpenCode 或 Claude Code + 兼容层。
为什么说 dsh 的「一切皆插件」和普通插件机制不同?
普通工具(含 Claude Code/OpenCode/Codex)的扩展点是外围的:加工具、接 MCP、装 skills,内核循环、编排、UI 焊死。dsh 建在 Cordis 元框架上,模型/工具/技能/会话/沙箱/存储/循环/编排/UI 九类组件全是插件,替换任意一层都不需要改框架源码--这是「边缘可扩展」与「全系统可组合」的区别。
OpenCode 和 DeepSeek Harness 都是开源,怎么选?
看你要产品还是底座。OpenCode 是打磨好的终端编码 agent,装上就用、多 provider 切换,定位「日用」;dsh 是运行时底座,价值在可拆可换可研究(Minimal 模式做模型评测、Creator 模式做插件实验),定位「构建」。绝大多数开发者今天该选 OpenCode,等 dsh 接口稳定再评估迁移。
harness 选型会影响模型基准分数的解读吗?
会,而且影响很大。DeepSeek 官方就是在 Harness Minimal 模式(仅 bash + 文件编辑两工具)下跑 Code Agent 基准的--同一模型在不同 harness、不同工具脚手架下的生产表现可以差出一个档位。看到任何「XX 模型 Coding 第一」时,先问一句:在哪个 harness、哪种模式下测的。

相关文章