DeepSeek Harness 实测:插件架构、使用体验与优缺点

基于 DeepSeek Harness 0.1 Developer Preview 的实测评测:安装、插件架构、Profile、Web UI、优缺点,以及现阶段适合哪些开发者。

利益披露:deepseekagent.io 维护 DeepSeek Harness 绿色免安装版。本评测将官方上游 Harness 与绿色免安装版分开评价,并明确说明测试边界。

DeepSeek Harness 不是另一个 Codex

DeepSeek Harness 容易被理解成 DeepSeek 推出的 Coding Agent,但它与 Codex、Claude Code 并不是同一类产品。

Codex 和 Claude Code 提供的是相对完整的编码产品,用户主要负责提出任务。DeepSeek Harness 则把模型、工具、会话、运行循环和界面拆成可以组合的部分,重点是让开发者调整 Agent 的构成方式。

因此,对 DeepSeek Harness 的评价取决于使用目的:

如果你只想找一个更好用的 AI 编程工具,现在没必要从 Codex 或 Claude Code 换过来;如果你想改造 Agent 本身,DeepSeek Harness 是最近最值得动手研究的项目之一。

DeepSeek Harness 实际启动后的插件设置界面,可查看已安装能力与启用状态

插件构成运行时本身

一般产品说“支持插件”,意思是允许你加几个命令、接几个 API。DeepSeek Harness 不是这样。

在它的插件列表里,模型、工具、会话、重试、沙箱、子 Agent、工作流,甚至界面和 Agent Loop 都可以被拆开。插件不是挂在产品外面的配件,它们就是产品本身。

这件事有什么实际价值?举个具体的例子:

假设公司想做一个代码审查 Agent。它只能读取指定仓库,必须走内部模型网关,每次修改都要保留轨迹,危险命令默认禁止,最终结果还要写回工单。传统做法是在某个 Coding Agent 外面再包一层服务,或者不断修改上游代码。用 DeepSeek Harness,可以把权限、模型、工具、审计和工作流组合成一个 Profile。

以后换模型,不用重做工具;换界面,不用重写 Agent Loop;某个团队需要额外权限,也不必复制整套项目。

“一切皆插件”的价值,在于团队可以复用同一套能力,同时按场景调整 Agent 的组成。

Creator mode 展示了 DeepSeek Harness 的设计方向

DeepSeek Harness 工作界面中的运行模式选择器

DeepSeek Harness 目前提供 Standard、Code、Minimal 和 Creator 几种运行模式。

  • Standard mode 是完整工具集,适合正常使用。
  • Code mode 让模型用代码组织多轮工具调用。
  • Minimal mode 只保留 Bash 和文件编辑器,更适合做模型或 Harness 实验。
  • Creator mode 用来检查当前运行时、试插件、做自己的 Agent preset。

Creator mode 最能体现 DeepSeek Harness 的设计方向。它允许开发者检查当前运行时、测试插件并创建 Agent preset,从而明确哪些能力被装载,以及这些能力如何组合。

如果只用 Standard mode 完成普通代码问答,DeepSeek Harness 与其他 Coding Agent 的差异并不明显。更有代表性的使用方式是修改一个插件或 Profile,再比较同一任务的行为变化。

安装不难,理解它需要一点时间

官方启动命令很短:

npx @deepseek-ai/dsh web

Web UI 很快就能打开。主要学习成本来自 Profile。

Profile 决定这一轮 DeepSeek Harness 装载哪些插件、使用什么配置、再叠加哪些机器或命令行覆盖。刚开始你会遇到 bundle、patch、overlay、插件依赖这些概念。它们都不是多余设计,但也确实让 DeepSeek Harness 比普通 Coding Agent 更难一眼看懂。

我建议不要上来就读完整配置。先做三件事:

  1. 用 Standard mode 跑一个真实的小任务。
  2. 切到 Creator mode,看当前能力从哪些插件来。
  3. 导出最终配置,改一个小地方,再跑同一个任务。

这样比先啃文档更容易理解 DeepSeek Harness。

如果你连 Node 都不想配置,可以直接用我们做的 DeepSeek Harness 绿色免安装版,解压后双击启动。它不改变 Harness 代码,只是把运行时一起打包了。

我们实际检查了哪些东西

这次使用的是 @deepseek-ai/[email protected],Node 版本为 24.19.0。我们验证了:

  • Web 与 headless 两种入口能否正常初始化。
  • Profile、bundle patch、用户 patch 和命令行覆盖如何叠加。
  • 工具、会话轨迹、重试、子 Agent、工作流、模型选择和沙箱在包里是否真的以插件形式存在。
  • 打包运行时能否脱离系统 Node 执行 DeepSeek Harness。

这次没有计算任务成功率。模型、Provider、Profile 和工具集都会影响结果,单一总分无法说明 DeepSeek Harness 本身的表现。更合适的评测方式是固定模型与任务,再比较 Standard、Code、Minimal 等 Harness 配置带来的差异。

三项主要优势

1. 定制范围不止于提示词

过去所谓“定制 Agent”,很多时候只是换 system prompt、接 MCP、写几个 Skill。DeepSeek Harness 把可修改范围继续往下推了一层:工具怎么暴露、循环怎么跑、会话怎么存、失败怎么重试,都可以进入组合系统。

2. Web 与 headless 共用组合方式

这点对团队很实用。你可以先在 Web 里调通,再把同一套 Profile 放到脚本、CI 或批处理任务中,不需要维护两个完全不同的 Agent。

3. 适合研究 Harness 对模型表现的影响

同一个模型放进不同 Harness,表现可能完全不同。工具描述、上下文裁剪、重试逻辑、子 Agent 调度都会影响结果。DeepSeek Harness 把这些东西暴露出来,至少让实验不再完全是黑箱。

当前限制

配置自由增加了排查范围

一次任务失败,原因可能是模型,也可能是插件依赖、patch 顺序、Profile 配置或工具实现。DeepSeek Harness 提供了 --dump-default-config--dump-config,但仍需要更直观的配置差异和运行诊断工具。

现在仍然是 Developer Preview

插件接口和配置可能继续变化。今天写好的 Profile,升级后不一定原封不动继续工作。个人项目可以接受;如果要进生产环境,就必须锁版本,并为迁移留时间。

插件生态尚未成熟

插件架构最终需要由生态验证。现阶段可直接使用的 Provider、工具、沙箱、工作流和模板仍然有限。

与 Codex、Claude Code 和 OpenCode 的关系

几类产品的重点并不相同:

产品它最擅长解决的问题
Codex把一个工程任务直接交给 Agent 完成
Claude Code在终端和开发工具里高质量地完成编码工作
OpenCode用开放客户端连接不同模型和 Provider
DeepSeek Harness重新组合 Agent 的运行时和产品形态

所以不要先问“DeepSeek Harness 能不能替代 Codex”。先问自己:

你是想用一个 Agent,还是想造一个 Agent?

前者选成熟产品更省时间;后者才是 DeepSeek Harness 的主场。

更完整的产品差异,可以看DeepSeek Harness 与 Codex、Claude Code、Hermes Agent、OpenCode 的对比

谁应该现在就试

以下几类用户适合现在开始尝试:

  • 正在做内部 Agent 平台。
  • 对 Agent Loop、工具调用和上下文策略感兴趣。
  • 想把公司权限、工具和流程固定成一套可复现环境。
  • 在做模型评测,不想被某个封闭 Harness 绑住。
  • 喜欢拆工具、改工具,而不是只使用默认配置。

如果需求是稳定地写代码、修 Bug 和提交 PR,Codex 或 Claude Code 的完成度更高。DeepSeek Harness 也不会因为架构更开放,就自动提高模型的代码能力。

结论

DeepSeek Harness 现在还不是一个完成度最高的 Agent,但它提出了一个更有意思的问题:

当模型能力逐渐接近时,Harness 会成为影响 Agent 表现的重要变量。

模型决定能力上限,Harness 决定模型能看到什么、能做什么、失败后如何继续,以及整个过程能否被复现和调整。

DeepSeek Harness 将这部分能力做成了可以检查和组合的系统。目前产品仍然粗糙,生态也处于早期阶段;但对 Agent 开发者而言,已经具备实际研究和试验价值。

想直接运行,可以看安装指南;不想配置 Node,可以下载 DeepSeek Harness 绿色免安装版。源码和最新版本以 DeepSeek Harness GitHub 为准。