DeepSeek Harness vs Pi:30 项工具任务测试解读

作者
DeepSeekAgent.io 编辑部
发布
更新

2026 年 9 月 8 日,Composio 发布了一组 DeepSeek Harness 与 Pi 的社区对比,并在 Reddit 引发方法讨论。测试让 DeepSeek V4 Pro 在两套 Harness 中完成 30 项真实应用与数据工具任务,每项最长运行 900 秒。

这不是 DeepSeek、Pi 或独立学术机构发布的官方 Benchmark。本文整理作者报告的数据、架构观察与方法限制,帮助读者理解这次测试能够说明什么。

作者报告的结果

指标PiDeepSeek Harness
通过任务21 / 3020 / 30
中位耗时362.9 秒252.1 秒
共同成功任务平均成本0.031 美元0.028 美元
报告的平均 Runtime Token924,99088,562

两套系统有 27 项任务结果相同。Pi 多通过一项,DSH 在本轮测试中位耗时更短,共同成功任务成本略低。

最大限制:两边使用了不同 API 路径

DSH 使用 DeepSeek 原生 Endpoint,Pi 通过 OpenRouter 调用。Provider、缓存实现、计费口径和 Token 统计方式可能不同。

因此,88,562 与 924,990 的 Runtime Token 不能解释成 DSH 已被证明节省约十倍 Token。原作者也明确提醒读者不要这样理解。实际报告的共同成功任务成本仅相差 0.003 美元。

Reddit 讨论进一步指出,若要隔离 Harness 影响,Pi 与 DSH 应使用同一个 DeepSeek Endpoint、相同模型版本、同一缓存与计费路径。公开文章也没有完整列出每项任务、运行版本、DSH Profile、随机性控制和重复次数,复现性仍有限。

结果仍提供了什么信息

30 项任务中,两者成功率接近,说明第一方 DSH 在该组样本里没有形成压倒性任务完成率优势。Harness 仍显著改变了运行时间、成本表现和具体任务结果。

这个观察与“同一个模型在不同 Harness 中会表现不同”的行业判断一致。它也提醒我们,评估 Agent 时需要同时记录成功率、耗时、实际费用、Token 口径和运行环境。

两套架构的核心差异

Pi 从很小的核心出发,默认提供少量工具,以 TypeScript Extension 扩展能力。代码规模和默认上下文更容易理解,也适合个人日常编码。

DSH 提供 Cordis 插件依赖图、可替换 Agent Loop、Sandbox、Subagent、MCP、Schedule、回放与追加式 Trajectory。扩展门槛更高,运行时治理和深度组合空间也更大。

DSH 对非 DeepSeek 模型的部分支持使用 Pi 的 pi-ai 模型层。两者在基础设施层存在复用关系,产品设计仍选择了不同复杂度。

怎样做更可靠的复测

  1. 两边固定同一个 DeepSeek 原生 Endpoint 和模型快照。
  2. 公布 Pi 与 DSH 的精确版本、DSH Profile、工具列表和系统提示词。
  3. 对每项任务运行多次,并报告均值、方差与失败原因。
  4. 分开记录缓存前 Token、缓存命中、计费 Token 和最终费用。
  5. 发布任务集、Verifier、原始 Trajectory 与逐项结果。
  6. 同时测试 Minimal 与 Standard,避免把一个 Profile 代表成整个 DSH。

选型参考

需求更值得先试
小型、易读、日常终端编码Pi
深度修改 Agent Loop、Sandbox 与生命周期DSH
需要完整 Trajectory、回放和插件依赖管理DSH
经常切换 Provider 或本地模型Pi
追求实测性能在自己的任务和 Endpoint 上复测两者

相关阅读

常见问题

这次测试证明 Pi 的质量更好吗?

Pi 在 30 项任务中多通过一项。样本规模、运行配置和复现信息不足以支持普遍结论。

DSH 真的节省十倍 Token 吗?

当前测试无法证明。两边使用不同 API 路径,Token 与缓存统计不可直接比较;共同成功任务的实际成本非常接近。