模型与 Harness 的 66 种配置评测
模型与 Harness 匹配效应:66 种配置跨任务评测
- 作者
- DeepSeekAgent.io 编辑部
- 发布
- 更新
同一个模型换一套 Agent Harness,能力排名、运行成本和失败方式都可能改变。论文 Finding the Right Fit: Model–Harness Interactions across Agent Tasks 将 OpenHands、DeepSeek Harness(DSH)、PI 与 openJiuwen 分别接入 Claude Opus 5、GPT-6 Astra、GLM-5.3、Kimi K3 和 DeepSeek V4 Pro,在 TUA-Bench、ALE-CLI 与 Terminal-Bench 4 上组成 60 个可配置组合,再加入 Codex–GPT 与 Claude Code–Claude 的 6 个原生组合。
实验最终公开了 66 组结果和 6,204 条评分轨迹。它研究的重点不是选出一套“总冠军” Harness,而是观察模型、Harness 与任务如何共同决定结果。
三组任务测量的不是同一件事
| 任务集 | 侧重点 | 任务数 |
|---|---|---|
| TUA-Bench | 通用终端与桌面操作 | 120 |
| ALE-CLI | 专业工作流与计算机使用 | 99 |
| Terminal-Bench 4 | 高难度命令行任务 | 63 |
所有可配置 Harness 都通过 OpenRouter 固定到模型的第一方 Provider,并使用高推理强度。论文没有额外安装 Skill、MCP、Memory 或自定义 Prompt;Context、Compaction、重试和轮数限制保留各 Harness 的默认策略。因此,结果更接近“默认 Harness 与模型的匹配程度”,不是每套系统经过专项调优后的上限。
DeepSeek V4 Pro 的最佳 Harness 随任务改变
| DeepSeek V4 Pro | OpenHands | DSH | PI | openJiuwen | 本组最高 |
|---|---|---|---|---|---|
| TUA-Bench | 56.49 | 51.93 | 57.58 | 62.59 | openJiuwen |
| ALE-CLI | 51.20 | 40.94 | 47.72 | 50.83 | OpenHands |
| Terminal-Bench 4 | 3.17 | 9.52 | 6.35 | 7.94 | DSH |
DSH 在 Terminal-Bench 4 上给出了 DeepSeek V4 Pro 的最高结果,但在另两组任务中不是第一。GLM-5.3 也呈现相同的“openJiuwen → OpenHands → DSH”任务切换。模型与 Harness 的适配不应脱离具体工作负载讨论。
GPT 在 PI 与 DSH 中的差距来自哪里
Terminal-Bench 4 中,GPT-6 Astra 在 PI 得到 60.32%,单任务模型成本为 4.66 美元;在 DSH 得到 52.38%,单任务成本为 19.94 美元。PI 使用了 2,560 次模型调用和 1.10 亿未缓存输入 Token,DSH 对应为 11,879 次调用和 6.73 亿未缓存输入 Token。
这不是简单的“工具越多越差”。论文的轨迹分析显示,GPT 会主动给多数 PI Shell 命令设置超时,因此可以驾驭较轻的 Scaffold。对更容易生成错误工具调用的模型,额外的错误拦截、续写和恢复机制反而更重要。
Harness 的关键价值是把失败变成可用反馈
作者人工检查了相同任务、相同模型在不同 Harness 下的失败与恢复。192 个可操作失败信号中,180 个响应由模型自己发起;诊断或定向修复解决了 133 个事件中的 116 个。
真正拉开结果的往往是模型有没有收到信号:
- Shell 没有默认超时,挂起命令就会变成长期沉默;
- 输出达到上限后直接结束,模型没有机会继续完成;
- 连续错误调用被过早停止,已经形成的方案无法落地;
- Harness 返回明确的超时、错误与未完成状态,模型才有机会修复。
Agent Loop 的职责不只是“继续调用模型”,还要把环境失败转换成模型能够采取行动的上下文。
对 DSH 选型与评测的启示
- 不要只看模型榜,也不要只看 Harness 榜;需要固定模型、Harness、Profile 和任务共同测试。
- 成本必须和得分一起报告。更多模型调用与更长轨迹不自动带来更高完成率。
- 对默认 DSH 结果不满意时,应先检查 Profile、工具集合、超时、续轮和 Compaction,而不是立刻更换模型。
- 评测应保留逐项 Trajectory。总分只能告诉你差距存在,轨迹才能解释差距来自工具调用、反馈恢复还是结束判断。
- DSH、PI 或其他 Harness 的优势都可能只在某类任务上成立,生产选型应使用自己的真实任务集。
与此前 DSH vs Pi 社区测试的关系
此前 30 项社区测试只比较 DeepSeek V4 Pro 在 DSH 与 PI 下的工具任务,而且两边使用了不同 API 路径。新论文将 Provider 路径统一,并扩展到五种模型、三组任务和四套可配置 Harness。两项研究不是重复实验,但都指向同一件事:Harness 会同时改变任务完成、运行时间、Token 与成本,单一总榜不足以决定选型。
相关阅读
- Gemini Agent:统一工作入口、持久执行与多 Agent 协作
- DeepSeek Harness vs Pi:30 项工具任务社区测试
- Agent Harness 组件效应:工具、压缩与 Sub-agent
- DSH、deepagents 与 Pi 的架构趋同