模型与 Harness 匹配效应:66 种配置跨任务评测

作者
DeepSeekAgent.io 编辑部
发布
更新

同一个模型换一套 Agent Harness,能力排名、运行成本和失败方式都可能改变。论文 Finding the Right Fit: Model–Harness Interactions across Agent Tasks 将 OpenHands、DeepSeek Harness(DSH)、PI 与 openJiuwen 分别接入 Claude Opus 5、GPT-6 Astra、GLM-5.3、Kimi K3 和 DeepSeek V4 Pro,在 TUA-Bench、ALE-CLI 与 Terminal-Bench 4 上组成 60 个可配置组合,再加入 Codex–GPT 与 Claude Code–Claude 的 6 个原生组合。

实验最终公开了 66 组结果和 6,204 条评分轨迹。它研究的重点不是选出一套“总冠军” Harness,而是观察模型、Harness 与任务如何共同决定结果。

三组任务测量的不是同一件事

任务集侧重点任务数
TUA-Bench通用终端与桌面操作120
ALE-CLI专业工作流与计算机使用99
Terminal-Bench 4高难度命令行任务63

所有可配置 Harness 都通过 OpenRouter 固定到模型的第一方 Provider,并使用高推理强度。论文没有额外安装 Skill、MCP、Memory 或自定义 Prompt;Context、Compaction、重试和轮数限制保留各 Harness 的默认策略。因此,结果更接近“默认 Harness 与模型的匹配程度”,不是每套系统经过专项调优后的上限。

DeepSeek V4 Pro 的最佳 Harness 随任务改变

DeepSeek V4 ProOpenHandsDSHPIopenJiuwen本组最高
TUA-Bench56.4951.9357.5862.59openJiuwen
ALE-CLI51.2040.9447.7250.83OpenHands
Terminal-Bench 43.179.526.357.94DSH

DSH 在 Terminal-Bench 4 上给出了 DeepSeek V4 Pro 的最高结果,但在另两组任务中不是第一。GLM-5.3 也呈现相同的“openJiuwen → OpenHands → DSH”任务切换。模型与 Harness 的适配不应脱离具体工作负载讨论。

GPT 在 PI 与 DSH 中的差距来自哪里

Terminal-Bench 4 中,GPT-6 Astra 在 PI 得到 60.32%,单任务模型成本为 4.66 美元;在 DSH 得到 52.38%,单任务成本为 19.94 美元。PI 使用了 2,560 次模型调用和 1.10 亿未缓存输入 Token,DSH 对应为 11,879 次调用和 6.73 亿未缓存输入 Token。

这不是简单的“工具越多越差”。论文的轨迹分析显示,GPT 会主动给多数 PI Shell 命令设置超时,因此可以驾驭较轻的 Scaffold。对更容易生成错误工具调用的模型,额外的错误拦截、续写和恢复机制反而更重要。

Harness 的关键价值是把失败变成可用反馈

作者人工检查了相同任务、相同模型在不同 Harness 下的失败与恢复。192 个可操作失败信号中,180 个响应由模型自己发起;诊断或定向修复解决了 133 个事件中的 116 个。

真正拉开结果的往往是模型有没有收到信号:

  • Shell 没有默认超时,挂起命令就会变成长期沉默;
  • 输出达到上限后直接结束,模型没有机会继续完成;
  • 连续错误调用被过早停止,已经形成的方案无法落地;
  • Harness 返回明确的超时、错误与未完成状态,模型才有机会修复。

Agent Loop 的职责不只是“继续调用模型”,还要把环境失败转换成模型能够采取行动的上下文。

对 DSH 选型与评测的启示

  1. 不要只看模型榜,也不要只看 Harness 榜;需要固定模型、Harness、Profile 和任务共同测试。
  2. 成本必须和得分一起报告。更多模型调用与更长轨迹不自动带来更高完成率。
  3. 对默认 DSH 结果不满意时,应先检查 Profile、工具集合、超时、续轮和 Compaction,而不是立刻更换模型。
  4. 评测应保留逐项 Trajectory。总分只能告诉你差距存在,轨迹才能解释差距来自工具调用、反馈恢复还是结束判断。
  5. DSH、PI 或其他 Harness 的优势都可能只在某类任务上成立,生产选型应使用自己的真实任务集。

与此前 DSH vs Pi 社区测试的关系

此前 30 项社区测试只比较 DeepSeek V4 Pro 在 DSH 与 PI 下的工具任务,而且两边使用了不同 API 路径。新论文将 Provider 路径统一,并扩展到五种模型、三组任务和四套可配置 Harness。两项研究不是重复实验,但都指向同一件事:Harness 会同时改变任务完成、运行时间、Token 与成本,单一总榜不足以决定选型。

相关阅读

参考资料