HarnessDev Agent Harness Research
HarnessDev 论文解读:AI 能否创建并演化 Agent Harness?
- 作者
- DeepSeekAgent.io 编辑部
- 发布
- 更新
2026 年 9 月 1 日提交的论文《HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?》把评测对象从单次任务结果推进到可运行的 Agent 基础设施:让模型从一个弱小的种子开始创建 Harness,再根据执行反馈持续修改它。
HarnessDev 是独立研究,与 DeepSeek Harness 官方项目没有隶属关系。论文把 DeepSeek V4 Pro 列入六个 Harness 创建模型之一,研究结论也能帮助我们判断“Agent 能否自己完成 Harness 工程”。
评测怎样设计
HarnessDev 分成两个阶段:
- **Creation:**模型从最小种子与少量示例出发,构建完整执行系统。
- **Evolution:**模型从自己生成的 Harness 出发,依据指定开发集的执行反馈迭代。
Creation 覆盖六个创建模型、四个领域和五个下游基准,共 2,207 个唯一实例:SWE-bench Pro、Terminal-Bench 2.1、MLE-bench、EQ-Bench3 与 BrowseComp。评测同时记录任务表现和执行 Token 成本。
论文还区分 Self-Eval 与 Unified-Eval。前者让创建模型运行自己生成的 Harness;后者统一使用 Gemini 3.1 Pro 执行,以观察 Harness 跨模型迁移能力。
论文报告的主要结果
模型已经可以生成可运行 Harness
从弱种子开始,多个模型能够构造完整的工具调用、上下文、状态与生命周期系统。最高 Self-Eval 总体分来自 Opus 4.8,为 67.8;论文采用的人类工程参考总体分为 86.2。
不同任务领域差异很大
生成式 Harness 在短写作任务上接近参考系统,在机器学习实验上部分结果超过选定参考;代码任务仍有明显差距,搜索与研究任务差距最大。
自我演化能够提高成绩,但稳定性有限
Evolution 阶段出现了一些改进,也出现回退。冻结版本迁移到未向创建模型展示的任务后,提升只能部分保留。
Harness 与执行模型之间存在强耦合
同一 Harness 更换执行模型后可能显著掉分。论文举出的案例中,某个为 Opus 构造的 Code Harness 固定了 120 步限制,换成 Gemini 执行后几乎失效。一个 Harness 在原模型上表现良好,无法直接证明它具备通用迁移能力。
Token 更多不保证结果更好
MLE-bench 中,论文报告 GPT-5.5 创建的 Harness 以 2,930 万 Token 达到 19.1 的 Medal Rate;DeepSeek V4 创建的 Harness 使用 2.084 亿 Token,Medal Rate 为 19.6。接近的成绩对应约七倍执行 Token 差距。
需要谨慎理解的地方
人类工程参考来自公开系统结果,搭配各自原有的执行模型,并非全部在同一执行器上重跑。它适合展示成熟系统上限,不能当成严格配对实验。
论文的 Token 统计排除了创建模型编写和修改 Harness 的成本,主要衡量冻结 Harness 的下游执行开销。真实产品还要计算创建、诊断、验证与回滚成本。
Evolution 当前集中在代码 Harness,其他领域的长期自我演化仍需更多证据。论文结果也尚待独立复现。
对 DeepSeek Harness 生态的启示
- Agent Preset 应绑定版本、模型、任务集和可复现评测。
- “由 Agent 创建插件”需要回归测试、权限上限与人工审查。
- 插件市场可以展示适用模型、成本和失败案例,帮助用户理解迁移边界。
- 保存完整 Trajectory 有助于发现步数限制、停止条件和上下文策略造成的隐性回退。
- Harness 的价值应通过任务成功率、稳定性和成本共同评价。
与 JIT-Agent 的关系
JIT-Agent研究针对当前任务即时生成 Harness;HarnessDev提供了一套衡量 Harness 创建和持续演化能力的基准。前者报告了动态 Harness 的性能潜力,后者揭示了成熟工程差距、成本差异和跨模型迁移限制。
相关阅读
常见问题
HarnessDev 是 DeepSeek 官方研究吗?
不是。它是独立研究,实验模型包含 DeepSeek V4 Pro,也包含 Opus、GPT、Gemini、Qwen 与 Seed 系列模型。
论文证明 Agent 可以完全接管 Harness 开发吗?
没有。实验显示模型能创建可运行系统,代码、搜索与研究任务仍落后成熟的人类工程 Harness,自我演化也存在回退和迁移问题。