MemoHarness: Agent Harnesses That Learn
MemoHarness 论文解读:Agent Harness 如何从经验中学习
- 作者
- DeepSeekAgent.io 编辑部
- 发布
- 更新
2026 年 7 月 14 日发布的预印本论文《MemoHarness: Agent Harnesses That Learn from Experience》提出了一种不同于固定 Harness 的路线:让 Harness 从少量已标注任务的搜索过程中积累经验,再在没有测试标签、梯度更新或额外搜索的情况下,为新任务生成更合适的运行策略。
MemoHarness 不是 DeepSeek Harness 的官方功能,也不是 DSH 插件。它是一项独立研究,但它把上下文、工具、生成参数、编排、记忆和输出处理都视为可优化的 Harness 表面,对理解 DSH 这类可组合系统很有启发。
它要解决什么问题
固定 Harness 通常为所有任务使用同一套提示、工具策略与上下文管理。这样易于部署,却很难同时适配终端操作、代码生成、金融分析等差异很大的工作。
MemoHarness 把 Harness 定义为模型外部的控制层,并列出六类可编辑表面:
- Context:怎样选择、压缩与组织上下文。
- Tool:提供哪些工具,以及如何描述和约束工具。
- Generation:采样、预算等生成配置。
- Orchestration:规划、循环、重试与任务分解。
- Memory:怎样写入、检索与使用历史经验。
- Output:怎样解析、验证和交付结果。
研究的核心不是让模型反复重写一个系统提示,而是让这些表面形成可积累、可检索、可迁移的经验。
双层经验库怎样工作
MemoHarness 保留两类信息:每个训练案例的具体经验,以及从多个案例提炼出的全局模式。
在搜索阶段,系统对带标签案例尝试 Harness 修改。候选方案先按正确性排序,在正确性相同的情况下再以 Token 使用量作为决胜项。有效与无效的修改都会进入经验库,帮助后续任务判断哪些变化值得尝试。
到测试阶段,系统检索相关经验,把全局 Harness 适配成面向当前案例的版本。论文强调,这一步不使用测试标签、执行反馈、梯度更新或新的搜索,因此它与“在测试题上反复试到成功”不同。
论文报告了什么结果
以下都是论文在其协议下报告的结果,尚不等于独立复现或通用产品结论:
| 基准 | 固定 Harness | MemoHarness 最终检查点 |
|---|---|---|
| Terminal-Bench | 0.722 | 0.806 |
| LiveCodeBench | 0.900 | 0.967 |
| FinanceAgent | 0.600 | 0.767 |
论文称,在 Terminal-Bench 上,0.806 高于其最强固定基线 Codex 的 0.722。在跨模型测试中,作者报告六个保留模型的平均提升为 0.098;其中 DeepSeek V3.2 从 0.333 提高到 0.444,GLM-5 从 0.500 提高到 0.733。
这些数字不能被解释为“MemoHarness 在任何环境都优于 Codex”,也不能证明其中任一模型的普遍排名。基准版本、任务样本、执行环境、固定基线配置和评分协议都会影响结果。
它与 JIT-Agent 有什么区别
两项研究都认为 Harness 本身是重要的性能变量,但优化时机不同:
| 方法 | 主要信号 | 适配方式 |
|---|---|---|
| JIT-Agent | 当前任务、执行反馈与配置档案 | 即时生成并修复任务级 Harness |
| MemoHarness | 已标注案例中积累的成功与失败经验 | 检索经验,在测试时生成案例级 Harness |
可以把 JIT-Agent 理解为“为当前任务现场构造”,把 MemoHarness 理解为“把过去执行中学到的东西带到当前任务”。两者并非直接替代关系,也没有在同一个统一协议下完成充分比较。
对 DSH 开发者的启示
把 Harness 配置当作可评估对象
Prompt、工具集合、权限、上下文压缩、循环上限与结果验证都应版本化。只记录模型名,很难解释同一模型为什么在两次评测中表现不同。
同时保存成功与失败经验
失败轨迹可以告诉系统某类任务不适合哪些工具、上下文结构或恢复策略。但这类经验必须去除密钥、个人数据和不应跨项目传播的代码。
正确性之外还要记录成本
论文在正确性相同的候选中用 Token 数量决胜,这是一种可操作的多目标选择方法。生产环境还应加入延迟、工具调用次数、人工审批与失败恢复成本。
经验不能突破安全上限
学习到的 Harness 不应自行扩大文件、网络或进程权限。经验适配适合在固定的权限边界和工具允许列表内发生,而不是把过去一次成功当作永久授权。
仍然需要回答的问题
- 论文是预印本,作者也提出需要更大规模研究和更细的消融实验。
- 跨数据集迁移并不均匀;部分已接近饱和的数据集没有变化,法律任务表现也有好有坏。
- 经验库本身可能过时、污染或携带敏感信息,需要来源、版本、过期和删除机制。
- 搜索阶段需要带标签案例和计算预算,实际收益必须把这部分成本计算在内。
相关阅读
- JIT-Agent 论文解读:AI 能否即时生成更强的 Agent Harness?
- DSH、deepagents 与 Pi 为何走向相似的 Harness 架构?
- DSH Agent Preset 与 Plugin 的区别
常见问题
MemoHarness 是 DeepSeek 官方项目吗?
不是。它是独立研究,与 DeepSeek Harness 没有官方从属关系;论文的跨模型实验包含 DeepSeek V3.2。
测试阶段完全不执行任务吗?
不是。它仍然使用生成出的 Harness 执行任务;“无测试反馈”指适配时不使用测试标签、执行结果来继续搜索或更新参数。
DSH 现在已经会自动学习 Harness 吗?
本文引用的论文没有证明 DSH 已实现 MemoHarness。对 DSH 而言,这更适合作为评测、Preset 版本化和安全经验库设计的研究方向。