JIT-Agent 论文解读:AI 能否即时生成更强的 Agent Harness?

作者
DeepSeekAgent.io 编辑部
发布
更新

2026 年 8 月 27 日发布的论文《JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution》提出:与其为所有任务固定一套 Agent Harness,不如让一个专门的模型针对当前任务即时生成、修复并演化 Harness。

这项工作与 DeepSeek Harness 官方项目没有从属关系,但它直接使用 DeepSeek V4 Flash 进行实验,也为“模型之外的 Harness 有多重要”提供了可量化证据。

Harness Intelligence 是什么

论文把 Harness 拆成围绕模型运行的操作层,包括记忆管理、规划策略、动作协议,以及工具和 Skill 的组织方式。所谓 Harness Intelligence,就是根据任务选择和组合这些机制的能力。

JIT-Agent 不只是生成一段系统提示词。它使用固定的四模块协议来构造任务级 Harness,并尝试从执行反馈中修复失败配置、积累以往方案。

论文报告了什么结果

作者在 Deep Research、日常工作、规划和 Workspace 等基准上比较不同组合。论文报告:

  • 在 18 个直接匹配的 Backbone–任务组合中,JIT 生成的 Harness 全部提高分数。
  • DeepSeek V4 Flash 的九项平均分从 66.7 提升到 75.5,即增加 8.8 分。
  • 在 DeepSearchQA 与 OdysseyBench 上,DeepSeek V4 Flash + JIT-Agent 分别超过论文中的 GPT-5.6 基线 9.1 分和 4.3 分。
  • 六组受控 Harness 对比中,JIT-Agent 的 Token 用量和 API 成本均最低;相对各组最便宜的固定 Harness,论文报告平均节省约 36%。

这些都是论文作者报告的实验结果,不是 DeepSeek 官方 Benchmark,也尚不能视为独立复现。

为什么结果值得重视

模型固定时,仅改变 Harness 就能显著改变得分、Token 消耗与成本。这说明 Agent 产品之间的差异不能只归因于底层模型。上下文如何回收、任务怎样拆分、何时调用工具、失败如何重试,都可能成为决定性能的变量。

对 DSH 而言,“一切皆插件”提供了可组合基础;JIT-Agent 则把问题继续向前推进:这些组合是否可以由模型按任务自动生成,而不是一直由人手工维护?

不能从论文推出什么

不能证明固定 Harness 已经过时

生产系统需要可预测行为、权限审查、版本固定和回归测试。动态生成 Harness 会增加新的攻击面和验证成本。

不能直接证明超过某个通用模型

论文比较的是特定 Harness、特定基准和特定运行设置。它不能简化成“DeepSeek V4 Flash 全面超过 GPT-5.6”。

不能忽略生成 Harness 的额外系统成本

论文报告了任务执行成本优势,但实际部署还要考虑 Harness 生成模型、验证、缓存、失败回滚和安全审计。

对 DSH 开发者的启示

  1. 把 Prompt、工具、记忆、规划和恢复策略视为可独立评估的模块。
  2. 为 Agent Preset 建立任务级 Benchmark,而不是只展示 Demo。
  3. 保存准确的组合版本和运行轨迹,才能比较 Harness 变化。
  4. 动态组合必须经过权限上限、允许列表和执行前验证。
  5. 未来的插件市场可能不只分发插件,也会分发可测试的 Harness 配方与评测记录。

与 DeepSeek Harness 的关系

JIT-Agent 是研究项目,不是 DSH 新版本或官方插件。两者的共同点是把 Harness 视为独立于模型、可组合且会显著影响结果的系统层;区别在于 DSH 当前主要由开发者组合插件,而 JIT-Agent 研究由模型即时构造组合。

相关阅读

常见问题

JIT-Agent 是 DeepSeek 官方项目吗?

不是。它是一项独立研究,实验包含 DeepSeek V4 Flash,但不等于 DeepSeek 或 DSH 官方发布。

论文是否证明 Harness 比模型更重要?

它证明在所测试设置中,改变 Harness 能产生很大的性能和成本差异。它没有为所有任务给出统一的模型与 Harness 贡献比例。