JIT-Agent Harness Evolution
JIT-Agent 论文解读:AI 能否即时生成更强的 Agent Harness?
- 作者
- DeepSeekAgent.io 编辑部
- 发布
- 更新
2026 年 8 月 27 日发布的论文《JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution》提出:与其为所有任务固定一套 Agent Harness,不如让一个专门的模型针对当前任务即时生成、修复并演化 Harness。
这项工作与 DeepSeek Harness 官方项目没有从属关系,但它直接使用 DeepSeek V4 Flash 进行实验,也为“模型之外的 Harness 有多重要”提供了可量化证据。
Harness Intelligence 是什么
论文把 Harness 拆成围绕模型运行的操作层,包括记忆管理、规划策略、动作协议,以及工具和 Skill 的组织方式。所谓 Harness Intelligence,就是根据任务选择和组合这些机制的能力。
JIT-Agent 不只是生成一段系统提示词。它使用固定的四模块协议来构造任务级 Harness,并尝试从执行反馈中修复失败配置、积累以往方案。
论文报告了什么结果
作者在 Deep Research、日常工作、规划和 Workspace 等基准上比较不同组合。论文报告:
- 在 18 个直接匹配的 Backbone–任务组合中,JIT 生成的 Harness 全部提高分数。
- DeepSeek V4 Flash 的九项平均分从 66.7 提升到 75.5,即增加 8.8 分。
- 在 DeepSearchQA 与 OdysseyBench 上,DeepSeek V4 Flash + JIT-Agent 分别超过论文中的 GPT-5.6 基线 9.1 分和 4.3 分。
- 六组受控 Harness 对比中,JIT-Agent 的 Token 用量和 API 成本均最低;相对各组最便宜的固定 Harness,论文报告平均节省约 36%。
这些都是论文作者报告的实验结果,不是 DeepSeek 官方 Benchmark,也尚不能视为独立复现。
为什么结果值得重视
模型固定时,仅改变 Harness 就能显著改变得分、Token 消耗与成本。这说明 Agent 产品之间的差异不能只归因于底层模型。上下文如何回收、任务怎样拆分、何时调用工具、失败如何重试,都可能成为决定性能的变量。
对 DSH 而言,“一切皆插件”提供了可组合基础;JIT-Agent 则把问题继续向前推进:这些组合是否可以由模型按任务自动生成,而不是一直由人手工维护?
不能从论文推出什么
不能证明固定 Harness 已经过时
生产系统需要可预测行为、权限审查、版本固定和回归测试。动态生成 Harness 会增加新的攻击面和验证成本。
不能直接证明超过某个通用模型
论文比较的是特定 Harness、特定基准和特定运行设置。它不能简化成“DeepSeek V4 Flash 全面超过 GPT-5.6”。
不能忽略生成 Harness 的额外系统成本
论文报告了任务执行成本优势,但实际部署还要考虑 Harness 生成模型、验证、缓存、失败回滚和安全审计。
对 DSH 开发者的启示
- 把 Prompt、工具、记忆、规划和恢复策略视为可独立评估的模块。
- 为 Agent Preset 建立任务级 Benchmark,而不是只展示 Demo。
- 保存准确的组合版本和运行轨迹,才能比较 Harness 变化。
- 动态组合必须经过权限上限、允许列表和执行前验证。
- 未来的插件市场可能不只分发插件,也会分发可测试的 Harness 配方与评测记录。
与 DeepSeek Harness 的关系
JIT-Agent 是研究项目,不是 DSH 新版本或官方插件。两者的共同点是把 Harness 视为独立于模型、可组合且会显著影响结果的系统层;区别在于 DSH 当前主要由开发者组合插件,而 JIT-Agent 研究由模型即时构造组合。
相关阅读
常见问题
JIT-Agent 是 DeepSeek 官方项目吗?
不是。它是一项独立研究,实验包含 DeepSeek V4 Flash,但不等于 DeepSeek 或 DSH 官方发布。
论文是否证明 Harness 比模型更重要?
它证明在所测试设置中,改变 Harness 能产生很大的性能和成本差异。它没有为所有任务给出统一的模型与 Harness 贡献比例。