V4.1 Flash:DSH Minimal、Standard、PTC 怎么选?

作者
DeepSeekAgent.io 编辑部
发布
更新

DeepSeek V4.1 Flash 的官方模型卡首次把同一个模型放进多种 Agent Scaffold 中对比,其中包含 DSH Minimal、DSH Standard 和 DSH PTC。结果给出一个很重要的信号:模型相同,Harness 模式不同,任务成功率仍会明显变化。

本文基于 DeepSeek 官方 Scaffold Benchmark、DSH 架构资料和早期社区反馈给出选择建议。下表数据来自 DeepSeek 官方模型卡,社区体验单独标注。

官方结果:Minimal 在两项测试中领先

官方测试统一使用 V4.1 Flash、最高推理强度、temperature=1.0top_p=0.95、100 万 Token 上下文和最多 500 个 Agent Step。DeepSWE v1.1 每题运行 8 个样本,Terminal-Bench 2.1 每题运行 3 个样本;后者关闭网络。

官方评测DSH MinimalDSH StandardDSH PTC
DeepSWE v1.1(Resolved)72.670.567.6
Terminal-Bench 2.1(Pass@1)90.685.885.8

官方结果给出的选择很明确:DeepSWE 和 Terminal-Bench 这类代码任务优先使用 Minimal。日常工作还会涉及附件、Web、插件和交互体验,需要按任务选择模式。

三种模式分别适合什么

Minimal:边界清楚,适合复现和纯代码任务

Minimal 减少模型可见的工具和额外结构,让 Agent 通过较小的执行面完成任务。它适合:

  • 代码修复、终端任务与 Benchmark 复现;
  • 希望减少工具选择和流程分叉的工作;
  • 需要明确记录命令、文件修改与结果的实验;
  • 准备用容器或一次性工作区隔离执行的任务。

工具更少也意味着部分便利能力需要 Agent 自己通过 Shell 组合,操作门槛高于 Standard。

Standard:能力完整,适合日常交互

Standard 提供更丰富的默认工具、工作区上下文和产品能力。它适合:

  • 浏览文件、查看图片、使用 Web 工具和插件的日常工作;
  • 需要较强交互性、可视化反馈和多种输入类型的任务;
  • 用户希望先获得开箱即用体验,再逐步理解 Profile 的场景。

更多工具会增加模型需要理解的选择与约束。遇到反复选错工具、轮数过多或执行路径膨胀时,可以用 Minimal 做对照。

PTC:适合可以程序化编排的批量操作

PTC 允许模型生成代码来组合多次工具操作,减少逐轮调用的往返。它适合:

  • 批量读取、筛选或转换大量文件;
  • 多个相互独立的检查可以并行执行;
  • 需要把重复工具流程压缩成一次程序化执行;
  • 用户能够审阅生成的执行逻辑和结果。

官方两项成绩中 PTC 没有领先。它的价值在批量编排和减少工具往返,任务质量仍取决于工作能否清楚拆成程序化步骤。

社区反馈透露了什么

V4.1 Flash 发布后的早期讨论出现了相反体验:部分用户认为真实项目中的持续性和完成度低于预期,也有人表示从 Standard 换到 Minimal 或 PTC 后,速度和 Token 使用明显改善。任务、版本、Endpoint、量化精度和统计口径并不统一,真正值得跟进的是模式切换带来的差异。

官方表格与社区反馈共同指向一点:V4.1 Flash 的表现明显受 Harness 结构影响。遇到效果不稳定时,固定模型、推理强度和任务,只切换模式对照,就能定位模型、工具配置与提示结构之间的差异。

普通用户怎么选

第一次使用 DSH,可以先用 Standard 熟悉工作区、附件和工具。任务主要是代码修改或终端操作,并且 Standard 出现明显绕路时,再用 Minimal 对照。已经理解工具边界、任务中包含大量重复或并行操作时,再尝试 PTC。

一个实用顺序是:

  1. Standard 跑一次,确认需求与可用能力。
  2. Minimal 用相同输入重跑,观察是否减少轮数和偏航。
  3. 只有任务能拆成批量工具操作时,再测试 PTC。
  4. 按最终结果、人工返工、耗时和成本共同选择,不能只看 Token。

如何完成自己的三模式复测

至少准备三类任务:单文件修复、跨文件功能修改、需要批量检查的仓库任务。每种模式使用相同的初始仓库、提示词、模型 ID、推理强度和验收测试,并记录:

维度记录方法
完成质量自动测试、任务验收项、人工返工次数
执行效率总耗时、Agent Step、工具调用次数
成本输入、输出、缓存 Token 与账单金额
稳定性卡住、循环、重试、人工接管次数
可审计性Trajectory 是否足以解释关键修改

每个任务和模式至少重复三次,同时保留失败案例和完整配置,避免单次采样主导结论。

当前建议

  • 纯代码与评测复现: 优先 Minimal。
  • 日常使用与完整工具体验: 先用 Standard。
  • 批量、并行、可程序化的工具任务: 对照测试 PTC。
  • 关键生产流程: 三种模式都使用自己的任务集复测后再定。

相关阅读

常见问题

官方测试中哪种 DSH 模式成绩最高?

在官方公布的 DeepSWE v1.1 和 Terminal-Bench 2.1 测试中,DSH Minimal 分别得到 72.6 和 90.6,高于同表中的 Standard 与 PTC。

普通用户应该直接使用 Minimal 吗?

第一次使用可以先选 Standard。任务主要依赖代码和终端、Standard 出现绕路或工具负担时,再切换 Minimal 对照。

PTC 一定更省 Token 吗?

批量工具操作可以减少往返轮数,但最终 Token 和成本取决于生成代码、工具输出、重试和任务结构。需要用同一任务实测。