V4.1 Flash:DSH Minimal、Standard、PTC 怎么选
V4.1 Flash:DSH Minimal、Standard、PTC 怎么选?
- 作者
- DeepSeekAgent.io 编辑部
- 发布
- 更新
DeepSeek V4.1 Flash 的官方模型卡首次把同一个模型放进多种 Agent Scaffold 中对比,其中包含 DSH Minimal、DSH Standard 和 DSH PTC。结果给出一个很重要的信号:模型相同,Harness 模式不同,任务成功率仍会明显变化。
本文基于 DeepSeek 官方 Scaffold Benchmark、DSH 架构资料和早期社区反馈给出选择建议。下表数据来自 DeepSeek 官方模型卡,社区体验单独标注。
官方结果:Minimal 在两项测试中领先
官方测试统一使用 V4.1 Flash、最高推理强度、temperature=1.0、top_p=0.95、100 万 Token 上下文和最多 500 个 Agent Step。DeepSWE v1.1 每题运行 8 个样本,Terminal-Bench 2.1 每题运行 3 个样本;后者关闭网络。
| 官方评测 | DSH Minimal | DSH Standard | DSH PTC |
|---|---|---|---|
| DeepSWE v1.1(Resolved) | 72.6 | 70.5 | 67.6 |
| Terminal-Bench 2.1(Pass@1) | 90.6 | 85.8 | 85.8 |
官方结果给出的选择很明确:DeepSWE 和 Terminal-Bench 这类代码任务优先使用 Minimal。日常工作还会涉及附件、Web、插件和交互体验,需要按任务选择模式。
三种模式分别适合什么
Minimal:边界清楚,适合复现和纯代码任务
Minimal 减少模型可见的工具和额外结构,让 Agent 通过较小的执行面完成任务。它适合:
- 代码修复、终端任务与 Benchmark 复现;
- 希望减少工具选择和流程分叉的工作;
- 需要明确记录命令、文件修改与结果的实验;
- 准备用容器或一次性工作区隔离执行的任务。
工具更少也意味着部分便利能力需要 Agent 自己通过 Shell 组合,操作门槛高于 Standard。
Standard:能力完整,适合日常交互
Standard 提供更丰富的默认工具、工作区上下文和产品能力。它适合:
- 浏览文件、查看图片、使用 Web 工具和插件的日常工作;
- 需要较强交互性、可视化反馈和多种输入类型的任务;
- 用户希望先获得开箱即用体验,再逐步理解 Profile 的场景。
更多工具会增加模型需要理解的选择与约束。遇到反复选错工具、轮数过多或执行路径膨胀时,可以用 Minimal 做对照。
PTC:适合可以程序化编排的批量操作
PTC 允许模型生成代码来组合多次工具操作,减少逐轮调用的往返。它适合:
- 批量读取、筛选或转换大量文件;
- 多个相互独立的检查可以并行执行;
- 需要把重复工具流程压缩成一次程序化执行;
- 用户能够审阅生成的执行逻辑和结果。
官方两项成绩中 PTC 没有领先。它的价值在批量编排和减少工具往返,任务质量仍取决于工作能否清楚拆成程序化步骤。
社区反馈透露了什么
V4.1 Flash 发布后的早期讨论出现了相反体验:部分用户认为真实项目中的持续性和完成度低于预期,也有人表示从 Standard 换到 Minimal 或 PTC 后,速度和 Token 使用明显改善。任务、版本、Endpoint、量化精度和统计口径并不统一,真正值得跟进的是模式切换带来的差异。
官方表格与社区反馈共同指向一点:V4.1 Flash 的表现明显受 Harness 结构影响。遇到效果不稳定时,固定模型、推理强度和任务,只切换模式对照,就能定位模型、工具配置与提示结构之间的差异。
普通用户怎么选
第一次使用 DSH,可以先用 Standard 熟悉工作区、附件和工具。任务主要是代码修改或终端操作,并且 Standard 出现明显绕路时,再用 Minimal 对照。已经理解工具边界、任务中包含大量重复或并行操作时,再尝试 PTC。
一个实用顺序是:
- Standard 跑一次,确认需求与可用能力。
- Minimal 用相同输入重跑,观察是否减少轮数和偏航。
- 只有任务能拆成批量工具操作时,再测试 PTC。
- 按最终结果、人工返工、耗时和成本共同选择,不能只看 Token。
如何完成自己的三模式复测
至少准备三类任务:单文件修复、跨文件功能修改、需要批量检查的仓库任务。每种模式使用相同的初始仓库、提示词、模型 ID、推理强度和验收测试,并记录:
| 维度 | 记录方法 |
|---|---|
| 完成质量 | 自动测试、任务验收项、人工返工次数 |
| 执行效率 | 总耗时、Agent Step、工具调用次数 |
| 成本 | 输入、输出、缓存 Token 与账单金额 |
| 稳定性 | 卡住、循环、重试、人工接管次数 |
| 可审计性 | Trajectory 是否足以解释关键修改 |
每个任务和模式至少重复三次,同时保留失败案例和完整配置,避免单次采样主导结论。
当前建议
- 纯代码与评测复现: 优先 Minimal。
- 日常使用与完整工具体验: 先用 Standard。
- 批量、并行、可程序化的工具任务: 对照测试 PTC。
- 关键生产流程: 三种模式都使用自己的任务集复测后再定。
相关阅读
- DeepSeek V4.1 Flash 完整解读
- V4.1 Flash 接入 DeepSeek Harness
- 使用 DSH Minimal 复现 DeepSWE
- V4 Pro 已切换至 V4.1 Flash
常见问题
官方测试中哪种 DSH 模式成绩最高?
在官方公布的 DeepSWE v1.1 和 Terminal-Bench 2.1 测试中,DSH Minimal 分别得到 72.6 和 90.6,高于同表中的 Standard 与 PTC。
普通用户应该直接使用 Minimal 吗?
第一次使用可以先选 Standard。任务主要依赖代码和终端、Standard 出现绕路或工具负担时,再切换 Minimal 对照。
PTC 一定更省 Token 吗?
批量工具操作可以减少往返轮数,但最终 Token 和成本取决于生成代码、工具输出、重试和任务结构。需要用同一任务实测。