DeepSeek V4.1 Flash vs V4 Flash:Harness 场景对比

作者
DeepSeekAgent.io 编辑部
发布
更新

DeepSeek V4.1 Flash 已经接替旧版 V4 Flash API 路由,模型架构、多模态能力、缓存占用和官方 Agent 成绩都发生了变化。对 Harness 用户来说,核心问题很具体:在同一套 Scaffold 下,新模型能否更可靠、更高效地完成工具密集型任务?

官方评测提供了目前最强的一组对照证据。一项社区快速测试补充了真实 DSH 运行数据,但两边任务完成状态不同,无法据此得出严格质量结论。本文将两类证据分开解读。

版本层面的差异

维度DeepSeek V4 FlashDeepSeek V4.1 Flash
API 状态ID 已退役,暂时兼容路由当前 deepseek-flash 路由
Backbone 参数284B552B
激活参数13B输入 8B / 输出 16B
原生图片输入单独的 Vision Exp 路由已集成到当前模型
上下文官方对比中为 100 万100 万
全局 KV Cache基线890 字节/Token,约为 V4 Flash 的四分之一
推理控制上一代机制API 层支持 1–100 连续强度

8B/16B 非对称激活与 Agent 工作负载的输入输出形态相吻合。大型代码库上下文和工具历史会让 Prefill 占据较大成本,每次操作生成的文本通常短得多。Causal Encoder–Decoder 在输入侧减少计算,生成阶段使用更大的激活路径。

官方同系列对比

DeepSeek 报告的 Instruct 结果使用最高推理强度、temperature=1.0top_p=0.95。代码 Agent 评测使用 100 万 Token 上下文,并明确标注 Harness。

BenchmarkV4 FlashV4.1 Flash变化
Terminal-Bench 2.182.790.6+7.9
Terminal-Bench 3.07.630.0+22.4
Terminal-Bench 4.07.031.2+24.2
DeepSWE v1.154.474.2+19.8
NL2Repo-Bench54.264.0+9.8
CyberGym76.788.1+11.4
SEC-Bench Pro30.962.8+31.9

这组数字支持 V4.1 在 DeepSeek 评测体系中获得了明显提升。影响来源包含架构、预训练、Agent 任务数据管线、强化学习规模与 On-policy Distillation 数据,不能把全部差异只归因于单一架构变化。

方法细节也很重要。主要模型对比中的 DeepSWE 使用官方 mini-SWE Harness,Terminal-Bench 使用 DSH Minimal,SEC-Bench Pro 使用 Claude Code。每个分数都属于一组具体的模型与 Scaffold 配置。

DSH 社区快速测试报告了什么

2026 年 9 月,一位 Reddit 用户在最新版 DeepSeek Harness 中使用相同的应用开发 Prompt、Skill 文件和规格,分别运行 V4.1 Flash 与 V4 Flash Vision Exp。作者报告的数据如下:

报告指标V4.1 FlashV4 Flash Vision Exp
总耗时18 分 49 秒30 分 11 秒
Total Usage11.59M20.31M
Output126K154K
LLM 时间7 分 48 秒25 分 10 秒
生成速度361 tok/s120 tok/s
Cache Hit99.5%99.7%

在这一轮中,V4.1 总耗时约少 38%,报告的总 Token 约少 43%,生成速度约为三倍。

截图同时显示,V4.1 仍有一个任务进行中、一个任务等待中,Vision Exp 已完成全部 11 项任务。两边的完成状态不同,因此耗时与 Token 降幅可以视为有价值的观察,无法证明同等完成质量或稳定的百分比优势。

怎样做更干净的 Harness 对比

选择一组受控任务,并完整公布配置:

  1. 固定 DSH 版本与 Profile。
  2. 使用同一个官方 Endpoint、区域、机器、工具、权限和 Skill 文件。
  3. 新建 Session,提供等价上下文。
  4. 固定推理强度、Temperature、输出上限与步数上限。
  5. 两边都完成全部要求后再比较时间。
  6. 每项任务重复运行,报告方差、重试、缓存命中、计费 Token 与实际成本。
  7. 用自动化测试或盲评 Rubric 检查产物质量。
  8. 保存 Trajectory,分别标记模型、工具、Harness 和环境失败。

选型涉及 DSH Profile 时,应把 Minimal 与 Standard 分开测试。DeepSeek 的 V4.1 Scaffold 表格中,两者在 DeepSWE 为 72.6 与 70.5,在 Terminal-Bench 2.1 为 90.6 与 85.8。单个 Profile 无法代表全部 DSH 行为。

现有 DSH 用户要迁移吗

新的官方 API 工作应使用当前 deepseek-flash 路由,旧 Flash ID 已经成为临时兼容别名。完成冒烟测试后迁移是合理默认选择。

关键工作流可以保留一组短期回退对照,重点测试最长 Session、图片附件、代码库导航、工具调用恢复和验收测试。社区中有一条超长上下文、最高推理强度下出现 V4.1 推理循环的报告。它适合作为排错线索,更广泛的可靠性判断还需要更多数据。

最终应比较一组完整结果:正确性、耗时、成本、Trajectory 质量与失败恢复能力。

相关阅读

常见问题

V4.1 Flash 在 DSH 中一定比 V4 Flash 快吗?

目前没有一个适用于所有任务的固定百分比。官方架构与 Benchmark 显示出明显提升,一项社区运行也报告了大幅加速;实际结果仍受工作负载、缓存状态、完成质量、Endpoint 负载和 DSH 配置影响。

社区测试证明 Token 减少 43% 了吗?

它报告了单轮运行的这一降幅。V4.1 截图仍有未完成任务,所以两边 Token 总量没有对应完全相同的已完成工作。

旧模型 ID 还能继续使用吗?

DeepSeek 表示,已经退役的 V4 Flash ID 会暂时路由到 V4.1 Flash。新配置应使用 deepseek-flash,把旧别名视为迁移窗口。