DeepSeek V4.1 Flash vs V4 Flash in Harness
DeepSeek V4.1 Flash vs V4 Flash:Harness 场景对比
- 作者
- DeepSeekAgent.io 编辑部
- 发布
- 更新
DeepSeek V4.1 Flash 已经接替旧版 V4 Flash API 路由,模型架构、多模态能力、缓存占用和官方 Agent 成绩都发生了变化。对 Harness 用户来说,核心问题很具体:在同一套 Scaffold 下,新模型能否更可靠、更高效地完成工具密集型任务?
官方评测提供了目前最强的一组对照证据。一项社区快速测试补充了真实 DSH 运行数据,但两边任务完成状态不同,无法据此得出严格质量结论。本文将两类证据分开解读。
版本层面的差异
| 维度 | DeepSeek V4 Flash | DeepSeek V4.1 Flash |
|---|---|---|
| API 状态 | ID 已退役,暂时兼容路由 | 当前 deepseek-flash 路由 |
| Backbone 参数 | 284B | 552B |
| 激活参数 | 13B | 输入 8B / 输出 16B |
| 原生图片输入 | 单独的 Vision Exp 路由 | 已集成到当前模型 |
| 上下文 | 官方对比中为 100 万 | 100 万 |
| 全局 KV Cache | 基线 | 890 字节/Token,约为 V4 Flash 的四分之一 |
| 推理控制 | 上一代机制 | API 层支持 1–100 连续强度 |
8B/16B 非对称激活与 Agent 工作负载的输入输出形态相吻合。大型代码库上下文和工具历史会让 Prefill 占据较大成本,每次操作生成的文本通常短得多。Causal Encoder–Decoder 在输入侧减少计算,生成阶段使用更大的激活路径。
官方同系列对比
DeepSeek 报告的 Instruct 结果使用最高推理强度、temperature=1.0 和 top_p=0.95。代码 Agent 评测使用 100 万 Token 上下文,并明确标注 Harness。
| Benchmark | V4 Flash | V4.1 Flash | 变化 |
|---|---|---|---|
| Terminal-Bench 2.1 | 82.7 | 90.6 | +7.9 |
| Terminal-Bench 3.0 | 7.6 | 30.0 | +22.4 |
| Terminal-Bench 4.0 | 7.0 | 31.2 | +24.2 |
| DeepSWE v1.1 | 54.4 | 74.2 | +19.8 |
| NL2Repo-Bench | 54.2 | 64.0 | +9.8 |
| CyberGym | 76.7 | 88.1 | +11.4 |
| SEC-Bench Pro | 30.9 | 62.8 | +31.9 |
这组数字支持 V4.1 在 DeepSeek 评测体系中获得了明显提升。影响来源包含架构、预训练、Agent 任务数据管线、强化学习规模与 On-policy Distillation 数据,不能把全部差异只归因于单一架构变化。
方法细节也很重要。主要模型对比中的 DeepSWE 使用官方 mini-SWE Harness,Terminal-Bench 使用 DSH Minimal,SEC-Bench Pro 使用 Claude Code。每个分数都属于一组具体的模型与 Scaffold 配置。
DSH 社区快速测试报告了什么
2026 年 9 月,一位 Reddit 用户在最新版 DeepSeek Harness 中使用相同的应用开发 Prompt、Skill 文件和规格,分别运行 V4.1 Flash 与 V4 Flash Vision Exp。作者报告的数据如下:
| 报告指标 | V4.1 Flash | V4 Flash Vision Exp |
|---|---|---|
| 总耗时 | 18 分 49 秒 | 30 分 11 秒 |
| Total Usage | 11.59M | 20.31M |
| Output | 126K | 154K |
| LLM 时间 | 7 分 48 秒 | 25 分 10 秒 |
| 生成速度 | 361 tok/s | 120 tok/s |
| Cache Hit | 99.5% | 99.7% |
在这一轮中,V4.1 总耗时约少 38%,报告的总 Token 约少 43%,生成速度约为三倍。
截图同时显示,V4.1 仍有一个任务进行中、一个任务等待中,Vision Exp 已完成全部 11 项任务。两边的完成状态不同,因此耗时与 Token 降幅可以视为有价值的观察,无法证明同等完成质量或稳定的百分比优势。
怎样做更干净的 Harness 对比
选择一组受控任务,并完整公布配置:
- 固定 DSH 版本与 Profile。
- 使用同一个官方 Endpoint、区域、机器、工具、权限和 Skill 文件。
- 新建 Session,提供等价上下文。
- 固定推理强度、Temperature、输出上限与步数上限。
- 两边都完成全部要求后再比较时间。
- 每项任务重复运行,报告方差、重试、缓存命中、计费 Token 与实际成本。
- 用自动化测试或盲评 Rubric 检查产物质量。
- 保存 Trajectory,分别标记模型、工具、Harness 和环境失败。
选型涉及 DSH Profile 时,应把 Minimal 与 Standard 分开测试。DeepSeek 的 V4.1 Scaffold 表格中,两者在 DeepSWE 为 72.6 与 70.5,在 Terminal-Bench 2.1 为 90.6 与 85.8。单个 Profile 无法代表全部 DSH 行为。
现有 DSH 用户要迁移吗
新的官方 API 工作应使用当前 deepseek-flash 路由,旧 Flash ID 已经成为临时兼容别名。完成冒烟测试后迁移是合理默认选择。
关键工作流可以保留一组短期回退对照,重点测试最长 Session、图片附件、代码库导航、工具调用恢复和验收测试。社区中有一条超长上下文、最高推理强度下出现 V4.1 推理循环的报告。它适合作为排错线索,更广泛的可靠性判断还需要更多数据。
最终应比较一组完整结果:正确性、耗时、成本、Trajectory 质量与失败恢复能力。
相关阅读
- DeepSeek V4.1 Flash 完整解读
- 在 DeepSeek Harness 中配置 V4.1 Flash
- 用 DSH Minimal 复现 DeepSWE
- 旧版 DeepSeek V4 Flash 历史页面
常见问题
V4.1 Flash 在 DSH 中一定比 V4 Flash 快吗?
目前没有一个适用于所有任务的固定百分比。官方架构与 Benchmark 显示出明显提升,一项社区运行也报告了大幅加速;实际结果仍受工作负载、缓存状态、完成质量、Endpoint 负载和 DSH 配置影响。
社区测试证明 Token 减少 43% 了吗?
它报告了单轮运行的这一降幅。V4.1 截图仍有未完成任务,所以两边 Token 总量没有对应完全相同的已完成工作。
旧模型 ID 还能继续使用吗?
DeepSeek 表示,已经退役的 V4 Flash ID 会暂时路由到 V4.1 Flash。新配置应使用 deepseek-flash,把旧别名视为迁移窗口。