DeepSeek V4.1 Flash:API、架构、评测与 Harness 指南

DeepSeek V4.1 Flash 是面向长上下文、工具调用和 Agent 工作流的 552B 参数多模态 MoE 模型。官方 API 使用 deepseek-flash 作为模型 ID,支持文本与图片输入,上下文窗口最高 100 万 Token。

作者
DeepSeekAgent.io 编辑部
发布
更新

V4.1 Flash 更新了什么

552B MoE

输入阶段每个 Token 激活 8B 参数,输出阶段激活 16B 参数

100 万上下文

长会话、大型代码库、图片和工具历史可以进入同一上下文

890 字节/Token KV

DeepSeek 报告其全局 KV Cache 约为 V4 Flash 的四分之一

原生多模态

同一模型与提示格式处理文本和图片输入

API 迁移:使用 deepseek-flash

当前 API 模型 ID 是 deepseek-flash。DeepSeek 表示,已经退役的 deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 会在一段时间内兼容路由到 V4.1 Flash。新配置直接写当前 ID,可以清楚表达目标模型,也能减少兼容别名退出后的迁移工作。

状态模型 ID说明
推荐deepseek-flash当前 V4.1 Flash 路由
旧版别名deepseek-v4-flash暂时路由到 V4.1 Flash
旧视觉别名deepseek-v4-flash-vision-exp暂时路由到 V4.1 Flash

这套架构为什么适合 Agent Harness

新的 Causal Encoder–Decoder 由 20 层因果编码器和 20 层解码器组成。CSA2 在层间共享并复用稀疏注意力状态,FP4 缓存进一步压缩全局 KV 占用。这些设计针对 Agent 工作负载中的高成本部分:大型提示与历史、重复缓存读取、工具调用,以及相对较短的操作输出。

官方 Agent Benchmark 摘要

下表来自 DeepSeek 模型卡,使用最高推理强度、temperature 1.0、top_p 0.95;代码 Agent 评测使用 100 万 Token 上下文。它们可以作为版本证据,不能直接代表每个代码库或生产任务。

评测V4 FlashV4.1 Flash变化
Terminal-Bench 2.182.790.6+7.9
Terminal-Bench 3.07.630.0+22.4
Terminal-Bench 4.07.031.2+24.2
DeepSWE v1.154.474.2+19.8
NL2Repo-Bench54.264.0+9.8

从 Harness 角度看这次更新

DeepSeek 使用 Claude Code、Codex、OpenCode、Pi、mini-SWE、DSH Minimal、DSH Standard 和 DSH PTC 测试了同一个 V4.1 Flash。这个表格固定模型、改变 Scaffold,因此很适合观察 Harness 的影响。DeepSWE v1.1 中 mini-SWE 为 74.2,DSH Minimal 为 72.6;Terminal-Bench 2.1 中 DSH Minimal 为 90.6。不同 DSH Profile 应分别测试,单一模式无法代表整个 DSH。

继续阅读 V4.1 Harness 专题

常见问题

DeepSeek V4.1 Flash 应该使用哪个模型 ID?

新的 DeepSeek API 与 DeepSeek Harness 配置应使用 deepseek-flash。

V4.1 Flash 支持图片吗?

支持。DeepSeek 将它定义为原生多模态模型,当前 DSH 模型目录也为 deepseek-flash 声明了文本和图片输入。

100 万上下文能保证长时间 Agent 任务稳定吗?

不能。100 万是容量上限,长任务质量仍取决于提示结构、工具反馈、上下文压缩、推理强度和针对具体任务的验证。