552B MoE
输入阶段每个 Token 激活 8B 参数,输出阶段激活 16B 参数
发布于 2026 年 9 月 10 日
DeepSeek V4.1 Flash 是面向长上下文、工具调用和 Agent 工作流的 552B 参数多模态 MoE 模型。官方 API 使用 deepseek-flash 作为模型 ID,支持文本与图片输入,上下文窗口最高 100 万 Token。
输入阶段每个 Token 激活 8B 参数,输出阶段激活 16B 参数
长会话、大型代码库、图片和工具历史可以进入同一上下文
DeepSeek 报告其全局 KV Cache 约为 V4 Flash 的四分之一
同一模型与提示格式处理文本和图片输入
当前 API 模型 ID 是 deepseek-flash。DeepSeek 表示,已经退役的 deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 会在一段时间内兼容路由到 V4.1 Flash。新配置直接写当前 ID,可以清楚表达目标模型,也能减少兼容别名退出后的迁移工作。
| 状态 | 模型 ID | 说明 |
|---|---|---|
| 推荐 | deepseek-flash | 当前 V4.1 Flash 路由 |
| 旧版别名 | deepseek-v4-flash | 暂时路由到 V4.1 Flash |
| 旧视觉别名 | deepseek-v4-flash-vision-exp | 暂时路由到 V4.1 Flash |
新的 Causal Encoder–Decoder 由 20 层因果编码器和 20 层解码器组成。CSA2 在层间共享并复用稀疏注意力状态,FP4 缓存进一步压缩全局 KV 占用。这些设计针对 Agent 工作负载中的高成本部分:大型提示与历史、重复缓存读取、工具调用,以及相对较短的操作输出。
下表来自 DeepSeek 模型卡,使用最高推理强度、temperature 1.0、top_p 0.95;代码 Agent 评测使用 100 万 Token 上下文。它们可以作为版本证据,不能直接代表每个代码库或生产任务。
| 评测 | V4 Flash | V4.1 Flash | 变化 |
|---|---|---|---|
| Terminal-Bench 2.1 | 82.7 | 90.6 | +7.9 |
| Terminal-Bench 3.0 | 7.6 | 30.0 | +22.4 |
| Terminal-Bench 4.0 | 7.0 | 31.2 | +24.2 |
| DeepSWE v1.1 | 54.4 | 74.2 | +19.8 |
| NL2Repo-Bench | 54.2 | 64.0 | +9.8 |
DeepSeek 使用 Claude Code、Codex、OpenCode、Pi、mini-SWE、DSH Minimal、DSH Standard 和 DSH PTC 测试了同一个 V4.1 Flash。这个表格固定模型、改变 Scaffold,因此很适合观察 Harness 的影响。DeepSWE v1.1 中 mini-SWE 为 74.2,DSH Minimal 为 72.6;Terminal-Bench 2.1 中 DSH Minimal 为 90.6。不同 DSH Profile 应分别测试,单一模式无法代表整个 DSH。
新的 DeepSeek API 与 DeepSeek Harness 配置应使用 deepseek-flash。
支持。DeepSeek 将它定义为原生多模态模型,当前 DSH 模型目录也为 deepseek-flash 声明了文本和图片输入。
不能。100 万是容量上限,长任务质量仍取决于提示结构、工具反馈、上下文压缩、推理强度和针对具体任务的验证。