DeepSeek V4 Pro 与 V4.1 Flash 对比:API、价格与 Agent 场景

作者
DeepSeekAgent.io 编辑部
发布
更新

DeepSeek V4 Pro 与 V4.1 Flash 目前同时通过官方 API 提供。二者都有 100 万 Token 上下文与 38.4 万 Token 最大输出,但面向的工作负载并不相同:V4.1 Flash 支持图片输入、并发更高、价格更低;V4 Pro 0813 延续原有纯文本 Pro 路线。

API 能力对比

项目V4.1 FlashV4 Pro 0813
模型 IDdeepseek-flashdeepseek-v4-pro
文本输入支持支持
图片输入支持不支持
上下文1M1M
最大输出384K384K
并发上限2500500

需要理解截图、图表、界面或扫描文档的任务只能从 V4.1 Flash 开始。对于纯文本代码与 Agent 任务,两者都可以接入 DeepSeek Harness,但应通过同一任务集评测,而不是仅凭 Pro 或 Flash 的名称判断。

官方价格对比

以下价格单位均为每百万 Token 美元,峰值与非峰值时段以官方计费页面为准。

Token 类型V4.1 Flash 非峰值 / 峰值V4 Pro 非峰值 / 峰值
缓存命中输入$0.003 / $0.006$0.022 / $0.044
缓存未命中输入$0.15 / $0.30$0.66 / $1.32
输出$0.60 / $1.20$1.98 / $3.96

假设一次 Agent 工作负载累计产生 1000 万未命中输入 Token 与 200 万输出 Token,非峰值时 V4.1 Flash 约为 $2.70,V4 Pro 约为 $10.56;峰值时分别约为 $5.40 与 $21.12。实际账单还会受到缓存命中、Sub-agent 数量、工具轮数和重试影响。

Agent 与代码任务表现

DeepSeek 官方资料中,V4.1 Flash 在 Terminal Bench 2.1、DeepSWE、NL2Repo、CyberGym 与 Automation-Bench 等 Agent 或代码基准上取得很强的结果,部分数据高于 V4 Pro 的发布结果。不同发布使用的 Harness、工具与评测设置可能不同,因此这些数字适合判断方向,不适合直接推导每个生产任务的胜负。

更可靠的选择方法是建立三类任务:短修复、跨文件修改、长工具链任务。每个任务同时记录成功率、人工返工、耗时、输入输出 Token、缓存命中与工具调用轮数。

DeepSeek Harness 配置建议

V4.1 Flash 适合以下场景:

  • 包含图片、截图或视觉材料;
  • 多用户或多 Agent 并发;
  • 长任务对输入与输出成本敏感;
  • 希望使用 DeepSeek 当前重点优化的 Agent 模型。

V4 Pro 适合以下场景:

  • 已有稳定的 V4 Pro 纯文本生产基线;
  • 模型迁移成本高,需要继续复现既有流程;
  • 已通过内部任务验证它在特定文本工作流上更合适。

新建 Profile 时直接填写明确的模型 ID,不把 deepseek-v4-pro 当作 V4.1 Pro,也不假设它会自动跟随未来版本。

迁移检查清单

  1. 固定 DSH 版本、模式、系统提示词与工具集合。
  2. 分别运行 deepseek-flash 和 deepseek-v4-pro。
  3. 保存 Trajectory、最终结果、Token、耗时与费用。
  4. 检查视觉输入、结构化输出和工具参数是否稳定。
  5. 根据业务成功标准选择模型,而不是只比较单个基准分数。

相关阅读

参考资料