同家族里更快
面向高并发对话与编程,把大量短中程请求从 Pro 分流出来。
DeepSeek · V4 Flash · 2026 年 4 月
免费面向高吞吐编程、对话与短中程 Agent 的 V4 高效 MoE — 可在 iMini Agent 免费试用。
DeepSeek V4 Flash 是 DeepSeek 于 2026 年 4 月发布的 V4 高效向模型,面向高吞吐编程、对话与短中程 Agent。相较 V3.2 与更重的 V4 Pro,它更强调速度与成本;加大思考预算时,Flash-Max 在部分推理任务上可接近 Pro。本站帮助你在 iMini 免费在线 AI Agent 中直接打开使用,无需本地安装。
DeepSeek V4 Flash 是 2026 年 4 月发布的 DeepSeek V4 家族中的高效档。它是一个混合专家(MoE)模型,总参数约 284B、每 token 激活约 13B——这正是它能快速响应、同时仍与 V4 Pro 共享百万 token 上下文的原因。
V4 系列取消了以往「对话模型」与「推理模型」分开命名的做法:推理强度改为请求参数,因此同一个 Flash 可以运行在不思考、思考,或 Flash-Max 模式下。加大思考预算后,Flash-Max 在偏推理的题目上能追回一部分与 Pro 的差距。
实际使用中,Flash 适合高频重复的任务——代码走查、快速修复、问答、信息抽取、短中程 Agent 循环——单次答得不完美的代价足够低,你宁愿重试也不愿等待。
吞吐、同架构长上下文,以及可加深的 Flash-Max——选高效档前先看清这些边界。
面向高并发对话与编程,把大量短中程请求从 Pro 分流出来。
与 Pro 同属长上下文档,短轮任务也能带着更长材料跑。
加大思考预算后,部分推理结果可接近 Pro,适合先快后深的流水线。
日常工具调用与快速迭代很合适;先在线试用,再决定是否接本地 API。
以下数据来自 DeepSeek-V4 技术报告与公开 API 定价。要结合起来看:Flash 用一部分推理上限换来了很大的效率提升。
100 万
与 V4 Pro 同属长上下文档,短轮任务也能带着大体量材料跑。
约 13B
总 MoE 参数 284B 中的激活部分,这是延迟与成本能压下来的原因。
约 10%
百万上下文场景下相对 DeepSeek V3.2 的单 token FLOPs,KV 缓存约降到 7%。
0.84–0.91
Flash-Max 在 128K 以内多数取点的检索准确率;满 100 万时约 0.49。
$0.14
每百万 token(缓存未命中),约为 V4 Pro 输入价的三分之一。
$0.28
每百万 token,这也是与旗舰档成本差距最明显的一项。
数据来源:DeepSeek-V4 技术报告(arXiv:2606.19348)与公开的 DeepSeek API 定价。评测分数会随推理强度变化,投入生产前请先在自己的真实任务上验证。
DeepSeek V4 Flash 适合失败成本相对可控、需要高频周转的工作。
日常功能与小修小补。最重的长程任务再升级到 V4 Pro。
问答、说明性草稿与结构化输出。
步骤清晰的工具调用。需要顶配推理时再切 Pro。
试用 Flash 不需要 DeepSeek API Key。在 iMini Agent 里打开它,描述一个真实任务,直接在浏览器里看它规划并调用工具。
不用 API Key、不用本地 CLI、不用改配置文件,打开就能提问。
Flash 会规划、调用工具、持续迭代,而不只是回一条聊天消息。
先用 Flash 起步;同一会话里发现任务更难,可直接升到 V4 Pro。
两者都是各自家族里又快又便宜的一档,面向延迟和价格比能力上限更重要的高频场景。
| 对比项 | DeepSeek V4 Flash | GPT-5.6 Luna |
|---|---|---|
| 发布时间 | 2026 年 4 月 | 2026 年 7 月 |
| 上下文窗口 | 100 万 tokens | 105 万 tokens |
| 推理模式 | 不思考 / Think High / Flash-Max | 最高 max(不支持 ultra) |
| API 价格(每百万 输入/输出) | $0.14 / $0.28 | $1.00 / $6.00 |
| 权重 | 开放,MIT 许可 | 闭源,仅 API |
| 主要面向 | 高吞吐编程、对话、短中程 Agent | 分类、抽取、路由、初稿生成 |
| 升级路径 | DeepSeek V4 Pro | GPT-5.6 Terra 或 Sol |
最直观的差距在成本:Luna 本身是很好的走量档,但 Flash 的输入价格约为 Luna 的七分之一,而且权重开放,可自部署、可审计。Luna 的优势是窗口略大、OpenAI 生态工具更全。最快的判断办法是同一个提示词各跑一遍——现在就能在 iMini Agent 里免费试 Flash。
免费试用 iMini Agent →两者都是百万上下文。差距主要在能力上限与吞吐——按任务选,不必先站队。
| 对比项 | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|
| 上下文 | 100 万 tokens | 100 万 tokens |
| 推理 | 支持 Flash-Max | Think High / Max |
| 编程与 Agent | 高吞吐编程 | 复杂编程与长程 Agent |
| 长程工具 | 更适合短中程 | 长程自动化姿态 |
| 速度姿态 | 吞吐优先 | 更偏完成质量 |
| 优先场景 | 高频周转的 DeepSeek 工作 | 代码与硬推理旗舰 |
也可查看 DeepSeek V4 Pro
三步在免费在线 Agent 中运行这款 DeepSeek V4 模型——无需 DeepSeek API Key。
点击按钮,在浏览器启动免费在线 Agent。
要吞吐/成本选 Flash,要更深推理选 Pro。
让 Agent 规划、调用工具并交付;不满意再追问迭代。
免费额度、模型命名、关键规格,以及 Flash 与 Pro 的差异。
百万上下文、更快吞吐——适合日常编程与对话。无需 DeepSeek API Key。
在线 Agent 由 iMini 提供。本站为独立指南,与 DeepSeek 官方无关联。