DeepSeek V4 Flash 基准测试:速度与分数详解
Aug 3, 2026

DeepSeek V4 Flash 基准测试:速度与分数详解

DeepSeek V4 Flash 基准测试全解析:吞吐量、延迟与编程/MMLU 分数中哪些已证实、哪些存疑,以及与 GLM 5.2 的参数对比。

如果你搜索「DeepSeek V4 Flash benchmarks」,多半想快速拿到两个数字:它每秒能跑多少 token,以及在人人都在引用的编程和推理套件上拿多少分。问题在于,发布周的 benchmark 榜单是业内噪音最大的数据。厂商挑自己赢的测试来秀,第三方聚合站给出的吞吐量因托管方不同而天差地别,社媒上流传的「分数」里有一半根本找不到一手出处。

这篇文章做的就是枯燥但有用的事:把 DeepSeek V4 Flash 身上真正可以证实的东西和无法证实的东西分开。文中凡是作为硬性数字给出的数据,都能追溯到 DeepSeek 官方文档或独立的测评机构(主要是 Artificial Analysis)。遇到无法对上一手来源的 benchmark 数值,我们会直说,用定性描述代替编造数字。本文写于 2026 年 8 月;模型路由、价格和榜单名次变动很快,请把所有数字当作某一时间点的快照,在据此做预算前重新核对文末链接的来源。

对 Flash 级模型来说,「benchmark」意味着什么

DeepSeek V4 Flash 是 DeepSeek V4 家族的效率级型号。它的兄弟 DeepSeek V4 Pro 是大型旗舰(约 1.6 万亿参数的混合专家模型,为攻克最难的推理测试而生)。Flash 走的是另一条路线。它是一个混合专家(MoE)模型,总参数 284B,每 token 仅激活约 13B,为速度、低成本和海量「日常任务」而设计,而不是为了登顶推理榜单。

这个设计目标决定了哪些 benchmark 才有意义。对 Flash 这类模型,值得看的数字是:

  • 吞吐量(每秒输出 token 数)和延迟(首 token 时间)—— 这正是你最初选 Flash 而不选 Pro 的理由。
  • 每百万 token 成本 —— Flash 的存在就是为了大规模下便宜。
  • 任务级质量分数(编程、智能体工具调用、MMLU 式知识测试)—— 但要这样读:「这活儿它够不够用」,而不是「它能不能打过前沿模型」。

一个速度快一倍、价格便宜五倍的模型,不需要赢下 MMLU。它只需要足够准,让速度和价格成为决定性因素。所以我们先从已证实的数据讲起,再明确说明哪些未经证实。

已证实的数字

以下规格今天就能从 DeepSeek 官方文档和独立模型注册库中确认。这是本文唯一一张全部由有据可查数字填充的表格。

指标DeepSeek V4 Flash依据来源
架构混合专家(MoE)DeepSeek 官方 / 模型注册库
总参数量284B独立注册库(Artificial Analysis、OpenRouter)
每 token 激活参数约 13B独立注册库
上下文窗口1,048,576 tokens(1M)DeepSeek 价格/API 文档
最大输出最高 384K tokensDeepSeek 价格表
输入价格(官方 API)$0.14 / 1M tokensDeepSeek 官方定价
输出价格(官方 API)$0.28 / 1M tokensDeepSeek 官方定价
许可证MIT、开放权重DeepSeek 发布信息
发布时间2026-04-24DeepSeek 发布信息

有两点值得注意。第一,1M token 的上下文是货真价实的旗舰级配置 —— Flash 并没有为了压低价格而砍上下文,这在效率级型号里并不常见。第二,$0.14 输入 / $0.28 输出的定价,说明它生来就是被大规模调用几百万次的,而不是拿来瞻仰一次的。(有些第三方托管商,比如 DeepInfra,挂出的价格更低,约 $0.10 / $0.20 —— 那是各家服务商自己的定价,不应被当作 DeepSeek 官方的价格。)

吞吐量与延迟:数字说明了什么

这就是「benchmark」最容易滑头的地方。托管模型的输出速度并不是权重自带的固有属性 —— 它取决于推理服务栈、批大小、量化方式以及你打到哪家服务商。DeepSeek V4 Flash 不存在唯一「真实」的每秒 token 数,这也是我们没有引用单一数值的原因。

站得住脚的结论是:约 13B 的激活参数设计正是 Flash 快的全部原因。每个 token 只激活 284B MoE 的一小片,这是实现高吞吐、低延迟的标准架构手段,也是 DeepSeek 把 Flash 定位为低延迟、高吞吐选项、区别于更重的 V4 Pro 的原因。Artificial Analysis 等独立跟踪平台按服务商发布实时中位输出速度和首 token 时间;按照这些测评页面报告的数据,Flash 落在「快而低延迟」那一档,而不是「慢但聪明」那一档。真需要某个数字来规划,请去读你打算用的那家服务商当前的数值 —— 发布周的一张截图不是规格。

诚实提醒: 任何你看到被安在 DeepSeek V4 Flash 头上的具体「X tokens/sec」或「Y ms 延迟」,都只对特定服务商、特定日期成立。我们没法把某一个权威吞吐量数字钉在一手来源上,所以宁可定性描述,也不印一个对大多数读者的实际环境来说都是错的数字。

已发布的 benchmark 分数:哪些能确认,哪些不能

这就是大多数「DeepSeek V4 Flash benchmarks」页面翻车的地方 —— 它们把 MMLU、编程和智能体分数列到小数点后两位,却没有任何引用。

跟你说句实话:截至本文写作时,我们无法确认专门针对 Flash 型号、且有一手来源的具体 benchmark 分数(MMLU、SWE-bench 式编程测试或智能体工具调用套件)。很多流传的数字把 Flash 和 V4 Pro 混为一谈,或者来自没有标注的重发帖。按照我们的来源纪律,凡是无法追溯到 DeepSeek 或独立权威机构的分数,我们一概不印。

可以定性说明的部分,以及如何自行验证:

  • 编程与智能体任务: DeepSeek 把 Flash 定位给编程助手和智能体工作流,而它默认不开启推理的特性,更偏向快速、便宜的迭代而非深度思维链。按照聚合榜单的报告,Flash 这一档以部分峰值推理质量为代价换速度 —— 以它的体量来说意料之中。要确认当前名次,请查阅该模型在 Artificial Analysis Intelligence Index 页面上的数据。
  • 知识类(MMLU 式): 任何单一的 Flash MMLU 数字,除非能连到一次原始跑测,否则都应视为未经证实。一个约 13B 激活参数的模型能力不错,但不是为了登顶研究生级知识测试而生的。
  • 正确的心理模型: Flash 是那种「够不够用、快不快、便宜不便宜」的模型。如果某个任务需要尽可能高的分数,那是旗舰(V4 Pro,或 GLM 5.2 —— 见下文)的活儿,不是 Flash 的。

如果你需要真实的分数,可靠路径是打开独立 benchmark 权威机构上该模型的页面,读今天的数据,然后跑自己的提示词。不要相信任何不带链接的图表。

DeepSeek V4 Flash vs GLM 5.2:基于已证实规格的对比

对多数读者来说,这才是真正要做的决策:便宜快速 vs 旗舰深度。下表只对比已证实的规格 —— 不比较有争议的 benchmark 分数 —— 这样你可以在不依赖我们无法背书的数字的前提下权衡取舍。

规格DeepSeek V4 FlashGLM 5.2
定位效率 / 速度旗舰
总参数量284B(MoE)约 750B(MoE)
每 token 激活参数约 13B约 40B
上下文窗口1M tokens1M tokens
输入价格 / 1M$0.14约 $1.40
输出价格 / 1M$0.28约 $4.40
许可证MIT、开放权重MIT、开源
最适合高吞吐、低延迟、对成本敏感的任务质量至上的深度编程与智能体任务

读得坦诚一点。DeepSeek V4 Flash 在原始成本和速度上是明显赢家 —— 输入价格约为 GLM 5.2 的十分之一,激活参数更轻、为吞吐而生。GLM 5.2 每个 token 激活的参数约为前者的 3 倍,是重活编程与智能体任务上更强的旗舰 —— 在那些任务里,一个 benchmark 分或一个被正确解决的 bug,价值远超一美分的零头。两者都带着完整的 1M token 上下文,所以这不是上下文的取舍 —— 而是质量与成本的取舍。

务实的路由规则:当量和延迟占主导时选 DeepSeek V4 Flash;当你要买的是答案的深度时,选 GLM 5.2 这类旗舰。 它们其实不是竞品;它们是两条不同的预算线。

感受这种差异最快的方式,是拿同一个真实任务在两个模型上各跑一遍。你可以在 glm5.app 的浏览器里打开 GLM 5.2,无需 API key、无需安装,粘贴一个真实的工单或 diff,直接把旗舰级输出和 Flash 级跑测放在一起评判。图表只是别人测试的平均值;你自己的提示词才是唯一随行出厂的 benchmark。

掏钱之前,怎么读 Flash 的 benchmark

因为太多 DeepSeek V4 Flash「benchmark」的说法没有来源,这里是我们写这篇文章时用的判断清单,你也可以照用:

  1. 这个数字能连到一手来源吗? 规格和价格认 DeepSeek 官方文档;实时速度和指数分数认独立权威机构(Artificial Analysis)。没链接,就不信。
  2. 它说的是 Flash 还是 V4 Pro? 两者经常被混为一谈。一个「V4」分数往往就是 Pro 的数字。
  3. 吞吐量数字绑定了服务商和日期吗? 速度是服务栈的属性,不是权重的属性。
  4. 这个 benchmark 匹配你的任务吗? 编程分数对摘要流水线毫无意义,反之亦然。
  5. 你跑过自己的评测吗? 你工作流里的五个真实提示词,胜过任何榜单,足以决定路由。

常见问题

DeepSeek V4 Flash benchmarks 背后已确认的规格是什么? 经官方/注册库来源核实:284B 总参数、约 13B 激活的 MoE 模型,1M token 上下文,最大输出 384K,每百万 token 定价 $0.14 输入 / $0.28 输出,MIT 许可证,2026-04-24 发布。

DeepSeek V4 Flash 每秒多少 token,快吗? 不存在单一的权威数字 —— 输出速度取决于服务商和服务栈。它约 13B 激活参数的设计让它落在快而低延迟的一档;要当前数值,请到你选定服务商的 Artificial Analysis 页面上读实时中位数。

DeepSeek V4 Flash 的 MMLU 或编程分数是多少? 我们无法确认专门针对 Flash 型号、有一手来源的 MMLU 或编程分数,也不会印未经证实的数字。请到独立 benchmark 权威机构读当前数值,并用你自己的提示词验证。

DeepSeek V4 Flash 比 GLM 5.2 好吗? 不同档位。Flash 赢在成本和速度(输入价格约便宜 10 倍)。GLM 5.2 是深度编程与智能体质量上的旗舰。按你的任务是以量为主还是以答案深度为主来选。

DeepSeek V4 Flash 是开放权重的吗? 是的 —— MIT 许可证、开放权重,可以自托管,不过多数用户通过托管 API 使用。

写在最后

DeepSeek V4 Flash 可以证实的故事很强也很简单:一个 284B/约 13B 激活的 MoE,带完整 1M token 上下文,定价为大规模运行而生,为速度而生而非为峰值分数而生。而无法证实的故事 —— 流传的具体每秒 token 数和 MMLU/编程数字 —— 应该得到比它通常获得的更多的怀疑,这正是我们选择标记而不是编造的原因。

如果你的负载是高吞吐、成本敏感的,Flash 是理性的默认选择。如果你买的是答案的深度 —— 硬核编程、长程智能体链路 —— 那是旗舰的地盘。测试旗舰要像测试 Flash 一样:用你自己的任务,现在就试。在 glm5.app 免费试用 GLM 5.2,跑一个真实提示词;如果决定基于它构建,再去看 glm5.app/pricing 上的价格。

作者:GLM 5 Team。截至 2026 年 8 月,已对照 DeepSeek 官方文档与 Artificial Analysis 复核。规格、价格与 benchmark 名次变动频繁 —— 引用任何数字前请核对文末链接的来源。

Sources

Start Using GLM 5 Today

Try GLM 5 free — reasoning, coding, agents, and image generation in one platform.