现在搜"DeepSeek V4 Pro benchmarks",你会得到互相打架的图表。一个帖子说它是有史以来测试过的最聪明的模型。另一个说它慢。第三个引用了一个你在任何官方页面都找不到的编码分数。三个帖子都在说"同一个"模型——区别在于每个数字来自哪里,以及引用它的人是否真的知道。
DeepSeek V4 Pro(版本 -0813,2026 年 8 月 13 日发布)是一个真正重要的发布:一个 1.6 万亿参数的混合专家(MoE)旗舰,在独立的 Artificial Analysis Intelligence Index 上排名 104 个模型中的第 2。但如果你分不清哪些数字是独立测量、哪些是厂商自报、哪些是编造的,第 2 名的排名就毫无意义。这篇文章解读真正重要的 0813 数字,解释每个数字衡量什么,并给你一套阅读任何模型基准测试的经验法则——让你下次看到的榜单不再误导你。
这篇文章解决什么
互相冲突的数字:厂商自报分数对独立第三方测量、你不认识的基准术语(II、TTFT、verbosity),以及完全不知道一个跑分对你的实际工作意味着什么。这篇文章只使用一个独立数据源——Artificial Analysis,2026-08-13 采集——并用大白话解释每个数字,而不是只把它引用出来。
为什么这份数据可信(而大多数其他数据不可信)
几乎所有流传的 DeepSeek V4 Pro "基准"数字都过不了可信度的第一关:谁测的,怎么测的?
DeepSeek 发布规格和定价,但不发布自己的性能分数——这是正确行为。本文的数字来自 Artificial Analysis(AA),一个独立的基准测试组织,它在受控、标准化的测试平台上自己运行模型,而不是接受厂商提供的结果。这个区别很重要:一个分数只跟跑测试的人一样可信,而 AA 没有动机去抬高任何厂商的数字。
第二个问题是你看的是哪个版本的指数。AA 的 Intelligence Index 目前是 v4.1.1,由九个独立评测复合而成,覆盖不同的能力领域:
- GDPval-AA v2 — 研究生级别的、以证据驱动的推理(AA 自己版本的 GDPval)
- 𝜏³-Banking — 真实银行任务上的智能体工具使用与多步骤工作流
- Terminal-Bench v2.1 — 终端环境中的智能体编码:读取文件、串联命令、修复错误
- SciCode — 科学编码:把研究问题实现为可运行代码
- Humanity's Last Exam(HLE) — 横跨几十个领域的前沿知识
- GPQA Diamond — 研究生级别科学问题(物理、化学、生物)
- CritPt — 困难、模糊问题上的临界点推理
- AA-Omniscience — 时间压力下的广泛知识检索
- AA-LCR — 长上下文回忆,测试模型是否真的使用了巨大提示词里的内容
我们刻意不引用单项测试分数:AA 在其实时页面上发布总体指数和分项测试结果,而这些会随运行次数累积而变化。稳定且有日期标注的是复合分数——而复合分数才是应该用来推理的东西。
智能指数:53 分与 104 个模型中的第 2 名
在 Artificial Analysis Intelligence Index(v4.1.1)上,DeepSeek V4 Pro 0813 得分 53,在 104 个被测试模型中排名第 2。做个校准:全部 104 个模型的中位分数是 27。换句话说,V4 Pro 的能力大约是 AA 测试过所有模型中位能力的 2 倍——是两个标准差的级别跃升,而不是边际改进。
正确理解这个分数:
- 104 个中的第 2 说的是覆盖全部九项评测的复合指数,而不是任何单一任务。它意味着 V4 Pro 是 AA 测量过的第二强的全能模型。
- 复合排名是"哪个模型总体更聪明"的最佳信号,同时也是为某一项具体工作选模型时最差的工具——一个排第 40 的模型可能在你的狭窄任务上击败第 2(决策框架里会详述)。
- 分数是在 **Reasoning Max Effort(最大推理努力)**下采集的——AA 以最大推理努力在 V4 Pro 的思考模式下运行,而这本来就是你做硬任务该用的设置。DeepSeek 的 API 支持在思考与非思考模式之间切换;基准反映的是思考模式的画像。
能力维度:V4 Pro 真正擅长什么
指数内的九项评测按能力分组。DeepSeek V4 Pro 已知的优势与诚实的提醒:
编码与智能体工作(Terminal-Bench v2.1、SciCode、𝜏³-Banking)。 这是模型被设计来赢的领域:智能体式终端操作、科学编码、带真实交易的多步骤工具工作流。Terminal-Bench 类任务奖励那些行动前先规划、出错后自我修正的模型——对 1.6T MoE 且只有 49B 激活参数、以最大努力运行推理的模型来说,这是天然契合。
研究生级推理与知识(GPQA Diamond、Humanity's Last Exam、CritPt)。 GPQA 覆盖研究生级科学;HLE 是流通中最难的通识测试。这里的强复合分数意味着 V4 Pro 能在真正困难、模糊的问题上站得住——那种能把小模型击垮成"自信的错误答案"的问题。
长上下文(AA-LCR)。 有了 1M token 的上下文窗口,相关的测试不是"能不能塞进提示词",而是"能不能回忆起埋在中间的事实"。AA-LCR 测的正是这个,这也是任何打算把 V4 Pro 用于超大代码库或长文档的人最相关的维度。
诚实的提醒: DeepSeek V4 Pro 是纯文本模型。它不接受图像输入——所以它无法理解截图、图表或 UI 原型,九项指数评测也都不覆盖多模态能力。如果你的工作流需要视觉,无论指数分数如何,这个模型都不是完整答案。
速度与延迟:83.2 tok/s 与 1.63 秒 TTFT
智能只是画面的一半。另一半是模型能不能交互式使用。
- 输出速度:每秒 83.2 token(所有模型的中位数为 66.2)。在 104 个模型中排第 19——舒适地高于平均水平。对一个 1.6T 参数旗舰来说这令人印象深刻:更大的模型通常牺牲吞吐量,而 V4 Pro 足够快到用于实时交互式编码。
- TTFT(首 token 时间):1.63 秒(中位数 1.89 秒)。这是发送请求到第一个 token 到达之间的时间。两秒以内让 V4 Pro 与许多小得多的模型处于同一延迟级别。
这两个数字为什么重要:TTFT 决定你对速度的感知,tok/s 决定你的账单。启动慢但流式快的模型在聊天里显得迟钝,但在长生成上便宜——V4 Pro 两者都不错,这就是它在"使用速度"综合指标上得分高的原因。把这些当作 AA 测试平台上带日期的测量;绝对吞吐量因提供商和服务配置而异。
成本效率:第 2 名模型实际要花多少钱
没有价格标签的排名只是爱好。下面是运行一个第 2 名模型的经济账,来自 AA 的实测成本数据和 DeepSeek 的官方定价(每 1M token,2026-08-13):
| 指标 | DeepSeek V4 Pro | 背景 |
|---|---|---|
| 输出价格 | $0.87 / 1M | 同类中位数 $2.20——不到一半 |
| 输入价格(缓存未命中) | $0.435 / 1M | 略高于中位数 $0.33 |
| 缓存命中输入 | $0.003625 / 1M(−99%) | 缓存价格在 104 个模型中排第 8 |
| 综合费率(7:2:1 缓存命中/输入/输出) | ≈ $0.18 / 1M | 启用缓存后的有效成本 |
| 跑完所有 II 任务的总成本 | $135.03 | AA 跑完整评测的实际花费 |
两个值得关注的数字:
- 综合费率 ≈ $0.18/1M。 因为 DeepSeek 的上下文缓存折扣巨大(缓存输入 −99%),重度复用上下文的负载——智能体、编码会话、多轮聊天——实际成本远低于名义上的 $0.435 输入价。缓存命中才是这个模型在生产中便宜的原因。
- 整个 II 评测总共 $135.03。 AA 公布了它以最大推理努力跑完全部九个套件的实际花费。这是一个理智检查:对一个前沿模型做一次真正完整的基准运行,API 费用大约要一百美元。任何发布"独立基准结果"却没有这种成本足迹的厂商,很可能并没有运行真正的评测。
一个关键警告:DeepSeek 已宣布 V4 Pro 近期将大幅涨价。 上面的数字是 2026-08-13 的官方价格;做预算请对照官方定价页面,而不是本文。
冗长标志:1.3 亿 token 与对你的意义
每个基准都有一个脚注。DeepSeek V4 Pro 的脚注是冗长度:II 评测产生了 约 1.3 亿输出 token,而被测模型的中位数是约 1 亿。翻译过来:在最大推理努力下,V4 Pro 每个任务大约比平均模型多写 30% 的文字。
这是大多数评测文章跳过的基准细节,而它会改变你的成本计算:
- 每个答案更多的 token 意味着更长的答案——在硬推理任务上确实有用,因为"出声思考"有帮助;但在总结、提取这类例行工作上则是浪费。
- 你的 API 账单随输出 token 增长。在 $0.87/1M 的价格下,重度负载上 30% 的冗长溢价是真金白银——上面的成本表正是 DeepSeek 回答"积极用缓存、简单任务切非思考模式"的原因。
- 实际的操作杠杆:只在任务需要时才用思考模式。 DeepSeek 的 API 允许按请求在思考与非思考之间切换。便宜、短答案的活不需要最大努力的推理,非思考模式同时降低延迟和 token 数。
如何用基准测试选模型(决策框架)
别把复合指数当成高分竞赛,把它当作过滤器,然后是测试:
- 查来源。 数字来自独立测试方(Artificial Analysis)还是无标注的图表?没有一手来源就没有信任。仅此一条就能淘汰大多数社交媒体"基准"。
- 匹配任务,而不是总分。 编码智能体?看 Terminal-Bench/SciCode,忽略知识测试。长文档?看 AA-LCR。一个"第 2"的复合分数告诉你模型处处都强——但决定性的数字是你的任务对应的分项测试。
- 给负载定价,而不是给 token 定价。 用你的缓存命中率计算综合成本(DeepSeek 的 −99% 缓存折扣对重复上下文彻底改变一切),再乘以你的真实月流量。即使单价相同,冗长的模型每个任务也更贵。
- 检查分数没显示出来的边界。 对 V4 Pro:纯文本(无图像)、500 个并发请求(V4 Flash 是 2,500)、思考/非思考模式,以及已宣布的涨价。基准从不包含这些,而它们决定真实可用性。
经验法则: 基准分数告诉你模型可能做什么;分项测试与任务的相关性告诉你它会不会为你做。总分给模型排名是为了面子——分项分数和定价才能买到生产系统。
如果你想要一个没有上述边界的旗舰,GLM 5.2——智谱 AI 的旗舰,约 750B MoE、约 40B 激活——是 MIT 许可、1M 上下文,你可以在 glm5.app 上无需 API key 免费试用。不同的设计,同一级别;做预算前用你自己的任务在两个模型上都跑一遍。(刚接触这个家族?我们的 DeepSeek V4 Flash 基准测试一文解释了效率档,V4 Flash vs. V4 Pro 覆盖了家族内的分档。)
常见问题
DeepSeek V4 Pro 现在是世界上最强的模型吗? 按 Artificial Analysis(v4.1.1,2026-08-13 采集)的数据,它得 53 分——104 个中的第 2,是中位数 27 的两倍。"最强"取决于你的任务:复合分数说明全能精英;分项测试决定具体任务;而且它只支持文本,所以多模态工作无论如何都不在范围内。
DeepSeek V4 Pro 快吗? 就它的体积而言快:83.2 tok/s 输出(中位数 66.2)、1.63 秒 TTFT(中位数 1.89 秒),AA 实测。速度因提供商和服务配置而异——把这些当作 AA 带日期的测量值。
为什么 DeepSeek V4 Pro 这么啰嗦? 在最大推理努力下,它在 II 套件上产生约 1.3 亿 token,而中位数约 1 亿——每个任务约多 30% 的文字。这是思考模式推理的副作用。例行工作切换到非思考模式可以削减 token 和成本。
我能相信看到的 DeepSeek V4 Pro 基准数字吗? 只有当它们引用独立来源时才行。AA 的数字是带已发布方法论、可复现的测量;无标注图表和厂商自报不是。检查分项测试是否匹配你的任务,做预算前注意 DeepSeek 已宣布的涨价。
跑一个第 2 名的模型要多少钱? 官方价格(2026-08-13):输出 $0.87/1M、缓存未命中输入 $0.435/1M、缓存命中输入 $0.003625/1M(−99%,104 个中排第 8)。启用缓存后综合 ≈ $0.18/1M;AA 完整九套件运行总花费 $135.03。
写在最后
DeepSeek V4 Pro 的 0813 故事,来自独立测量:Intelligence Index 53(104 个中第 2,中位数 27)、83.2 tok/s、1.63 秒 TTFT、启用缓存后综合 ≈ $0.18/1M,以及最大推理努力下 30% 的冗长溢价。它是一个真正精英、服务成本低廉的旗舰——但带着三个诚实的边界:纯文本、依赖缓存的经济性,以及已宣布的涨价。
如果你在硬任务上用它的推理模式、例行工作上用非思考模式,经济账是成立的。如果你现在就想试一个旗舰且不需要 API key,在 glm5.app 免费测试 GLM 5.2——同一级别、不同的边界,而你自己写的提示词才是唯一随行的基准。
GLM 5 Team。基准数字是 Artificial Analysis 于 2026-08-13 采集的测量值(Intelligence Index v4.1.1);价格是截至 2026-08-13 的 DeepSeek 官方定价。排名、版本和价格变动频繁——DeepSeek 已宣布即将涨价,引用任何数字前请核实链接来源。
Sources
- Artificial Analysis — DeepSeek V4 Pro — Intelligence Index(53 分,104 个中第 2)、83.2 tok/s 输出速度、1.63 秒 TTFT、冗长度(约 1.3 亿 token)与评测成本($135.03)的独立测量。所有性能数字的一手来源。
- Artificial Analysis — Methodology — Intelligence Index v4.1.1 及其九项评测(GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、HLE、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR)如何测量。
- DeepSeek Models & Pricing —
deepseek-v4-pro官方定价(缓存命中/未命中输入、输出)、上下文限制与并发数。注意:已宣布大幅涨价。 - DeepSeek-V4-Pro on Hugging Face — 官方模型卡:1.6T 参数 MoE,每 token 49B 激活,1M 上下文,MIT 许可。
- DeepSeek Thinking Mode — 思考与非思考模式切换的官方文档,AA 测量时使用的设置。

