DeepSeek V4 Pro 定价:完整成本拆解(2026)
Aug 13, 2026

DeepSeek V4 Pro 定价:完整成本拆解(2026)

DeepSeek V4 Pro 定价全拆解:每 1M token $0.435/$0.87,缓存命中输入低至 $0.003625(-99%),真实负载成本测算、推理冗长税,以及官方涨价通知对你的预算意味着什么。

在 DeepSeek V4 Pro 上规划一个正经工作负载的预算,翻车方式每次都一样:控制台里显示的数字看起来没问题,然后账单是你预估的 4 倍。你知道「Pro 很贵」,但没人告诉你它每百万 token 到底花多少钱——或者你据以做预算的输入费率,并不是你实际支付的输入费率。DeepSeek 官方定价页写了三个不同的输入数字(缓存未命中、缓存命中、以及介于两者之间的混合现实),推理模型比普通模型多写约 30% 的输出 token,而官方文档现在带着一条警告:价格即将「大幅」上涨。以上任何一条单独出现都扛得住。但加在一起,就是预算死亡的方式。

本指南给你 2026 年 8 月 13 日时的 DeepSeek V4 Pro 定价全貌——精确的官方费率、决定你实际支付哪个数字的缓存机制、真实负载的算账过程,以及对官方涨价通知的直白解读。所有数字均取自 DeepSeek 官方 API 文档和 HuggingFace 模型卡,并与 Artificial Analysis 的独立价格/性能数据交叉核对,采集于 2026-08-13。DeepSeek 已明确警告价格即将上涨,所以在锁定任何预测之前,请先在官方 DeepSeek 定价页核实当前数字。

本文解决什么问题

你可能已经知道三件事:V4 Pro 是 DeepSeek 的旗舰推理模型,它很大(约 1.6T 参数),而且比 V4 Flash 贵。你没有的是一个数字。**本文回答:V4 Pro 每百万 token 实际花多少钱,缓存如何改变这个数字,推理冗长会把账单抬高多少,以及官方的「即将涨价」通知对你的预算意味着什么。**读完你会得到一条经验法则,一分钟内就能套用到你自己的业务量上。

DeepSeek V4 Pro:官方 API 定价

DeepSeek 官方 API(做预测要用的那个版本)为当前版本 DeepSeek-V4-Pro-0813(2026 年 8 月 13 日发布)列出了三档费率:

方向每 1M token 价格备注
输入 — 缓存命中$0.003625比缓存未命中费率低约 99%
输入 — 缓存未命中$0.435略高于同类中位数(约 $0.33)
输出$0.87远低于推理类中位数(约 $2.20)
并发上限500 个并发请求V4 Flash 为 2,500

动手算账之前有三件事值得注意。第一,缓存命中费率不是文档里的四舍五入错误——$0.003625/M 比未命中费率低约 99%,它是你账单上最大的杠杆(下文详述)。第二,$0.87/M 的输出费率对一款推理旗舰来说便宜得惊人:Artificial Analysis 给出的推理类中位数约 $2.20,所以 V4 Pro 的输出比竞争组低了约 60%。第三,500 个请求的并发上限(是 Flash 的 2,500 的五分之一)意味着突发时你会排队——这对吞吐量而非 token 价格成为瓶颈的批量流水线和智能体农场尤其重要。如果你在对比各档位,我们的 DeepSeek V4 Flash 定价拆解覆盖了这个家族最便宜的一档:$0.14/$0.28。

做预算前还值得知道:V4 Pro 是纯文本模型(无图像/音频输入),思考模式默认开启(可通过 API 切换到非思考模式),并提供1M token 上下文、最高 384K 输出 token。两种 API 格式都可用(https://api.deepseek.com 走 OpenAI 风格请求,/anthropic 走 Anthropic 格式),支持 JSON 输出、工具调用和 Responses API。

算账:把费率变成经验法则

每百万 token 的费率掩盖了真正打到钱包上的算术。让我们把它具体化。以下所有示例都使用上面的官方费率。

  • 一次 1M token 输入(缓存未命中)+ 1M token 输出的任务: $0.435 + $0.87 = $1.305。两个方向各满一百万 token,也就刚过一美元。
  • 一个读多的一天: 50M 输入 + 5M 输出 = (50 × $0.435) + (5 × $0.87) = $21.75 + $4.35 = $26.10/天——不做缓存的话约 $783/月。
  • 同样的日子配上热缓存: 如果 80% 的输入命中缓存,输入变成 (10M × $0.435) + (40M × $0.003625) = $4.35 + $0.145 = $4.50,总计 $8.85/天——零代码改动省下 66%。

V4 Pro 的经验法则: 输入按每百万约半美元(未命中)或几乎为零(命中)计算,输出按每百万约一美元计算,并假设推理模型写的输出比你计划的多。 对于均衡、缓存混合的负载,一个安全的规划数字是独立追踪机构给出的混合费率——Artificial Analysis 计算的 7:2:1 混合(缓存命中输入 : 缓存未命中输入 : 输出)约等于每 1M token $0.18。粗粒度容量规划用这个数字;下面的场景表用于精确预算。

成本场景:三个真实负载的定价

头价会变成具体形状的账单。下面是三个典型负载,用官方费率端到端核算。

场景业务量缓存行为预估日成本对比无缓存
1. 批量长文档总结200 篇文档 × 50K 输入 / 4K 输出无(一次性)10M × $0.435 + 0.8M × $0.87 = $5.05
2. 编程智能体(每天 2,000 次调用,每次 4K 缓存前缀 + 4K 新输入,1.5K 输出)8M 命中 + 8M 未命中 + 3M 输出约 50% 输入命中缓存$0.029 + $3.48 + $2.61 = $6.12$9.57/天(省 36%)
3. 大规模 RAG(每天 5,000 次查询,每次 200K token 语料前缀,800 输出)1,000M 命中 + 10M 未命中 + 4M 输出语料前缀完全缓存$3.63 + $4.35 + $3.48 = $11.46$442.83/天(省约 97%)

场景 3 是那个会改变架构决策的:一个 200K token 的知识库每次查询都重新发送,就是每天 10 亿输入 token——按缓存未命中费率计算约 $439/天,每月超过 $13,000,而这些数据根本没变过。把语料前缀以 $0.003625/M 缓存后,整条流水线大约 $344/月。没有缓存,V4 Pro 对这类负载根本不现实;有了缓存,同样的活就很便宜。这就是缓存命中费率值得单独开一节的原因。

表格里没显示的另一层乘数:推理冗长。DeepSeek 的旗舰默认是思考模型,而思考模型写得更多。在 Artificial Analysis 独立的 9 任务评测组中,V4 Pro 输出了 130M token,而同类中位数是 100M——同样的任务多写 30% 输出,按 $0.87/M 算就是 $113.10 对比 $87.00(整个评测全包 $135.03)。给输出 token 按真实业务量 × 1.3 做预算,或者把量大但浅层的任务切到非思考模式。

$0.003625 的缓存命中:KV 缓存如何把输入成本砍掉 99%

每百万输入 token $0.435 与 $0.003625 之间的差距,是 DeepSeek 整个价目表上最大的价差,而且它完全是机制性的。API 会缓存重复输入前缀的 key-value(KV)状态——系统提示词、工具 schema、文档块、对话历史——所以当请求重新发送服务见过的 token 时,它们按近乎免费的缓存命中费率计费,而不是重新处理。DeepSeek 官方的上下文缓存(KV cache)指南记录了该机制,而且价格优惠是自动生效的:你不需要手动开启,只要你的输入前缀命中缓存,就直接享受命中费率

按影响程度排序的实际含义:

  1. 把所有重复的内容放在提示词开头。 系统提示词、工具定义、稳定的上下文,然后是可变化的部分。缓存基于前缀——你的提示词顺序决定你的账单。
  2. 不要在调用之间打乱提示词。 对已缓存前缀的任何编辑都会使其之后的所有内容失效,把整个输入打回 $0.435 费率。
  3. RAG 流水线必须缓存语料,而不是重发。 上面的场景 3 就是 $13K/月与 $344/月之间的差别——也就是「能不能上线」之间的差别。
  4. 缓存命中几乎免费,但不是免费。 按 $0.003625/M,一 GB 缓存输入约 $3.6——所以继续做缓存没错,但一旦命中占主导,它就不再是优化的重点。

注意 Artificial Analysis 列出的缓存命中费率约 $0.004(仍然便宜约 99%,在被追踪模型中排第 8/104);全文我们统一使用 DeepSeek 官方的 $0.003625。

涨价通知:它对你的预算意味着什么

DeepSeek 定价页目前带着一条值得直接引用的警告:近期整体价格将大幅上涨,以官方定价页为准。截至本文采集时,没有公布日期,也没有公布幅度。这对规划的影响如下:

  • 任何基于今日费率做出的预测都是一个上限,而不是基线。 「大幅」上涨很可能移动缓存命中的价差、头价,或两者一起——用 1.5x 和 2x 的敏感性场景给你的预算建模,让冲击成为一次决策,而不是一个意外。
  • 现在就锁定架构,而不是以后锁定价格。 你账单里自己能控制的部分是缓存命中率、输出量(非思考模式、token 上限)和供应商选择。这些杠杆在任何价格水平上都有效。
  • 评估替代方案的窗口就是现在。 如果你已经在为 V4 Pro 的推理能力付旗舰价,这正是拿一个可比旗舰在你的提示词上做基准测试的时刻——因为「V4 Pro 便宜」的定位在通知落地的瞬间就被侵蚀了。我们在这篇 GLM 5.2 vs DeepSeek V4 Pro 里把我们自己的旗舰对这一类模型做过基准测试;档位级的账目在下面的小节里。

V4 Pro vs V4 Flash vs GLM 5.2:按「成本做到事」来选

每 token 的价格只是决策的一半,做到一件事要花多少 token 是另一半。一个更便宜但需要在困难任务上重试和返工的模型,可能比一个一次做完的更贵模型花得更多——而在推理负载上,输出冗长还会放大这个差距。

模型输入 / 1M输出 / 1M缓存命中输入 / 1M最佳匹配
DeepSeek V4 Flash$0.14$0.28高吞吐、对延迟敏感的日常任务
DeepSeek V4 Pro$0.435$0.87$0.003625最难的推理;深度编程/智能体任务
GLM 5.2~$1.40~$4.40旗舰级编程/智能体深度;MIT 开放权重

诚实地读这张表:V4 Pro 的输出费率($0.87)大约是 GLM 5.2($4.40)的三分之一,输入也是三分之一。单看每 token 的经济账,V4 Pro 是更便宜的旗舰——当你的负载以体量为主、且任务形状正好适合 V4 Pro 时。GLM 5.2 的理由是每 token 价格展示不了的:它以更精简的约 750B/40B 激活设计和 1M 上下文瞄准同一个前沿档位,针对编程和智能体工作做了调优,而且是 MIT 开源。对一个「跑错一遍就要重来」的智能体农场,或一个按每完成任务成本(而不是每 token)来比较的编程工作流,更便宜的旗舰并不自动等于更便宜的结果。

我们实际使用的决策框架:

  • 体量大、推理浅 → V4 Flash。 批量分类、总结、聊天。详见完整的 V4 Flash 定价测算
  • 以最低成本做最难推理 → V4 Pro,把缓存设计进去,把涨价通知计入价格。
  • 以智能体/编程深度为约束的旗舰质量 → 在通知把今天的费率变成历史注脚之前,拿 GLM 5.2 在你的真实提示词上跟 V4 Pro 做基准测试。 在 glm5.app 免费试用 GLM 5.2——无需 API key——按结果定价,而不是按价目表;方案详情见 GLM 5.2 定价页

常见问题

DeepSeek V4 Pro 的价格会上涨吗?

会——DeepSeek 官方定价页声明近期价格将大幅上涨。截至 2026 年 8 月 13 日未公布日期或幅度。请做 1.5x–2x 的敏感性预算,并把今日费率当作上限。

DeepSeek V4 Pro 的缓存定价如何运作?

命中缓存前缀(系统提示词、工具 schema、重复的文档块)的输入 token 按 $0.003625/M 计费,而不是 $0.435/M——大约 99% 的折扣,由 API 的 KV 缓存自动应用。把可重复内容放在提示词开头,不要在调用之间打乱前缀。

DeepSeek V4 Pro 每 token 多少钱?

每百万 token:$0.435 输入(缓存未命中)、$0.003625 输入(缓存命中)、$0.87 输出。按 7:2:1 的缓存命中/未命中/输出混合比,独立追踪机构给出的有效费率约每 1M token $0.18。

DeepSeek V4 Pro 比 GPT 级或其他推理旗舰便宜吗?

输出方面,是的——$0.87/M 对比推理类中位数约 $2.20/M。缓存未命中输入($0.435)方面,它略高于同类中位数(约 $0.33)。端到端是否更便宜,取决于你的缓存命中率,以及它的思考模式多写了多少输出(独立测试中比同类中位数多约 30%)。

DeepSeek V4 Pro vs V4 Flash——哪个更划算?

V4 Flash($0.14/$0.28,并发 2,500)便宜得多,为体量而生。V4 Pro(输入约 3 倍、输出约 3 倍,并发 500)是攻坚那最难的 10% 工作的推理旗舰。把批量任务路由给 Flash,把困难的推理升级到 Pro——并且在按今天的价格押注 Pro 之前,拿一个 GLM 5.2 这样的旗舰替代品做基准测试。

写在最后

截至 2026-08-13 的 DeepSeek V4 Pro 定价:$0.435/M 输入(缓存未命中)、$0.003625/M 输入(缓存命中,-99%)、$0.87/M 输出、500 个并发请求。 按 7:2:1 混合比折算,有效费率约 $0.18/M——对一款排名第 2 的推理旗舰(II 53,据 Artificial Analysis)来说确实有竞争力。但有三股力量会迅速推高预测:推理冗长(输出 token 多约 30%)、一个只有你主动设计才能省钱的 99% 折扣缓存,以及 DeepSeek 自己「价格将大幅上涨」的警告。做预算时把缓存设计进去、给上涨建模,并且——在把数月期的预测押到今天的费率上之前——拿一个可比旗舰跑一遍你的真实负载。在 glm5.app 免费测试 GLM 5.2,完整方案定价见 glm5.app/pricing,等通知落地后由你来决定哪个旗舰配得上你的预算。

By the GLM 5 Team. 所有数字均来自 DeepSeek 官方 API 文档和 HuggingFace 模型卡,与 Artificial Analysis 交叉核对,截至 2026 年 8 月 13 日;DeepSeek 已宣布大幅涨价在即,生产预算前请在官方定价页核实当前费率。

Sources

本文所有事实均于 2026-08-13 从一手和独立来源采集。价格与版本经常变动——DeepSeek 自己的文档警告近期将大幅涨价——所以在投入预算之前,请以官方定价页为准。

立即开始使用 GLM 5

免费试用 GLM 5 — 推理、编程、智能体和图像生成,一个平台全搞定。

DeepSeek V4 Pro 定价:完整成本拆解(2026) - GLM 5