在 DeepSeek V4 Pro 上规划一个正经工作负载的预算,翻车方式每次都一样:控制台里显示的数字看起来没问题,然后账单是你预估的 4 倍。你知道「Pro 很贵」,但没人告诉你它每百万 token 到底花多少钱——或者你据以做预算的输入费率,并不是你实际支付的输入费率。DeepSeek 官方定价页写了三个不同的输入数字(缓存未命中、缓存命中、以及介于两者之间的混合现实),推理模型比普通模型多写约 30% 的输出 token,而官方文档现在带着一条警告:价格即将「大幅」上涨。以上任何一条单独出现都扛得住。但加在一起,就是预算死亡的方式。
本指南给你 2026 年 8 月 13 日时的 DeepSeek V4 Pro 定价全貌——精确的官方费率、决定你实际支付哪个数字的缓存机制、真实负载的算账过程,以及对官方涨价通知的直白解读。所有数字均取自 DeepSeek 官方 API 文档和 HuggingFace 模型卡,并与 Artificial Analysis 的独立价格/性能数据交叉核对,采集于 2026-08-13。DeepSeek 已明确警告价格即将上涨,所以在锁定任何预测之前,请先在官方 DeepSeek 定价页核实当前数字。
本文解决什么问题
你可能已经知道三件事:V4 Pro 是 DeepSeek 的旗舰推理模型,它很大(约 1.6T 参数),而且比 V4 Flash 贵。你没有的是一个数字。**本文回答:V4 Pro 每百万 token 实际花多少钱,缓存如何改变这个数字,推理冗长会把账单抬高多少,以及官方的「即将涨价」通知对你的预算意味着什么。**读完你会得到一条经验法则,一分钟内就能套用到你自己的业务量上。
DeepSeek V4 Pro:官方 API 定价
DeepSeek 官方 API(做预测要用的那个版本)为当前版本 DeepSeek-V4-Pro-0813(2026 年 8 月 13 日发布)列出了三档费率:
| 方向 | 每 1M token 价格 | 备注 |
|---|---|---|
| 输入 — 缓存命中 | $0.003625 | 比缓存未命中费率低约 99% |
| 输入 — 缓存未命中 | $0.435 | 略高于同类中位数(约 $0.33) |
| 输出 | $0.87 | 远低于推理类中位数(约 $2.20) |
| 并发上限 | 500 个并发请求 | V4 Flash 为 2,500 |
动手算账之前有三件事值得注意。第一,缓存命中费率不是文档里的四舍五入错误——$0.003625/M 比未命中费率低约 99%,它是你账单上最大的杠杆(下文详述)。第二,$0.87/M 的输出费率对一款推理旗舰来说便宜得惊人:Artificial Analysis 给出的推理类中位数约 $2.20,所以 V4 Pro 的输出比竞争组低了约 60%。第三,500 个请求的并发上限(是 Flash 的 2,500 的五分之一)意味着突发时你会排队——这对吞吐量而非 token 价格成为瓶颈的批量流水线和智能体农场尤其重要。如果你在对比各档位,我们的 DeepSeek V4 Flash 定价拆解覆盖了这个家族最便宜的一档:$0.14/$0.28。
做预算前还值得知道:V4 Pro 是纯文本模型(无图像/音频输入),思考模式默认开启(可通过 API 切换到非思考模式),并提供1M token 上下文、最高 384K 输出 token。两种 API 格式都可用(https://api.deepseek.com 走 OpenAI 风格请求,/anthropic 走 Anthropic 格式),支持 JSON 输出、工具调用和 Responses API。
算账:把费率变成经验法则
每百万 token 的费率掩盖了真正打到钱包上的算术。让我们把它具体化。以下所有示例都使用上面的官方费率。
- 一次 1M token 输入(缓存未命中)+ 1M token 输出的任务: $0.435 + $0.87 = $1.305。两个方向各满一百万 token,也就刚过一美元。
- 一个读多的一天: 50M 输入 + 5M 输出 = (50 × $0.435) + (5 × $0.87) = $21.75 + $4.35 = $26.10/天——不做缓存的话约 $783/月。
- 同样的日子配上热缓存: 如果 80% 的输入命中缓存,输入变成 (10M × $0.435) + (40M × $0.003625) = $4.35 + $0.145 = $4.50,总计 $8.85/天——零代码改动省下 66%。
V4 Pro 的经验法则: 输入按每百万约半美元(未命中)或几乎为零(命中)计算,输出按每百万约一美元计算,并假设推理模型写的输出比你计划的多。 对于均衡、缓存混合的负载,一个安全的规划数字是独立追踪机构给出的混合费率——Artificial Analysis 计算的 7:2:1 混合(缓存命中输入 : 缓存未命中输入 : 输出)约等于每 1M token $0.18。粗粒度容量规划用这个数字;下面的场景表用于精确预算。
成本场景:三个真实负载的定价
头价会变成具体形状的账单。下面是三个典型负载,用官方费率端到端核算。
| 场景 | 业务量 | 缓存行为 | 预估日成本 | 对比无缓存 |
|---|---|---|---|---|
| 1. 批量长文档总结 | 200 篇文档 × 50K 输入 / 4K 输出 | 无(一次性) | 10M × $0.435 + 0.8M × $0.87 = $5.05 | — |
| 2. 编程智能体(每天 2,000 次调用,每次 4K 缓存前缀 + 4K 新输入,1.5K 输出) | 8M 命中 + 8M 未命中 + 3M 输出 | 约 50% 输入命中缓存 | $0.029 + $3.48 + $2.61 = $6.12 | $9.57/天(省 36%) |
| 3. 大规模 RAG(每天 5,000 次查询,每次 200K token 语料前缀,800 输出) | 1,000M 命中 + 10M 未命中 + 4M 输出 | 语料前缀完全缓存 | $3.63 + $4.35 + $3.48 = $11.46 | $442.83/天(省约 97%) |
场景 3 是那个会改变架构决策的:一个 200K token 的知识库每次查询都重新发送,就是每天 10 亿输入 token——按缓存未命中费率计算约 $439/天,每月超过 $13,000,而这些数据根本没变过。把语料前缀以 $0.003625/M 缓存后,整条流水线大约 $344/月。没有缓存,V4 Pro 对这类负载根本不现实;有了缓存,同样的活就很便宜。这就是缓存命中费率值得单独开一节的原因。
表格里没显示的另一层乘数:推理冗长。DeepSeek 的旗舰默认是思考模型,而思考模型写得更多。在 Artificial Analysis 独立的 9 任务评测组中,V4 Pro 输出了 130M token,而同类中位数是 100M——同样的任务多写 30% 输出,按 $0.87/M 算就是 $113.10 对比 $87.00(整个评测全包 $135.03)。给输出 token 按真实业务量 × 1.3 做预算,或者把量大但浅层的任务切到非思考模式。
$0.003625 的缓存命中:KV 缓存如何把输入成本砍掉 99%
每百万输入 token $0.435 与 $0.003625 之间的差距,是 DeepSeek 整个价目表上最大的价差,而且它完全是机制性的。API 会缓存重复输入前缀的 key-value(KV)状态——系统提示词、工具 schema、文档块、对话历史——所以当请求重新发送服务见过的 token 时,它们按近乎免费的缓存命中费率计费,而不是重新处理。DeepSeek 官方的上下文缓存(KV cache)指南记录了该机制,而且价格优惠是自动生效的:你不需要手动开启,只要你的输入前缀命中缓存,就直接享受命中费率。
按影响程度排序的实际含义:
- 把所有重复的内容放在提示词开头。 系统提示词、工具定义、稳定的上下文,然后是可变化的部分。缓存基于前缀——你的提示词顺序决定你的账单。
- 不要在调用之间打乱提示词。 对已缓存前缀的任何编辑都会使其之后的所有内容失效,把整个输入打回 $0.435 费率。
- RAG 流水线必须缓存语料,而不是重发。 上面的场景 3 就是 $13K/月与 $344/月之间的差别——也就是「能不能上线」之间的差别。
- 缓存命中几乎免费,但不是免费。 按 $0.003625/M,一 GB 缓存输入约 $3.6——所以继续做缓存没错,但一旦命中占主导,它就不再是优化的重点。
注意 Artificial Analysis 列出的缓存命中费率约 $0.004(仍然便宜约 99%,在被追踪模型中排第 8/104);全文我们统一使用 DeepSeek 官方的 $0.003625。
涨价通知:它对你的预算意味着什么
DeepSeek 定价页目前带着一条值得直接引用的警告:近期整体价格将大幅上涨,以官方定价页为准。截至本文采集时,没有公布日期,也没有公布幅度。这对规划的影响如下:
- 任何基于今日费率做出的预测都是一个上限,而不是基线。 「大幅」上涨很可能移动缓存命中的价差、头价,或两者一起——用 1.5x 和 2x 的敏感性场景给你的预算建模,让冲击成为一次决策,而不是一个意外。
- 现在就锁定架构,而不是以后锁定价格。 你账单里自己能控制的部分是缓存命中率、输出量(非思考模式、token 上限)和供应商选择。这些杠杆在任何价格水平上都有效。
- 评估替代方案的窗口就是现在。 如果你已经在为 V4 Pro 的推理能力付旗舰价,这正是拿一个可比旗舰在你的提示词上做基准测试的时刻——因为「V4 Pro 便宜」的定位在通知落地的瞬间就被侵蚀了。我们在这篇 GLM 5.2 vs DeepSeek V4 Pro 里把我们自己的旗舰对这一类模型做过基准测试;档位级的账目在下面的小节里。
V4 Pro vs V4 Flash vs GLM 5.2:按「成本做到事」来选
每 token 的价格只是决策的一半,做到一件事要花多少 token 是另一半。一个更便宜但需要在困难任务上重试和返工的模型,可能比一个一次做完的更贵模型花得更多——而在推理负载上,输出冗长还会放大这个差距。
| 模型 | 输入 / 1M | 输出 / 1M | 缓存命中输入 / 1M | 最佳匹配 |
|---|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.28 | — | 高吞吐、对延迟敏感的日常任务 |
| DeepSeek V4 Pro | $0.435 | $0.87 | $0.003625 | 最难的推理;深度编程/智能体任务 |
| GLM 5.2 | ~$1.40 | ~$4.40 | — | 旗舰级编程/智能体深度;MIT 开放权重 |
诚实地读这张表:V4 Pro 的输出费率($0.87)大约是 GLM 5.2($4.40)的三分之一,输入也是三分之一。单看每 token 的经济账,V4 Pro 是更便宜的旗舰——当你的负载以体量为主、且任务形状正好适合 V4 Pro 时。GLM 5.2 的理由是每 token 价格展示不了的:它以更精简的约 750B/40B 激活设计和 1M 上下文瞄准同一个前沿档位,针对编程和智能体工作做了调优,而且是 MIT 开源。对一个「跑错一遍就要重来」的智能体农场,或一个按每完成任务成本(而不是每 token)来比较的编程工作流,更便宜的旗舰并不自动等于更便宜的结果。
我们实际使用的决策框架:
- 体量大、推理浅 → V4 Flash。 批量分类、总结、聊天。详见完整的 V4 Flash 定价测算。
- 以最低成本做最难推理 → V4 Pro,把缓存设计进去,把涨价通知计入价格。
- 以智能体/编程深度为约束的旗舰质量 → 在通知把今天的费率变成历史注脚之前,拿 GLM 5.2 在你的真实提示词上跟 V4 Pro 做基准测试。 在 glm5.app 免费试用 GLM 5.2——无需 API key——按结果定价,而不是按价目表;方案详情见 GLM 5.2 定价页。
常见问题
DeepSeek V4 Pro 的价格会上涨吗?
会——DeepSeek 官方定价页声明近期价格将大幅上涨。截至 2026 年 8 月 13 日未公布日期或幅度。请做 1.5x–2x 的敏感性预算,并把今日费率当作上限。
DeepSeek V4 Pro 的缓存定价如何运作?
命中缓存前缀(系统提示词、工具 schema、重复的文档块)的输入 token 按 $0.003625/M 计费,而不是 $0.435/M——大约 99% 的折扣,由 API 的 KV 缓存自动应用。把可重复内容放在提示词开头,不要在调用之间打乱前缀。
DeepSeek V4 Pro 每 token 多少钱?
每百万 token:$0.435 输入(缓存未命中)、$0.003625 输入(缓存命中)、$0.87 输出。按 7:2:1 的缓存命中/未命中/输出混合比,独立追踪机构给出的有效费率约每 1M token $0.18。
DeepSeek V4 Pro 比 GPT 级或其他推理旗舰便宜吗?
输出方面,是的——$0.87/M 对比推理类中位数约 $2.20/M。缓存未命中输入($0.435)方面,它略高于同类中位数(约 $0.33)。端到端是否更便宜,取决于你的缓存命中率,以及它的思考模式多写了多少输出(独立测试中比同类中位数多约 30%)。
DeepSeek V4 Pro vs V4 Flash——哪个更划算?
V4 Flash($0.14/$0.28,并发 2,500)便宜得多,为体量而生。V4 Pro(输入约 3 倍、输出约 3 倍,并发 500)是攻坚那最难的 10% 工作的推理旗舰。把批量任务路由给 Flash,把困难的推理升级到 Pro——并且在按今天的价格押注 Pro 之前,拿一个 GLM 5.2 这样的旗舰替代品做基准测试。
写在最后
截至 2026-08-13 的 DeepSeek V4 Pro 定价:$0.435/M 输入(缓存未命中)、$0.003625/M 输入(缓存命中,-99%)、$0.87/M 输出、500 个并发请求。 按 7:2:1 混合比折算,有效费率约 $0.18/M——对一款排名第 2 的推理旗舰(II 53,据 Artificial Analysis)来说确实有竞争力。但有三股力量会迅速推高预测:推理冗长(输出 token 多约 30%)、一个只有你主动设计才能省钱的 99% 折扣缓存,以及 DeepSeek 自己「价格将大幅上涨」的警告。做预算时把缓存设计进去、给上涨建模,并且——在把数月期的预测押到今天的费率上之前——拿一个可比旗舰跑一遍你的真实负载。在 glm5.app 免费测试 GLM 5.2,完整方案定价见 glm5.app/pricing,等通知落地后由你来决定哪个旗舰配得上你的预算。
By the GLM 5 Team. 所有数字均来自 DeepSeek 官方 API 文档和 HuggingFace 模型卡,与 Artificial Analysis 交叉核对,截至 2026 年 8 月 13 日;DeepSeek 已宣布大幅涨价在即,生产预算前请在官方定价页核实当前费率。
Sources
本文所有事实均于 2026-08-13 从一手和独立来源采集。价格与版本经常变动——DeepSeek 自己的文档警告近期将大幅涨价——所以在投入预算之前,请以官方定价页为准。
- DeepSeek Models & Pricing — 官方 token 定价($0.435/$0.003625 输入、$0.87 输出)、模型版本,以及即将涨价的官方通知。
- DeepSeek Context Caching (KV Cache) — 缓存命中定价机制及已缓存输入前缀如何计费的官方文档。
- DeepSeek Rate Limits — 吞吐规划用的官方并发限制(V4 Pro 为 500)。
- DeepSeek-V4-Pro on HuggingFace — 官方模型卡:1.6T/49B 激活 MoE 架构、1M 上下文、MIT 许可证、发布详情。
- Artificial Analysis — DeepSeek V4 Pro — 独立基准(II 53,第 2/104)、输出速度 83.2 tok/s、TTFT 1.63s、冗长数据(130M vs 100M token)、缓存命中价格(约 $0.004)与混合费率(约 $0.18/M)分析。

