你花钱买了(或正打算买)一个带 1M token 上下文窗口的模型,这时脑子里有个声音说:把所有东西、一次性、每次都整段粘贴进去。这个本能会让你多花钱。推理模型会为它「思考」的内容慷慨计费,长输入并不免费,而且这么大的窗口,只有当任务真的需要在一遍之内看完所有内容时才值这个价。真正的本事在于:知道「1M token」换算成页数是多少、哪些任务配得上它,以及怎么把账单变得微不足道而不是吓人。
本指南用你真正需要的方式拆解 DeepSeek V4 Pro 上下文窗口:1,048,576 个输入 token 换算到真实文档里是多少、为什么最大输出是 384K 而不是 1M、哪些工作负载在这个窗口里物有所值、什么时候根本不该用它,以及 KV cache 定价如何把反复调用长上下文变成毛毛雨。
这里的一切都基于 DeepSeek 官方 API 文档、官方 Hugging Face 模型卡,以及 Artificial Analysis 的独立评测,数据截至 2026 年 8 月 13 日——也就是 DeepSeek-V4-Pro-0813 发布的那一天。token 到字数的换算是经验法则,不是厂商数据,因为 tokenization 因语言和格式而异。
本文解决什么问题
大多数介绍 DeepSeek V4 Pro 的页面都把「1M 上下文」当成一个卖点罗列出来就完事了。这就留下了三个真实空白:没有尺度感(1M token 到底能装下什么?)、没有不对称感(为什么输出上限只有 384K,它会不会限制你?)、没有成本感(一次全上下文调用到底花多少钱,缓存会不会改变答案?)。
如果你曾经把一份巨型文档粘贴进模型,眼看着账单或延迟一路飙升,而其实一个 20K token 的提示词就能给出答案——那么这篇指南就是为你写的。
1M Token 实际是什么概念
先看规格表,并把它「翻译」成人话。DeepSeek V4 Pro 是 DeepSeek V4 家族的旗舰:一个总参数 1.6T、每 token 激活约 49B 的 Mixture-of-Experts 模型,于 2026 年 8 月 13 日在 MIT 开放权重许可证下发布。
| 规格 | DeepSeek V4 Pro |
|---|---|
| 上下文窗口(输入) | 1,048,576 token(1M) |
| 最大输出 | 最高 384K token |
| 架构 | MoE,1.6T 总量 / 49B 激活 |
| 模式 | 思考(默认)与非思考 |
| 输入价格 | $0.435 / 1M(缓存未命中),$0.003625 / 1M(缓存命中) |
| 输出价格 | $0.87 / 1M |
| 模态 | 仅文本 |
| 并发数 | 500 |
Token 不是词,所以在换算之前这个数字始终是抽象的。经验法则:一个 token 大约相当于四分之三个英文单词。由此可得:
| 参照物 | 体量 | Token 估算 |
|---|---|---|
| 满 1M 上下文 | 约 750,000 词 | 1,048,576 token |
| A4 纸页数(Artificial Analysis 的框架) | 约 1,500 页 | 1M token |
| 长篇小说(约 80,000 词) | 约 107K token | 同时容纳 7–8 本 |
| 300 页非虚构书籍(约 90,000 词) | 约 120K token | 同时容纳 7–8 本 |
| 10 小时会议纪要 | 约 200K token | 同时容纳 5 份 |
| 50 篇学术论文 | 约 400K–650K token | 一套文献 |
| 中等规模代码库(40,000–60,000 行) | 约 400K–700K token | 一次请求 |
最贴切的比喻:1M token 是一整层书架,不是一个段落。 书架上七八本书、一摞会议纪要,或一个完整的中型代码仓库——全部同时打开,一遍之内全部可交叉引用。
输入 vs 输出:没人解释的不对称
这里有一对数字最让人犯晕:进 1M,出 384K。 你读起来像一座图书馆,写起来像一本书。这不是 bug——而是设计决策,而且它直接影响你怎么做预算。
不对称为什么存在:
推理 token 属于输出侧。 V4 Pro 默认思考模式。它的思维链是按输出 token 计费的,所以输出预算必须同时覆盖推理轨迹加上最终答案。Artificial Analysis 恰好观察到了这一点:它的 Intelligence Index 评测在所有任务上消耗了约 1.3 亿输出 token,而同类模型的中位数是 1 亿——V4 Pro 属于话多的一边。每一个思考 token 都是要付费的输出 token。
输出是昂贵且不可缓存的一侧。 输出价格是每百万 token $0.87——是缓存未命中输入价格的两倍——而且生成出来的文本永远不可能从缓存里提供。输入可以复用并打折,输出则每次都要全价买单。
读多写少才是真实负载。 文档分析、代码仓库评审、智能体会话都在输入侧消耗上下文,最终只产生不大不小的答案。384K 的上限足够装下一条很长的推理轨迹、一整份翻译文档或一次大规模结构化导出而不会截断——而且很少真的触顶。
实用的约束表:
| 配置 | 输入预算 | 输出预算 | 花费(标价) |
|---|---|---|---|
| 典型分析调用 | 约 100K–300K token | 1K–10K token | 输入 $0.04–$0.14,输出几乎可忽略 |
| 满窗口、短答案 | 约 1M token | 5K token | 输入约 $0.44(或缓存后约 $0.004) |
| 满窗口、超大答案 | 约 1M token | 384K token | 输入约 $0.44 + 输出约 $0.33 |
| 最大强度思考、长答案 | 输入适中 | 100K+ token | 输出主导账单 |
经验法则:输入是你的阅读容量,输出是你的写作容量——而在思考模型里,还是你的思考预算。 如果你的任务是「读得多、写得少」,1M 窗口完美契合;如果你的任务是「写得多」,384K 就是你规划时要围着转的天花板。
1M 窗口在哪里物有所值
这么大的窗口不是花架子。它改变了哪些工作流可以不用分块、embedding 或检索拼接就能跑:
整仓库评审。 把一个 40,000–60,000 行的服务一次粘贴进一个请求,然后问跨文件的问题:追踪某个配置值如何流经路由和处理器、找出某个废弃函数的全部调用点、或在完整的依赖关系图视野下起草迁移方案。单文件评审会漏掉活在文件之间的 bug;1M 窗口看得见这些连接。
全文分析。 带交叉引用条款的合同、300 页的监管申报文件、研究文献集、技术手册——模型一遍通读。逐条款摘要、第 12 页与第 87 页之间的矛盾检查、结构化 JSON 抽取:全部无需预切分源文件、也不会在接缝处丢失上下文。
长程智能体会话。 智能体工作流积累历史记录的速度极快:工具输出、中间推理、检索到的页面。有了 1M token,智能体在不得不摘要或丢弃较早轮次之前,能保留更多的自身工作记忆——「智能体忘了它十步前做的决定」这类失败会少很多。
跨文档推理。 五十篇论文放进一个提示词,你可以问遍整套文献做对比问题,而不是一篇一篇地比。
什么时候你不需要 1M(而且硬要为此买单会吃亏)
大窗口是上限,不是默认。它伴随三种失败模式:
极限处记忆会退化。 「支持 1M token」意味着模型能接受 1M token,不代表它对第 700,000 个 token 的记忆能和第 5,000 个 token 一样可靠。长上下文记忆因模型和提示词位置而异。把关键指令放在开头或结尾附近,并在信任之前,先用自己的数据测一下深中段检索。
延迟和成本随你发送的内容而放大。 你包含的每一个 token 都要先处理完,才会出现第一个输出 token。为了一个 20K token 切片就能回答的问题发 800K token,纯属浪费——更慢也更贵。
在超大上下文上推理会让思考账单翻倍。 一个读了 800K token 的思考模式模型往往也会想得更久,而那段推理是按输出价格计费的。廉价任务裹着巨型提示词,是预算静悄悄死掉的方式。
决策框架:
| 你的场景 | 需要的窗口 | 结论 |
|---|---|---|
| 基于已知语料的 FAQ 式问题 | 10K–50K | 用检索,别用 1M |
| 单文档不超过约 50 页 | 16K–64K | 1M 是杀鸡用牛刀 |
| 交叉引用的合同或申报文件(100–500 页) | 100K–500K | V4 Pro 的窗口帮得上忙 |
| 整个代码库、跨文件分析 | 500K–1M | 1M 正是为此而生 |
| 带工具历史的长程智能体会话 | 300K+ | 1M 正是为此而生 |
| 含图片和图表的扫描版 PDF | — | 仅文本模型;先 OCR |
经验法则:用能完整回答任务的最小上下文。 只有当工作流真的需要一次性看全所有内容时才动用完整的 1M——同时记住 V4 Pro 只支持文本,所以图片密集的 PDF 需要先过一道 OCR。
长上下文的成本工程:KV Cache
让 1M token 工作流变得负担得起的关键机制是:KV cache。 模型处理提示词时,会为每一个输入 token 计算 key-value 注意力状态。同样的前缀再发一次(同一个代码库、同一份合同、继续的对话),没有缓存的模型会把这一切全部重算。DeepSeek 的 KV cache 在服务端保存这些状态,复用的前缀只按原价的一小部分计费。
官方数字让这个杠杆一目了然:
| 费率 | 每 1M 输入 token |
|---|---|
| 缓存未命中 | $0.435 |
| 缓存命中 | $0.003625(约省 99%) |
| 输出 | $0.87 |
一个完整的算例。你加载一个 700K token 的代码库,对它跑十次分析查询:
| 步骤 | Token 数 | 费率 | 成本 |
|---|---|---|---|
| 首次加载(缓存未命中) | 700K | $0.435 / 1M | 约 $0.30 |
| 10 次后续查询(缓存命中) | 7M | $0.003625 / 1M | 约 $0.025 |
| 启用缓存的总成本 | 约 $0.33 | ||
| 同样 11 次调用、无缓存 | 7.7M | $0.435 / 1M | 约 $3.35 |
缓存让这个工作流便宜了大约 10 倍——而且你对着同一语料跑的查询越多,这个倍数只会越大。Artificial Analysis 的混合估算也印证了这一点:按现实中的 7:2:1 缓存命中/输入/输出配比,V4 Pro 的混合成本约为每 1M token $0.18——接近某些标价只有它零头的小模型的水平。约 99% 的缓存命中折扣,正是把「整段粘贴代码仓库」从烧钱习惯变成默认工作流的东西。
一个诚实的提醒:DeepSeek 官方定价页说明价格即将大幅上调。机制本身——缓存命中价格约为未命中的 1%——在重新定价后依然成立,但在投入生产前,请对照官方页面重新验证你的预算。
DeepSeek V4 Pro vs V4 Flash:同一窗口,不同引擎
V4 Pro 和 DeepSeek V4 Flash 都宣称 1M 上下文、384K 输出,所以上下文大小并不能区分它们。其他一切都不同:
| 维度 | V4 Pro | V4 Flash |
|---|---|---|
| 上下文 / 最大输出 | 1M / 384K | 1M / 384K |
| 架构 | MoE 1.6T / 49B 激活 | MoE 约 284B / 13B 激活 |
| 默认模式 | 思考 | 非思考 |
| 发布日期 | 2026-08-13 | 2026-04-24 |
| 输入价格 | $0.435 / 1M | $0.14 / 1M |
| 输出价格 | $0.87 / 1M | $0.28 / 1M |
| 并发数 | 500 | 2500 |
这不是「谁的上下文更大」的选择——而是**「这个上下文里该发生什么」**。当你需要旗舰级推理深度时用 V4 Pro:硬核跨文件 bug 分析、跨长合同找矛盾、在大语料上做多步智能体规划。当任务高并发、单次调用成本占主导时用 V4 Flash:便宜的首遍摘要、批量抽取、日常聊天——「够好、够快、够便宜」胜出,推理开销是负担而不是亮点。
如果两者都在你的技术栈里,常见做法是搭一条流水线:Flash 负责分流和预处理语料,V4 Pro 负责对幸存下来的切片做高风险的推理。想看更深入的正面对比,我们的 DeepSeek V4 Flash vs DeepSeek V4 Pro 对比 会按场景逐一拆解取舍。
旗舰级替代方案:GLM 5.2
如果你的长上下文工作核心是窗口内的推理质量,还有一个同样 1M token 的旗舰值得知道——而且在这里免费就能测。GLM 5.2 是 Zhipu AI 的旗舰:约 750B MoE 参数(约 40B 激活)、同样的 1M token 上下文窗口、MIT 开源,并且在独立排行榜顶端与 V4 Pro 并肩(Artificial Analysis Intelligence Index 51,V4 Pro 为 53)。
| 维度 | DeepSeek V4 Pro | GLM 5.2 |
|---|---|---|
| 上下文窗口 | 1M token | 1M token |
| 架构 | 1.6T / 49B 激活 | 约 750B / 约 40B 激活 |
| AA Intelligence Index | 53(第 2/104) | 51 |
| 输入价格 | $0.435 / 1M | 约 $1.40 / 1M |
| 输出价格 | $0.87 / 1M | 约 $4.40 / 1M |
| 缓存命中输入 | $0.003625 / 1M | 约 $0.26 / 1M |
| 速度 | 83.2 token/秒 | 158 token/秒 |
| 许可证 | MIT 开放权重 | MIT 开源 |
同一个 1M 窗口,不同的经济学和不同的速度。V4 Pro 赢在每 token 价格和缓存折扣;GLM 5.2 赢在生成速度和更低的单次缓存成本。哪个对你的工作负载更合适,规格表回答不了——你自己的提示词能回答。
在 glm5.app 的浏览器里打开 GLM 5.2——免费,无需 API key,把同一个长上下文提示词在两个模型上并排跑一遍。拿你的真实文档花十分钟,胜过任何基准测试表。
常见问题
DeepSeek V4 Pro 的 1M 上下文窗口相当于多少页?
按粗略的经验法则,1M token 约等于 750,000 个英文单词——按 Artificial Analysis 的框架约合 1,500 页 A4,或七到八部长篇小说。精确数字因语言和格式而异,因为 tokenization 并不是一个 token 对应一个词。
最大输出是多少,它与 1M 输入是什么关系?
最大输出是 384K token。输入和输出预算是分开的:你读起来像图书馆(进 1M)、写起来像一本书(出 384K)。思考模式下的推理轨迹按输出 token 计费,所以一次长思考调用会很快耗尽输出预算。
一次满 1M token 的调用要花多少钱?
一次满 1M token 输入,缓存未命中时约 $0.435;如果前缀已在缓存里则约 $0.0036(约省 99%)。加上按 $0.87/1M 计费的最大 384K 输出约 $0.33,所以一次满窗口、满输出的调用按标价约 $0.77。DeepSeek 已宣布大幅涨价,请到官方定价页确认当前费率。
DeepSeek V4 Pro 真的能记住 1M 窗口里的所有内容吗?
它能接受最多 1M token,但对于深埋在超长上下文中的信息,记忆质量可能下降。把关键指令放在开头或结尾附近,并在依赖它之前,先用自己的数据测试深中段检索。
1M 上下文能取代 RAG 吗?
当你的语料能装进窗口时,可以:你可以跳过 chunking、embedding 和检索拼接,而且 KV cache 让同一语料上的重复查询在输入侧便宜约 99%。当你的语料超过 1M token,或者包含扫描版/图片密集的 PDF(V4 Pro 仅文本)时,仍然需要检索或 OCR 步骤。
写在最后
DeepSeek V4 Pro 的上下文窗口确实大得惊人——进 1M、出 384K,背后还有一套让成本变得亲民的工程故事:复用前缀享受约 99% 的缓存命中折扣,加上现实负载下接近 $0.18/1M 的独立混合成本。它在整仓库评审、全文分析和长程智能体会话上能值回票价。只要记住:窗口是上限,不是默认。用能完整回答任务的最小上下文,在思考模式下盯着推理 token 的账单,并且因为 DeepSeek 已宣布涨价,上线前重新核对价格。
而当任务是在同一个 1M 窗口里做硬核推理——生成更快、旗舰免费可试——把提示词丢进 glm5.app 上的 GLM 5.2,亲自对比答案。想更深入理解大窗口的行为,我们的 GLM 5.2 上下文窗口指南 从 GLM 的角度覆盖了同一片领域。
By the GLM 5 Team. 最后更新于 2026 年 8 月。规格与价格反映发布时可公开获取的信息,可能会变;做生产预算前请对照官方厂商页面核实。
Sources
- DeepSeek Models & Pricing — DeepSeek V4 Pro 的官方模型 ID、上下文长度、输出上限与 token 定价。
- DeepSeek KV Cache Guide — 官方上下文缓存机制与缓存命中定价。
- DeepSeek Thinking Mode Guide — 官方思考/非思考模式切换与力度控制。
- DeepSeek-V4-Pro on Hugging Face — 官方模型卡:1.6T/49B MoE 架构、1M 上下文、MIT 许可证。
- Artificial Analysis: DeepSeek V4 Pro — 独立评测:Intelligence Index 53(第 2/104)、83.2 token/秒、TTFT 1.63 秒、冗长度与成本数据、1,500 页 A4 的框架,采集于 2026-08-13。
关于数字的说明:价格和模型版本变化很快——DeepSeek 官方已宣布大幅涨价——请把以上所有数字视为 2026-08-13 的快照,做预算前到上述来源核实。token 到字数的换算只是估算,不是厂商规格。

