如果你正在为高流量的 LLM 工作负载做预算,最难的往往不是选模型——而是搞清楚一个模型到底要花多少钱。服务商页面报价各不相同,「每百万 token」又掩盖了输入/输出拆分,而一个头条价格根本无法告诉你真实任务会开出怎样的账单。这篇文章就帮你把 DeepSeek V4 Flash 定价 一次性讲透:官方一手价格、第三方服务商在哪里出现分歧、面向真实任务的工作成本示例,以及与 GLM 5.2 和其他廉价模型坦诚的每 token 价格对比。
文中的数字取自 DeepSeek 官方定价文档,并对照独立价格追踪平台(Artificial Analysis、OpenRouter 及其他聚合平台)交叉核验,数据截至 2026 年 8 月。模型价格变动频繁,因此在确定生产预算之前,请以 DeepSeek 官方定价页面为准。本文由 GLM 5 Team 撰写,该团队每天都在运行对成本敏感的推理负载,所以下面的示例反映的是 token 账单在真实场景中如何累积,而非规格表上的照本宣科。
这篇文章解决什么问题
痛点很简单:光凭一个头条价格你根本无法规划支出。 在弄清它是输入价还是输出价、按多少 token 计费、来自哪家服务商、以及如何对应到你的流量之前,「$0.14」这个数字毫无意义。下面你会看到锁定的官方一手价格、服务商之间的价差,以及可以套用到自己业务量的计算公式——这样你就能判断 DeepSeek V4 Flash 是不是最便宜的选择,或者当质量进入考量时,像 GLM 5.2 这样更强的模型是否更划算。
DeepSeek V4 Flash:官方一手定价
DeepSeek V4 Flash 是 DeepSeek V4 家族中的高性价比型号,于 2026-04-24 发布,采用 MIT 开放权重许可证。它是一款专家混合(MoE)模型,总参数量 284B,每个 token 约激活 13B 参数,主打日常任务的速度与低成本——编程助手、聊天、高容量智能体任务——而非最深的推理能力(该旗舰角色由它的兄弟型号 DeepSeek V4 Pro 承担)。
根据 DeepSeek 官方 API 定价,deepseek-v4-flash 的一手价格为:
| 方向 | 每 1M token 价格 |
|---|---|
| 输入 | $0.14 |
| 输出 | $0.28 |
输入与输出 1:2 的比价在这一类模型中属于标准配置,它对预算规划很重要:输出 token 的成本是输入的两倍,所以冗长的回复比长提示词更快推高账单。DeepSeek 的定价页面还注明可能适用峰谷计价规则,一旦此类政策生效,高峰期价格可能高于基础费率——在锁定预算预测之前,请务必在官方 DeepSeek 定价页面确认当前条款。
服务商差异(报价之前务必先读这一节)
DeepSeek V4 Flash 是开放权重模型,因此第三方推理服务商也在托管它——而它们的价格与 DeepSeek 自家 API 并不相同。例如 DeepInfra 的挂牌价约为 $0.10 / 1M 输入 和 $0.20 / 1M 输出,比一手价格更便宜。其他聚合平台则根据吞吐保障、地区与上下文长度处理方式,定价与一手价持平或更高。
两条规则让你避免踩坑:
- 注明来源。「$0.10 输入」只在特定服务商上成立;它不是「DeepSeek V4 Flash 的价格」。报数字时,请带上服务商名字。
- 给整个请求定价,而不是最便宜的那一半。 某家服务商在输入上压价、但输出不压价,对输出密集的流量反而可能更贵。请按你真实的输入:输出比例来比较。
要获取实时的跨服务商快照,Artificial Analysis 和 OpenRouter 这类独立追踪平台会并排列出各家服务商的当前费率。
成本示例:一个真实任务实际要花多少钱
头条价格一旦动手算账就会变得具体。以下所有数字均使用一手费率(输入 $0.14 / 输出 $0.28,每 1M token)。
示例 1 —— 输入 1M token、输出 1M token 的任务。 输入:1M × $0.14 = $0.14。输出:1M × $0.28 = $0.28。总计:处理两百万 token 仅需 $0.42。即便双向各满一百万 token,花费也抵不上一杯咖啡。
示例 2 —— 以读取为主的批处理(摘要 / 抽取)。 假设你一天处理 50M 输入 token、生成 5M 输出 token。输入:50 × $0.14 = $7.00。输出:5 × $0.28 = $1.40。总计:$8.40/天,也就是稳定流水线大约 $252/月。
示例 3 —— 聊天/智能体负载(输入输出均衡)。 10 万次请求,每次约 2K 输入、约 500 输出 token。输入:200M × $0.14 = $28.00。输出:50M × $0.28 = $14.00。总计:10 万次请求 $42.00。若放在 DeepInfra(约 $0.10/$0.20)这类服务商上,同样的任务约为 $20 + $10 = $30——节省约 29%,这正是规模上服务商选择如此重要的原因。
结论:DeepSeek V4 Flash 确实便宜,而推动账单的杠杆是输出量——不是头条输入价。限制 max_tokens、精简 system prompt,成本还会进一步下降。
DeepSeek V4 Flash 对比 GLM 5.2 与其他廉价模型
每 token 价格只讲了故事的一半。另一半是你为了真正完成一个任务要花掉多少 token、重试多少次。一个更便宜的模型在困难编码任务上要跑两遍,可能比一个一次做对的更贵模型花钱更多。下面是定价本身的坦诚对比:
| 模型 | 输入 / 1M | 输出 / 1M | 定位 / 最适合 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.28 | 最便宜档位;高容量、低延迟的日常任务 |
| DeepSeek V4 Flash(DeepInfra) | ~$0.10 | ~$0.20 | 服务商专属;更便宜,需核实当前费率 |
| GLM 5.2 | ~$1.40 | ~$4.40 | 旗舰级编程/智能体深度,前沿水准的价格 |
| DeepSeek V4 Pro | 更高(旗舰档) | 更高 | 深度推理兄弟型号;以官方页面为准 |
GLM 5.2 每输入 token 的价格大约是 DeepSeek V4 Flash 的 10 倍——而这正是对比的意义所在,不是对任何一方的贬低。它们本就处于不同的定位档位:
- **当原始成本与速度占主导时选 DeepSeek V4 Flash:**高容量摘要、分类、廉价聊天,以及「够好、够快、够便宜」就赢的智能体循环。以 $0.14/$0.28 的价格,它是你能调用的成本最低的可用模型之一。
- **当质量与智能体深度是约束条件、而不是 token 价格时选 GLM 5.2。**GLM 5.2 是智谱 AI 的旗舰——约 750B 总参数的 MoE、约 40B 激活参数、1M token 上下文窗口、MIT 开源、编程与智能体表现强劲。在一个困难的 SWE-bench 式任务或多步工具调用智能体上,即使每 token 单价更高,一次做对的模型往往才是更便宜的结果。如果你的负载由深度主导而非体量主导,在 glm5.app 上试试 GLM 5.2,按结果而不是按价目表来定价。完整套餐详见 GLM 5.2 定价页面。
最可靠的决策方式是拿你自己的提示词在两个模型上都跑一遍,比较完成任务的总体成本(cost-to-done),而不是比较头条费率。
如何判断一个模型的真实价格
评估任何廉价模型时,请从四个维度打分,而不是只看一个:
- **拆分费率,而非头条价。**始终把输入和输出分开看;1:2 或 1:4 的比价会改变输出密集任务的算法。
- **服务商与地区。**开放权重模型因托管方而异。报价前先锁定服务商。
- **完成任务所需 token 数。**统计重试与失败轮次。在你的任务上尝试次数更少的模型,整体可能更便宜。
- **隐藏乘数。**高峰期定价、最低上下文计费、缓存行为都可能把有效费率推到标价之上。
**边界情况与局限:**这里的数字是 2026 年 8 月的一手费率,随时可能变化;峰谷政策与服务商专属费率会改变有效成本;而且 DeepSeek V4 Flash 默认不推理,所以推理密集的任务可能消耗更多输出 token(或需要换 Pro),从而缩小它与更强模型之间的差距。在确定预算前,请对照所列官方来源逐一核实每个数字。
结论
把各层拆开之后,DeepSeek V4 Flash 的定价其实一目了然:一手价输入 $0.14 / 输出 $0.28(每 1M token),部分第三方服务商(如 DeepInfra 约 $0.10/$0.20)更便宜——但务必标注为服务商专属价格。一个完整的 1M 进 / 1M 出任务约 $0.42,10 万次请求的聊天负载约 $42。这使得它成为高容量、成本敏感型工作的最佳每 token 性价比选项之一。
但最便宜的价目表并不总是最便宜的结果。当你的负载依赖编程深度或智能体推理时,像 GLM 5.2 这样的旗舰模型往往在完成任务成本上胜出,尽管每 token 单价更高。把两者都放到你的真实提示词上:在 glm5.app 免费测试 GLM 5.2,并查看 GLM 5.2 定价页面,看看对你的技术栈而言价值落在哪里。
Sources
- DeepSeek Models & Pricing —
deepseek-v4-flash的官方一手 token 定价、模型 ID、上下文长度与峰谷计费说明。 - DeepSeek Your First API Call — 官方 base URL、受支持的模型 ID 与 OpenAI 格式请求示例。
- DeepSeek Chat Completions API — 官方请求结构、模型 ID 与 token 计账行为。
- DeepSeek Platform — 官方账号、计费与 API key 管理。
- DeepSeek-AI on Hugging Face — 官方开放权重模型卡、许可证(MIT)与架构细节。
- Artificial Analysis — DeepSeek V4 Flash — 独立基准权威,跨服务商价格/性能追踪。
- OpenRouter — DeepSeek V4 Flash — 独立的服务商价格与可用性快照。
- DeepInfra Pricing — 用于服务商差异对比的第三方服务商费率示例。
- GLM 5.2 pricing — 官方 GLM 5.2 套餐与每 token 定价,用于旗舰对比。
- Zhipu AI — GLM 5.2 的官方开发者,即对比中引用的旗舰模型。




