快速回答: GLM 5.3 Flash 的标价是每 100 万输入 token $0.15、缓存输入 $0.03、输出 $0.50。你到处看到的 $0.075 / $0.25 是标价打了限时 5 折的结果,目前只有 Z.AI 自家端点、Novita 和 GMICloud 在执行。另外六家 provider 已经在收全价。按 $0.15 / $0.50 做预算,把折扣当作意外之喜,而不是基准线。
这篇文章存在的理由,是要拆掉下面这个陷阱:你搜 "GLM 5.3 Flash cost",找到 $0.075,据此做了预测,三个月后促销窗口关闭——代码没改、也没有任何预警,你的推理账单直接翻倍。这不是假设,这就是限时折扣按设计会造成的结果。
下面的数字来自 Z.ai 公布的 API 费率,以及 OpenRouter 的公开 endpoints API(它会暴露某个模型下每一家 provider 的实时单价)。我们在 2026 年 8 月 27 日查询了该 API,并完整复现十家 provider 的表格而不是只给一个头条数字——因为"GLM 5.3 Flash 的价格"根本不是一个数字,它是一个区间。我们每天在跑成本敏感的推理负载,所以下面的算例是按 token 账单真实累积的方式写的,不是规格表算术。
这篇文章解决什么问题
痛点:你没法用一个头条价推算支出。 具体到 GLM 5.3 Flash,有三件事会让朴素计算失效——一个在多数报道里没被标注为促销的折扣、同一份权重在不同 provider 之间 2 倍的价差,以及一个缓存输入费率:用了它,长上下文任务的经济性会变一个数量级;不用它,它完全不存在。
读完你会拿到标价、折扣价、provider 全表、三个真实成本场景,以及一个多数定价页完全省略的缓存命中算法。
标价(用这个)
Z.ai 公布的 glm-5.3-flash API 费率:
| 方向 | 每 100 万 token 价格 |
|---|---|
| 输入 | $0.15 |
| 缓存输入 | $0.03 |
| 输出 | $0.50 |
有两点在同档模型里很突出。第一,输入输出比是 1:3.3,比廉价模型常见的 1:2 更陡。输出量才是这里推高账单的杠杆——限制 max_tokens、抑制模型说废话,比缩短 prompt 更划算。
第二,缓存输入费率比新鲜输入便宜 5 倍。在一个拥有百万 token 上下文窗口的模型上,这不是零头细节,而是代码库级、文档级任务的全部胜负手。下面详述。
折扣——以及到底谁在执行
OpenRouter 的模型页显示 GLM 5.3 Flash 已应用 5 折折扣,这就是流传甚广的 $0.075 / $0.25 / $0.015 的来源。这个折扣并非全网通用。下面是 2026 年 8 月 27 日从 OpenRouter endpoints API 直接拉取的、服务该模型的每一家 provider:
| Provider | 输入 / 1M | 输出 / 1M | 缓存读 / 1M | 上下文 | 最大输出 |
|---|---|---|---|---|---|
| Z.AI | $0.075 | $0.25 | $0.015 | 1,048,576 | 131,072 |
| Novita | $0.075 | $0.25 | $0.015 | 1,048,576 | 131,072 |
| GMICloud | $0.075 | $0.25 | $0.015 | 1,048,576 | 943,718 |
| Venice | $0.09375 | $0.3125 | $0.01875 | 1,048,576 | 131,072 |
| Modal | $0.14999 | $0.49995 | $0.03 | 1,048,576 | 943,718 |
| Parasail | $0.15 | $0.50 | — | 1,048,576 | 943,718 |
| DeepInfra | $0.15 | $0.50 | $0.03 | 1,048,576 | 943,718 |
| Baseten | $0.15 | $0.50 | $0.03 | 1,048,576 | 131,072 |
| Cloudflare | $0.15 | $0.50 | $0.03 | 1,310,720 | 1,179,648 |
| Io Net | $0.15 | $0.50 | $0.03 | 262,144 | 131,072 |
这张表请看两遍,因为它包含三个彼此独立的决策。
同一份权重,价差 2 倍。 表里每个 fp8 端点服务的都是同一个 MIT 许可的模型。如果你的路由按可用性而不是价格挑选,你就在随机地多付一倍钱。
上下文上限并不统一。 Io Net 提供 262,144 token——只有宣称窗口的四分之一。如果你按"最便宜可用"路由长上下文任务并落到 Io Net,你拿到的是截断报错,不是账单意外。而 Cloudflare 反过来标的是 1,310,720。
最大输出相差 9 倍。 Z.AI 和 Baseten 是 131,072;DeepInfra、Parasail、GMICloud、Modal 是 943,718;Cloudflare 是 1,179,648。对长文本生成任务,这决定了一次请求能否跑完,还是需要续写逻辑。
独立机构 Artificial Analysis 按 7:2:1 的缓存/输入/输出比例,为 GLM 5.3 Flash 给出每 100 万 token $0.10 的混合价。这是一个好的跨模型比价数字,和一个坏的预算数字——除非你的流量真的有 70% 命中缓存。
真实成本算例
以下全部按**标价(输入 $0.15 / 输出 $0.50)**计算,因为这才是你该拿去做预测的价。如果你的 provider 折扣还在、而你也接受这个风险,把结果减半即可。
算例 1 — 一次编程智能体会话。 一个像样的智能体任务:约 12 万输入 token(代码库上下文、工具返回、多轮迭代)和约 1.5 万输出 token。 输入:0.12M × $0.15 = $0.018。输出:0.015M × $0.50 = $0.0075。合计约每次任务 $0.026。 差不多一美元能跑 38 次有分量的智能体任务。
算例 2 — 高并发聊天。 10 万次请求,每次约 2K 输入、500 输出。 输入:200M × $0.15 = $30.00。输出:50M × $0.50 = $25.00。每 10 万次请求合计 $55.00。 注意:输出只占 20% 的 token,却占了 45% 的账单——这就是 1:3.3 那个比例在复利。
算例 3 — 长上下文文档处理。 500 份文档,每份约 40 万输入 token、4K 输出。 输入:200M × $0.15 = $30.00。输出:2M × $0.50 = $1.00。合计 $31.00。 很便宜——直到你发现自己为一段共用的 system prompt 按全价付了 500 遍。
真正省钱的地方是缓存费率
算例 3 值得用缓存重算一遍。假设每次请求的输入中有 60% 是稳定前缀——system prompt、schema、代码规范、一组固定的参考文档:
- 缓存部分:120M token × $0.03 = $3.60
- 新鲜部分:80M token × $0.15 = $12.00
- 输出不变:$1.00
- 新合计:$16.60 —— 降幅 46%,模型和质量都没有任何改变。
这是 GLM 5.3 Flash 上可用的最高杠杆优化,而且它是结构性的而非取巧:把稳定内容放在最前面,并保证请求之间逐字节一致。注意 Parasail 完全没有公布缓存读费率,所以缓存密集型任务不应该路由到那里。如果你想在动手接入之前先看看自己这套 prompt 形态要花多少钱,可以在 glm5.app 上跑一个 GLM 5.3 Flash 会话,用一个贴近真实的 prompt 观察 token 计数。
这个价格横向怎么看
Z.ai 自己主推的对比是和上一代比:GLM 5.3 Flash 据称以约十分之一的价格在各项基准和真实工作负载上超过 GLM-5.2。这是本次发布中最强的一条主张,而且是同家族、同方法学的对比,比跨厂商图表更可信。
对上那个显而易见的开源对手,DeepSeek V4 Flash 标价输入 $0.14 / 输出 $0.28——输出便宜一大截,但在 Artificial Analysis 的混合口径上更贵(每 100 万 $0.23 对 $0.10),因为 DeepSeek 的缓存折扣没那么激进。我们在 GLM 5.3 Flash vs DeepSeek V4 Flash 里做了完整对比。哪个对你更便宜,完全取决于你的缓存命中率和输入输出比。这里没有通用答案,任何给你一个通用答案的文章都是在猜。
值得记住的差异点: 多数 GLM 5.3 Flash 定价内容引一个折扣数字就结束了。真正决定你账单的三件事是:(1)折扣是临时的,(2)十家 provider 里已有六家不认这个折扣,(3)对任何有稳定前缀的负载,5 倍的缓存价差比货比三家更重要。按这个顺序去优化。
Coding Plan 还是按 token 付费
如果你的用量是"一个开发者加一个 IDE"而不是"一个服务加一堆流量",GLM Coding Plan 会改变这道算术题。GLM 5.3 Flash 在 Lite、Pro、Max 三档都可用,且在同一套餐下可用配额约为 GLM-5.3 的 3 倍。对稳定的日常编程使用,订阅档通常比计量 token 便宜;对突发或程序化流量,按量付费胜出,因为你不必为闲置容量买单。
判断规则很简单:如果你能把月度 token 用量预测在 2 倍误差以内,就把两种都算一遍再选。如果不能,先走计量——等你手上有一个月的真实数据,随时可以转套餐。
无论走哪条路,最便宜的验证方式都是免费的:在 glm5.app 上跑一个 GLM 5.3 Flash 会话,用一个形似你真实流量的任务,数一数它实际烧了多少 token,再把这个数字代进上面的算术,然后再去决定套餐或预测。
常见问题
GLM 5.3 Flash 免费吗? 已经不免费了。它在 OpenRouter 上以代号 Ox Alpha 预览的那一周是免费的。今天在所有托管端点上都收费。权重在开源意义上免费——Hugging Face 上的 MIT 许可——但自部署意味着提供约 328 GB 的显存,这在任何实际意义上都不算免费。
为什么同一个模型我看到 $0.075 和 $0.15 两个价? $0.15 是标价;$0.075 是限时 5 折,目前由 Z.AI、Novita 和 GMICloud 执行。两个都是真的,其中一个会消失。
哪家 provider 最便宜? 截至 2026 年 8 月 27 日:Z.AI、Novita、GMICloud 并列 $0.075 / $0.25。但路由前先看上下文上限——GMICloud 的最大输出是 943,718 而 Z.AI 是 131,072,Io Net 更是只提供 262K 上下文。
缓存输入费率怎么生效? 重复的前缀内容按每 100 万 $0.03 计费而不是 $0.15,便宜 5 倍。它作用于 prompt 中稳定且逐字节一致的开头部分。把固定内容放前面、可变内容放后面,可以最大化命中率。
它比 DeepSeek V4 Flash 便宜吗? 按标价的输出 token 算,不便宜($0.50 对 $0.28)。按 Artificial Analysis 的 7:2:1 混合口径算,便宜($0.10 对 $0.23)。答案会随你的缓存命中率反转,所以请算你自己的数,别信任何一个头条。
来源
- GLM 5.3 Flash on OpenRouter——模型页,展示 5 折促销与 provider 列表。
- OpenRouter endpoints API(z-ai/glm-5.3-flash)——十家 provider 的价格、上下文与最大输出表,2026 年 8 月 27 日查询。
- zai-org/GLM-5.3-Flash — Hugging Face 模型卡——MIT 许可、模型体积,以及"十分之一 GLM-5.2 价格"的主张。
- Artificial Analysis — GLM-5.3-Flash——独立混合价(每 100 万 $0.10)与性能实测。
- DeepSeek API 定价——DeepSeek V4 Flash 对照所用的第一方费率。
价格于 2026 年 8 月 27 日核对。促销折扣可能随时结束,provider 费率变动频繁——敲定预算前请以 provider 自己的页面为准。




