快速回答: GLM 5.3 Flash 在 OpenRouter 上的模型 ID 是 z-ai/glm-5.3-flash——一个多模态模型(文本 + 图片 + 视频输入,文本输出),主要端点上有 1,048,576 token 上下文窗口和 131,072 token 最大输出。十家 provider 在服务它,价格从 $0.075/$0.25(Z.AI、Novita、GMICloud,限时 5 折)到 $0.15/$0.50(标价)不等。通过标准的 OpenAI 兼容端点 https://openrouter.ai/api/v1/chat/completions 调用。务必锁定 provider——各家的上下文上限从 262K 到 1.31M 不等。
最后那句话正是这篇文章存在的理由。在一个单 provider 模型上,"调用模型 ID" 就是全部集成工作。而在一个价格差 2 倍、上下文上限差 5 倍的十 provider 模型上,默认路由会在不同日子悄悄给你不同的模型配置——而你会在凌晨三点以间歇性截断报错的形式发现它,而不是在账单条目里。
以下内容来自 OpenRouter 的模型页及其公开 endpoints API,查询于 2026 年 8 月 27 日。provider 表格完整复现而非概括,因为差异本身就是重点。
这篇文章解决什么问题
痛点:OpenRouter 把 provider 抽象掉了,而对这个模型来说这层抽象是漏的。 同一个模型 ID 可能把你路由到 262K 的上下文窗口或 1.31M 的、$0.075 的费率或 $0.15 的、131K 的最大输出或 1.18M 的。这些从模型 ID 上一点都看不出来。
读完你会拿到完整的 provider 表、可用的 curl 和 Python 调用、让行为变确定的 provider 锁定语法,以及需要规避的具体路由陷阱。
模型卡
| 字段 | 值 |
|---|---|
| 模型 ID | z-ai/glm-5.3-flash |
| 显示名 | Z.ai: GLM 5.3 Flash |
| 发布 | 2026 年 8 月 26 日 |
| 前身 | stealth/ox-alpha(2026 年 8 月 20 日起的匿名预览) |
| 上下文窗口 | 1,048,576 token |
| 最大输出 | 131,072 token(因 provider 而异,见下) |
| 模态 | 文本 + 图片 + 视频 → 文本 |
| Provider 数 | 10 |
OpenRouter 自己的描述:GLM-5.3-Flash 是 Z.ai 的原生多模态模型,适合高效编程与长周期智能体任务,其稀疏与线性混合注意力架构在降低计算开销的同时保持准确的长上下文行为。
Provider 表——集成前请先读这个
直接来自 OpenRouter endpoints API,2026 年 8 月 27 日:
| Provider | 输入 / 1M | 输出 / 1M | 缓存读 | 上下文 | 最大输出 | 量化 |
|---|---|---|---|---|---|---|
| Z.AI | $0.075 | $0.25 | $0.015 | 1,048,576 | 131,072 | fp8 |
| Novita | $0.075 | $0.25 | $0.015 | 1,048,576 | 131,072 | fp8 |
| GMICloud | $0.075 | $0.25 | $0.015 | 1,048,576 | 943,718 | fp8 |
| Venice | $0.09375 | $0.3125 | $0.01875 | 1,048,576 | 131,072 | unknown |
| Modal | $0.14999 | $0.49995 | $0.03 | 1,048,576 | 943,718 | fp8 |
| Parasail | $0.15 | $0.50 | — | 1,048,576 | 943,718 | fp8 |
| DeepInfra | $0.15 | $0.50 | $0.03 | 1,048,576 | 943,718 | fp8 |
| Baseten | $0.15 | $0.50 | $0.03 | 1,048,576 | 131,072 | fp8 |
| Cloudflare | $0.15 | $0.50 | $0.03 | 1,310,720 | 1,179,648 | unknown |
| Io Net | $0.15 | $0.50 | $0.03 | 262,144 | 131,072 | fp8 |
三个陷阱,按会让你损失多少排序:
陷阱 1 —— 那个 262K 的 provider。 Io Net 提供的上下文只有宣称值的四分之一。一个长上下文请求路由到那里会失败,同样的请求路由到 Z.AI 则成功。除非你锁定 provider,否则这就是一个间歇性、极难复现的 bug。
陷阱 2 —— 2 倍价差。 完全相同的 MIT 许可权重,输入从 $0.075 到 $0.15。默认路由不会为你的钱包做优化。
陷阱 3 —— 缺失的缓存费率。 Parasail 没有公布缓存读价格。如果你的架构依赖那 5 倍的缓存输入折扣,路由到那里会悄悄抹掉你的主要成本优化手段。
$0.075 / $0.25 这一档反映的是限时 5 折。未打折的标价是 $0.15 / $0.50 / $0.03,也是十家里已有六家在收的价——完整的成本算例见定价拆解。
用 curl 调用
标准的 OpenAI 兼容请求:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3-flash",
"messages": [
{"role": "user", "content": "Read this repo diff and write the migration notes."}
]
}'
锁定 provider(请务必做)
OpenRouter 的 provider 块让路由变得确定。这是整个集成里最有价值的一行:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3-flash",
"provider": { "order": ["Z.AI", "Novita"], "allow_fallbacks": false },
"messages": [{"role": "user", "content": "Summarise this 400-page contract."}]
}'
allow_fallbacks: false 意味着你要么拿到指定的 provider,要么拿到一个错误——这正是长上下文任务需要的,因为静默回落到一个 262K 端点比一次干脆的失败更糟。对任何 provider 都无所谓的延迟敏感流量,去掉这个标志、允许回落即可。
Python
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key=os.environ["OPENROUTER_API_KEY"],
)
resp = client.chat.completions.create(
model="z-ai/glm-5.3-flash",
messages=[{"role": "user", "content": "Trace this flaky test to its root cause."}],
max_tokens=8192,
extra_body={"provider": {"order": ["Z.AI"], "allow_fallbacks": False}},
)
print(resp.choices[0].message.content)
两点说明。显式设置 max_tokens——各 provider 的上限在 131,072 到 1,179,648 之间浮动,而在一个慢模型上发一个无上限请求,是一种代价昂贵的学习方式。另外由于 GLM 5.3 Flash 实测约 50 输出 token/秒,任何面向用户的场景都请用流式;这个模型的首 token 时间(约 1.47 秒)不错,吞吐不行。
发送图片和视频
模型是原生多模态的,所以视觉输入使用标准的 OpenAI content-parts 格式:
resp = client.chat.completions.create(
model="z-ai/glm-5.3-flash",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "This dropdown renders behind the modal. What CSS is wrong?"},
{"type": "image_url", "image_url": {"url": "data:image/png;base64,..."}},
],
}],
)
这正是它相对同价位纯文本对手真正拉开差距的地方。Z.ai 报告 OfficeQA Pro 得分 62.4——一个文档与视觉推理基准——并宣称领先 Claude Opus 4.8,这也是 Flash 这一档唯一宣称直接胜过旗舰的基准。如果你想在配置 API key 之前就用自己的截图验证一下,可以在浏览器里跑 GLM 5.3 Flash,直接把图贴进去。
走 OpenRouter 还是直连
多数集成指南跳过的差异点: 对这个模型来说,OpenRouter 并不自动是正确的入口。
用 OpenRouter,当你想要一把 key 打通多个模型、自动故障转移、或者不改代码就能 A/B 不同 provider。代价是上面描述的路由方差,外加 OpenRouter 约 5.5% 的充值手续费。
直连 Z.ai,当 GLM 5.3 Flash 是你的主力模型。你拿到第一方费率、不用赌 provider 就能拿到缓存输入折扣、可以用 GLM Coding Plan(Flash 在 Lite/Pro/Max 三档中的可用配额约为 GLM-5.3 的 3 倍),还少一跳延迟。
自部署,只在你需要数据主权、离网运行或微调时。MIT 许可的权重让这件事合法且免费;约 328 GB 的 FP8 体积让它昂贵。在每百万输入 token $0.15 的价格下,盈亏平衡所需的用量非常高。
无论选哪个入口,第一步都一样:把一个真实任务丢给模型。打开一个 GLM 5.3 Flash 会话,或者从你现有的框架里调用 glm-5.3-flash,然后和你今天在跑的东西 diff 一下输出。
常见问题
GLM 5.3 Flash 在 OpenRouter 上的模型 ID 是什么?
z-ai/glm-5.3-flash。它取代了匿名预览 ID stealth/ox-alpha(详见 Ox Alpha vs GLM 5.3 Flash),那是同一个模型自 2026 年 8 月 20 日起以代号运行的版本。
为什么同一个模型各家 provider 价格不同? 十家里有三家(Z.AI、Novita、GMICloud)在执行限时 5 折的 $0.075/$0.25;其余按 $0.15/$0.50 标价收费;Venice 居中。权重是完全相同的。
我该用哪家 provider?
想要折扣价、完整 1M 上下文并且有公布的缓存读价格,选 Z.AI 或 Novita。长上下文任务请避开 Io Net——它只提供 262,144 token。如果上下文长度重要,永远用 provider.order 锁定并设置 allow_fallbacks: false。
支持工具调用和结构化输出吗? 支持——它通过 OpenRouter 标准的 OpenAI 兼容接口服务,且被 Z.ai 定位为长周期智能体任务模型。由于支持的参数可能因端点而异,请在 OpenRouter 模型页确认你所选 provider 的具体参数列表。
OpenRouter 上的 1M 上下文是真的吗? 在多数 provider 上是真的——1,048,576 token。Cloudflare 列的是 1,310,720,Io Net 只有 262,144。没有任何公开基准测量过窗口顶端的检索准确率,所以请把这个上限当作规格,并在你的实际工作长度上实测。
来源
- GLM 5.3 Flash on OpenRouter——模型 ID、描述、发布日期、provider 列表、促销折扣。
- OpenRouter endpoints API(z-ai/glm-5.3-flash)——十家 provider 的价格、上下文、最大输出与量化表,2026 年 8 月 27 日查询。
- OpenRouter API 文档——provider 路由、
allow_fallbacks与 OpenAI 兼容请求格式。 - zai-org/GLM-5.3-Flash — Hugging Face——模型架构、MIT 许可与跑分数据。
- Artificial Analysis — GLM-5.3-Flash——独立吞吐与 TTFT 实测。
Provider 价格与端点能力核对于 2026 年 8 月 27 日,且变动频繁。依赖任何特定 provider 的上下文上限之前,请重新查询 endpoints API。




