官方定价
$0.15
每百万输入 token
测算 GLM 5.3 Flash 成本请以此为准,别按促销价算。
Z.ai 在 GLM 5 家族中的高效档位:总参数 320B、激活 18B 的混合专家模型,支持文本、图像与视频输入,100 万 token 上下文,权重以 MIT 协议开源。
GLM 5.3 Flash 于 2026 年 8 月 26 日发布,此前它已在 OpenRouter 上以隐匿模型 Ox Alpha 的身份运行了六天。
每个 token 只激活 288 个专家中的 8 个:显存吃 320B,算力只按 18B 算。
视觉能力来自 30T token 的预训练语料,而不是事后加装的视觉编码器。
Artificial Analysis 实测输出 50.2 token/秒,低于同档位 67 t/s 的中位数。
架构、权重与许可信息来自 Hugging Face 模型卡和 zai-org/GLM-5 仓库。
模型卡
MoE,45 层,288 选 8 个专家。
算力开销相当于 18B 稠密模型。
Io Net 上限 262,144,Cloudflare 为 1,310,720。
也有服务商标注可达 1,179,648。
多模态输入,文本输出。
权重与许可
可商用、可再分发,无门槛限制。
另有 -BF16 版本与 ModelScope 镜像。
没有独立仓库;GLM-5 采用 Apache-2.0。
需要多机多卡,单台工作站跑不动。
另有 TokenSpeed、KTransformers 与社区 GGUF。
数据来自模型卡与 OpenRouter endpoints API,2026 年 8 月。
价格 / 04
Z.ai 官方定价为每百万 token 输入 $0.15、输出 $0.50。各处引用的 $0.075 / $0.25 是限时 5 折的上线优惠价。
官方定价
$0.15
测算 GLM 5.3 Flash 成本请以此为准,别按促销价算。
官方定价
$0.50
1:3.3 的陡峭比例,先把输出长度压下来。
官方定价
$0.03
只有新增输入的五分之一,长上下文正是靠它才划算。
第三方测算
$0.10
Artificial Analysis 按缓存/输入/输出 7:2:1 的比例估算。
基准测试 / 05
Z.ai 自己发表格、自己挑对比对象。与 GLM 5.2 的差距以及 Artificial Analysis 的数据经得起推敲。
Z.ai 公布
GPT-5.6 Terra 为 87.4;任务越难,差距越明显。
Z.ai 公布
同一家族、同一套方法,价格只有十分之一。AutomationBench 为 48.8 对 26.2。
Z.ai 公布
文档与视觉推理,官方称领先 Opus 4.8。
Artificial Analysis
57
第三方实测;同类开源权重模型的中位数约为 27。
能力 / 06
面向 Agent 框架设计:可控推理强度、工具调用、结构化输出,以及百万 token 窗口上的流式响应。
默认开启,推理强度可按需调节。
支持工具与工具选择;每个动作仍需你的应用自行校验。
指定响应格式即可拿到可直接解析的 JSON。
首 token 1.47 秒优于中位数,但吞吐量并不占优。
可以把截图、示意图或屏幕录制随提示词一起贴进来。
$0.03 的缓存输入价,让后续轮次一直很便宜。
对比 / 07
两者都是前沿家族里以 MIT 权重发布的低价档位,差异集中在模态、推理与硬件门槛上。
Z.ai
混合 KDA 加 NoPE 稀疏 MLA 注意力。
原生多模态。
输出上限因服务商而异。
上线折扣之前的价格。
虽然是 MIT,但要多机多卡。
DeepSeek
默认不做推理。
截图必须先转成文字。
可用的回复额度大得多。
一方供给,1:2 的比例更平缓。
体量更小,部署成本更低。
两者都在 glm5.app 的模型列表里,同一条提示词可以分别跑一遍。
发布时间线 / 08
先以匿名隐匿模型运行六天,随后完整开源权重正式发布。
`stealth/ox-alpha` 出现在 OpenRouter,未标注提供方,按 token 免费。
用量前五全是 Agent 编程工具,OpenCode 直接免费提供。
Z.ai 确认它就是 Ox Alpha;模型卡、MIT 权重与价格同时公开。
使用基于 SGLang 改造的自研引擎,据称提速约 3 倍,芯片厂商未公开。
`zai-org/GLM-5.3-Flash`,另有 BF16 版本与 ModelScope 镜像,没有 GitHub 仓库。
价格看 OpenRouter,量化看 Hugging Face;想找实测反馈,Reddit 上仍要搜 Ox Alpha。
适合谁 / 09
那些为「本来不需要旗舰深度」的活儿付着旗舰价的团队——以及它并不适合的场景。
工具调用只花 GLM 5.3 十分之一的 token 单价,长 Agent 循环才跑得起。
百万 token 窗口能把整个代码库放进上下文,跨文件提问不必再做检索。
错乱的布局、复现过程录屏、画成图的数据结构。
可在 glm5.app 对话里与 DeepSeek V4 Flash、Qwen 直接对比。
MIT 权重和 vLLM 支持都是真的,但 FP8 的 328 GB 单机装不下。
每秒约 50 个输出 token,落后于同价位的多数模型。
三条路径:浏览器里免费对话、调用 glm5.app 的 API,或在自己的硬件上跑 MIT 权重。
在对话里选择 GLM 5.3 Flash 并上传截图。新账号可获赠免费额度。
向 `https://glm5.app/api/v1` 发送 OpenAI 兼容请求,模型 ID 填 `glm-5.3-flash`。
拉取 `zai-org/GLM-5.3-Flash`,用 SGLang 或 vLLM 部署,FP8 约 328 GB。
Integration specimen
OpenAI 兼容的 Chat Completions 接口。在 `https://glm5.app/api/v1` 使用模型 ID `glm-5.3-flash`。
打开 API 文档curl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'关于 Ox Alpha、价格、基准测试、参数量、Hugging Face、vLLM、DGX Spark 以及 DeepSeek V4 Flash。
是的——它从 2026 年 8 月 20 日起以 `stealth/ox-alpha` 的名义运行了六天。已保存的 Ox Alpha 对话会自动映射过来。
不是,两者属于不同档位,价格差约 10 倍。Flash 是 320B-A18B 的多模态模型,GLM 5.3 则是文本旗舰。
Z.ai 定价为每百万 token 输入 $0.15、缓存 $0.03、输出 $0.50。被广泛引用的 $0.075 / $0.25 是限时 5 折的上线优惠。
Ox Alpha 预览期免费,现在按量计费。你仍可以在 glm5.app 的对话里免费试用。
总参数 320B,每个 token 激活 18B,45 层从 288 个专家中路由 8 个。FP8 checkpoint 约 328 GB。
权重以 MIT 协议发布在 Hugging Face 的 `zai-org/GLM-5.3-Flash`。没有独立 GitHub 仓库,相关脚本在 `zai-org/GLM-5` 里。
vLLM、SGLang、TokenSpeed 和 KTransformers 都支持。328 GB 装不进单台 DGX Spark,社区反馈可用 4 bit 量化把两台连起来跑。
需要视觉输入或深度推理选 Flash;想要 1:2 更平缓的比例或 384K 输出,就选 DeepSeek V4 Flash。
多数实测反馈仍挂在预览版名字下,所以在 Reddit 上请直接搜 Ox Alpha。
Start here
先在浏览器里免费用 GLM 5.3 Flash 跑一遍你最难的任务,再把模型 ID 接进自己的流程。