GLM 5.3 Flash

Z.ai 在 GLM 5 家族中的高效档位:总参数 320B、激活 18B 的混合专家模型,支持文本、图像与视频输入,100 万 token 上下文,权重以 MIT 协议开源。

用 GLM 5 创作

GLM 5.3 Flash 是什么?

GLM 5.3 Flash 于 2026 年 8 月 26 日发布,此前它已在 OpenRouter 上以隐匿模型 Ox Alpha 的身份运行了六天。

01

总参数 320B,激活 18B

每个 token 只激活 288 个专家中的 8 个:显存吃 320B,算力只按 18B 算。

02

原生多模态

视觉能力来自 30T token 的预训练语料,而不是事后加装的视觉编码器。

03

Flash 指的是便宜,不是快

Artificial Analysis 实测输出 50.2 token/秒,低于同档位 67 t/s 的中位数。

GLM 5.3 Flash 规格、体积与开源情况

架构、权重与许可信息来自 Hugging Face 模型卡和 zai-org/GLM-5 仓库。

模型卡

架构

总参数量
320B

MoE,45 层,288 选 8 个专家。

激活参数量
18B

算力开销相当于 18B 稠密模型。

上下文窗口
1,048,576 token

Io Net 上限 262,144,Cloudflare 为 1,310,720。

最大输出
131,072 token

也有服务商标注可达 1,179,648。

模态
文本、图像、视频

多模态输入,文本输出。

权重与许可

体积与许可

权重许可
MIT

可商用、可再分发,无门槛限制。

Hugging Face
zai-org/GLM-5.3-Flash

另有 -BF16 版本与 ModelScope 镜像。

GitHub
zai-org/GLM-5

没有独立仓库;GLM-5 采用 Apache-2.0。

checkpoint 体积
约 328 GB(FP8)

需要多机多卡,单台工作站跑不动。

推理框架
SGLang、vLLM

另有 TokenSpeed、KTransformers 与社区 GGUF。

数据来自模型卡与 OpenRouter endpoints API,2026 年 8 月。

价格 / 04

GLM 5.3 Flash 价格:官方定价与上线折扣

Z.ai 官方定价为每百万 token 输入 $0.15、输出 $0.50。各处引用的 $0.075 / $0.25 是限时 5 折的上线优惠价。

01

官方定价

$0.15

每百万输入 token

测算 GLM 5.3 Flash 成本请以此为准,别按促销价算。

02

官方定价

$0.50

每百万输出 token

1:3.3 的陡峭比例,先把输出长度压下来。

03

官方定价

$0.03

每百万缓存输入 token

只有新增输入的五分之一,长上下文正是靠它才划算。

04

第三方测算

$0.10

混合单价

Artificial Analysis 按缓存/输入/输出 7:2:1 的比例估算。

同一份权重价差可达 2 倍:Z.AI、Novita、GMICloud 打折,其余按官方定价收费。

基准测试 / 05

GLM 5.3 Flash 基准测试:官方公布值与第三方实测

Z.ai 自己发表格、自己挑对比对象。与 GLM 5.2 的差距以及 Artificial Analysis 的数据经得起推敲。

01

Z.ai 公布

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra 为 87.4;任务越难,差距越明显。

02

Z.ai 公布

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

同一家族、同一套方法,价格只有十分之一。AutomationBench 为 48.8 对 26.2。

03

Z.ai 公布

OfficeQA Pro

5.3 Flash62.4

文档与视觉推理,官方称领先 Opus 4.8。

04

Artificial Analysis

57

Intelligence Index

第三方实测;同类开源权重模型的中位数约为 27。

衡量 GLM 5.3 Flash 最可靠的基准,是你自己的待办队列。

能力 / 06

GLM 5.3 Flash 能做什么

面向 Agent 框架设计:可控推理强度、工具调用、结构化输出,以及百万 token 窗口上的流式响应。

01

可调强度的推理

默认开启,推理强度可按需调节。

02

函数调用

支持工具与工具选择;每个动作仍需你的应用自行校验。

03

结构化输出

指定响应格式即可拿到可直接解析的 JSON。

04

流式响应

首 token 1.47 秒优于中位数,但吞吐量并不占优。

05

图像与视频输入

可以把截图、示意图或屏幕录制随提示词一起贴进来。

06

百万 token 上下文

$0.03 的缓存输入价,让后续轮次一直很便宜。

对比 / 07

GLM 5.3 Flash 对比 DeepSeek V4 Flash

两者都是前沿家族里以 MIT 权重发布的低价档位,差异集中在模态、推理与硬件门槛上。

Z.ai

GLM 5.3 Flash

架构
320B / 激活 18B

混合 KDA 加 NoPE 稀疏 MLA 注意力。

输入
文本、图像、视频

原生多模态。

上下文 / 输出
1M / 131K

输出上限因服务商而异。

官方定价
$0.15 / $0.50

上线折扣之前的价格。

自建部署
约 328 GB FP8

虽然是 MIT,但要多机多卡。

DeepSeek

DeepSeek V4 Flash

架构
284B / 激活约 13B

默认不做推理。

输入
仅文本

截图必须先转成文字。

上下文 / 输出
1M / 384K

可用的回复额度大得多。

官方定价
$0.14 / $0.28

一方供给,1:2 的比例更平缓。

自建部署
MIT 权重

体量更小,部署成本更低。

两者都在 glm5.app 的模型列表里,同一条提示词可以分别跑一遍。

发布时间线 / 08

GLM 5.3 Flash 发布时间线:从 Ox Alpha 到开源权重

先以匿名隐匿模型运行六天,随后完整开源权重正式发布。

01

8 月 20 日 — Ox Alpha 出现

`stealth/ox-alpha` 出现在 OpenRouter,未标注提供方,按 token 免费。

02

8 月 20-26 日 — Agent 工具蜂拥而至

用量前五全是 Agent 编程工具,OpenCode 直接免费提供。

03

8 月 26 日 — GLM 5.3 Flash 发布

Z.ai 确认它就是 Ox Alpha;模型卡、MIT 权重与价格同时公开。

04

预览版跑在国产芯片上

使用基于 SGLang 改造的自研引擎,据称提速约 3 倍,芯片厂商未公开。

05

权重已上线 Hugging Face

`zai-org/GLM-5.3-Flash`,另有 BF16 版本与 ModelScope 镜像,没有 GitHub 仓库。

06

消息最先出现在哪里

价格看 OpenRouter,量化看 Hugging Face;想找实测反馈,Reddit 上仍要搜 Ox Alpha。

适合谁 / 09

谁在用 GLM 5.3 Flash?

那些为「本来不需要旗舰深度」的活儿付着旗舰价的团队——以及它并不适合的场景。

01

高频次的 Agent 编程

工具调用只花 GLM 5.3 十分之一的 token 单价,长 Agent 循环才跑得起。

02

仓库级的代码任务

百万 token 窗口能把整个代码库放进上下文,跨文件提问不必再做检索。

03

看图排障

错乱的布局、复现过程录屏、画成图的数据结构。

04

在 Z.ai 与竞品之间做选型的团队

可在 glm5.app 对话里与 DeepSeek V4 Flash、Qwen 直接对比。

05

有集群的自建部署方

MIT 权重和 vLLM 支持都是真的,但 FP8 的 328 GB 单机装不下。

06

不适合对延迟敏感的界面

每秒约 50 个输出 token,落后于同价位的多数模型。

如何使用 GLM 5.3 Flash / 10

如何使用 GLM 5.3 Flash

三条路径:浏览器里免费对话、调用 glm5.app 的 API,或在自己的硬件上跑 MIT 权重。

01
01

免费与 GLM 5.3 Flash 对话

在对话里选择 GLM 5.3 Flash 并上传截图。新账号可获赠免费额度。

02
02

调用 glm5.app 的 API

向 `https://glm5.app/api/v1` 发送 OpenAI 兼容请求,模型 ID 填 `glm-5.3-flash`。

03
03

或者自建部署权重

拉取 `zai-org/GLM-5.3-Flash`,用 SGLang 或 vLLM 部署,FP8 约 328 GB。

Integration specimen

从 GLM 5.3 Flash API 开始

OpenAI 兼容的 Chat Completions 接口。在 `https://glm5.app/api/v1` 使用模型 ID `glm-5.3-flash`。

打开 API 文档
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

GLM 5.3 Flash 常见问题

关于 Ox Alpha、价格、基准测试、参数量、Hugging Face、vLLM、DGX Spark 以及 DeepSeek V4 Flash。

GLM 5.3 Flash 和 Ox Alpha 是同一个模型吗?

是的——它从 2026 年 8 月 20 日起以 `stealth/ox-alpha` 的名义运行了六天。已保存的 Ox Alpha 对话会自动映射过来。


GLM 5.3 Flash 和 GLM 5.3 是同一个吗?

不是,两者属于不同档位,价格差约 10 倍。Flash 是 320B-A18B 的多模态模型,GLM 5.3 则是文本旗舰。


GLM 5.3 Flash 怎么收费?

Z.ai 定价为每百万 token 输入 $0.15、缓存 $0.03、输出 $0.50。被广泛引用的 $0.075 / $0.25 是限时 5 折的上线优惠。


GLM 5.3 Flash 免费吗?

Ox Alpha 预览期免费,现在按量计费。你仍可以在 glm5.app 的对话里免费试用。


GLM 5.3 Flash 有多少参数?体积多大?

总参数 320B,每个 token 激活 18B,45 层从 288 个专家中路由 8 个。FP8 checkpoint 约 328 GB。


GLM 5.3 Flash 在 Hugging Face 和 GitHub 上吗?

权重以 MIT 协议发布在 Hugging Face 的 `zai-org/GLM-5.3-Flash`。没有独立 GitHub 仓库,相关脚本在 `zai-org/GLM-5` 里。


能用 vLLM 或 DGX Spark 跑 GLM 5.3 Flash 吗?

vLLM、SGLang、TokenSpeed 和 KTransformers 都支持。328 GB 装不进单台 DGX Spark,社区反馈可用 4 bit 量化把两台连起来跑。


GLM 5.3 Flash 和 DeepSeek V4 Flash 该选哪个?

需要视觉输入或深度推理选 Flash;想要 1:2 更平缓的比例或 384K 输出,就选 DeepSeek V4 Flash。


Reddit 上怎么评价 GLM 5.3 Flash?

多数实测反馈仍挂在预览版名字下,所以在 Reddit 上请直接搜 Ox Alpha。


Start here

今天就用上 GLM 5.3 Flash

先在浏览器里免费用 GLM 5.3 Flash 跑一遍你最难的任务,再把模型 ID 接进自己的流程。