GLM 5.3 Flash 是什么?智谱 320B-A18B 原生多模态模型详解
Aug 27, 2026

GLM 5.3 Flash 是什么?智谱 320B-A18B 原生多模态模型详解

GLM 5.3 Flash 是 Z.ai 的 320B-A18B 原生多模态 MoE 模型,1M 上下文、MIT 开源权重、$0.15/$0.50 API 定价。它是什么、什么时候该用、什么时候不该用。

快速回答: GLM 5.3 Flash 是 Z.ai(智谱)GLM-5 系列的效率档模型,发布于 2026 年 8 月 26 日。它是一个 320B 总参数、18B 激活参数的 Mixture-of-Experts 模型,也是该系列首个原生多模态模型(文本 + 图片 + 视频输入,文本输出),拥有 1,048,576 token 的上下文窗口MIT 许可的开源权重,API 标价为每 100 万输入 token $0.15、每 100 万输出 token $0.50。它同时也是此前在 OpenRouter 上以代号 "Ox Alpha" 匿名运行了一周的那个模型。

如果你过去一周试着查过这个模型,多半掉进了同一团乱麻:找到的文章一半在讲 GLM 5.3(另一个更贵的模型),一半在讲一个叫 Ox Alpha 的神秘端点,而各处报出来的价格彼此差两倍。这不怪你——这模型先用代号发布、再揭晓身份,然后带着限时折扣正式上线,任何一句价格引用都因此变得含糊。

本文只用一手来源:Hugging Face 模型卡、zai-org/GLM-5 仓库、OpenRouter 模型页及其公开 endpoints API(2026 年 8 月 27 日查询)、以及 Artificial Analysis 的独立实测。凡是来自社区而非厂商的数据,文中都会明确标注。我们没有自己跑过 GLM 5.3 Flash 的完整 benchmark 套件——这一点我们直说,而不是把厂商图表包装成实测。

这篇文章解决什么问题

痛点是名称冲突叠加价格歧义。"GLM 5.3" 和 "GLM 5.3 Flash" 是两个不同的模型,价格差约 10 倍;而你在各处看到的 Flash 报价,绝大多数是限时 5 折,不是标价。再加上模型是匿名预览发布的,社区积累的实践认知全部归档在一个已经不存在的名字下面。

读完这页你会清楚:GLM 5.3 Flash 的架构到底是什么、标价和折扣价分别是多少、跑分数据哪些是厂商自报哪些是独立测得,以及——这是多数科普文会跳过的部分——哪些场景下 18B 激活的模型是错误选择

GLM 5.3 Flash 速览

项目
全称GLM-5.3-Flash
厂商Z.ai(智谱 AI)
发布日期2026 年 8 月 26 日
曾用代号Ox Alpha(stealth/ox-alpha,2026 年 8 月 20 日起预览)
总参数量320B
激活参数量每 token 18B
架构Mixture-of-Experts,45 层,每 token 从 288 个专家中路由 8 个
注意力混合架构——KDA 线性注意力层 + NoPE 稀疏 MLA 层
上下文窗口1,048,576 token(1M)
最大输出131,072 token
模态文本 + 图片 + 视频 → 文本
权重精度原生 FP8(另有 BF16 版本)
训练语料30T token 多模态预训练语料
权重许可MIT
API 标价输入 $0.15 / 缓存输入 $0.03 / 输出 $0.50(每 100 万 token)

架构,用人话讲

最重要的数字不是 320B,而是 18B。GLM 5.3 Flash 是 MoE 模型,单个 token 只激活 288 个专家中的 8 个。你为 320B 参数付出存储和显存代价,但算力开销更接近一个 18B 稠密模型。这一条就解释了这个模型的全部性格:接近前沿的质量,配上一个看起来像标错了的价格。

有三个设计选择值得理解,因为它们直接决定了模型的行为方式:

1. 稀疏 + 线性混合注意力。 这是 GLM 系列首次采用混合注意力栈:KDA 线性注意力层负责局部依赖,NoPE 稀疏 MLA 层负责拉取全局相关上下文。Z.ai 称这套组合相比 GLM-5.3 带来约 3 倍更少的注意力计算和 4.4 倍更小的 KV cache。实际意义在于后者:长上下文的成本瓶颈通常是 KV 显存而不是权重本身,把它缩小 4.4 倍,才让百万 token 上下文从"规格表数字"变成"能负担得起的产品"。

2. IndexPool。 为了让百万上下文真正可用而不只是标在纸上,模型通过加权池化压缩索引 key 向量,用一点精度换取长上下文下明显更低的延迟和显存占用。

3. mHC(Manifold-Constrained Hyper-Connections)。 Z.ai 把它归功为在总参数量相当的前提下,相比 GLM-4.5 把激活参数量和层数同时减半的关键。这是让 320B/18B 这个比例真正跑得通的规模化技巧。

你不需要吃透这些才能用这个模型。但你需要它们,才能向同事解释为什么一个"320B 模型"能以每百万输入 token $0.15 的价格服务而没人亏钱。

原生多模态——"原生"两个字为什么重要

GLM 5.3 Flash 是 GLM-5 家族里第一个原生多模态模型。它接受文本、图片和视频输入,输出文本。"原生"意味着视觉通路是预训练语料(30T token,多模态)的一部分,而不是事后给文本模型外挂一个视觉编码器。

实际后果是:混合了代码与视觉上下文的任务——读一张 UI 崩掉的截图然后改 CSS、从一段录屏里追踪 bug、从架构图里抽出 schema——落在模型的核心能力区内,而不是一个改造方案的边缘地带。Z.ai 自报的 OfficeQA Pro 分数(62.4,官方称领先 Claude Opus 4.8)是文档与视觉推理基准,也是 Flash 这一档唯一宣称直接胜过旗舰而不是接近旗舰的地方。

如果你想用自己的截图而不是一张图表来验证这个说法,可以直接在 glm5.app 上打开一个 GLM 5.3 Flash 会话贴进去——五分钟的自测比任何 benchmark 表格都更能说明它适不适合你。

它到底多少钱(请读脚注)

Z.ai 的标价是每 100 万输入 token $0.15、缓存输入 $0.03、输出 $0.50

你现在几乎在所有地方看到的那个数字——输入 $0.075 / 输出 $0.25——是标价打了限时 5 折之后的结果,目前 Z.AI 自己在 OpenRouter 上的端点、Novita 和 GMICloud 是这个价。同一个模型的其他 provider(DeepInfra、Baseten、Parasail、Io Net、Cloudflare)已经在按不打折的 $0.15 / $0.50 收费

由此得出两条规则,它们是"预算稳得住"和"某天账单翻倍"之间的分界线:

  1. 按 $0.15 / $0.50 做预测。 折扣是促销性质的。如果你的单位经济模型只在折扣价下成立,那你其实没有单位经济模型。
  2. 报价格时必须说明是哪个 provider。 "GLM 5.3 Flash 是 $0.075" 这句话,在服务它的十个端点里只有三个成立。

完整的十家 provider 价差拆解见我们的 GLM 5.3 Flash 定价指南。独立机构 Artificial Analysis 按 7:2:1 的缓存/输入/输出比例给出的混合价是每 100 万 token $0.10——这是个不错的横向比价数字,但只有当你的流量真的长这个比例时,它才是个可用的预算数字。

跑分:哪些是厂商自报,哪些是独立测得

Z.ai 自己公布的数据,以及它自己挑选的对照组:

基准GLM 5.3 Flash对照
Terminal-Bench 2.184.3Claude Opus 4.8:85.0 · GPT-5.6 Terra:87.4
DeepSWE v1.163.4GLM-5.2:46.2
AutomationBench48.8GLM-5.2:26.2
Z.ai Code Bench v1.0(max effort)29.0Claude Opus 4.8:29.5
OfficeQA Pro62.4官方称领先 Opus 4.8
HLE(带工具)55.3

对第一方表格要保持常规警惕——"Z.ai Code Bench" 是 Z.ai 自己出的基准,而厂商挑对照组这件事,就是厂商挑对照组。真正有用的信号是 GLM-5.2 的差值:DeepSWE v1.1 从 46.2 涨到 63.4,AutomationBench 从 26.2 涨到 48.8,而对照的这个模型贵了大约十倍。这是同家族、同方法学的对比,是经得起推敲的那一类。

独立方面,Artificial Analysis 给 GLM 5.3 Flash 的 Intelligence Index 评分是 57,远高于同体量开源权重模型约 27 的中位数。同一来源测得输出速度 50.2 token/秒(低于同类 67 t/s 的中位数——这个模型在吞吐意义上并不快),首 token 时间 1.47 秒(优于 2.14 秒的中位数)。

这个组合值得直说,因为名字有误导性:这里的 "Flash" 指便宜,不指快。 它是低成本档,不是低延迟档。如果你的产品需要 token 尽快出现在屏幕上,请先实测再假设。

开源权重:MIT,以及它给你什么

权重发布在 Hugging Face 的 zai-org/GLM-5.3-Flash(另有 -BF16 版本)和 ModelScope,采用 MIT 许可——这基本是开源权重能给到的最宽松条款。商用、修改、再分发、私有分支全部允许,没有营收门槛,也没有附加的可接受使用条款。合规审查时有一个细节要弄对:权重是 MIT,而 zai-org/GLM-5 代码仓库是 Apache-2.0。

GitHub 上没有独立的 GLM-5.3-Flash 仓库。 推理配方和架构说明都在 zai-org/GLM-5 里,这才是该指给团队的地址。官方支持的服务栈是 SGLang、vLLM、TokenSpeed 和 KTransformers,社区已经产出了适配 llama.cpp、Ollama、LM Studio 和 Jan 的 GGUF 量化版本。

完整的架构与下载细节见我们的 GLM 5.3 Flash 参数与体积拆解。自部署是真的可行,但不是随手能做的事:FP8 权重合计约 328 GB,这个数字来自 NVIDIA 开发者论坛用户对 Hugging Face 文件体积的读数。那是一场多卡多机的讨论,不是一台工作站的讨论。

Ox Alpha 那条线

有六天时间,GLM 5.3 Flash 以 stealth/ox-alpha 的身份活在 OpenRouter 上——一个匿名、免费、不披露 provider 的推理模型。完整的前后对照(模型 ID、价格、数据政策)见 Ox Alpha vs GLM 5.3 Flash。Z.ai 的发布公告直接确认了这条关联,并且值得注意地提到,预览期间它完全跑在中国国产 AI 芯片上。围绕发布的报道称其使用了一套基于 SGLang 改造的服务引擎,带来约 3 倍的端到端服务性能提升;具体芯片厂商未披露。

这件事的意义不止于八卦。第一,大量实用的社区经验——吞吐观察、智能体编程结果、各种脾气——都归档在 "Ox Alpha" 名下,想找一线反馈而不是发布日通稿,就该用这个词去搜。第二,预览期产生了真实的生产流量(OpenRouter 自己的活跃面板显示排名前五的消费方全是智能体编程工具),这意味着发布数据是建立在一周真实负载之上,而不是冷启动。

什么时候 GLM 5.3 Flash 是错误选择

多数科普文停在规格表。下面这部分能帮你省下一个白干的迭代——三种它并不合适的情形:

你要的是低延迟,不是低成本。 实测输出约 50 token/秒,GLM 5.3 Flash 比同价位的多数对手都慢。对于"感知速度就是产品"的流式聊天界面,选一个更贵但更快的模型,往往才是更省钱的决策。

你的任务处在前沿的边缘。 在 Z.ai 挑选的基准上,它和 Claude Opus 4.8 的差距很小(Terminal-Bench 2.1 上 84.3 对 85.0),但基准上的小差距会在真实任务最难的那 5% 上放大成大差距。对于"答错了还很难被发现"的任务,旗舰的溢价通常是值得付的。

你想在单机上自部署。 328 GB 的 FP8 权重塞不进一台 128 GB 的机器。NVIDIA 论坛上的社区反馈把实际下限放在多台设备集群加 4-bit 或混合量化——而量化掉三分之一的精度,会改变 benchmark 所描述的那个质量图景。

适合的场景则毫不含糊:高并发的智能体编程、长上下文的文档与代码库处理,以及任何"你此前在为不需要旗舰深度的任务支付 GLM 5.2 或旗舰价"的流水线。判断的诚实做法是拿你自己最难的真实任务跑一遍——在 glm5.app 上试用 GLM 5.3 Flash,零配置;或者把 glm-5.3-flash 这个模型 ID 接进现有流水线,和你今天在跑的东西 diff 一下输出。

常见问题

GLM 5.3 Flash 和 GLM 5.3 是同一个模型吗? 不是。它们是不同价格档的不同模型。GLM 5.3 Flash 是 2026 年 8 月 26 日发布的 320B-A18B 多模态效率模型;GLM 5.3 是 8 月早些时候发布的、更贵的、以文本为主的版本。Z.ai 称 Flash 以约十分之一的价格在各项基准上超过 GLM-5.2,且 Coding Plan 用户在 Flash 上的可用配额约为 GLM-5.3 的 3 倍。

GLM 5.3 Flash 免费吗? 不是长期免费。它在 Ox Alpha 预览周期间免费,当前的 $0.075 / $0.25 是标价 $0.15 / $0.50 的限时 5 折。权重在开源意义上是免费的——Hugging Face 上的 MIT 许可——但自己跑起来意味着你要提供约 328 GB 的显存。

它真的能处理一百万 token 吗? 在 Z.ai 自己的端点和多数 OpenRouter provider 上,上下文窗口是 1,048,576 token。两个注意点:Io Net 提供的是 262,144 token 的版本,Cloudflare 列的是 1,310,720,所以上限取决于你打到哪个端点;另外最大输出在多数端点上单独限制在 131,072 token。

本地跑需要什么硬件? 不止一台。FP8 版本约 328 GB。NVIDIA DGX Spark 论坛上的社区讨论把现实起点放在 2 台设备配 4-bit 或混合量化,该配置下报告的峰值吞吐约 43 token/秒——社区实测,未经独立验证。

去哪拿权重? Hugging Face 上的 zai-org/GLM-5.3-Flash(BF16 版本是 zai-org/GLM-5.3-Flash-BF16),以及 ModelScope 上的 ZhipuAI/GLM-5.3-Flash。没有专用 GitHub 仓库——推理配方在 zai-org/GLM-5 里。

来源

价格与端点可用性变动频繁。以上数据均于 2026 年 8 月 27 日核对;在敲定生产预算前,请以 OpenRouter 模型页或 Z.ai 官方定价文档为准。

立即开始使用 GLM 5

免费试用 GLM 5 — 推理、编程、智能体和图像生成,一个平台全搞定。