快速回答: GLM 5.3 Flash 有 3200 亿总参数、每 token 激活 180 亿——一个 Mixture-of-Experts 模型,写作 320B-A18B。它有 45 层,每个 token 从 288 个专家中路由 8 个,采用 KDA 线性注意力 + NoPE 稀疏 MLA 的混合注意力栈。原生 FP8 权重在磁盘上约占 328 GB,发布于 Hugging Face 的 zai-org/GLM-5.3-Flash,采用 MIT 许可。GitHub 上没有专用仓库——代码和推理配方在 zai-org/GLM-5 里。那个 17.8:1 的总参数/激活参数比,就是一个 320B 模型能以每百万输入 token $0.15 服务的全部原因。
参数量是模型发布中被引用最多、被理解最少的数字。"320B" 听起来该和旗舰放在一句话里,"18B" 听起来像个笔记本能跑的模型——而对 GLM 5.3 Flash 来说,两者同时成立,只是对应不同的资源。搞错这个区分,团队要么把算力容量高估一个数量级,要么部署到一半才发现模型根本加载不进去。
本文内容取自 Z.ai 的 Hugging Face 模型卡、zai-org/GLM-5 仓库和发布相关的技术报道,核对于 2026 年 8 月 27 日。凡属社区实测而非厂商公布的数字——具体说就是磁盘体积——文中都有标注。
这篇文章解决什么问题
痛点:"320B 参数"告诉你的是存储成本而不是算力成本,而且这个模型的资产散落在四个位置、挂着两种许可。 在 MoE 模型里,总参数和激活参数相差一个数量级以上。同时权重在 Hugging Face、镜像在 ModelScope、代码在一个以别的模型命名的仓库里,而社区量化版本看起来像官方的但并不是。
读完你会知道哪个数字管哪个资源、逐层的完整架构、真实的磁盘与显存占用、每一份官方资产的确切位置,以及 MIT 许可允许和不允许什么。
完整参数拆解
| 属性 | 值 |
|---|---|
| 总参数 | 320B |
| 每 token 激活参数 | 18B |
| 稀疏比 | 约 17.8:1 |
| 层数 | 45 |
| 专家数 | 288 |
| 每 token 路由专家数 | 8 |
| 注意力设计 | 混合:KDA 线性注意力 + NoPE 稀疏 MLA |
| 其他结构 | mHC(Manifold-Constrained Hyper-Connections)、IndexPool、1 层 MTP draft |
| 原生权重精度 | FP8(另有 BF16 版本) |
| 磁盘体积(FP8) | 约 328 GB(社区从 Hugging Face 文件体积读取) |
| 训练语料 | 30T token,多模态 |
| 上下文窗口 | 1,048,576 token |
| 权重许可 | MIT |
总参数 vs 激活参数:各自管什么
这一节就是整篇文章的核心。
320B(总参数)管显存。 每一个参数都必须常驻且可加载,因为路由器可以为任意 token 选中任意专家。你无法在可接受的延迟下按需换入专家。所以你的显存或统一内存预算要按 320B 来算——FP8 下约 328 GB,BF16 下大约翻倍。
18B(激活参数)管算力和速度。 对一个给定 token,288 个专家里只有 8 个被激活。每 token 的 FLOPs、以及由此决定的每 token 边际服务成本,看起来像一个 18B 稠密模型而不是 320B 模型。
这个拆分同时解释了模型的定价和它的性能特征:
- 为什么这么便宜(标价每百万输入 token $0.15,而 GLM 5.3 是 $1.40):你是按 18B 量级的算力被计费的。
- 为什么它不快(Artificial Analysis 实测输出 50.2 token/秒,低于同类约 67 t/s 的中位数):MoE 路由带来额外开销,而无论实际激活多少参数,触达 320B 权重所需的显存带宽是真实存在的。
- 为什么自部署这么难:328 GB 装不进一台机器,尽管算力上绰绰有余。
如果你只从这一页带走一件事:跑起来便宜,托起来昂贵。 这两句不矛盾——它们说的是两个不同的数字。
架构,逐块拆开
45 层、288 个专家、选 8。 对这个参数量来说是一个相对浅的堆栈,宽度放在了专家维度上。Z.ai 把 mHC(Manifold-Constrained Hyper-Connections) 归功为:在总参数量相当的前提下,相比 GLM-4.5 把激活参数量和层数同时减半。这就是让 17.8:1 的稀疏比从"理论上可行"变成"实际可训"的结构性技巧。
混合注意力——GLM 系列首次。 两类层分担工作:
- KDA 线性注意力层以线性而非二次的代价处理局部依赖。
- NoPE 稀疏 MLA 层在不遍历全部内容的前提下拉取全局相关上下文。
Z.ai 报告这个组合相比 GLM-5.3 带来约 3 倍更少的注意力计算和 4.4 倍更小的 KV cache。后者才是商业上关键的那个数字:在长上下文场景下,让服务变贵的通常是 KV 显存而不是权重。把它缩小 4.4 倍,才让百万 token 窗口从规格表数字变成可负担的产品。
IndexPool。 为了让这个窗口真正可处理,索引 key 向量经加权池化压缩,从而在长上下文下降低延迟和显存占用。诚实地说明其含义:这按设计就是有损的,而且没有任何已发布的基准测量过 80 万 token 处相比 8 万 token 处的检索准确率。机制描述得很清楚;极端处的取舍幅度没有。
原生 FP8 加一层 MTP draft。 权重是原生以 FP8 发布的,而不是事后从 BF16 量化下来的,所以 FP8 版本就是参考模型,不是有损衍生品。随附一层多 token 预测 draft 层用于投机解码。
磁盘与显存占用
硬件讨论中你需要的数字是 FP8 版本的约 328 GB——这是 NVIDIA 开发者论坛用户对 Hugging Face 文件体积的读数,不是厂商公布值,请当作近似。
| 配置 | 可行? |
|---|---|
| 单台 128 GB 统一内存机器(如一台 DGX Spark) | 不行——差约 2.5 倍 |
| 2 台,配 4-bit 或混合量化 | 社区讨论收敛到的现实起点 |
| 4 台 | 论坛里被描述为"勉强装下" |
| 8× 80 GB 数据中心 GPU(640 GB) | 原生 FP8 下从容 |
作为参照,那个显而易见的开源对手 DeepSeek V4 Flash 约为 160 GB,差不多一半。如果你的约束是硬件而非许可,这个差距会在任何跑分之前就替你做完决定。
权重到底在哪
| 资产 | 位置 | 许可 |
|---|---|---|
| 权重(FP8,参考版) | Hugging Face zai-org/GLM-5.3-Flash | MIT |
| 权重(BF16) | Hugging Face zai-org/GLM-5.3-Flash-BF16 | MIT |
| 权重镜像 | ModelScope ZhipuAI/GLM-5.3-Flash | MIT |
| 代码、配方、架构说明 | GitHub zai-org/GLM-5 | Apache-2.0 |
有两件事要记住。
GitHub 上没有 GLM-5.3-Flash 仓库。 如果你搜过没找到,不是你漏了什么。zai-org 这个 GitHub 组织下有 GLM-5、GLM-V、GLM-4、GLM-Image 等,而 GLM 5.3 Flash 的推理手册在 GLM-5 里。内部文档请指向 zai-org/GLM-5。
权重和代码挂的是不同许可——权重 MIT,GLM-5 代码仓库 Apache-2.0。两者都宽松,都不会阻碍商业部署,但一份把所有东西都记成 "MIT" 的合规审查是不准确的。请分开记录。
MIT 许可到底允许什么
这是开源权重模型里在用的最宽松的许可,和常态的对比值得说明:
- 商用——允许,无营收门槛,无需另行谈判商业授权。
- 修改与微调——允许,且成果归你。
- 再分发——允许,包括分发你修改后的权重。
- 私有分支——允许,无公开变更的义务。
- 无可接受使用条款附录——不像多数"开放"模型许可,这里没有附带的禁止用途清单。
你唯一的义务是保留版权声明。对一个跑分接近前沿的 3200 亿参数模型来说,这是一个异常干净的法律位置,也是这次发布的意义超出跑分数字本身的实质原因之一。
下载与部署
标准 Hugging Face 客户端即可。开始传输之前先看清体积。
pip install -U "huggingface_hub[cli]"
# FP8 参考版本 —— 约 328 GB
hf download zai-org/GLM-5.3-Flash --local-dir ./GLM-5.3-Flash
在 1 Gbps 连接满速的情况下大约要 45 分钟,并且需要落在一块既装得下、又留有服务余量的存储上。如果你受 Hugging Face 限速影响,ModelScope 镜像 ZhipuAI/GLM-5.3-Flash 提供同样的权重。
Z.ai 官方支持四套推理栈——SGLang、vLLM、TokenSpeed 和 KTransformers——zai-org/GLM-5 仓库里有各自的手册。那才是查准确参数的权威位置;一个混合注意力 MoE 的启动配置不是靠猜的。vLLM 的大致形态是:
vllm serve zai-org/GLM-5.3-Flash \
--tensor-parallel-size 8 \
--max-model-len 1048576
三点会替你省下一轮排障:
- 按手册指定的版本锁定框架。 KDA 线性 + NoPE 稀疏 MLA 这套栈是全新的;发布前后的社区讨论集中在 vLLM v0.28.0,以及是否需要特定 PR。
--max-model-len 1048576在小硬件上只是愿望。 完整窗口需要在 328 GB 权重之上再留 KV cache 余量。先设得低很多,等模型能起来了再往上加。- FP8 版本是参考版,不是量化版。 用它不会拿质量换体积——这就是 Z.ai 跑分所用的那个构建。
社区量化版本(非官方)
模型卡提到有 22 个量化变体,社区 GGUF 仓库让这个模型进入了 llama.cpp、Ollama、LM Studio 和 Jan 的射程。它们是落到消费级或小型服务器硬件上的唯一现实路径。
它们附带一个多数下载指南会省略的警告:本模型所有已发布的跑分都跑在完整 FP8 精度上。 一个长上下文行为本来就依赖 IndexPool 压缩的架构,再叠一层 4-bit 量化,那实质上已经是另一个模型,而没有人发布过这个质量差值。做实验尽管用量化版;但别假设 84.3 的 Terminal-Bench 分数可以平移过来。
如果你更想在为硬件报价之前先评估模型的实际输出,托管路径试起来是零成本的——在 glm5.app 上跑 GLM 5.3 Flash,先判断质量值不值得开启这场基础设施讨论。
参数画像横向对比
| 模型 | 总参数 | 激活 | 比例 | 磁盘 | 备注 |
|---|---|---|---|---|---|
| GLM 5.3 Flash | 320B | 18B | 17.8:1 | 约 328 GB | 原生多模态,MIT |
| DeepSeek V4 Flash | 284B | 13B | 21.8:1 | 约 160 GB | 主线文本,MIT |
多数文章没写到的差异点: 更高的稀疏比并不自动更好。DeepSeek V4 Flash 更稀疏(21.8:1),因而也更快——输出 119.4 token/秒对 GLM 的 50.2。GLM 不那么激进的比例换来了每 token 更多的激活容量,体现为更高的独立智能评分(Artificial Analysis 指数 57 对 52)。
这就是两家实验室各自做的取舍,而且直接可以从参数量读出来:DeepSeek 为吞吐优化了这个比例;Z.ai 为每美元能力优化了它。 都不算错。你要哪个,取决于你的瓶颈是墙钟时间还是答案质量。
实操含义
给自部署做容量规划: 按 320B / 约 328 GB 做预算,不是 18B。要么多机,要么量化并接受一个未被测量的质量差值。
估算延迟: 18B 的激活量设定了一个下限,但 MoE 路由开销和触达 320B 权重所需的带宽,会让真实吞吐低于同等 18B 稠密模型。请按实测的 50.2 t/s 做规划。
和稠密模型对比: 一个 320B-A18B 的 MoE 不等于"类似 320B 稠密模型"。把它当作大致 18B 量级的算力,配上明显优于 18B 量级的质量——因为总参数池储存的知识远多于激活切片在任一时刻用到的部分。
决定托管还是自部署: MIT 许可让自部署真正免费,328 GB 让它真正昂贵。在托管每百万输入 token $0.15 的价格下,自有硬件胜过租用 token 的临界点,比多数团队想象的高得多。开源权重的价值在于数据主权、离网部署、微调和可复现性——在这个价格上,很少单纯因为成本而成立。买任何东西之前先把这笔账算清楚,并且先测试模型本身,因为能力不匹配会让整个硬件问题失去意义。
确认你拿到的是正确的模型
给做部署审计的人一份速查清单:
- 仓库 ID 是
zai-org/GLM-5.3-Flash(或-BF16)。其他一切——包括所有 GGUF 仓库——都是社区维护的。 - 权重仓库里的许可文件写的是 MIT。
- 配置应体现 45 层、288 个专家、每 token 选 8。
- 参考版本的精度是 FP8。
- 代码引用是 GitHub 上的
zai-org/GLM-5,不是某个 GLM-5.3-Flash 仓库。
如果某个仓库没通过上述任一检查,它就是一个 fork 或量化版本,行为可能与已发布的跑分不同。
常见问题
GLM 5.3 Flash 有多少参数? 总计 3200 亿,每 token 激活 180 亿。它是 MoE 模型,两个数字管的资源不同:320B 决定你的显存需求,18B 决定你的算力成本。
GLM 5.3 Flash 在磁盘上多大? 原生 FP8 版本约 328 GB,依据是 NVIDIA 开发者论坛用户对 Hugging Face 文件体积的读数。BF16 版本明显更大。社区 4-bit 量化版本小得多,但没有对照官方结果做过跑分。
权重在哪?
FP8 在 Hugging Face 的 zai-org/GLM-5.3-Flash,BF16 在 zai-org/GLM-5.3-Flash-BF16,ModelScope 镜像是 ZhipuAI/GLM-5.3-Flash。
有 GLM 5.3 Flash 的 GitHub 仓库吗?
没有专用的。代码、推理手册和架构说明都在 zai-org/GLM-5 里,该仓库是 Apache-2.0,而权重本身是 MIT。
它有多少个专家? 288 个专家,跨 45 层、每 token 路由 8 个。
18B 激活参数够干正事吗? 就这个架构而言,独立证据说够:Artificial Analysis 给它 57 分的 Intelligence Index,对比同体量开源权重模型约 27 的中位数。320B 的总参数池储存的东西远多于任一 token 的 18B 切片所用——这正是 MoE 的意义所在。
我可以商用微调吗? 可以。MIT 许可允许微调、商业部署和再分发你修改后的权重,无营收门槛,也无开源你的改动的义务。
mHC 是什么? Manifold-Constrained Hyper-Connections——Z.ai 归功于它的一项结构技术:在总参数量相当的前提下,相比 GLM-4.5 把激活参数量和层数同时减半。它是让 320B/18B 拆分变得实用的规模化方法。
来源
- zai-org/GLM-5.3-Flash — Hugging Face——参数量、mHC、混合注意力、MIT 许可、量化版本情况。
- zai-org/GLM-5 — GitHub——官方架构说明、FP8 与 BF16 版本、SGLang/vLLM/TokenSpeed/KTransformers 推理配方。
- Artificial Analysis — GLM-5.3-Flash——独立 Intelligence Index 与吞吐实测。
- GLM-5.3-Flash weights released (Ox Alpha) — NVIDIA 开发者论坛——社区的文件体积与硬件适配报告。
架构数据核对于 2026 年 8 月 27 日。磁盘体积为社区从仓库文件列表实测,非厂商规格;采购硬件前请在官方仓库确认当前文件体积和手册中锁定的框架版本。




