GLM 5.3 Flash 跑 DGX Spark:装得下吗?能跑多快?
Aug 27, 2026

GLM 5.3 Flash 跑 DGX Spark:装得下吗?能跑多快?

在 NVIDIA DGX Spark 上跑 GLM 5.3 Flash:328 GB 的 FP8 权重对单台 128 GB。什么装得下、什么必须量化,以及社区实测的 2× Spark 吞吐。

快速回答: GLM 5.3 Flash 的 FP8 权重合计约 328 GB,而单台 NVIDIA DGX Spark 有 128 GB 统一内存——所以单台装不下,而且差得远。两台 Spark 通过 ConnectX-7 互联可得 256 GB,仍然需要 4-bit 或混合量化才能加载。NVIDIA 开发者论坛上的社区反馈把 2× Spark 加量化描述为现实起点,其中一个帖子报告该配置下峰值约 43.4 token/秒。这些是社区实测,不是厂商跑分。

每次有带着大数字的开源权重发布,都会跟着这个问题,而它通常被回答得很糟——要么是"量化一下就行了"式的挥手,要么是一个忽略了 KV cache 的显存计算。GLM 5.3 Flash 让这个问题更尖锐,因为它的参数画像是刻意失衡的:320B 总参数,但每 token 只激活 18B。算力很小,显存不小。

下面的硬件规格来自 NVIDIA 自己的 DGX Spark 产品页。GLM 5.3 Flash 的数据来自 Z.ai 的 Hugging Face 模型卡和仓库。吞吐与适配报告来自 NVIDIA 开发者论坛的帖子,全文均标注为社区来源——我们自己没有在 Spark 硬件上跑过 GLM 5.3 Flash,我们宁愿直说,也不愿暗示做过并不存在的测试。核对于 2026 年 8 月 27 日

这篇文章解决什么问题

痛点:MoE 模型打破了人们用来估算硬件的直觉。 "18B 激活参数" 听起来像工作站能轻松搞定的东西。并不是——因为 320B 里的每一个参数都必须常驻:路由器可以为任意 token 挑选任意专家,你无法在可用的延迟下按需换入。

读完你会拿到确切的算术、每种配置到底能得到什么、带着注意事项的社区吞吐数字,以及一个诚实的回答:这件事到底值不值得做。

算术

DGX Spark,按 NVIDIA 官方规格:

规格
芯片GB10 Grace Blackwell Superchip
统一内存128 GB LPDDR5x
内存带宽273 GB/s
网络ConnectX-7 NIC @ 200 Gbps
集群支持两台互联
NVIDIA 宣称容量单台最高 200B 参数;两台互联最高 405B 参数
存储4 TB NVMe M.2

GLM 5.3 Flash:

规格
总参数320B
激活参数18B
原生精度FP8
磁盘权重约 328 GB(社区从 Hugging Face 文件体积实测)

注意这两张表之间的张力。NVIDIA 给两台互联 Spark 的标称是"最高 4050 亿参数",而 GLM 5.3 Flash 是 320B——按参数量算应该装得下。但 NVIDIA 那个数字假设的是 4-bit 量化(405B 参数按约 4 bit 计 ≈ 200 GB,在 256 GB 里留有 KV 余量)。GLM 5.3 Flash 原生以 FP8 发布,是那个的两倍。在其发布精度下,328 GB 塞不进 256 GB。

所以实际答案是:两台 Spark,外加从 FP8 往下量化。 这恰好也是社区讨论收敛到的位置。

每种配置能得到什么

配置总内存结论
1× DGX Spark128 GB不行。 FP8 下差约 2.5 倍,而且即便 4-bit 量化后算上 KV cache 依然不够。
2× DGX Spark256 GB可以,需 4-bit 或混合量化。 社区帖子收敛到的配置。
4× DGX Spark512 GB有论坛参与者称这样"勉强"装下 GLM 5.3——Spark 官方只支持两台集群,超出即脱离支持路径。
8× 80 GB 数据中心 GPU640 GB原生 FP8 下从容,无质量取舍。

1× 那一行值得强调,因为这是多数人真正在问的配置。单台 Spark 跑不了这个模型。 没有哪个开关、哪个 offload 设置或哪个框架能改变这一点——328 GB 权重对 128 GB 内存,不是一个调参问题。

吞吐数字(社区实测)

一个论坛帖子报告 2× DGX Spark 上峰值约 43.4 token/秒。请谨慎对待这个数字:

  • 它是社区实测,不是厂商跑分,没有公布方法学。
  • 它是峰值而非持续均值——真实负载在长上下文和 KV cache 压力下会低于它。
  • 它几乎肯定测的是量化后的构建,因为 FP8 权重装不进 256 GB。

作为校准:Artificial Analysis 在数据中心硬件上跑完整 FP8 权重的托管 API 端点,测得 GLM 5.3 Flash 为 50.2 输出 token/秒。所以社区的 Spark 数字落在一个可信区间——略低于托管,这正是你从 273 GB/s 的 LPDDR5x 带宽对比 HBM 会预期的,而量化减少了每 token 搬运的字节数,部分抵消了差距。

MoE 架构在这里也帮了忙。因为每 token 只激活 18B 参数,每 token 的显存带宽需求远低于一个 320B 稠密模型会施加的压力。这正是这个模型在 Spark 这一档硬件上还能被讨论的原因——一个 320B 稠密模型在 273 GB/s 下是不可用的。

那个没人回答的量化问题

下面这部分是多数"能不能跑"文章漏掉的,而它才是真正应该决定你做不做这件事的因素。

GLM 5.3 Flash 所有已发布的跑分都跑在完整 FP8 精度上。 Terminal-Bench 2.1 的 84.3、DeepSWE v1.1 的 63.4、Artificial Analysis Intelligence Index 的 57——全部是数据中心硬件上的 FP8 参考模型。

而要装进 2× Spark,你必须降到大约 4 bit。这个架构有一个具体理由对此敏感:它的长上下文行为本来就依赖有损压缩。GLM 5.3 Flash 使用 IndexPool 通过加权池化压缩索引 key 向量,并采用 KDA 线性注意力 + NoPE 稀疏 MLA 的混合注意力栈——Z.ai 报告这相比 GLM-5.3 带来约 3 倍更少的注意力计算和 4.4 倍更小的 KV cache。在一个已经在用精度换效率的架构之上再叠一层激进的权重量化,是把两个有损步骤复合起来,而没有人发布过由此产生的质量差值

实际含义:如果你要搭 2× Spark 部署,先在自己的任务上给量化构建跑基准,再去信任它。别假设发布数据可以平移。而为了知道"正确"长什么样,先拿同样的 prompt 打一遍完整精度的托管模型——在 glm5.app 上打开一个 GLM 5.3 Flash 会话,把那批输出留作参照集。

框架说明

发布前后的社区讨论集中在 vLLM v0.28.0,以及混合注意力栈是否需要特定 PR 的开放问题。Z.ai 官方支持 SGLang、vLLM、TokenSpeed 和 KTransformers,手册在 zai-org/GLM-5 仓库里。

给任何要尝试这件事的人两条实用警告:

  1. 锁定官方手册指定的框架版本。 一个全新的 KDA 线性 + NoPE 稀疏 MLA 注意力实现,不该跑在今天 pip install vllm 随手给你的版本上。
  2. 把 KV cache 和权重分开做预算。 328 GB 是纯权重。百万 token 上下文需要在此之上的 cache,而它正是把"模型加载成功了"变成"第三个请求就 OOM"的那个东西。

这件事值得做吗

差异点:多数硬件指南回答"能不能装下"就结束了。更有用的问题是装下值不值。

在每百万输入 token $0.15 的标价下——部分 provider 目前折到 $0.075——托管的 GLM 5.3 Flash 极其便宜。两台 DGX Spark 是一笔实打实的资本支出。相对 $0.15/1M 达到盈亏平衡所需的 token 用量非常巨大,而自部署还会带来永远不出现在每 token 对比里的运维成本。

在 Spark 上自部署恰好有四个成立的理由:

  • 数据主权——数据确实不能出场。
  • 离网部署——推理时没有外部网络。
  • 微调——MIT 许可允许,成果归你;注意 NVIDIA 给单台 Spark 的微调标称上限是 70B,所以一个 320B MoE 超出这个范围。
  • 可复现性——你需要把确切权重永久锁定,不受 provider 决策影响。

成立于单纯的成本考虑(在这个价位上),也不成立于你还没确认模型适不适合你的任务时。而那个确认是零成本的:在任何人签硬件申请单之前,先在浏览器里测 GLM 5.3 Flash,或者从现有框架调用 glm-5.3-flash API。

如果必须本地跑,有更便宜的选择

如果本地推理不可妥协而 2× Spark 又超出预算,诚实的建议是换一个模型。DeepSeek V4 Flash160 GB——差不多是 GLM 5.3 Flash 的一半——同样 MIT 许可、同样 1M 上下文,而且实测更快(119.4 输出 token/秒)。它在 Artificial Analysis 的 Intelligence Index 上更低(52 对 57),主线版本是纯文本而非原生多模态。

这就是本地推理这一档的真实取舍:GLM 5.3 Flash 更聪明、能处理图片和视频;DeepSeek V4 Flash 能装进你可能已经拥有的硬件。

常见问题

GLM 5.3 Flash 能在单台 DGX Spark 上跑吗? 不能。FP8 权重约 328 GB,而统一内存是 128 GB——大约超了 2.5 倍。即使激进量化,单台也几乎不给 KV cache 留空间。

我需要几台 DGX Spark? 两台,配 4-bit 或混合量化,是社区帖子收敛到的配置。NVIDIA 官方支持两台互联,并给这一对标称最高 405B 参数(降精度前提下)。

GLM 5.3 Flash 在 2× DGX Spark 上有多快? 一个论坛帖子报告峰值约 43.4 token/秒。那是社区实测、量化构建未指明、没有公布方法学——请当作数量级信号,不是规格。

量化会伤害质量吗? 几乎肯定会有一定程度,且幅度未知。所有已发布跑分都用完整 FP8 精度,而这个架构的长上下文行为本来就依赖 IndexPool 压缩。请给你自己的量化构建跑基准,别假设发布数据能平移。

有能装进一台 Spark 的更小模型吗? DeepSeek V4 Flash 约 160 GB,是最接近的同类开源权重模型,在有限硬件上友好得多,不过完整精度下仍超过单台 128 GB。两个模型的社区 GGUF 量化版本可以把占用进一步压低。

来源

核对于 2026 年 8 月 27 日。归属于 NVIDIA 开发者论坛的吞吐与显存适配数据为社区实测、未经独立验证;NVIDIA 硬件规格取自 NVIDIA 官方产品文档。

立即开始使用 GLM 5

免费试用 GLM 5 — 推理、编程、智能体和图像生成,一个平台全搞定。