GLM 5.3 Flash 跑分:厂商自报数据 vs 独立实测
Aug 27, 2026

GLM 5.3 Flash 跑分:厂商自报数据 vs 独立实测

GLM 5.3 Flash 跑分解读:Terminal-Bench 2.1 拿 84.3、DeepSWE 63.4、Artificial Analysis 57 分。哪些是第一方数据,哪些经得起推敲。

快速回答: Z.ai 报告 GLM 5.3 Flash 在 Terminal-Bench 2.1 上拿 84.3(Claude Opus 4.8 为 85.0)、DeepSWE v1.1 上 63.4(GLM-5.2 为 46.2)、AutomationBench 上 48.8(对 26.2)、自家 Z.ai Code Bench v1.0 上 29.0(Opus 4.8 为 29.5)、OfficeQA Pro 上 62.4HLE 带工具 55.3。独立方面,Artificial Analysis 给出 Intelligence Index 57 分,输出速度 50.2 token/秒,首 token 时间 1.47 秒。头条数据是真的;需要打的折扣是:多数好看的对比,对照组都是厂商自己挑的。

跑分表是 AI 发布中被抄得最多、被追问得最少的东西。厂商放出六个数字,四十篇博客照抄,没人指出哪个基准是厂商自己写的、对照模型是谁挑的、脚注里的 "max effort" 又意味着什么。这篇文章把 Z.ai 的主张和独立实验室的实测分开,并告诉你其中哪一类才该影响你的决策。

以下每个数字都可追溯到 Z.ai 自己的模型卡与仓库,或 Artificial Analysis 的独立评测,核对日期 2026 年 8 月 27 日。我们没有自己重跑这些基准——认真跑一遍 Terminal-Bench 是一笔实打实的算力投入——我们宁愿直说,也不愿暗示做过并不存在的测试。我们做过的是:把每个数字都对回它的一手来源,而不是对回另一篇博客。

这篇文章解决什么问题

痛点:在你知道基准是谁写的、对照是谁挑的之前,一张跑分表什么都说明不了。 GLM 5.3 Flash 的发布表里包含一个 Z.ai 自己出的基准、几个讨巧但范围狭窄的对照组,以及一个 "max effort" 口径——那不是你在生产环境里会用的跑法。

读完你会知道哪三个数字是承重的、哪一个是营销、独立实验室怎么说,以及一件没人发布的事:那个对这个模型不利的实测结果。

第一方表格

Z.ai 公布的结果,以及它自己选择的对照模型:

基准GLM 5.3 Flash对照
Terminal-Bench 2.184.3Claude Opus 4.8:85.0 · GPT-5.6 Terra:87.4
DeepSWE v1.163.4GLM-5.2:46.2
AutomationBench48.8GLM-5.2:26.2
Z.ai Code Bench v1.0(max effort)29.0Claude Opus 4.8:29.5
OfficeQA Pro62.4官方称领先 Opus 4.8
HLE(带工具)55.3

现在来打分。

Terminal-Bench 2.1 —— 84.3。承重。 这是一个第三方智能体基准,衡量模型能否真正完成多步终端任务,也是最难作弊的项目之一。以远低于对手的价格落后 Claude Opus 4.8 仅 0.7 分,是本次发布中最有分量的一条主张。诚实的备注:GPT-5.6 Terra 在 87.4,所以这是"接近前沿",不是"处于前沿"。

DeepSWE v1.1 —— 63.4 对 GLM-5.2 的 46.2。承重。 这是同家族对比,同一套评测框架、同一个团队,相对提升 37%。确实是厂商自跑——但厂商拿自家上一代做对照,动机上远比拿竞品做对照要干净。再加上 Z.ai 宣称的相对 GLM-5.2 约 10 倍降价,这才是支撑"该迁移"的那个数字。

AutomationBench —— 48.8 对 26.2。承重,但有备注。 86% 的相对涨幅非常大,而非常大的涨幅通常意味着上一代在这个任务上本来就不适配,而不是新一代聪明了两倍。应该读作"GLM-5.2 在这里很弱,Flash 修好了",而不是一个通用智能倍率。

Z.ai Code Bench v1.0(max effort)—— 29.0 对 Opus 4.8 的 29.5。营销。 两个问题。第一,这个基准是 Z.ai 自己写的,厂商的内部评测不构成关于竞品的证据。第二,"max effort" 是一个推理预算档位——模型是在它最贵的配置下跑出这个数字的,而那不是你成本模型假设的配置。请相应打折。

OfficeQA Pro —— 62.4。有意思。 这是唯一一个 Flash 档宣称直接胜过旗舰的基准。它考察文档与视觉推理,而这恰好对上了模型真实的结构性优势:GLM 5.3 Flash 是原生多模态、在 30T token 多模态语料上训练,而不是外挂视觉适配器的文本模型。如果你的工作负载是文档、截图和图表,这是最该先拿自己数据去验证的数字。

HLE 带工具 —— 55.3。缺上下文。 模型卡上没有给对照组,所以它确立了一个水平,但没有确立一个排名。

独立数据

Artificial Analysis 跑自己的标准化评测而不是转载厂商表格,其结果:

指标GLM 5.3 Flash同类参照
Intelligence Index57同体量开源权重模型中位数约 27
输出速度50.2 tok/s中位数 67.0 t/s —— 低于同类中位数
首 token 时间1.47 s中位数 2.14 s —— 优于同类中位数
混合价$0.10 / 1M7:2:1 缓存:输入:输出
上下文窗口1.0M

57 分的 Intelligence Index 印证了大方向:这个模型的表现约为同体量开源权重模型中位数的两倍。这是一家独立实验室、一套标准化框架、一个厂商无法挑选的对照集。它是本页最可信的单一数字。

那个对它不利的数字

下面这个结果几乎没有任何发布报道提到,而它正是这篇文章存在的理由:GLM 5.3 Flash 很慢。

输出 50.2 token/秒,对比同体量模型 67 t/s 的中位数,明显低于平均。这个命名有实质的误导性。在多数厂商的命名习惯里,"Flash" 指的是延迟档;在这里它指的是价格档。这个模型便宜、接近前沿的聪明,同时不紧不慢地吐 token。

部分安慰来自首 token 时间:1.47 秒优于 2.14 秒的中位数,也就是说模型很快开始回应,然后慢慢流式输出。对聊天界面来说,这个组合比反过来要好忍受。但对一条"墙钟吞吐决定作业时长"的批处理流水线,这是一笔实实在在、却不体现在单价里的成本。

这恰恰是你该在自己的负载上验证、而不是听信任何人(包括我们)的那类事情。在 glm5.app 上跑一个 GLM 5.3 Flash 会话,给一个会产生长回复的 prompt 并计时——五分钟的自测胜过任何表格,包括这一张。

怎么把这些数字读成一个决策

差异点:跑分回答"有多好",而你的决策需要的是"对什么任务够好、代价多少"。 下面是我们用的判断框架。

如果你在从 GLM-5.2 迁移: DeepSWE(46.2 → 63.4)和 AutomationBench(26.2 → 48.8)的差值配上约十分之一的价格,基本是一次白送的升级。拿你最难的任务测一遍,然后迁。

如果你在拿它和旗舰比: Terminal-Bench 2.1 上的差距是 0.7 分,听起来等于没有。但基准在顶部会压缩——聚合分数上 0.7 分的差距,通常对应最难那一档任务上更大的差距。如果你的失败代价高且难以察觉,就把难路径留给旗舰,把简单的 80% 路由到 Flash。

如果你在权衡 DeepSeek V4 Flash: 五个维度的正面对比见 GLM 5.3 Flash vs DeepSeek V4 Flash

如果你的工作负载是多模态: OfficeQA Pro 是该信的那个数字,而原生多模态相对后期改造的视觉能力是结构性优势。直接实测。

如果吞吐是你的瓶颈: 上面所有跑分对你都不重要。重要的数字是 50.2 tok/s,而它低于中位数。要么另择模型,要么为并行度做预算。

还没有人测过的部分

公开记录里有两个空白,直说出来,免得你去找根本不存在的数字:

长上下文衰减未被测量。 模型宣称 1,048,576 token,并用 KDA 线性 + NoPE 稀疏 MLA 的混合注意力配合 IndexPool 压缩来让这个窗口变得可负担。Z.ai 报告相比 GLM-5.3 有约 3 倍更少的注意力计算和 4.4 倍更小的 KV cache。但没有任何已发布的基准显示:在 80 万 token 处的检索准确率相比 8 万 token 处会怎样。压缩按定义就是用精度换成本;这个取舍在该模型的极端处有多大,目前是未知数。

量化后的质量未被测量。 社区 GGUF 量化版本存在,且是在少于数台设备的条件下自部署的唯一现实路径。而本页所有跑分都跑在完整精度的 FP8 版本上。一个长上下文行为本来就依赖压缩的模型,再叠一层 4-bit 量化,那已经是另一个模型了,而没有人发布过这个差值。

如果这两点中的任何一个对你的部署重要,请把它当作开放问题去实测,而不是假设发布数据可以平移。当你准备好把真实任务丢给它时,打开一个 GLM 5.3 Flash 对话,或者把 glm-5.3-flash 这个模型 ID 接进你的评测框架。

常见问题

GLM 5.3 Flash 比 Claude Opus 4.8 更强吗? 在 Z.ai 挑选的基准上非常接近——Terminal-Bench 2.1 上 84.3 对 85.0,Z.ai 自家 Code Bench 上 29.0 对 29.5——但"聚合基准上非常接近"不等于"难任务上等价"。而且这两个对比都出自 Z.ai。把它当作强力的性价比替代品,而不是旗舰替代品。

Artificial Analysis 的 Intelligence Index 是多少? 57 分,对比同体量开源权重模型约 27 的中位数。这是最可信的数字,因为它由独立机构测量,且对照集不是厂商挑的。

GLM 5.3 Flash 快吗? 不快——在吞吐意义上不快。输出 50.2 token/秒,低于同类 67 t/s 的中位数。它起步快(1.47 秒 TTFT,优于 2.14 秒的中位数),然后慢慢流。"Flash" 指价格,不指速度。

它比 GLM 5.2 强多少? 在 Z.ai 自己的同家族评测上提升可观:DeepSWE v1.1 从 46.2 到 63.4,AutomationBench 从 26.2 到 48.8——而价格约为其十分之一。同家族对比是厂商表格里最可信的部分。

这些跑分能复现吗? 部分能。Terminal-Bench 2.1、DeepSWE、HLE 和 AutomationBench 都是第三方基准,你可以拿 MIT 许可的开源权重自己跑。Z.ai Code Bench v1.0 是 Z.ai 自己的,无法独立验证。

来源

跑分数据于 2026 年 8 月 27 日核对。第一方结果已在全文中标注;凡基准由模型厂商自己撰写,均在表格评述中注明。

立即开始使用 GLM 5

免费试用 GLM 5 — 推理、编程、智能体和图像生成,一个平台全搞定。