快速回答: GLM 5.3 Flash 更聪明、混合成本更低;DeepSeek V4 Flash 快出一倍还多。 在 Artificial Analysis 的 Intelligence Index 上,GLM 拿 57 分对 DeepSeek 的 52 分;混合价每 100 万 token $0.10 对 $0.23——但 DeepSeek 的输出速度是 119.4 token/秒,GLM 是 50.2。如果瓶颈是质量或成本,选 GLM。如果瓶颈是墙钟吞吐,选 DeepSeek。如果你需要原生图片和视频输入,只有 GLM 够格。
这两个模型在规格表上几乎可以互换:都是 MIT 许可的开源权重 MoE 模型,都宣称 1M token 上下文窗口,都是某个中国实验室旗舰家族的廉价档,标价输入也只差几分钱。正因为表面如此相似,这道选择题才经常做错——真正重要的差异都不在规格表正面。
以下内容取自 Artificial Analysis 的独立实测(两个模型跑同一套框架,所以数字真正可比)、两家厂商的官方定价,以及 Hugging Face 模型卡,核对于 2026 年 8 月 27 日。我们没有自己做过正面评测,凡公开记录稀薄之处都会明确指出,而不是用猜测填补。
这篇文章解决什么问题
痛点:两个模型的头条数字指向相反方向,而多数对比只引用其中一个维度。 GLM 在智能和混合价上胜出。DeepSeek 在速度和原始输出 token 成本上大幅胜出。只引价格表的文章会得出"DeepSeek 更便宜",只引智能指数的会得出"GLM 更好"。两句话技术上都对,两句话都不是决策。
读完你会拿到五个真正有差异的维度的正面对比、那个会让成本答案反转的具体算术,以及一条四行的决策规则。
正面对比
| GLM 5.3 Flash | DeepSeek V4 Flash | |
|---|---|---|
| 发布 | 2026 年 8 月 26 日 | 2026 年 4 月 24 日 |
| 总参数 | 320B | 284B |
| 激活参数 | 18B | 13B |
| 架构 | MoE,KDA 线性 + NoPE 稀疏 MLA 混合注意力 | MoE |
| 上下文窗口 | 1,048,576 | 1,048,576 |
| 模态 | 文本 + 图片 + 视频 → 文本 | 文本(视觉是独立实验分支) |
| 权重许可 | MIT | MIT |
| API 标价 | 输入 $0.15 / 缓存 $0.03 / 输出 $0.50 | 输入 $0.14 / 输出 $0.28 |
| AA 混合价(7:2:1) | $0.10 / 1M | $0.23 / 1M |
| AA Intelligence Index | 57 | 52 |
| AA 输出速度 | 50.2 tok/s | 119.4 tok/s |
| AA 首 token 时间 | 1.47 s | 1.12 s |
第一回合:成本——以及答案为什么会反转
这是朴素对比失效最严重的一个维度。
按标价的输出 token 算,DeepSeek 便宜得多。 每 100 万 $0.28 对 $0.50——在账单更贵的那一半上省了 44%。对输出密集型负载(长文生成、话多的智能体、代码合成),DeepSeek 在单价上胜出,而且不接近。
按混合成本算,GLM 便宜得多。 Artificial Analysis 给 GLM 的混合价是 $0.10,DeepSeek 是 $0.23——GLM 便宜 2.3 倍。原因是 GLM 的缓存输入费率为每 100 万 $0.03,比它自己的新鲜输入便宜 5 倍。在 7:2:1 的缓存:输入:输出组合里,你大部分 token 都按那个 $0.03 计费。
所以到底是哪个?决定性的算术:
- 缓存命中率约 50% 以上、输入密集 → GLM 5.3 Flash。代码库级编程智能体、带固定 system prompt 的文档流水线、有稳定语料前缀的 RAG。$0.03 的缓存价压倒一切。
- 缓存复用低、输出密集 → DeepSeek V4 Flash。一次性生成、prompt 多变、每段对话都不同的聊天。GLM 的缓存优势根本不会激活,你只剩下 $0.50 对 $0.28 的输出价。
还有一个临时因素:GLM 5.3 Flash 目前在部分 provider 上有 5 折促销(Z.AI、Novita、GMICloud 为 $0.075 / $0.25),这让它今天在每个维度上都毫无争议地更便宜。完整的 provider 拆解见我们的 GLM 5.3 Flash 定价指南。但那是促销,别拿它做 12 个月的预测。
第二回合:智能
Artificial Analysis 给 GLM 5.3 Flash 57 分、DeepSeek V4 Flash 52 分。同一实验室、同一套框架,所以这是一个真正可比的 5 分差距,方向对 GLM 有利,也与"GLM 是更新的模型、激活参数更多(18B 对 13B)"相符。
Z.ai 自己的发布跑分强化了这个方向——Terminal-Bench 2.1 上 84.3、DeepSWE v1.1 上 63.4——但那是厂商自跑且并未把 DeepSeek V4 Flash 列为对照,所以它确立了 GLM 接近前沿,却没有裁定这场正面对决。把 Artificial Analysis 的数字当作可信的那一个。
在一个百分制左右的指数上,5 分是实打实的但不是颠覆性的。它是"能处理中等难度任务"和"更可靠地处理中等难度任务"之间的差别——不是一个能力档位的差别。
第三回合:速度——DeepSeek 的决定性胜利
119.4 token/秒 对 50.2。 DeepSeek V4 Flash 的输出速度是 GLM 5.3 Flash 的 2.4 倍,首 token 也更快(1.12 秒对 1.47 秒)。
这是两个模型之间最大的一道鸿沟,也是最容易被忽略的一个——因为两者名字里都有 "Flash"。DeepSeek 的 Flash 是速度档;GLM 的 Flash 是价格档。任何以为命名习惯可以跨厂商平移的人,都会在这里做错选择。
实际后果随你的任务形态放大。对交互式聊天界面,50 t/s 可以接受——人的阅读速度大致就在这个量级。对一条要生成一万份长文档的批处理流水线,2.4 倍的吞吐差就是 2.4 倍的墙钟时长差,以及你必须准备的并行容量差。而那笔容量成本,不会出现在任何单价对比表里。
第四回合:多模态——GLM 的决定性胜利
GLM 5.3 Flash 是原生多模态:文本、图片、视频输入,文本输出,视觉数据在 30T token 的预训练语料里,而不是事后经适配器加进去的。它是 GLM-5 家族首个原生多模态模型,Z.ai 报告其 OfficeQA Pro 得分 62.4——一个文档与视觉推理基准——并宣称在该项上领先 Claude Opus 4.8。
DeepSeek V4 Flash 的主线版本是文本。视觉能力存在于一个独立的实验分支里,而不在你会拿来做通用工作的那个模型中。
如果你的工作负载包含截图、UI 稿、带插图的 PDF、图表或视频帧,这就不是一个加分项,而是对 DeepSeek 的一票否决——一个模型能干这活,另一个不能。
判断原生多模态对你的任务是否真的有用,最快的方式是喂它一个真实素材。在 glm5.app 上试用 GLM 5.3 Flash,丢一张你产品里真的坏掉的界面截图进去,看看诊断结果能不能用。
第五回合:自部署
两者都是 MIT 许可,意味着都可以真正免费地部署、fork 和商用,没有营收门槛,也没有可接受使用条款附录。相同点到此为止。
权重体积是分水岭,而且差距很大。 GLM 5.3 Flash 的 FP8 版本合计约 328 GB;DeepSeek V4 Flash 约 160 GB——这两个数字来自 NVIDIA 开发者论坛用户对文件体积的读数,属社区来源而非厂商规格。差不多两倍的显存占用意味着差不多两倍的硬件。
实际来看:在 DGX Spark 这一档硬件上,论坛讨论认为 DeepSeek V4 Flash 在一套小配置的射程之内,而 GLM 5.3 Flash 需要多台设备集群配 4-bit 或混合量化才装得下。GLM 官方支持的服务栈是 SGLang、vLLM、TokenSpeed 和 KTransformers;社区 GGUF 量化版本覆盖 llama.cpp、Ollama、LM Studio 和 Jan。
如果计划是在中等硬件上自部署,DeepSeek V4 Flash 明显更好相处。 这是一个基础设施事实,不是质量事实,而它会决定的真实部署数量,比那 5 分的智能差距要多得多。
决策规则
四行。找到你那一行就可以不用往下读了。
- 你需要图片或视频输入 → GLM 5.3 Flash。DeepSeek 主线做不了。
- 吞吐是瓶颈(批处理流水线、高并发服务、延迟 SLO)→ DeepSeek V4 Flash,输出快 2.4 倍。
- 缓存密集、输入密集的流量(编程智能体、长上下文文档、稳定 system prompt)→ GLM 5.3 Flash。$0.03 的缓存价是这场对比里最便宜的东西。
- 在有限硬件上自部署 → DeepSeek V4 Flash,权重体积约为一半。
如果以上都不是你——流量混合、用托管 API、没有强约束——那么凭智能差距和混合价,GLM 5.3 Flash 是更好的默认选择,前提是记住目前让它价格好看的折扣是临时的。打破平局最便宜的方式是实证:把同样的十个难 prompt 各跑一遍。打开一个 GLM 5.3 Flash 会话完成其中一半,想写脚本的话公开 API ID 是 glm-5.3-flash。
常见问题
GLM 5.3 Flash 和 DeepSeek V4 Flash 哪个便宜? 取决于你的缓存命中率。按原始输出 token,DeepSeek 更便宜(每 100 万 $0.28 对 $0.50)。按 Artificial Analysis 的 7:2:1 混合口径,GLM 便宜 2.3 倍($0.10 对 $0.23),因为 GLM 的缓存输入是每 100 万 $0.03。高缓存复用利好 GLM;低复用加重输出利好 DeepSeek。
哪个更快? DeepSeek V4 Flash,明显更快——输出 119.4 token/秒对 50.2,首 token 时间也更短(1.12 秒对 1.47 秒)。GLM 的 "Flash" 指的是价格,不是延迟。
哪个更聪明? GLM 5.3 Flash,在 Artificial Analysis 的 Intelligence Index 上高 5 分(57 对 52)。同实验室、同框架,所以对比是公平的——不过 5 分是渐进优势,不是能力跃迁。
两个都能处理 100 万 token 吗? 两者都宣称 1,048,576 token 上下文窗口。但都没有公布长上下文衰减曲线,所以把这个上限当作规格而非保证,并在你的实际工作长度上实测检索准确率。
两个都是开源的吗?
两者的权重都以 MIT 许可发布——允许商用、修改和再分发。GLM 的权重在 Hugging Face 的 zai-org/GLM-5.3-Flash。注意 GLM 的代码仓库(zai-org/GLM-5)是 Apache-2.0,而权重是 MIT。
来源
- Artificial Analysis — GLM-5.3-Flash——GLM 的 Intelligence Index、输出速度、TTFT 与混合价。
- Artificial Analysis — DeepSeek V4 Flash——DeepSeek 在同一套框架上的相同指标。
- zai-org/GLM-5.3-Flash — Hugging Face 模型卡——参数量、MIT 许可、多模态、跑分表。
- DeepSeek API 定价——DeepSeek V4 Flash 第一方费率。
- GLM 5.3 Flash on OpenRouter——GLM 定价、上下文、provider 列表与促销折扣。
核对于 2026 年 8 月 27 日。GLM 5.3 Flash 的折扣价属促销性质、会变动;自部署权重体积为 NVIDIA 开发者论坛读数,属社区来源,非厂商规格。




