你要在两个开放权重的中国前沿模型之间做选择,它们的成本与能力取舍截然不同:GLM 5.2 更快、更聪明、能处理百万 token 文档,而 DeepSeek V3 以几分之一的价格提供接近的推理能力。
简单版结论:GLM 5.2 在 AA Intelligence Index 上得 51 分,DeepSeek V3 约 47 分;前者运行速度 158 t/s,后者约 55 t/s;前者支持 1M token 上下文窗口,是 DeepSeek V3 128K 上限的八倍。DeepSeek V3 输出 token 每 1M 只需 $1.10,GLM 5.2 是 $4.40——便宜 75%——而且 DeepSeek V3 采用 Apache 2.0 许可,允许商业自托管,限制更少。
选 GLM 5.2,如果你在处理长文档、运行需要高吞吐的智能体流水线,或需要编程与科学推理基准上的顶尖分数。
选 DeepSeek V3,如果每 token 成本是你的首要约束、你需要在宽松许可下自托管,或你的任务在 128K 上下文中就能从容完成。
快速对比
| 特性 | GLM 5.2 | DeepSeek V3 |
|---|---|---|
| AA Intelligence Index | 51 | 约 47 |
| 输出速度 | 158 t/s | 约 55 t/s |
| TTFT | 1.54 s | 约 1.2 s |
| 输入价格 | $1.40/M tokens | $0.27/M tokens |
| 输出价格 | $4.40/M tokens | $1.10/M tokens |
| 缓存命中价格 | $0.26/M tokens | — |
| 上下文窗口 | 1,048,576 tokens(1M) | 128,000 tokens |
| 总参数 | 753B | 671B |
| 激活参数(MoE) | 40B | 37B |
| 架构 | Transformer decoder,78 层,256 个专家,8 个激活,DSA | Transformer decoder,MoE |
| 许可 | MIT | Apache 2.0 |
| 可自托管 | 是(Hugging Face: THUDM/GLM-5.2) | 是 |
| 模态 | 仅文本 | 仅文本 |
基准性能
两个模型都是混合专家(MoE)架构,激活参数数量接近(约 40B vs 约 37B),所以通用基准上差距不大。差距在科学与智能体任务上拉开。
| 基准 | GLM 5.2 | DeepSeek V3 |
|---|---|---|
| AA Intelligence Index | 51 | 约 47 |
| GPQA Diamond | 89% | 约 75% |
| SWE-bench Pro | 62.1% | — |
| Terminal-Bench v2.1 | 78% | — |
| HumanEval | 90%+ | 约 90% |
| MMLU | — | 约 88.5% |
GLM 5.2 在 GPQA Diamond 上的 89% 是这个研究生级科学基准公开成绩最高的之一,说明它在多步科学推理上明显强于 DeepSeek V3 的约 75%。14 分的 GPQA 差距大到足以影响研究相关场景——化学、生物、物理——这些领域不容忍近似推理。
在 HumanEval 上,两个模型都收敛在 90% 附近,这反映的是该基准的天花板效应:大多数前沿模型都已饱和。评估编程能力时,SWE-bench Pro 是更好的区分器,而 GLM 5.2 在生产代码变体上的 62.1% 表明它有扎实的软件工程能力。DeepSeek V3 的 SWE-bench 数字不可直接比较,因为它是在该基准的不同版本上评估的。
AA Intelligence Index 把多项基准聚合成一个数字。在这样层级的前沿模型上,4 分差距(51 vs 约 47)代表真实但并不剧烈的质量差异——对大多数日常语言任务,用户很可能感受不到。
定价明细
| 指标 | GLM 5.2 | DeepSeek V3 | 用 DeepSeek V3 节省 |
|---|---|---|---|
| 输入(每 1M tokens) | $1.40 | $0.27 | 便宜 81% |
| 输出(每 1M tokens) | $4.40 | $1.10 | 便宜 75% |
| 缓存命中(每 1M tokens) | $0.26 | — | — |
DeepSeek V3 在输入和输出两端都便宜得多。对每天处理 1,000 万输出 token 的工作负载,GLM 5.2 每天 $44,DeepSeek V3 每天 $11——每天 $33 的差额,在这个量级下复利成每月约 $1,000 的节省。
GLM 5.2 的 $0.26/M 缓存命中价格低得惊人,会改变那些系统提示词重复或文档前缀固定的应用的计算。如果你的提示词 80% 是静态的且能稳定命中缓存,你的有效输入成本会降到接近 $0.26/M,缩小与 DeepSeek V3 的价格差距。
对低流量或实验性使用,绝对金额差异很小。一个每月跑 1M 输出 token 的开发者,GLM 5.2 付 $4.40,DeepSeek V3 付 $1.10——每月差 $3.30。在这个量级,能力和 API 可靠性比价格更重要。
GLM 5.2 可通过 Z.ai(base_url: https://api.z.ai/v1,模型 glm-5.2)和 OpenRouter(z-ai/glm-5.2)访问。关于 GLM 5.2 API 接入与成本结构的更多内容,见 GLM 5.2 定价 总览。
速度与延迟
| 指标 | GLM 5.2 | DeepSeek V3 |
|---|---|---|
| 输出速度 | 158 t/s | 约 55 t/s |
| TTFT | 1.54 s | 约 1.2 s |
GLM 5.2 生成 token 的速度大约是 DeepSeek V3 的三倍。据 Artificial Analysis,GLM 5.2 的吞吐量在所有前沿模型中排名第三——对一个 753B 参数的模型来说相当出众,也反映了其每 token 激活 8 个专家的稀疏 MoE 设计的效率。
DeepSeek V3 的 TTFT 约 1.2 秒,比 GLM 5.2 的 1.54 秒稍快,意味着 DeepSeek V3 的首个 token 出现得更早。在感知响应速度重要的交互式聊天应用中,这约 0.3 秒的 TTFT 优势可能会被注意到。不过一旦开始生成,GLM 5.2 三倍的吞吐优势意味着它完成长响应的绝对时间要快得多。
对有许多串行调用的智能体工作负载——每次工具调用响应都喂给下一次——GLM 5.2 的更高吞吐能显著减少墙钟时间。假设基础设施延迟相近,一个包含 50 次 LLM 调用、每次 500-token 响应的流水线,用 GLM 5.2 大约快三倍完成。
对流式聊天界面——用户看着模型打字——两个模型都感觉流畅。吞吐差异在批处理、后台任务和多步智能体这类总时间至关重要的场景才变得关键。
上下文窗口
GLM 5.2 支持 1,048,576-token(1M)上下文窗口。DeepSeek V3 支持 128,000 tokens。实际影响高度取决于你的使用场景。
1M 上下文窗口大约能容纳:
- 一个包含 700+ 个中等大小文件的完整软件仓库
- 一份 750 页的法律合同或技术规格书
- 整套丛书或多年邮件存档
- 数十篇研究论文的单个提示词
128K 窗口(DeepSeek V3)大约能容纳:
- 一份 100 页的文档
- 5–10 篇研究论文
- 一个完整的中型代码库
对大多数问答、摘要和代码生成任务,128K 够用。绝大多数真实世界提示词都能轻松落在这个限制内。但当不够时——你需要传入完整仓库、冗长的监管文件或丰富的对话历史——DeepSeek V3 就需要分块、检索或上下文压缩策略,这会增加工程开销并带来丢失相关信息的风隙。
GLM 5.2 的 1M 上下文不只是数量上的能力,更是质的飞跃。它开启了 128K 模型在架构上不可能实现的使用场景:跨整个文档集的跨文档推理、从数百个示例中上下文学习,或在长智能体任务中保持完整会话历史而无需摘要损失。
关键差异:许可与自托管
两个模型都是开放权重、可自托管的,但许可在重要方面有所不同。
GLM 5.2 使用 MIT 许可。MIT 是软件界最宽松的许可之一——对使用、修改或分发几乎不加限制,包括商业使用。权重在 Hugging Face 的 THUDM/GLM-5.2。
DeepSeek V3 使用 Apache 2.0。Apache 2.0 同样是宽松的商业许可,但包含署名要求以及 MIT 没有的明确专利条款。对大多数企业法务团队,两个许可都满足商业部署的门槛。如果你的法务团队已广泛预先批准 MIT 项目,GLM 5.2 可能面临的内部审查轮次更少。
两个模型都不支持图像或音频输入——都是纯文本。如果你的应用需要多模态输入,这两个模型当前形态都不合适。最新能力路线图见 GLM 5.2 完整规格。
什么时候选 GLM 5.2
- 你的文档或对话历史超过 128K tokens,且分块不可接受
- 你在运行智能体流水线,吞吐(158 t/s)直接减少墙钟时间和成本
- 你的领域需要 GPQA Diamond 级别的科学推理(89%)——化学、生物、医学、高级工程
- 你需要 SWE-bench 质量的软件工程表现(Pro 变体 62.1%)
- 你的系统提示词又大又静态,GLM 5.2 的 $0.26/M 缓存命中价格划算
- 你想要一个经过验证的 MIT 许可开放权重模型,商业路径清晰
- 你倾向于用 Z.ai API 或 OpenRouter 部署,不自己管理 GPU 基础设施
什么时候选 DeepSeek V3
- 输出 token 成本是主导因素,且你能在 128K 上下文内工作
- 你在自有基础设施上自托管,想要 Apache 2.0 明确的专利保护
- 你的场景是通用文本任务——摘要、翻译、内容生成、聊天——4 分的 AA Index 差距几乎不可感知
- 你在原型开发或跑低流量实验,想要最低的入门成本
- 你的团队已经集成了 DeepSeek V3,切换成本超过性能增量
- 对你的流式场景,TTFT(约 1.2 s)比生成吞吐更重要
常见问题
GLM 5.2 比 DeepSeek V3 好吗? 在可测的基准上,GLM 5.2 全面领先:AA Intelligence Index 51 vs 约 47,GPQA Diamond 89% vs 约 75%,生成速度 158 t/s vs 约 55 t/s 明显更快。「更好」是否适用于你的场景,取决于这些差异是否落在你在意的维度上。对成本敏感型通用任务,DeepSeek V3 提供了很高的性价比。对科学推理、长上下文任务和智能体流水线,GLM 5.2 是更强的选择。
两个模型能用于同一个应用吗? 能。一个常见模式是把廉价、高吞吐的任务(分类、抽取、简单问答)路由给 DeepSeek V3,把复杂、延迟敏感或长上下文任务路由给 GLM 5.2。两者都暴露 OpenAI 兼容 API,在路由层切换它们非常直接,无需改动应用代码。
GLM 5.2 的 1M 上下文窗口实际表现如何? GLM 5.2 通过架构优化把标准注意力机制扩展到 1M tokens。实践中,1M 上下文的极远端性能可能下降——所有长上下文模型都是如此。处理超长文档时,为获得最佳效果,把最重要的信息放在上下文的开头或结尾附近,那里注意力通常最强。
哪个模型更适合编程? 两个模型在 HumanEval 上都约 90%。GLM 5.2 在 SWE-bench Pro 上的 62.1% 表明它在真实软件工程任务——bug 修复、多文件编辑、仓库级推理——上更强。对简短、自包含的代码生成,两个模型大致相当。对生产软件工程工作流,GLM 5.2 有优势。
两个模型都能不自托管通过 API 使用吗? 能。GLM 5.2 可通过 Z.ai(交互式使用经 glm5.app/chat 无需 API key)和 OpenRouter 使用。DeepSeek V3 可通过 DeepSeek 自己的 API 以及多个第三方 API 服务商使用。自托管两个模型都需要可观的 GPU 资源,毕竟它们的参数量分别是 753B 和 671B。
DeepSeek V3 价格更低意味着质量更差吗? 不一定——DeepSeek V3 在 HumanEval 上约 90%、MMLU 上约 88.5%,对前沿层级的模型来说是很有竞争力的分数。价格差异反映的是 DeepSeek 的基础设施经济学和商业模式,而不是直接的质量妥协。对通用语言任务,质量差距很小。差距在专业科学基准(GPQA Diamond:89% vs 约 75%)和 GLM 5.2 更高 AA Index 分数得以显现的智能体任务上拉大。
哪个模型的开源许可更好? MIT(GLM 5.2)和 Apache 2.0(DeepSeek V3)都是允许商业使用、修改和再分发的宽松许可。MIT 更简单、略微更宽松——没有专利条款、署名要求更少。对大多数商业应用,两个许可都可用;如有特定合规要求请咨询你的法务团队。
结论
GLM 5.2 在每一项基准上都是更强的模型——更快、科学任务更聪明、上下文比 DeepSeek V3 大八倍。当你以成本为优化目标、工作负载落在 128K tokens 以内时,DeepSeek V3 是更好的选择。在规模上,75% 的输出 token 节省意义重大。在低流量下,或当质量与速度重要时,GLM 5.2 值得那份溢价。
试用 GLM 5.2——无需 API key:glm5.app/chat。




