GLM 5.2 vs Qwen 3:两款中国开放权重模型对比
Jul 20, 2026

GLM 5.2 vs Qwen 3:两款中国开放权重模型对比

Qwen 3 235B-A22B 每个输出 token 比 GLM 5.2 便宜 73%,但 GLM 5.2 上下文大 8 倍、智能体基准表现更强。两大开放权重领军者这样对比。

你的生产负载需要一个能打的开放权重模型,而你把候选圈定在了两款中国旗舰系统上:Zhipu AI 的 GLM 5.2 和阿里云的 Qwen 3 235B-A22B。两者在原始智能上都在前沿竞争——决策取决于每 token 成本、上下文长度、推理速度,以及你的负载在多大程度上依赖智能体任务。

一句话版本: GLM 5.2 在 Artificial Analysis Intelligence Index 上得 51 分;Qwen 3 235B-A22B 落在约 50–52 的同一区间,两者在通用推理能力上基本打平。把它们区分开的是其他一切。GLM 5.2 以每秒 158 token 运行——据 Artificial Analysis,全球最快的前沿模型之一——支持 1M token 上下文窗口,在 SWE-bench Pro 上拿到 62.1%、Terminal-Bench v2.1 上 78%,属于已公开报道的最强智能体数据之一。Qwen 3 每个输出 token 便宜 73%($1.20/M 对比 $4.40/M),在规模大时累积得很快。

选 GLM 5.2,如果你需要单次处理长文档或整个代码库、运行自主软件智能体,或在延迟敏感的产品中需要近乎实时的响应速度。

选 Qwen 3 235B-A22B,如果你运行的是输出 token 成本主导预算的高吞吐生成流水线、你的内容能舒服地装进 128K token,并且你愿意用一部分智能体能力换显著的成本节省。

快速对比

特性GLM 5.2Qwen 3 235B-A22B
Intelligence Index (AA)51约 50–52
总参数 / 激活参数753B / 40B235B / 22B
架构MoE(256 专家,8 个激活)MoE(235B 总参数,22B 激活)
上下文窗口1,048,576 token(1M)128,000 token(128K)
输入价格$1.40/M token$0.30/M token
输出价格$4.40/M token$1.20/M token
缓存读取价格$0.26/M token
推理速度158 t/s约 50–60 t/s
首 token 时间1.54s
许可证MITApache 2.0
模态文本文本
开发者Zhipu AI / Z.ai阿里云

两个模型都是开放权重,可在 HuggingFace 获取。GLM 5.2 在 THUDM/GLM-5.2;Qwen 3 在 Qwen/Qwen3-235B-A22B。自托管两者都不需要商业许可费。

基准测试表现

基准测试GLM 5.2Qwen 3 235B-A22B
GPQA Diamond89%约 85%
HumanEval90%+约 90%+
SWE-bench Pro62.1%
Terminal-Bench v2.178%

在标准学术基准上,两个模型趋同。GPQA Diamond——一个用于代理专家级推理的研究生级科学推理测试——GLM 5.2 拿 89%,Qwen 3 约 85%。HumanEval 衡量 Python 代码生成,两个模型都在 90% 以上。

更有意义的差距出现在智能体评估上。SWE-bench Pro 测试模型跨整个代码库自主解决真实 GitHub issue 的能力。GLM 5.2 的 62.1% 是这一基准上公开报道的最高结果之一。Terminal-Bench v2.1 衡量多步 CLI 任务完成度,GLM 5.2 是 78%。Qwen 3 在这两个智能体基准上没有可比的公开数据——这说明要么没跑过,要么结果没发布——如果你的首要关切是智能体可靠性,这是一个有意义的信号。

两个模型都支持扩展思考(输出前的 chain-of-thought 推理),能提升复杂多步问题的表现。该功能可通过 API 使用:Z.ai(GLM 5.2)和阿里云或 OpenRouter(Qwen 3)都有。

定价拆解

价格档GLM 5.2Qwen 3 235B-A22BQwen 3 节省
输入(每 M token)$1.40$0.30便宜 79%
输出(每 M token)$4.40$1.20便宜 73%
缓存读取(每 M token)$0.26

对大多数负载,输出 token 主导成本。GLM 5.2 的 $4.40/M 对比 Qwen 3 的 $1.20/M,你用 GLM 5.2 每个输出 token 要多付约 3.7 倍。一个每月生成 1 亿输出 token 的负载,就是 $440,000 对比 $120,000——每月差 $320,000。

GLM 5.2 用 $0.26/M 的提示词缓存部分抵消了这一点。如果你的应用复用大型系统提示词或文档前缀——RAG 流水线和智能体系统的常见模式——有效输入成本可以大幅下降。Qwen 3 没有列出等价的公开缓存定价。

当你把上下文长度需求算进去,成本计算会发生变化。如果你需要一次性处理 500K token 的法律文件或整个开源仓库,Qwen 3 做不到。它的 128K 上下文上限意味着你必须把文档分块、多次调用、再合并结果。这些工程开销,加上分块边界处损失的准确性,是定价页上看不到的真实成本。

对延迟敏感的应用——聊天机器人、实时编程助手、交互式智能体——GLM 5.2 的速度优势还能在不水平扩展的情况下转化为更好的用户体验。吞吐大约是 Qwen 3 的 3 倍,同样的推理基础设施你可以服务 3 倍的并发用户。想深入了解 GLM 5.2 的价格档位和缓存行为,请看 GLM 5.2 定价拆解

速度与延迟

指标GLM 5.2Qwen 3 235B-A22B
输出吞吐158 t/s约 50–60 t/s
首 token 时间(TTFT)1.54s

据 Artificial Analysis 基准测试,GLM 5.2 的吞吐在所有前沿模型中排名第三——仅次于最快的几个系统,大幅领先大多数。按每秒 158 token 计算,一段 2,000 词(约 2,500 token)的响应大约 16 秒完成。按 55 t/s(Qwen 3 的中点估计值),同样的响应要约 45 秒。

在面向用户的聊天产品里,16 秒和 45 秒的区别,就是可用体验与不可用体验的区别。对隔夜运行的批处理任务,吞吐差异没那么要紧——但它仍然影响你需要的实例数量和基础设施预算。

GLM 5.2 的 1.54 秒首 token 时间有竞争力。用户把第一个 token 感知为响应的开始,所以短的 TTFT 让模型在完整答案到来之前就感觉灵敏。Qwen 3 经第三方 API 的公开 TTFT 数据没有一致的基准测试;结果因供应商而异。

上下文窗口

GLM 5.2 支持 1,048,576 token 的上下文窗口——通常叫 1M 上下文。Qwen 3 235B-A22B 支持 128,000 token。实际差距是 8 倍。

这个差异在几个具体场景里很重要:

  • 法律和金融文档。 一份大合同或 10-K 申报文件可能超过 200,000 token。GLM 5.2 一次调用处理整份文档;Qwen 3 需要分块和合并。
  • 代码库分析。 一个中等规模的开源仓库通常有 500K–1M token 的源码。GLM 5.2 可以吞入整个仓库上下文;Qwen 3 不做大量预处理做不到。
  • 长文研究综合。 多文档研究任务——学术论文、新闻档案、财报电话会记录——极大受益于大上下文。在 1M token 下,GLM 5.2 可以同时容纳约 750 篇研究文章。
  • 智能体记忆。 自主智能体会在多次工具调用中累积很长的对话历史。1M 上下文意味着智能体很少需要总结或丢弃早期上下文,降低上下文截断带来的幻觉风险。

对 128K 真正够用的应用——大多数聊天机器人、短文档问答、小函数代码生成——GLM 5.2 的上下文优势无关紧要,Qwen 3 更低的成本成为主导因素。

许可证与自托管

按实际标准,两个模型的开放程度相当。GLM 5.2 以 MIT 许可证发布;Qwen 3 用 Apache 2.0。两者都允许商业使用、微调和再分发,无版税。MIT 在署名要求上略宽松,但对大多数组织来说这个区别无关紧要。

两者都可行自托管完整模型权重,不过部署 753B 参数的系统——即使在 MoE 下任何时刻只有 40B 激活——也需要大量 GPU 基础设施。大多数团队选择通过 Z.ai(GLM 5.2)或阿里云和 OpenRouter(Qwen 3)的 API 接入,而不是自研跑旗舰模型。两个家族都有更小的蒸馏变体,可用更克制的硬件需求做本地或本地部署推理。

两个模型的旗舰版本目前都不支持图像或音频输入。Qwen3-VL(阿里的独立模型)增加了视觉能力;截至本文写作时 GLM 5.2 是纯文本。如果多模态输入是硬性要求,请评估专门为该模态设计的模型,而不是这里对比的两款旗舰。

什么时候选 GLM 5.2

  • 你需要处理超过 128K token 的文档、仓库或对话历史
  • 你的应用需要自主智能体——写代码并执行、开 issue,或完成多步 CLI 任务
  • 响应延迟面向用户,158 t/s vs 约 55 t/s 转化为可测的 UX 差异
  • 你想要最强的公开记录的智能体基准数据(SWE-bench Pro 62.1%、Terminal-Bench v2.1 78%)
  • 你的负载受益于提示词缓存——$0.26/M 的缓存读取价格让长系统提示词在规模化后变得经济
  • 你偏好 MIT 许可证以获得最大的下游灵活性

什么时候选 Qwen 3 235B-A22B

  • 输出 token 成本主导你的预算,$1.20/M vs $4.40/M 的 73% 节省是决定性因素
  • 你的文档和对话能稳定装进 128K token
  • 你已经扎根于阿里云生态(阿里云、DashScope),想要单一供应商关系
  • 你想要在统一供应商下接入更广的 Qwen 模型家族——面向代码任务的 Qwen2.5-Coder、面向视觉的 Qwen-VL
  • 你的用例是离线批量生成,吞吐速度不如每 token 成本重要

常见问题

GLM 5.2 和 Qwen 3 在整体智能上相当吗?

相当——两者在 Artificial Analysis Intelligence Index 上都在 50–52 区间,该指数聚合了数十个标准化基准的表现。它们在通用推理上是同级模型。区分它们的是速度、上下文长度、智能体能力和价格,而不是原始智能分数。

哪个模型更适合编程任务?

两者在 HumanEval 上都超过 90%。GLM 5.2 在真实软件工程上拉开差距:SWE-bench Pro 62.1%(测试在真实仓库上解决真实 GitHub issue)和 Terminal-Bench v2.1 78%(多步 CLI 任务完成)。如果你在构建一个需要跨整个代码库自主工作的编程助手,GLM 5.2 的智能体基准比单独的 HumanEval 更有参考价值。

我可以免费使用 GLM 5.2 吗?

GLM 5.2 可以在 glm5.app/chat 免费测试,无需 API key。生产 API 使用按 Z.ai 定价:输入 $1.40/M token、输出 $4.40/M token、缓存读取 $0.26/M。模型也可以通过 OpenRouter 以标识符 z-ai/glm-5.2 访问。

MoE 模型的总参数和激活参数有什么区别?

两个模型都使用 Mixture of Experts(MoE)架构,任何单次前向传播只有一部分参数激活。GLM 5.2 总参数 753B,每个 token 激活 40B;Qwen 3 总参数 235B,激活 22B。实践中这意味着推理算力——以及成本——随激活参数而非总参数增长。两个模型的运行成本都不如同等规模的稠密 750B 或 235B 模型高。

两个模型都支持扩展思考吗?

支持。GLM 5.2 和 Qwen 3 235B-A22B 都支持扩展思考(也叫 chain-of-thought 或推理模式),模型在产生输出前先在内部解决问题。这会显著提升复杂数学、逻辑和多步编程任务的表现。该功能在 Z.ai 和 OpenRouter 上都可通过 API 参数使用。

哪个模型更适合处理长文档?

GLM 5.2 大幅领先。它的 1M token 上下文可以在单次 API 调用中容纳一整本书、一份法律合同、一个大型代码库或多年财报电话会记录。Qwen 3 的 128K 上限要求任何更长的内容都必须分块,这会带来工程复杂性,并可能丢失对准确综合至关重要的跨块关系。

我可以自托管任意一个模型吗?

两个模型都是开放权重,托管在 HuggingFace 上。GLM 5.2 的权重在 THUDM/GLM-5.2(MIT 许可);Qwen 3 在 Qwen/Qwen3-235B-A22B(Apache 2.0)。完整自托管旗舰模型需要大量 GPU 基础设施。两个家族的更小蒸馏变体可满足本地或本地部署,硬件需求更克制。

写在最后

GLM 5.2 和 Qwen 3 235B-A22B 是目前最强的两款中国开放权重模型,它们服务不同的优化目标。Qwen 3 是面向高吞吐文本生成的最具成本效率的前沿级模型,输出 $1.20/M。当上下文长度、推理速度或智能体基准表现是硬性要求而非锦上添花时,GLM 5.2 是更强的选择——它的 158 t/s 吞吐、1M 上下文和领先的 SWE-bench 结果在前沿是真正的差异化。没有哪款普遍更好;正确答案取决于你的 token 预算和你正在构建什么。

试用 GLM 5.2——无需 API key:glm5.app/chat

Sources

Start Using GLM 5 Today

Try GLM 5 free — reasoning, coding, agents, and image generation in one platform.