GLM 5.2 与 Kimi K3:基准、价格与怎么选
Jul 18, 2026

GLM 5.2 与 Kimi K3:基准、价格与怎么选

Kimi K3 的 AA 智能指数 57 分,GLM 5.2 是 51 分,但 K3 输出 token 贵 3.4 倍、响应慢 2.5 倍。本文讲清两个模型各自在什么场景下值得用。

Kimi K3 于 2026 年 7 月 16 日发布——这是 Moonshot AI 推出的 2.8 万亿参数推理模型,Artificial Analysis 智能指数 57 分,一发布就被拿来和 GLM 5.2 比较。一句话结论:K3 基准成绩更高,但每个输出 token 要多付 3.4 倍的钱,每次响应要多等 2.5 倍的时间。

同一指数上 GLM 5.2 得 51 分。它领先的地方:每百万输出 token 4.40 美元对比 15.00 美元、每秒 158 token 对比 62 token、MIT 许可的权重今天就能在 Hugging Face 拿到。Kimi K3 的开放权重要到 7 月 27 日;GLM 5.2 的现在就是公开的。

选 GLM 5.2,如果你的工作流纯文本、在规模上运行且输出成本差会复利,或者你需要这个档位最快的响应时间。

选 Kimi K3,如果你需要图像输入、想要开放权重类别里最高的基准分,或者能承受更高的 token 价格换取实实在在的智能提升。

快速对比

GLM 5.2Kimi K3
智能指数5157
输出速度158 t/s62 t/s
首 token 时间1.54s1.99s
输入价格$1.40/M$3.00/M
输出价格$4.40/M$15.00/M
缓存命中价格$0.26/M$0.30/M
上下文窗口1M token1M token
模态仅文本文本、图像
总参数753B / 40B 激活2.8T
许可证MIT(现在可用)修改版 MIT(7 月 27 日)
发布时间2026 年 6 月2026 年 7 月 16 日
可自托管是(7 月 27 日)

基准表现

Kimi K3 在多数已发布基准上保持明显领先。差距因任务类型而有显著差异:K3 在 GitHub 风格编码评估上领先最多,而 GLM 5.2 在智能体终端任务上表现相当或更优。

基准GLM 5.2Kimi K3
AA 智能指数5157
AA 编码指数76
DeepSWE46.2%67.5%
FrontierSWE67.3%81.2%
Terminal-Bench v2.178%
SWE-bench Pro62.1%
GPQA Diamond89%≈88%

DeepSWE 和 FrontierSWE 的差距是 K3 最有力的论据:分别领先 21 和 14 个百分点。两者都是评估 GitHub issue 解决和前沿编码任务的真实世界软件工程基准。如果你的工作负载与这些评估相似,K3 的优势是实质性的。

Terminal-Bench v2.1 则反过来了:GLM 5.2 得 78%,它测试的是终端环境中的智能体编码——shell 命令、文件导航、脚本工作流、重复工具调用。对 CI 管道和自动化 shell 智能体,GLM 5.2 保持领先。

在 GPQA Diamond——一个博士级科学推理基准——上,两个模型都落在约 88–89%。科学推理的顶端,智能指数差距被显著压缩。

Kimi K3 的 57 总分让它和 Claude Opus 4.8 同处一个档位——对开放权重模型来说是不寻常的成就。在 LMArena 的 Frontend Code Arena 上它首发即 #1,Elo 1679,这对 UI 生成和前端开发任务来说是强烈的信号。

价格分解

两个模型之间的价格差是对比中最大的因素,单看输出 token 时差距进一步拉大。

价格档GLM 5.2Kimi K3GLM 5.2 节省
输入$1.40/M$3.00/M便宜 54%
输出$4.40/M$15.00/M便宜 71%
缓存命中$0.26/M$0.30/M便宜 13%

71% 的输出 token 折扣才是要关注的数字。多数实际 API 工作流产生的输出 token 远超输入 token,这意味着实际成本差更接近输出费率,而不是混合平均值。

具体示例:一次 30K 输入 token、10K 输出 token 的代码审查任务,用 GLM 5.2 花 $0.086,用 Kimi K3 花 $0.24——每次调用贵约 2.8 倍。每天 10,000 次调用,年差距超过 $560,000。

缓存命中价格几乎相同($0.26 对比 $0.30),所以重复上下文的工作流不会显著改变成本对比。基准输出费率仍是主导因素。

各家供应商的费率与 Kimi 和 Z.ai 官方 API 不同,逐供应商对比见 GLM 5.2 价格分解

速度与延迟

GLM 5.2 的响应生成明显更快。Kimi K3 在首 token 时间上也有小幅劣势。

指标GLM 5.2Kimi K3
输出速度158 t/s62 t/s
首 token 时间1.54s1.99s

每秒 158 token,GLM 5.2 在 Artificial Analysis 速度榜上排第三。Kimi K3 的 62 t/s 落在同一榜单的后三分之一。

一个 500-token 的响应,GLM 5.2 大约 3 秒,Kimi K3 大约 8 秒。对聊天助手、IDE copilot 或实时代码审查者,用户能感受到这个差别。对过夜批处理任务,则无关紧要。

一个结构性说明:Kimi K3 是推理模型,意味着它在最终答案前先生成思考轨迹。1.99s 的首 token 时间部分反映了这段扩展推理的开始,输出吞吐与推理步骤竞争。向用户流式展示思考轨迹的应用,与等最终答案的应用,感受到的延迟可能不同。

上下文窗口:各 1M token

两个模型都支持 100 万 token——单次请求约 1,500 页文本。这一维度打成平手。两个模型都不收长上下文附加费;整个上下文窗口内价格扁平。

在这个上下文长度下,两个模型都能不切块地处理大型代码库、完整法律合同、长研究语料和长期多轮智能体历史。任务远低于 256K token 时,上下文优势与选择无关。

多模态能力

Kimi K3 接受文本和图像输入。GLM 5.2 只接受文本。

这是二元的容量差距,不是质量取舍。Kimi K3 的图像支持带来:

  • 截图转代码工作流(UI 稿或截图 → 实现)
  • 技术文档中的图表理解
  • 对含嵌入图像的文档做 OCR 式处理
  • 多轮对话中的视觉问答

只要其中任何一个工作流是你的应用核心,Kimi K3 就是两者中的唯一选项。任务需要图像输入时,GLM 5.2 的优势全部作废。

对纯文本工作流——代码生成、文档分析、推理、写作——GLM 5.2 的速度和成本优势照常适用,没有这个限制。

开源状态

GLM 5.2 权重今天就在 Hugging Face 上,MIT 许可证。Kimi K3 权重定于 2026 年 7 月 27 日发布——API 上线后十一天。

对断网部署、自托管推理集群或微调管道,GLM 5.2 立即可用。如果 7 月 27 日的发布按时落地、且你的使用场景能接受这个时间线,Kimi K3 才会成为选项。

规模上的硬件要求分化明显。GLM 5.2 运行 753B 总参数、任何时候 40B 激活——仍然苛刻,但现代 GPU 集群能应付。Kimi K3 的 2.8 万亿总参数要全规模运行,需要大得多的基础设施。GLM 5.2 的硬件要求见 如何本地运行 GLM 5.2

何时选 GLM 5.2

以下情况 GLM 5.2 是更好的选择:

  • 你的工作流完全是文本或代码——不需要图像或图表输入
  • 你在规模上运行,71% 的输出 token 成本节省在调用间有意义地复利
  • 响应速度对用户重要:交互应用中 158 t/s 对比 62 t/s 是可感知的差异
  • 你的智能体任务涉及终端式工作流:shell 命令、文件导航、重复脚本步骤
  • 你需要今天就能拿到的开放权重、完整 MIT 许可、无商业限制
  • 你在同档位模型间选择,且 GPQA 式科学推理是主要任务

GLM 5.2 在 AA 智能指数上比 Kimi K3 低 6 分。这个差距反映的是编码评估上的真实基准差异——具体是 DeepSWE 和 FrontierSWE。但成本和速度的取舍大到对许多生产工作负载而言,即便有基准差距,GLM 5.2 每美元提供的价值仍然更高。

何时选 Kimi K3

以下情况 Kimi K3 是更好的选择:

  • 你的工作流需要图像输入——UI 截图、架构图、文档图像、视频帧
  • 你想要开放权重类别里可用的最高基准分:AA 智能指数 57、AA 编码指数 76
  • GitHub 风格编码任务主导你的工作负载:issue 解决、pull request 审查、前端代码生成——DeepSWE 和 FrontierSWE 的差距(67.5% vs 46.2%、81.2% vs 67.3%)最直接地反映这些场景
  • 你需要在开放权重模型中获得与 Claude Opus 4.8 相当的前沿级推理
  • 每次调用成本对原始能力的约束较小:低量的专业工具,每次调用的价格差相对输出价值很小

Kimi K3 是截至 2026 年 7 月发布的最强开放权重模型。它的 2.8T 参数规模和前沿基准定位,让它比上一代 Kimi K2.x 系列显著上了一个台阶。

常见问题

Kimi K3 比 GLM 5.2 好吗?

多数基准上,是的——Kimi K3 在 Artificial Analysis 智能指数上 57 对 51,并在 DeepSWE(67.5% vs 46.2%)和 FrontierSWE(81.2% vs 67.3%)上领先。GLM 5.2 在 Terminal-Bench 上领先,输出 token 便宜 71%。哪个「更好」完全取决于你的工作负载更看重基准分还是成本效率。

Kimi K3 贵多少?

输入 token 每百万 $3.00 对 $1.40——贵 54%。输出 token 每百万 $15.00 对 $4.40——贵 241%,即 GLM 5.2 费率的 3.4 倍。在生产调用量下,输出 token 差距主导总成本。

Kimi K3 支持图像吗?

支持。Kimi K3 接受文本和图像输入。GLM 5.2 只支持文本。对多模态工作流,Kimi K3 是两者中的唯一选项。GLM 5.2 模态支持的完整细节,见 GLM 5.2 是多模态的吗?

Kimi K3 开源吗?

Kimi K3 的 API 于 2026 年 7 月 16 日上线。开放权重定于 2026 年 7 月 27 日发布,采用允许商用的修改版 MIT 许可证。GLM 5.2 权重今天就在,完整 MIT 许可证。

Kimi K3 的上下文窗口多大?

100 万 token——与 GLM 5.2 相同。两个模型在这个容量下都能处理大型代码库、长文档和长智能体历史。

GLM 5.2 比 Kimi K3 快吗?

是的。GLM 5.2 每秒生成 158 token;Kimi K3 每秒 62。GLM 5.2 的首 token 时间也更低(1.54s 对比 1.99s)。对交互应用,GLM 5.2 的响应速度快一倍以上。

Kimi K3 的意义在哪里?

Kimi K3 是一个 2.8 万亿参数模型——按发布时的参数量,是有史以来最大的开放权重模型。它作为开放权重模型拿到了与 Claude Opus 4.8 相当的基准分,而这在此前需要专有系统。它在 LMArena 的 Frontend Code Arena 首发 #1(1679 Elo),说明 UI 和前端代码生成任务上真实用户偏好强烈。

底线

Kimi K3 在基准测试上是更强的模型——智能指数 57 对 51,GitHub 风格编码评估上大幅领先。GLM 5.2 快 2.5 倍、输出 token 便宜 71%、而且今天就是开源的。

决策归结为两个问题:你需要图像输入吗?基准差距值得那个价格溢价吗?

需要图像输入:Kimi K3,没有权衡。成本或速度是约束:GLM 5.2。原始基准表现是约束、token 成本次要:Kimi K3。

GLM 5.2 基准详情逐供应商价格,或 它如何对比 Kimi K2.5。两个都试试——无需 API key:GLM 5.2 · Kimi K3

Sources

Start Using GLM 5 Today

Try GLM 5 free — reasoning, coding, agents, and image generation in one platform.