Kimi K3 定价:API 成本、上下文窗口与性价比对比
Jul 20, 2026

Kimi K3 定价:API 成本、上下文窗口与性价比对比

Kimi K3 输入每百万 token $3.00、输出 $15.00——每个输出 token 比 GLM 5.2 贵 3.4 倍,只为换 6 分的 AA Intelligence 领先。这里是完整拆解。

如果你正在为一个生产 API 负载评估 Kimi K3,第一个问题是:它的性能溢价是否值得比同类替代品高 3.4 倍的输出价格。本文给你做这个判断所需的精确数字。

速览

Kimi K3 由 Moonshot AI 发布,每百万输入 token 收 $3.00,每百万输出 token 收 $15.00。它的 AA Intelligence Index 得分 57,比 GLM 5.2 的 51 分高 6 分——但 GLM 5.2 输入只要 $1.40/M、输出只要 $4.40/M,输入便宜 53%、输出便宜 70%。两个模型都提供 1M token 上下文窗口。价格之外的决定性差异是模态:Kimi K3 接受图像输入,而 GLM 5.2 是纯文本。如果你的流水线不需要视觉,GLM 5.2 以零头的价格交付强劲的前沿表现。

选 Kimi K3,如果你需要图像理解、6 分的智能领先对你的输出有实质影响,并且你承受得起 3.4 倍的输出成本溢价。

选 GLM 5.2,如果你的负载是纯文本、吞吐和成本效率要紧,或者你需要前沿模型中最快的推理速度——158 t/s 对比 Kimi K3 的 62 t/s。


快速对比

特性Kimi K3GLM 5.2
开发者Moonshot AIZhipu AI / Z.ai
AA Intelligence Index5751
输入价格$3.00/M token$1.40/M token
输出价格$15.00/M token$4.40/M token
缓存命中价格$0.30/M token$0.26/M token
上下文窗口1M token1M token
输出速度62 t/s158 t/s
TTFT1.99s1.54s
参数2.8T753B 总 / 40B 激活
图像输入支持不支持
开放权重许可证修改版 MIT(2026 年 7 月 27 日)MIT

基准测试表现

AA Intelligence Index 是 Artificial Analysis 的复合基准,聚合了推理、编程和知识任务的能力评估。Kimi K3 得 57 分,GLM 5.2 得 51 分——6 分的差距是真实的,但在前沿层面算窄。

GLM 5.2 在几个标准基准上有已发布的结果:

基准测试GLM 5.2Kimi K3
AA Intelligence Index5157
GPQA Diamond89%
SWE-bench Pro62.1%
Terminal-Bench v2.178%
HumanEval90%+

GLM 5.2 的 GPQA Diamond 89% 已经把它放在研究生级科学推理的前沿。它的 SWE-bench Pro 62.1% 和 Terminal-Bench v2.1 78% 反映了强大的真实软件工程能力。对编程密集型流水线,这些结果让 GLM 5.2 与明显更贵的模型有竞争力。

Kimi K3 领先 6 分的 AA Intelligence Index 差距有意义,但对大多数文本生成、总结和代码任务,输出质量的实际差异会很微妙。这个差距在需要深度多步推理或复杂科学推断的任务中最要紧。


定价拆解

这两个模型之间的成本差异大到足以在规模化时改变架构决策。

成本类别Kimi K3GLM 5.2GLM 5.2 节省
输入(每 M token)$3.00$1.40便宜 53%
输出(每 M token)$15.00$4.40便宜 71%
缓存命中(每 M token)$0.30$0.26便宜 13%
输出成本倍数3.41x1x 基线

规模化后,这些差异累积得很快。考虑一个每月生成 1 亿输出 token 的负载:

  • Kimi K3:100M × $15.00/M = $1,500/月
  • GLM 5.2:100M × $4.40/M = $440/月
  • GLM 5.2 每月节省:$1,060

对文档处理或长上下文检索这类输入密集型负载,输入 token 的差距同样显著。处理 10 亿输入 token:

  • Kimi K3:1B × $3.00/M = $3,000
  • GLM 5.2:1B × $1.40/M = $1,400
  • GLM 5.2 节省:$1,600

缓存命中价格更接近($0.30 vs $0.26),所以提示词缓存密集的架构会稍微缩小差距——但 GLM 5.2 在每一个定价档位仍然胜出。


速度与延迟

速度是两个模型之间运营上最显眼的差距。

指标Kimi K3GLM 5.2优势
输出速度62 t/s158 t/sGLM 5.2(快 2.5 倍)
TTFT1.99s1.54sGLM 5.2(快 450ms)

GLM 5.2 以每秒 158 token 生成——据 Artificial Analysis 测量,在所有前沿模型中第三快。Kimi K3 以 62 t/s 运行,吞吐明显退一步。

实际来看:对 1,000 token 的响应,Kimi K3 生成时间约 16 秒,GLM 5.2 约 6 秒。2,000 token 时,是 32 秒对比 13 秒。对用户等待流式响应的交互式应用,这个差异用户可感知。

首 token 时间同样有利于 GLM 5.2:1.54 秒对比 Kimi K3 的 1.99 秒。这 450ms 的优势改善了流式界面和 IDE 助手中的感知响应度——延迟会显现在用户体验里。对吞吐影响任务队列清空时间的批处理负载,2.5 倍的速度差异在同样的硬件成本下仍然意味着更快的周转。


上下文窗口

两个模型都支持 1M token 上下文窗口(GLM 5.2 精确为 1,048,576 token)。这让它们在做长文档任务时处于同一档位,上下文长度不再是两者之间的区分因素。

把 1M token 换成实际概念:

  • 约 750,000 词——大约三本全本小说放在同一上下文里
  • 一个约 5,000 个文件、平均每文件 200 token 的软件代码库
  • 同时载入约 35 份完整的财报电话会记录

对 RAG 流水线、法律文档审阅、仓库级代码理解和研究综合,两个模型处理相同的最大输入规模。如果你目前正在撞上下文上限,两者都能解决问题——它们之间的选择不取决于上下文容量。


关键差异点

模态支持

最具决定性的功能差异是图像输入。Kimi K3 在文本之外接受图像,支持带嵌入图形的文档解析、截图分析、视觉问答和产品图像分类。GLM 5.2 是纯文本,无法处理图像。

如果你的应用需要视觉,Kimi K3 是两者中唯一可行的选项。如果你的负载是纯文本,这个差异点与你的成本收益计算无关。

架构与参数

Kimi K3 是一个 2.8 万亿参数模型。GLM 5.2 使用 Mixture of Experts(MoE)架构,总参数 753B,但每次前向传播只有 40B 激活——78 个 transformer 层、每层 256 个专家、每个 token 激活 8 个,采用 Dense Sparse Attention。激活参数数比总参数数更能驱动推理成本。GLM 5.2 的 MoE 设计在不付出相应算力开销的情况下实现了高容量,这解释了它速度与定价优势的很大一部分。

开放权重与自托管

两个模型都已发布权重。GLM 5.2 在 Hugging Face 上以标准 MIT 许可提供(THUDM/GLM-5.2)——可商业使用、可修改、可再分发,无限制。Kimi K3 的权重于 2026 年 7 月 27 日以修改版 MIT 许可发布。

自托管 Kimi K3 的 2.8T 参数模型,需要的基础设施比运行 GLM 5.2 每个 token 40B 激活参数多得多。如果出于合规或超高体量下的成本原因以自托管为目标,GLM 5.2 的运营足迹容易管理得多。


什么时候选 GLM 5.2

  • 你的负载是纯文本,没有图像或多模态需求
  • 吞吐要紧,你需要快 2.5 倍的 token 生成(158 t/s vs 62 t/s)
  • 你运行高吞吐生产负载,输出成本是首要约束
  • 你需要完全宽松的 MIT 许可证做自托管、修改或再分发
  • 你想要更低的 TTFT(1.54s vs 1.99s)支撑响应式流式界面
  • 编程和推理基准要紧——SWE-bench Pro 62.1%、GPQA Diamond 89%
  • 你想要通过 OpenRouter(z-ai/glm-5.2)的 API 接入以简化路由

什么时候选 Kimi K3

  • 你的应用需要图像输入——文档图像、截图、视觉 QA
  • 6 分的 AA Intelligence Index 优势(57 vs 51)在你的具体任务上提升输出质量
  • 你运行低到中等体量的负载,3.4 倍的输出成本溢价可以承受
  • 你的用例中单次查询的响应质量比吞吐更重要
  • 你需要2.8T 参数模型的接入,又不想投入自托管基础设施

常见问题

Kimi K3 每百万输出 token 多少钱?

Kimi K3 每百万输出 token 收 $15.00,每百万输入 token 收 $3.00。缓存命中按每百万 token $0.30 计价。这让 Kimi K3 在输出 token 上比 GLM 5.2 贵 3.4 倍($15.00 vs $4.40),在输入 token 上贵 2.1 倍($3.00 vs $1.40)。

Kimi K3 在 AA Intelligence Index 上跟 GLM 5.2 比怎么样?

Kimi K3 在 Artificial Analysis 的 Intelligence Index 上得 57 分,GLM 5.2 得 51 分——6 分的差距。Kimi K3 拥有可测的智能优势,但 GLM 5.2 在标准基准上已经达到前沿级结果,包括 GPQA Diamond 89% 和 SWE-bench Pro 62.1%。对大多数生产文本任务,实际质量差异很窄。

我可以用 Kimi K3 做图像理解吗?

可以。Kimi K3 同时接受文本和图像输入,适合文档解析、截图分析和视觉问答等视觉任务。GLM 5.2 是纯文本。如果图像处理是硬性要求,Kimi K3 是两个模型之间唯一的选择。

Kimi K3 是开源、可自托管的吗?

Kimi K3 的权重于 2026 年 7 月 27 日以修改版 MIT 许可发布。GLM 5.2 也是开放权重,在 Hugging Face(THUDM/GLM-5.2)以标准 MIT 许可提供。两者都支持自托管,不过 Kimi K3 的 2.8T 总参数数需要的基础设施比 GLM 5.2 每次前向传播 40B 激活参数多得多。

GLM 5.2 比 Kimi K3 快多少?

GLM 5.2 以 158 t/s 生成 token,Kimi K3 是 62 t/s——约快 2.5 倍。GLM 5.2 的 TTFT 也更低:1.54 秒对比 Kimi K3 的 1.99 秒。对延迟敏感的应用或高吞吐批处理负载,这一速度优势是重要的运营因素。

我可以通过 API 在哪里接入 GLM 5.2?

GLM 5.2 可通过 Z.ai 的 API 使用,base URL https://api.z.ai/v1,模型 ID glm-5.2。也可通过 OpenRouter 以 z-ai/glm-5.2 访问。想要无需 API key 的无代码接入,两个模型都可以直接在 glm5.app 上使用。

相比 Kimi K3,GLM 5.2 在多少输出量时能回本?

GLM 5.2 每百万输出 token 比 Kimi K3 省 $10.60($15.00 vs $4.40)。即使在中等用量下——每月 1,000 万输出 token——GLM 5.2 每月省 $106。每月 1 亿输出 token 时,节省达 $1,060。这笔账很清楚:除非 Kimi K3 的质量提升能在成本差之上产生可测的下游价值,否则对纯文本负载,GLM 5.2 的 ROI 更强。


写在最后

Kimi K3 是一个能力扎实的前沿模型,有真实的智能优势和模态支持,但为了 6 分的 AA Intelligence Index 领先,它每个输出 token 比 GLM 5.2 贵 3.4 倍。对速度和成本效率要紧的纯文本负载,GLM 5.2 是更强的选择——它快 2.5 倍、输出便宜 71%、完全 MIT 开源,并且在编程和推理基准上处于前沿。如果你的流水线需要图像理解,或绝对需要 2.8T 参数模型的智能上限,Kimi K3 的溢价才合理。其他一切场景,GLM 5.2 以零头的价格交付同等效用。

试用 GLM 5.2——无需 API key:glm5.app/chat


Sources

Start Using GLM 5 Today

Try GLM 5 free — reasoning, coding, agents, and image generation in one platform.