如果你正在为一个生产 API 负载评估 Kimi K3,第一个问题是:它的性能溢价是否值得比同类替代品高 3.4 倍的输出价格。本文给你做这个判断所需的精确数字。
速览
Kimi K3 由 Moonshot AI 发布,每百万输入 token 收 $3.00,每百万输出 token 收 $15.00。它的 AA Intelligence Index 得分 57,比 GLM 5.2 的 51 分高 6 分——但 GLM 5.2 输入只要 $1.40/M、输出只要 $4.40/M,输入便宜 53%、输出便宜 70%。两个模型都提供 1M token 上下文窗口。价格之外的决定性差异是模态:Kimi K3 接受图像输入,而 GLM 5.2 是纯文本。如果你的流水线不需要视觉,GLM 5.2 以零头的价格交付强劲的前沿表现。
选 Kimi K3,如果你需要图像理解、6 分的智能领先对你的输出有实质影响,并且你承受得起 3.4 倍的输出成本溢价。
选 GLM 5.2,如果你的负载是纯文本、吞吐和成本效率要紧,或者你需要前沿模型中最快的推理速度——158 t/s 对比 Kimi K3 的 62 t/s。
快速对比
| 特性 | Kimi K3 | GLM 5.2 |
|---|---|---|
| 开发者 | Moonshot AI | Zhipu AI / Z.ai |
| AA Intelligence Index | 57 | 51 |
| 输入价格 | $3.00/M token | $1.40/M token |
| 输出价格 | $15.00/M token | $4.40/M token |
| 缓存命中价格 | $0.30/M token | $0.26/M token |
| 上下文窗口 | 1M token | 1M token |
| 输出速度 | 62 t/s | 158 t/s |
| TTFT | 1.99s | 1.54s |
| 参数 | 2.8T | 753B 总 / 40B 激活 |
| 图像输入 | 支持 | 不支持 |
| 开放权重许可证 | 修改版 MIT(2026 年 7 月 27 日) | MIT |
基准测试表现
AA Intelligence Index 是 Artificial Analysis 的复合基准,聚合了推理、编程和知识任务的能力评估。Kimi K3 得 57 分,GLM 5.2 得 51 分——6 分的差距是真实的,但在前沿层面算窄。
GLM 5.2 在几个标准基准上有已发布的结果:
| 基准测试 | GLM 5.2 | Kimi K3 |
|---|---|---|
| AA Intelligence Index | 51 | 57 |
| GPQA Diamond | 89% | — |
| SWE-bench Pro | 62.1% | — |
| Terminal-Bench v2.1 | 78% | — |
| HumanEval | 90%+ | — |
GLM 5.2 的 GPQA Diamond 89% 已经把它放在研究生级科学推理的前沿。它的 SWE-bench Pro 62.1% 和 Terminal-Bench v2.1 78% 反映了强大的真实软件工程能力。对编程密集型流水线,这些结果让 GLM 5.2 与明显更贵的模型有竞争力。
Kimi K3 领先 6 分的 AA Intelligence Index 差距有意义,但对大多数文本生成、总结和代码任务,输出质量的实际差异会很微妙。这个差距在需要深度多步推理或复杂科学推断的任务中最要紧。
定价拆解
这两个模型之间的成本差异大到足以在规模化时改变架构决策。
| 成本类别 | Kimi K3 | GLM 5.2 | GLM 5.2 节省 |
|---|---|---|---|
| 输入(每 M token) | $3.00 | $1.40 | 便宜 53% |
| 输出(每 M token) | $15.00 | $4.40 | 便宜 71% |
| 缓存命中(每 M token) | $0.30 | $0.26 | 便宜 13% |
| 输出成本倍数 | 3.41x | 1x 基线 | — |
规模化后,这些差异累积得很快。考虑一个每月生成 1 亿输出 token 的负载:
- Kimi K3:100M × $15.00/M = $1,500/月
- GLM 5.2:100M × $4.40/M = $440/月
- GLM 5.2 每月节省:$1,060
对文档处理或长上下文检索这类输入密集型负载,输入 token 的差距同样显著。处理 10 亿输入 token:
- Kimi K3:1B × $3.00/M = $3,000
- GLM 5.2:1B × $1.40/M = $1,400
- GLM 5.2 节省:$1,600
缓存命中价格更接近($0.30 vs $0.26),所以提示词缓存密集的架构会稍微缩小差距——但 GLM 5.2 在每一个定价档位仍然胜出。
速度与延迟
速度是两个模型之间运营上最显眼的差距。
| 指标 | Kimi K3 | GLM 5.2 | 优势 |
|---|---|---|---|
| 输出速度 | 62 t/s | 158 t/s | GLM 5.2(快 2.5 倍) |
| TTFT | 1.99s | 1.54s | GLM 5.2(快 450ms) |
GLM 5.2 以每秒 158 token 生成——据 Artificial Analysis 测量,在所有前沿模型中第三快。Kimi K3 以 62 t/s 运行,吞吐明显退一步。
实际来看:对 1,000 token 的响应,Kimi K3 生成时间约 16 秒,GLM 5.2 约 6 秒。2,000 token 时,是 32 秒对比 13 秒。对用户等待流式响应的交互式应用,这个差异用户可感知。
首 token 时间同样有利于 GLM 5.2:1.54 秒对比 Kimi K3 的 1.99 秒。这 450ms 的优势改善了流式界面和 IDE 助手中的感知响应度——延迟会显现在用户体验里。对吞吐影响任务队列清空时间的批处理负载,2.5 倍的速度差异在同样的硬件成本下仍然意味着更快的周转。
上下文窗口
两个模型都支持 1M token 上下文窗口(GLM 5.2 精确为 1,048,576 token)。这让它们在做长文档任务时处于同一档位,上下文长度不再是两者之间的区分因素。
把 1M token 换成实际概念:
- 约 750,000 词——大约三本全本小说放在同一上下文里
- 一个约 5,000 个文件、平均每文件 200 token 的软件代码库
- 同时载入约 35 份完整的财报电话会记录
对 RAG 流水线、法律文档审阅、仓库级代码理解和研究综合,两个模型处理相同的最大输入规模。如果你目前正在撞上下文上限,两者都能解决问题——它们之间的选择不取决于上下文容量。
关键差异点
模态支持
最具决定性的功能差异是图像输入。Kimi K3 在文本之外接受图像,支持带嵌入图形的文档解析、截图分析、视觉问答和产品图像分类。GLM 5.2 是纯文本,无法处理图像。
如果你的应用需要视觉,Kimi K3 是两者中唯一可行的选项。如果你的负载是纯文本,这个差异点与你的成本收益计算无关。
架构与参数
Kimi K3 是一个 2.8 万亿参数模型。GLM 5.2 使用 Mixture of Experts(MoE)架构,总参数 753B,但每次前向传播只有 40B 激活——78 个 transformer 层、每层 256 个专家、每个 token 激活 8 个,采用 Dense Sparse Attention。激活参数数比总参数数更能驱动推理成本。GLM 5.2 的 MoE 设计在不付出相应算力开销的情况下实现了高容量,这解释了它速度与定价优势的很大一部分。
开放权重与自托管
两个模型都已发布权重。GLM 5.2 在 Hugging Face 上以标准 MIT 许可提供(THUDM/GLM-5.2)——可商业使用、可修改、可再分发,无限制。Kimi K3 的权重于 2026 年 7 月 27 日以修改版 MIT 许可发布。
自托管 Kimi K3 的 2.8T 参数模型,需要的基础设施比运行 GLM 5.2 每个 token 40B 激活参数多得多。如果出于合规或超高体量下的成本原因以自托管为目标,GLM 5.2 的运营足迹容易管理得多。
什么时候选 GLM 5.2
- 你的负载是纯文本,没有图像或多模态需求
- 吞吐要紧,你需要快 2.5 倍的 token 生成(158 t/s vs 62 t/s)
- 你运行高吞吐生产负载,输出成本是首要约束
- 你需要完全宽松的 MIT 许可证做自托管、修改或再分发
- 你想要更低的 TTFT(1.54s vs 1.99s)支撑响应式流式界面
- 编程和推理基准要紧——SWE-bench Pro 62.1%、GPQA Diamond 89%
- 你想要通过 OpenRouter(z-ai/glm-5.2)的 API 接入以简化路由
什么时候选 Kimi K3
- 你的应用需要图像输入——文档图像、截图、视觉 QA
- 6 分的 AA Intelligence Index 优势(57 vs 51)在你的具体任务上提升输出质量
- 你运行低到中等体量的负载,3.4 倍的输出成本溢价可以承受
- 你的用例中单次查询的响应质量比吞吐更重要
- 你需要2.8T 参数模型的接入,又不想投入自托管基础设施
常见问题
Kimi K3 每百万输出 token 多少钱?
Kimi K3 每百万输出 token 收 $15.00,每百万输入 token 收 $3.00。缓存命中按每百万 token $0.30 计价。这让 Kimi K3 在输出 token 上比 GLM 5.2 贵 3.4 倍($15.00 vs $4.40),在输入 token 上贵 2.1 倍($3.00 vs $1.40)。
Kimi K3 在 AA Intelligence Index 上跟 GLM 5.2 比怎么样?
Kimi K3 在 Artificial Analysis 的 Intelligence Index 上得 57 分,GLM 5.2 得 51 分——6 分的差距。Kimi K3 拥有可测的智能优势,但 GLM 5.2 在标准基准上已经达到前沿级结果,包括 GPQA Diamond 89% 和 SWE-bench Pro 62.1%。对大多数生产文本任务,实际质量差异很窄。
我可以用 Kimi K3 做图像理解吗?
可以。Kimi K3 同时接受文本和图像输入,适合文档解析、截图分析和视觉问答等视觉任务。GLM 5.2 是纯文本。如果图像处理是硬性要求,Kimi K3 是两个模型之间唯一的选择。
Kimi K3 是开源、可自托管的吗?
Kimi K3 的权重于 2026 年 7 月 27 日以修改版 MIT 许可发布。GLM 5.2 也是开放权重,在 Hugging Face(THUDM/GLM-5.2)以标准 MIT 许可提供。两者都支持自托管,不过 Kimi K3 的 2.8T 总参数数需要的基础设施比 GLM 5.2 每次前向传播 40B 激活参数多得多。
GLM 5.2 比 Kimi K3 快多少?
GLM 5.2 以 158 t/s 生成 token,Kimi K3 是 62 t/s——约快 2.5 倍。GLM 5.2 的 TTFT 也更低:1.54 秒对比 Kimi K3 的 1.99 秒。对延迟敏感的应用或高吞吐批处理负载,这一速度优势是重要的运营因素。
我可以通过 API 在哪里接入 GLM 5.2?
GLM 5.2 可通过 Z.ai 的 API 使用,base URL https://api.z.ai/v1,模型 ID glm-5.2。也可通过 OpenRouter 以 z-ai/glm-5.2 访问。想要无需 API key 的无代码接入,两个模型都可以直接在 glm5.app 上使用。
相比 Kimi K3,GLM 5.2 在多少输出量时能回本?
GLM 5.2 每百万输出 token 比 Kimi K3 省 $10.60($15.00 vs $4.40)。即使在中等用量下——每月 1,000 万输出 token——GLM 5.2 每月省 $106。每月 1 亿输出 token 时,节省达 $1,060。这笔账很清楚:除非 Kimi K3 的质量提升能在成本差之上产生可测的下游价值,否则对纯文本负载,GLM 5.2 的 ROI 更强。
写在最后
Kimi K3 是一个能力扎实的前沿模型,有真实的智能优势和模态支持,但为了 6 分的 AA Intelligence Index 领先,它每个输出 token 比 GLM 5.2 贵 3.4 倍。对速度和成本效率要紧的纯文本负载,GLM 5.2 是更强的选择——它快 2.5 倍、输出便宜 71%、完全 MIT 开源,并且在编程和推理基准上处于前沿。如果你的流水线需要图像理解,或绝对需要 2.8T 参数模型的智能上限,Kimi K3 的溢价才合理。其他一切场景,GLM 5.2 以零头的价格交付同等效用。
试用 GLM 5.2——无需 API key:glm5.app/chat。




