Kimi K3 于 2026 年 7 月 16 日发布——这是 Moonshot AI 推出的 2.8 万亿参数推理模型,Artificial Analysis 智能指数 57 分,一发布就被拿来和 GLM 5.2 比较。一句话结论:K3 基准成绩更高,但每个输出 token 要多付 3.4 倍的钱,每次响应要多等 2.5 倍的时间。
同一指数上 GLM 5.2 得 51 分。它领先的地方:每百万输出 token 4.40 美元对比 15.00 美元、每秒 158 token 对比 62 token、MIT 许可的权重今天就能在 Hugging Face 拿到。Kimi K3 的开放权重要到 7 月 27 日;GLM 5.2 的现在就是公开的。
选 GLM 5.2,如果你的工作流纯文本、在规模上运行且输出成本差会复利,或者你需要这个档位最快的响应时间。
选 Kimi K3,如果你需要图像输入、想要开放权重类别里最高的基准分,或者能承受更高的 token 价格换取实实在在的智能提升。
快速对比
| GLM 5.2 | Kimi K3 | |
|---|---|---|
| 智能指数 | 51 | 57 |
| 输出速度 | 158 t/s | 62 t/s |
| 首 token 时间 | 1.54s | 1.99s |
| 输入价格 | $1.40/M | $3.00/M |
| 输出价格 | $4.40/M | $15.00/M |
| 缓存命中价格 | $0.26/M | $0.30/M |
| 上下文窗口 | 1M token | 1M token |
| 模态 | 仅文本 | 文本、图像 |
| 总参数 | 753B / 40B 激活 | 2.8T |
| 许可证 | MIT(现在可用) | 修改版 MIT(7 月 27 日) |
| 发布时间 | 2026 年 6 月 | 2026 年 7 月 16 日 |
| 可自托管 | 是 | 是(7 月 27 日) |
基准表现
Kimi K3 在多数已发布基准上保持明显领先。差距因任务类型而有显著差异:K3 在 GitHub 风格编码评估上领先最多,而 GLM 5.2 在智能体终端任务上表现相当或更优。
| 基准 | GLM 5.2 | Kimi K3 |
|---|---|---|
| AA 智能指数 | 51 | 57 |
| AA 编码指数 | — | 76 |
| DeepSWE | 46.2% | 67.5% |
| FrontierSWE | 67.3% | 81.2% |
| Terminal-Bench v2.1 | 78% | — |
| SWE-bench Pro | 62.1% | — |
| GPQA Diamond | 89% | ≈88% |
DeepSWE 和 FrontierSWE 的差距是 K3 最有力的论据:分别领先 21 和 14 个百分点。两者都是评估 GitHub issue 解决和前沿编码任务的真实世界软件工程基准。如果你的工作负载与这些评估相似,K3 的优势是实质性的。
Terminal-Bench v2.1 则反过来了:GLM 5.2 得 78%,它测试的是终端环境中的智能体编码——shell 命令、文件导航、脚本工作流、重复工具调用。对 CI 管道和自动化 shell 智能体,GLM 5.2 保持领先。
在 GPQA Diamond——一个博士级科学推理基准——上,两个模型都落在约 88–89%。科学推理的顶端,智能指数差距被显著压缩。
Kimi K3 的 57 总分让它和 Claude Opus 4.8 同处一个档位——对开放权重模型来说是不寻常的成就。在 LMArena 的 Frontend Code Arena 上它首发即 #1,Elo 1679,这对 UI 生成和前端开发任务来说是强烈的信号。
价格分解
两个模型之间的价格差是对比中最大的因素,单看输出 token 时差距进一步拉大。
| 价格档 | GLM 5.2 | Kimi K3 | GLM 5.2 节省 |
|---|---|---|---|
| 输入 | $1.40/M | $3.00/M | 便宜 54% |
| 输出 | $4.40/M | $15.00/M | 便宜 71% |
| 缓存命中 | $0.26/M | $0.30/M | 便宜 13% |
71% 的输出 token 折扣才是要关注的数字。多数实际 API 工作流产生的输出 token 远超输入 token,这意味着实际成本差更接近输出费率,而不是混合平均值。
具体示例:一次 30K 输入 token、10K 输出 token 的代码审查任务,用 GLM 5.2 花 $0.086,用 Kimi K3 花 $0.24——每次调用贵约 2.8 倍。每天 10,000 次调用,年差距超过 $560,000。
缓存命中价格几乎相同($0.26 对比 $0.30),所以重复上下文的工作流不会显著改变成本对比。基准输出费率仍是主导因素。
各家供应商的费率与 Kimi 和 Z.ai 官方 API 不同,逐供应商对比见 GLM 5.2 价格分解。
速度与延迟
GLM 5.2 的响应生成明显更快。Kimi K3 在首 token 时间上也有小幅劣势。
| 指标 | GLM 5.2 | Kimi K3 |
|---|---|---|
| 输出速度 | 158 t/s | 62 t/s |
| 首 token 时间 | 1.54s | 1.99s |
每秒 158 token,GLM 5.2 在 Artificial Analysis 速度榜上排第三。Kimi K3 的 62 t/s 落在同一榜单的后三分之一。
一个 500-token 的响应,GLM 5.2 大约 3 秒,Kimi K3 大约 8 秒。对聊天助手、IDE copilot 或实时代码审查者,用户能感受到这个差别。对过夜批处理任务,则无关紧要。
一个结构性说明:Kimi K3 是推理模型,意味着它在最终答案前先生成思考轨迹。1.99s 的首 token 时间部分反映了这段扩展推理的开始,输出吞吐与推理步骤竞争。向用户流式展示思考轨迹的应用,与等最终答案的应用,感受到的延迟可能不同。
上下文窗口:各 1M token
两个模型都支持 100 万 token——单次请求约 1,500 页文本。这一维度打成平手。两个模型都不收长上下文附加费;整个上下文窗口内价格扁平。
在这个上下文长度下,两个模型都能不切块地处理大型代码库、完整法律合同、长研究语料和长期多轮智能体历史。任务远低于 256K token 时,上下文优势与选择无关。
多模态能力
Kimi K3 接受文本和图像输入。GLM 5.2 只接受文本。
这是二元的容量差距,不是质量取舍。Kimi K3 的图像支持带来:
- 截图转代码工作流(UI 稿或截图 → 实现)
- 技术文档中的图表理解
- 对含嵌入图像的文档做 OCR 式处理
- 多轮对话中的视觉问答
只要其中任何一个工作流是你的应用核心,Kimi K3 就是两者中的唯一选项。任务需要图像输入时,GLM 5.2 的优势全部作废。
对纯文本工作流——代码生成、文档分析、推理、写作——GLM 5.2 的速度和成本优势照常适用,没有这个限制。
开源状态
GLM 5.2 权重今天就在 Hugging Face 上,MIT 许可证。Kimi K3 权重定于 2026 年 7 月 27 日发布——API 上线后十一天。
对断网部署、自托管推理集群或微调管道,GLM 5.2 立即可用。如果 7 月 27 日的发布按时落地、且你的使用场景能接受这个时间线,Kimi K3 才会成为选项。
规模上的硬件要求分化明显。GLM 5.2 运行 753B 总参数、任何时候 40B 激活——仍然苛刻,但现代 GPU 集群能应付。Kimi K3 的 2.8 万亿总参数要全规模运行,需要大得多的基础设施。GLM 5.2 的硬件要求见 如何本地运行 GLM 5.2。
何时选 GLM 5.2
以下情况 GLM 5.2 是更好的选择:
- 你的工作流完全是文本或代码——不需要图像或图表输入
- 你在规模上运行,71% 的输出 token 成本节省在调用间有意义地复利
- 响应速度对用户重要:交互应用中 158 t/s 对比 62 t/s 是可感知的差异
- 你的智能体任务涉及终端式工作流:shell 命令、文件导航、重复脚本步骤
- 你需要今天就能拿到的开放权重、完整 MIT 许可、无商业限制
- 你在同档位模型间选择,且 GPQA 式科学推理是主要任务
GLM 5.2 在 AA 智能指数上比 Kimi K3 低 6 分。这个差距反映的是编码评估上的真实基准差异——具体是 DeepSWE 和 FrontierSWE。但成本和速度的取舍大到对许多生产工作负载而言,即便有基准差距,GLM 5.2 每美元提供的价值仍然更高。
何时选 Kimi K3
以下情况 Kimi K3 是更好的选择:
- 你的工作流需要图像输入——UI 截图、架构图、文档图像、视频帧
- 你想要开放权重类别里可用的最高基准分:AA 智能指数 57、AA 编码指数 76
- GitHub 风格编码任务主导你的工作负载:issue 解决、pull request 审查、前端代码生成——DeepSWE 和 FrontierSWE 的差距(67.5% vs 46.2%、81.2% vs 67.3%)最直接地反映这些场景
- 你需要在开放权重模型中获得与 Claude Opus 4.8 相当的前沿级推理
- 每次调用成本对原始能力的约束较小:低量的专业工具,每次调用的价格差相对输出价值很小
Kimi K3 是截至 2026 年 7 月发布的最强开放权重模型。它的 2.8T 参数规模和前沿基准定位,让它比上一代 Kimi K2.x 系列显著上了一个台阶。
常见问题
Kimi K3 比 GLM 5.2 好吗?
多数基准上,是的——Kimi K3 在 Artificial Analysis 智能指数上 57 对 51,并在 DeepSWE(67.5% vs 46.2%)和 FrontierSWE(81.2% vs 67.3%)上领先。GLM 5.2 在 Terminal-Bench 上领先,输出 token 便宜 71%。哪个「更好」完全取决于你的工作负载更看重基准分还是成本效率。
Kimi K3 贵多少?
输入 token 每百万 $3.00 对 $1.40——贵 54%。输出 token 每百万 $15.00 对 $4.40——贵 241%,即 GLM 5.2 费率的 3.4 倍。在生产调用量下,输出 token 差距主导总成本。
Kimi K3 支持图像吗?
支持。Kimi K3 接受文本和图像输入。GLM 5.2 只支持文本。对多模态工作流,Kimi K3 是两者中的唯一选项。GLM 5.2 模态支持的完整细节,见 GLM 5.2 是多模态的吗?
Kimi K3 开源吗?
Kimi K3 的 API 于 2026 年 7 月 16 日上线。开放权重定于 2026 年 7 月 27 日发布,采用允许商用的修改版 MIT 许可证。GLM 5.2 权重今天就在,完整 MIT 许可证。
Kimi K3 的上下文窗口多大?
100 万 token——与 GLM 5.2 相同。两个模型在这个容量下都能处理大型代码库、长文档和长智能体历史。
GLM 5.2 比 Kimi K3 快吗?
是的。GLM 5.2 每秒生成 158 token;Kimi K3 每秒 62。GLM 5.2 的首 token 时间也更低(1.54s 对比 1.99s)。对交互应用,GLM 5.2 的响应速度快一倍以上。
Kimi K3 的意义在哪里?
Kimi K3 是一个 2.8 万亿参数模型——按发布时的参数量,是有史以来最大的开放权重模型。它作为开放权重模型拿到了与 Claude Opus 4.8 相当的基准分,而这在此前需要专有系统。它在 LMArena 的 Frontend Code Arena 首发 #1(1679 Elo),说明 UI 和前端代码生成任务上真实用户偏好强烈。
底线
Kimi K3 在基准测试上是更强的模型——智能指数 57 对 51,GitHub 风格编码评估上大幅领先。GLM 5.2 快 2.5 倍、输出 token 便宜 71%、而且今天就是开源的。
决策归结为两个问题:你需要图像输入吗?基准差距值得那个价格溢价吗?
需要图像输入:Kimi K3,没有权衡。成本或速度是约束:GLM 5.2。原始基准表现是约束、token 成本次要:Kimi K3。
见 GLM 5.2 基准详情、逐供应商价格,或 它如何对比 Kimi K2.5。两个都试试——无需 API key:GLM 5.2 · Kimi K3。
Sources
- Kimi K3——智能、性能与价格分析——Artificial Analysis(智能指数:57,速度:62 t/s,价格)
- Kimi K3 vs GLM-5.2 (max):模型对比——Artificial Analysis(并排基准数据)
- Kimi K3 在 Artificial Analysis 智能指数中取得第 3 名——Artificial Analysis
- 中国的 2.8 万亿参数 Kimi K3——Tom's Hardware(参数量、LMArena Elo)
- Kimi K3 上线:价格、基准与公开权重的等待——Trilogy AI(价格结构、开放权重时间线)




