Kimi K3 vs GLM 5.3:基准对比、独立评测与选购建议
快速回答: GLM 5.3 与 Kimi K3 是 2026 年年中两个最强的开源权重模型,成绩非常接近——智谱官方发布表上 GLM 5.3 赢 CyberGym(84.5 vs 80.0)和 AutomationBench(48.2 vs 46.7),Kimi K3 赢 SWE-Marathon(48.1 vs 42.5)和 Toolathlon(76.5 vs 73.0)。独立评测 Artificial Analysis 给两者同为 60 分(Intelligence Index),但 GLM 5.3 的 API 价格约为 Kimi K3 的一半。
快速对比
| 基准 | GLM 5.3 | Kimi K3 |
|---|---|---|
| Terminal-Bench 2.1 | 88.2 | 88.3 |
| Terminal-Bench 3.0 | 28.3 | 17.4 |
| DeepSWE v1.1 | 66.9 | 67.5 |
| SWE-Marathon v1.1 | 42.5 | 48.1 |
| AutomationBench v1.0.6 | 48.2 | 46.7 |
| Toolathlon Verified | 73.0 | 76.5 |
| Agents' Last Exam (ALE-CLI) | 28.5 | 27.6 |
| CyberGym | 84.5 | 80.0 |
| ExploitBench | 54.4 | 32.2 |
| ExploitGym(2h / 6h) | 105 / 130 | 36 / 70 |
两个开源旗舰,两条路线
- GLM 5.3(2026-08-14 发布)——与 GLM 5.2 同基座,全部提升来自大规模后训练(更多 RL 环境、更多算力),并意外"涌现"出网络安全能力。
- Kimi K3(2026-07-16 发布)——月之暗面(Moonshot AI)旗舰,GLM 5.2 时代就一直在较量的开源参照模型。
基准表上两者在通用编程上几乎平手,差异集中在各自专长领域。
GLM 5.3 赢在哪里
Terminal-Bench 3.0:28.3 vs 17.4(差距最大)——最难的公开终端基准。GLM 5.3 后训练重点就是长程终端任务,这一项优势明显,也是开发者最看重的"真实终端工作"指标。
CyberGym:84.5 vs 80.0——GLM 5.3 招牌的"涌现"安全能力(漏洞发现),对 Kimi K3 是明显差异项;ExploitBench(54.4 vs 32.2)和 ExploitGym(105/130 vs 36/70)差距更大。做安全工作选 GLM 5.3。
AutomationBench(48.2 vs 46.7)与 ALE-CLI(28.5 vs 27.6)——GLM 5.3 在智能体与长程自动化上小幅领先。
Kimi K3 赢在哪里
SWE-Marathon v1.1:48.1 vs 42.5——全表最大差距,Kimi K3 在马拉松式端到端软件工程任务上更强。
Toolathlon Verified:76.5 vs 73.0——工具调用可靠性领先。
DeepSWE v1.1:67.5 vs 66.9——基本打平,微弱优势。
独立评测:AA 指数都是 60 分
第三方评测机构 Artificial Analysis 的独立结果(8 月 18 日公布):
- 两者均为 60 分(Intelligence Index,181 个同类模型中第 8 位,中位数 35)。
- 领先者 Claude Opus 5 为 63 分,差距 3 分。
- 成本差异显著:GLM 5.3 每任务成本 $0.68,Kimi K3 为 $0.84——GLM 5.3 更便宜。
API 价格(每百万 token):
| 模型 | 输入 | 输出 |
|---|---|---|
| GLM 5.3 | $1.40 | $4.40 |
| Kimi K3 | $3.00 | $15.00 |
GLM 5.3 约为 Kimi K3 价格的一半(输出端便宜约 70%)。
怎么选?
选 GLM 5.3 如果你: 看重长程终端/智能体任务(TB 3.0、AutomationBench)、需要漏洞发现能力(CyberGym)、想要两周后到手的开源权重、或在意 Token 效率与性价比。
选 Kimi K3 如果你: 优先马拉松式软件工程任务(SWE-Marathon)、工具调用基准(Toolathlon)、或已深度使用月之暗面生态。
务实建议: 两者都是优秀开源选择。已在 GLM 5.2 上线的团队升级 5.3 是零摩擦(同基座、同服务栈);新选型的话用自己的真实工作负载各跑一遍——差异是按场景分布的,不是绝对的。
常见问题
GLM 5.3 比 Kimi K3 强吗? 智谱官方表上:GLM 5.3 赢 Terminal-Bench 3.0(28.3 vs 17.4)、CyberGym(84.5 vs 80.0)、AutomationBench;Kimi K3 赢 SWE-Marathon(48.1 vs 42.5)、Toolathlon。独立评测(AA)两者同为 60 分。
哪个更便宜? GLM 5.3——API $1.40/$4.40,约为 Kimi K3($3.00/$15.00)的一半。
哪个适合编码 Agent? GLM 5.3 在长程终端和自动化基准上小幅领先(TB 3.0、AutomationBench、ALE-CLI);Kimi K3 在马拉松 SWE 与工具调用上领先。
都是开源权重吗? Kimi K3 已开源(收入分层许可证);GLM 5.3 权重预计 8 月底发布,当前标记为专有。
网络安全能力谁强? GLM 5.3 明显更强——CyberGym 84.5 vs 80.0,ExploitBench 54.4 vs 32.2。
参考来源
- Z.AI 官方博客:GLM-5.3 基准表(2026-08-14)
- Unite.AI:GLM-5.3 Scores 60 on Artificial Analysis Intelligence Index(2026-08-18)
最后更新:2026 年 8 月 18 日




