2025 年中国 AI 格局变化飞快。短短几个月内,Moonshot AI 推出了 Kimi K3,Alibaba 发布了 Qwen 3,Zhipu AI 上线了 GLM 5.2——三个严肃的前沿模型在基准、定价和开发者体验上正面竞争,而这一切在两年前对非美国实验室来说几乎不可想象。
如果你正在构建生产应用,并把候选清单缩小到了 Kimi K3 和 Qwen 3,这篇文章给你真正需要的数字和权衡。我们会覆盖上下文长度、定价、思考模式、基准分数、自托管选项,以及各自胜出的使用场景。我们还会指出 GLM 5.2(Zhipu AI 的旗舰)在这个对比中的位置——因为对许多工作负载来说,它比两者都强。
一目了然:Kimi K3 vs Qwen 3
| 特性 | Kimi K3 | Qwen 3(235B 旗舰) |
|---|---|---|
| 厂商 | Moonshot AI | Alibaba Cloud |
| 发布时间 | 2025 年 7 月 | 2025 年 4 月 |
| 架构 | MoE(开放权重) | MoE——235B 总参数、22B 激活 |
| 上下文窗口 | 1,000,000 tokens(1M) | 128,000 tokens(128K) |
| 输入价格 | $0.30 / M tokens | 约 $0.60 / M tokens |
| 输出价格 | $1.10 / M tokens | 约 $2.40 / M tokens |
| 思考模式 | 有(扩展 CoT) | 有——/think 和 /no_think 标签 |
| 函数调用 | 有 | 有 |
| 可自托管 | 可以(开放权重) | 可以(Apache 2.0,通过 vLLM/Ollama) |
| MMLU | — | 87.5% |
| MATH | — | 97.4% |
| HumanEval | — | 95.1% |
| 许可 | 开放权重 + 可商用 | Apache 2.0 |
上下文长度:Kimi K3 的决定性优势
对大多数开发者来说,最显眼的数字是上下文。Kimi K3 提供 1M token 上下文窗口——和 Google Gemini 1.5、GLM 5.2 同一级别。Qwen 3 的旗舰模型默认 128K token,有些扩展版本可用,但并非所有托管选项都支持。
实际上,1M 上下文对特定工作流是变革性的:
- 把整个代码库(数万行)一次性装进提示词
- 分析长法律或金融文档而无需分块
- 累积大量工作记忆的多轮智能体
- 书级内容的批量摘要
如果你的管道仅仅因为模型吃不下完整输入而需要分块、检索增强生成(RAG)或手工拆分文档——Kimi K3 的 1M 窗口可能直接消除这部分工程开销。
Qwen 3 的 128K 上下文对大多数对话和中等文档任务够用,但如果你要规模化处理非结构化企业数据,你会感受到这个天花板。
定价:Kimi K3 明显更便宜
截至写作时,Kimi API 上 Kimi K3 的每百万输入 token $0.30、每百万输出 token $1.10。Qwen 3 旗舰(235B-A22B)在 DashScope 上大约是每百万输入 $0.60、每百万输出 $2.40——两个维度都差不多翻倍。
对一个每月生成 1 亿输出 token 的工作负载:
- Kimi K3:约 $110
- Qwen 3 旗舰:约 $240
差距随输出量增长而拉大。如果你规模化跑推理,Kimi K3 的价格优势是实打实的。
话虽如此,Qwen 3 的小号变体(7B、14B、32B)可以通过 Ollama 或 vLLM 自托管,只花算力钱,对有 GPU 的团队来说完全改变游戏规则。
基准表现:Qwen 3 在数学和编码上领先
Alibaba 为 Qwen3-235B-A22B 发布了亮眼的基准数据:
- MMLU:87.5%
- MATH:97.4%
- HumanEval:95.1%
这些数字与世界最好的模型相比也毫不逊色。特别是 MATH 分数表明 Qwen 3 为严谨的量化推理做了优化。
Kimi K3 的核心强项在长上下文任务、编码和数学推理——但截至写作时,Moonshot AI 还没有发布一套可对比的基准数据。模型架构(带扩展思维链的 MoE)瞄准的正是同一批推理密集的工作负载。
对采购或合规决策需要可验证基准数字的团队来说,Qwen 3 已发布的数据目前透明度更高。
思考模式:实现不同,目标相近
两个模型都提供某种形式的扩展推理——业界所谓的「思考模式」或思维链(CoT)输出。
Kimi K3 原生支持思考模式。激活后,模型在给出最终答案前先进行扩展的内部推理,类似 OpenAI o1 和 DeepSeek R1 开创的模式。这对多步数学、逻辑推理和代码生成这类精度比延迟更重要的任务特别有用。
Qwen 3 采用混合方案,用显式标签:/think 开启扩展推理,/no_think 关闭。这让开发者能按提示词粒度精细控制,而不是模型级的开关——当你想让某个会话中的复杂查询用思考模式、简单检索或模板任务不用时,这很有用。
Qwen 3 的混合方案对同一会话里混用简单和复杂任务的应用来说,可以说更顺手。Kimi K3 的方案在运维上更容易想清楚。
痛点:为生产选择中国 AI 模型
评估中国实验室前沿模型的开发者会遇到一个具体问题:上下文窗口不一致、定价不透明,以及和现有 OpenAI 工具链的 API 不兼容。
典型体验是这样的:
- 你基准测试 Qwen 3,发现 MATH/MMLU 数字很漂亮。
- 你集成它,发现 128K 上下文逼你用 RAG 重写文档管道。
- 你为 1M 窗口换成 Kimi K3,又发现 API 格式和你 SDK 期望的不一样。
- 你花两周做集成,最后得到一个脆弱的双模型配置。
这才是模型跳槽的真实成本——不是每 token 的价格,而是规范化 API、处理不同认证方案、维护多个供应商关系的工程时间。
为什么 GLM 5.2 应该出现在这个对比里
在你对 Kimi K3 或 Qwen 3 下注之前,值得对照你刚评估的每个维度,看看 GLM 5.2(Zhipu AI 的 glm-4-plus,2025 年 5 月发布)的位置。
| 特性 | GLM 5.2 (glm-4-plus) |
|---|---|
| 架构 | MoE——753B 总参数、40B 激活 |
| 上下文窗口 | 1,048,576 tokens(1M) |
| 输入价格 | $1.40 / M tokens |
| 输出价格 | $4.40 / M tokens |
| 速度 | 158 tokens/秒 |
| GPQA Diamond | 89% |
| SWE-bench Pro | 62.1% |
| 质量指数 | 51(Artificial Analysis) |
| API 兼容性 | 兼容 OpenAI |
| 许可 | MIT 开放权重 |
GLM 5.2 与 Kimi K3 一样有 1M 上下文窗口。它的 SWE-bench Pro 62.1% 对真实软件工程任务是个强信号——这个基准测试的是在真实 GitHub 仓库上的自主修 bug,而不是人为设计的编码谜题。GPQA Diamond 89% 表明它有很强的博士级科学推理能力。
API 兼容 OpenAI,端点 https://open.bigmodel.cn/api/paas/v4/——填上 api_base、换掉 key,现有代码就能跑。完整的 GLM 5.2 API 集成指南 有设置步骤和代码示例。
GLM 5.2 的每 token 价格高于 Kimi K3,但模型家族也更完整:轻量任务用 GLM-4-Air($0.0001/1K token)、长文档工作负载用 GLM-4-Long($0.001/1K token),外加两个 embedding 模型(1024 维的 embedding-2 和 2048 维的 embedding-3)。这意味着你可以在整个管道里用 GLM——embedding、轻量推理、前沿质量推理——都在同一个供应商关系下。
如果你不想配 API key 就体验 GLM 5.2 的能力,glm5.app 让你直接在浏览器里测试这个模型。
自托管:Qwen 3 拥有生态
对有 GPU 基础设施的团队来说,自托管完全改变经济账。Qwen 3 的 Apache 2.0 许可和生态支持都很强:
- Qwen3-7B、14B 和 32B 通过 Ollama 在消费级和准专业级硬件上跑得很舒服
- vLLM 开箱即用支持 Qwen 3
- 小模型在多数任务上保持有竞争力的推理质量
Kimi K3 发布开放权重并允许商用,但截至 2025 年中,生态支持还比较薄——教程更少、社区基础设施更少、经过验证的部署配方更少。
如果自托管是硬性要求,今天选 Qwen 3 更稳妥。
使用场景决策指南
选 Kimi K3,如果:
- 你需要 1M 上下文,又消化不了 GLM 5.2 的每 token 成本
- 你的工作负载主要是长上下文文档处理或编码
- 价格是主导约束,且你能接受更少的已发布基准
选 Qwen 3,如果:
- 你有 GPU 基础设施,想以接近零的边际成本自托管
- 内部采购审批需要 MATH 和 MMLU 基准
- 你需要通过
/think//no_think按提示词粒度控制思考模式 - 128K 上下文对你的文档足够
选 GLM 5.2,如果:
- 你需要 1M 上下文,同时要强劲的 SWE-bench / GPQA 表现
- 你想要能无代码改动接入现有工具链的 OpenAI 兼容 API
- 你在构建多模型管道,希望 embedding、轻量和前沿模型都在一个供应商下
- MIT 许可和开放权重对你的合规要求很重要
总结
Kimi K3 和 Qwen 3 代表了对「前沿」两种不同的押注。Kimi K3 押注上下文规模和价格效率。Qwen 3 押注基准表现和自托管灵活性。两者都不是普适赢家——正确的选择取决于你的上下文需求、基础设施和预算。
对大多数生产场景,1M token 上下文窗口是这类模型中杠杆率最高的单一特性。Kimi K3 和 GLM 5.2 都有,Qwen 3 在标准 API 档位没有。
如果你在对比中国前沿模型,想拿你的真实工作负载而不是榜单数字做基准,最快的起步方式是 glm5.app——不用配 API 直接测 GLM 5.2,然后在你自己的提示词上对比输出质量,再决定绑定哪家供应商。
参考来源
- Kimi K3 —— Moonshot AI 官方公告和 API 文档:https://platform.moonshot.cn
- Qwen 3 模型卡和基准结果(Qwen3-235B-A22B):https://huggingface.co/Qwen/Qwen3-235B-A22B
- Qwen 3 技术报告:https://qwenlm.github.io/blog/qwen3/
- Hugging Face 上的 GLM 5.2(glm-4-plus):https://huggingface.co/THUDM/glm-4
- Zhipu AI API 文档:https://open.bigmodel.cn/dev/api
- Artificial Analysis GLM-4-Plus 基准:https://artificialanalysis.ai/models/glm-4-plus
- SWE-bench 排行榜:https://www.swebench.com
- GPQA 基准(Diamond 子集):https://arxiv.org/abs/2311.12022




