中国开源 AI 格局已经迅速成熟。曾经只有少数模型主要靠营销话术竞争,2025 年带来了一批有可验证基准、生产级 API 和真正开放权重的严肃选手。两款讨论度最高的发布——Moonshot AI 的 Kimi K3 和 MiniMax 的 MiniMax M1——在纸面上几乎并驾齐驱:两者都用专家混合(MoE)架构,都提供百万 token 上下文窗口,都发布开放权重。然而,在两者之间做选择的开发者们一致报告:正确选择取决于工作负载类型、生态成熟度和具体推理需求。
这场对比穿透噪音。我们看价格、架构、优势、许可和真实用例,让你能做出明智选择——并标出两个模型真正分道扬镳的地方。
痛点:太多「1M 上下文」模型,太少差异化
头版规格——百万 token 上下文——如今几乎出现在每个中国开源 frontier 发布上。这个数字听起来很震撼,但实际上大多数应用连 100K tokens 都到不了。那么当 Kimi K3 和 MiniMax M1 在页面顶部的规格表上勾选了同样的方框时,真正重要的是什么?
答案是推理质量、定价结构、API 可靠性和生态契合度。两个模型都用过的开发者指出,差异在思考模式深度、指令遵循一致性,以及周边工具的成熟度。这些维度没有一项会出现在标着「1M 上下文:是」的特性表列里。
这才是真正的选型问题:表面规格几乎相同,但运营体验显著分化。本文让这些差异变得清晰可辨。
模型概览
Kimi K3 —— Moonshot AI(2025 年 7 月)
Moonshot AI 于 2025 年 7 月发布 Kimi K3,作为 Kimi 家族的旗舰推理模型。它建立在 Moonshot 成熟的长上下文研究谱系上,并引入显式思考模式——扩展链式思考推理,精神上类似 OpenAI o1——让模型在产出答案之前先在内部推演。
关键技术事实:
- API base:
https://api.moonshot.cn/v1(OpenAI 兼容,即插即用) - 价格: 每百万输入 token $0.30 / 每百万输出 token $1.10
- 上下文窗口: 1,000,000 tokens
- 架构: 专家混合(MoE),开放权重可用
- 思考模式: 有——扩展链式思考推理
- 函数调用: 有
- 语言: 中文和英文(强双语表现)
- 主要强项: 长上下文文档分析、编程、数学、推理任务、创意写作
OpenAI 兼容端点意味着任何已经在用 OpenAI Python SDK 的项目,只需改 base_url 和 API key 就能切换到 Kimi K3——不需要其他代码改动。
MiniMax M1 —— MiniMax AI(2025 年)
MiniMax M1 是 MiniMax 的旗舰长上下文推理模型。MiniMax 是一家资金雄厚的中国 AI 公司,产品横跨消费者和企业市场。和 Kimi K3 一样,M1 瞄准长上下文任务并发布开放权重。
关键技术事实:
- 架构: 专家混合(MoE),大规模
- 上下文窗口: 1,000,000 tokens
- 开放权重: 可用
- 价格: 与其他中国开源模型有竞争力(当前费率以 MiniMax API 平台为准)
- 语言: 中英双语
- 主要强项: 长上下文推理、指令遵循、中文任务
- API 访问: 通过 MiniMax API 平台提供
MiniMax 在中国消费者 AI 产品上有往绩,这让 M1 在高吞吐、指令遵循工作负载上有根基——这和纯研究基准略有不同。
正面交锋对比表
| 维度 | Kimi K3 | MiniMax M1 |
|---|---|---|
| 上下文窗口 | 1,000,000 tokens | 1,000,000 tokens |
| 架构 | MoE,开放权重 | MoE,开放权重 |
| 输入定价 | $0.30 / 1M tokens | 有竞争力(以平台为准) |
| 输出定价 | $1.10 / 1M tokens | 有竞争力(以平台为准) |
| 思考/推理模式 | 有(扩展链式思考) | 推理强;无专用思考模式 |
| 函数调用 | 有 | 有 |
| OpenAI 兼容 API | 有 | 有(兼容接口) |
| 中文质量 | 优秀 | 优秀 |
| 开发者生态 | Moonshot 平台;社区成长中 | MiniMax 平台;面向企业 |
| 开放权重许可 | 可用 | 可用 |
两个模型在基础能力上旗鼓相当。最清晰的技术差异是 Kimi K3 的专用思考模式,它对数学推理、多步编程问题,以及受益于输出前主动自我复查的任务意义重大。
竞争差异化:思考模式 vs 指令遵循深度
Kimi K3 的优势:显式推理
Kimi K3 的思考模式不是营销标签。调用时,模型把额外的推理算力分配给一个内部草稿区——你能看到推演过程,最终答案也反映了它。对中间推理步骤很重要的任务(竞赛数学、算法调试、复杂多跳问题),这个模式持续产出比单次前向传播更好的结果。
1M token 上下文窗口加扩展链式思考的组合意味着,Kimi K3 可以,比如说,载入一个大代码库、跨文件追踪一个 bug、逐步推理根因、提出修复方案——全部在一次调用内完成。
价格透明也是 Kimi K3 的优势:$0.30/M 输入和 $1.10/M 输出都是已公布的数字,让你在投入集成之前就能做准确成本建模。
MiniMax M1 的优势:规模化指令遵循
MiniMax M1 的优势来自它在消费者产品上的血统。MiniMax 在中国把 AI 规模化部署到聊天、创意和企业应用,这塑造了 M1 对可靠指令遵循的倾向——即准确地做提示词要求的事、且跨多样请求类型保持一致性。对提示词漂移和结构化输出幻觉是主要失败模式的生产系统,M1 的指令遵循可靠性是实打实的优势。
MiniMax 还提供面向企业的 SLA 承诺和集成,而 Moonshot 还在补建这些。所以对需要模型原始性能之外的厂商支持的团队,MiniMax M1 值得仔细一看。
用例指南
什么时候选 Kimi K3
如果你的工作负载是推理密集型的,选 Kimi K3。 显式思考模式在以下场景有实质性影响:
- 数学问题求解和竞赛式推理
- 跨大型仓库的代码调试(1M 上下文让你载入整个代码库)
- 中间结论汇入最终答案的多步文档分析
- 需要综合矛盾来源的研究摘要
OpenAI 兼容 API 是一个实际的迁移红利。如果你在评估中国开源模型作为 GPT-4 级模型的替代或补充,Kimi K3 需要的集成改动最少。你还可以看看 GLM 模型家族在中文和智能体任务上能提供什么——GLM-5.2 API 指南覆盖的集成模式对这一代中国模型普遍适用。
成本画像: 输入 $0.30/M、输出 $1.10/M,Kimi K3 坐在 frontier 模型谱系实惠的一端。对发送大提示词的长上下文负载,$0.30 的输入费率尤其诱人——一份 500K token 的上下文文档只需 $0.15 就能处理。
什么时候选 MiniMax M1
如果你的工作负载是指令遵循密集型的,选 MiniMax M1。 这个模型擅长:
- 从长文档做结构化数据抽取(JSON 输出、填表、分类)
- 一致性比深度更重要的大规模面向客户应用
- 有厂商 SLA 要求的企业工作流
- 能看出 MiniMax 消费者产品谱系的中文内容
如果你的生产系统每天跑几千次结构化抽取调用——每次都是常规任务——M1 的指令遵循稳定性可能转化为比纯推理导向模型(如 Kimi K3)更低的错误率。
基准表现背景
截至写作时,Kimi K3 和 MiniMax M1 都没有一个决定性的基准席位——中国开源圈发布基准结果的速度很快,独立第三方评测会滞后于发布。开发者社区的报告与上面描述的差异化大体一致:
- 在推理密集型基准(MATH、编程竞赛、科学 QA)上,Kimi K3 的思考模式产出有竞争力的结果。
- 在指令遵循和结构化输出基准上,MiniMax M1 表现可靠。
- 在中文任务上,两个模型都表现高水平;差异小到值得在投入前做针对工作负载的测试。
最新基准数字请参考官方模型卡和 Hugging Face Open LLM Leaderboard,而不是厂商营销页。
集成与生态
Kimi K3 集成
Moonshot AI 在 https://platform.moonshot.cn/ 维护一个开发者平台。注册后即可获得 API key。端点是:
https://api.moonshot.cn/v1因为 API 是 OpenAI 兼容的,你可以用官方 OpenAI Python SDK 加一个 base_url 覆盖:
from openai import OpenAI
client = OpenAI(
base_url="https://api.moonshot.cn/v1",
api_key="your_moonshot_api_key"
)函数调用遵循与 OpenAI 工具调用相同的 schema。对已经构建在 OpenAI SDK 上的应用,迁移是一行改动。
MiniMax M1 集成
MiniMax 通过 MiniMax 平台提供 API。API 表面同样 OpenAI 兼容,支持函数调用。当前端点 URL、速率限制和企业档位,查 MiniMax 开发者文档。
开放权重:这里的「开放」到底意味着什么
两个模型都公开发布权重,但「开放权重」是一个光谱。在把产品构建到任一模型的自托管部署上之前,检查:
- 许可条款 — 商业使用、微调权利、再分发
- 服务要求 — 这个规模的 MoE 模型需要可观的 GPU 内存;完整推理通常需要 8xA100 或同等配置
- 量化支持 — 可能有更小的量化版本供实验,但生产质量需要完整模型
对大多数团队,API 是务实路径。自托管一个 1M 上下文的 MoE 模型本身就是个基础设施项目,而且相对 API 定价的成本优势只有在非常高的吞吐下才能兑现。
你该选哪个?
默认推荐: 如果你在启动一个新项目,需要一个推理强、定价透明、集成路径容易的模型,Kimi K3 是更清晰的起点。已公布的定价、OpenAI 兼容 API 和显式思考模式减少了集成摩擦,并为复杂任务给你更多杠杆。
出现以下情况切到 MiniMax M1: 你的工作负载主要是结构化抽取、高吞吐指令遵循,或者你需要 Moonshot 当前平台还不提供的企业支持承诺。
出现以下情况两个都测: 你在处理大量中文内容,两个模型之间的质量差异有经济影响。在承诺之前,每个模型的 API 各跑 200–500 个代表性样本,按你的具体任务衡量输出质量。
对想在这两款之外探索中国开源模型全景的团队,glm5.app 是一个有用的起点——它深度覆盖 GLM 模型家族,这个家族在许多相同任务上直接和 Kimi K3 与 MiniMax M1 竞争,在中文和智能体工作流上常常有强表现。
总结
| Kimi K3 | MiniMax M1 | |
|---|---|---|
| 最适合 | 推理、编程、数学、长上下文分析 | 指令遵循、结构化抽取、企业 |
| 定价透明度 | 已公布($0.30/$1.10 per 1M tokens) | 有竞争力;以平台为准 |
| 思考模式 | 有 | 无专用模式 |
| 集成难度 | OpenAI 兼容,迁移容易 | OpenAI 兼容 |
| 开放权重 | 有 | 有 |
| 生态成熟度 | 开发者社区成长中 | 面向企业 |
Kimi K3 和 MiniMax M1 都是严肃的模型,任何新的中文或长上下文项目都该把它们放进评估清单。规格持平是真实的,但运营差异——推理深度、指令一致性、定价透明度、生态支持——决定了哪个契合你团队的实际工作流。投入之前,拿自己的数据测试。
Sources
- Moonshot AI developer platform: https://platform.moonshot.cn/
- Kimi API documentation: https://api.moonshot.cn/v1
- MiniMax AI official site: https://www.minimaxi.com/
- Hugging Face Open LLM Leaderboard: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard

