2026 年 7 月 16 日,Moonshot AI 发布了一个拥有 2.8 万亿参数的模型——按这个数字算,这是有史以来最大的开放权重模型。它的基准成绩与 Claude Opus 4.8 持平。它的输出 token 价格是每百万 $15。它的开放权重在十一天后的 7 月 27 日到来。
这就是用四个数字描述的 Kimi K3。下面说说这些数字对正在决定是否使用它的开发者和团队意味着什么。
本文覆盖内容: K3 的架构以及为什么 2.8T 参数不等于 2.8T 计算量、它在前沿模型中的基准位置、今天如何调用 API、成本多少、什么时候值得用,以及什么时候像 GLM 5.2 这样更便宜的模型更合适。
Kimi K3 有什么不同
两件事让 Kimi K3 区别于此前的开放权重模型。
第一,规模。 2.8 万亿参数让 K3 成为截至 2026 年 7 月发布的最大开放权重模型——比 Llama 405B 大近 7 倍,接近闭源前沿模型的估算参数规模。这个规模对应的是 K3 在 Artificial Analysis Intelligence Index 上拿到 57 分,与 Claude Opus 4.8 和 GPT-5.5 处于同一档位。
第二,效率。 K3 是混合专家(MoE)模型,每层 896 个专家。任意给定 token 只激活这 896 个中的 16 个——约占池子的 1.8%。2.8T 这个数字描述的是完整参数量;推理时的激活计算只是其中的一小部分。这与 Mixtral 和 DeepSeek 用的架构技巧相同——用巨大的参数空间承载知识和能力,同时保持高效的前向计算。
大参数空间加稀疏激活的组合,正是 K3 能拿到前沿级基准成绩、同时仍可成为开放权重发布候选的原因。它不等于在跑一个稠密的 2.8T 模型。
关键规格一览
| 规格 | Kimi K3 |
|---|---|
| 开发者 | Moonshot AI |
| 发布时间 | 2026 年 7 月 16 日 |
| 总参数 | 2.8T |
| 架构 | MoE,896 专家 / 16 激活 |
| 上下文窗口 | 1M tokens (1,048,576) |
| 模态 | 文本 + 图像输入,文本输出 |
| AA Intelligence Index | 57 |
| 输出速度 | 62 tokens/秒 |
| 首 token 时间 | 1.99s |
| 输入价格 | $3.00/M tokens |
| 输出价格 | $15.00/M tokens |
| 缓存命中价格 | $0.30/M tokens |
| 许可证 | 修改版 MIT |
| 开放权重 | 2026 年 7 月 27 日(计划) |
| API 模型 ID | kimi-k3 |
基准成绩
Kimi K3 在 Artificial Analysis Intelligence Index 上位居全部前沿模型第四,落后于 Claude Fable 5 和 GPT-5.6 Sol,领先于 Claude Opus 4.8。
| 基准 | Kimi K3 | 说明 |
|---|---|---|
| AA Intelligence Index | 57 | 总排名第四,与 Claude Opus 4.8 相当 |
| AA Coding Index | 76 | 强编码专项分数 |
| DeepSWE | 67.5% | 真实 GitHub issue 解决 |
| FrontierSWE | 81.2% | 前沿软件工程任务 |
| GPQA Diamond | ≈88% | 博士级科学推理 |
| MMMU-Pro(视觉) | 75% | 多模态视觉推理 |
| LMArena Frontend Code | #1(Elo 1679) | UI 生成用户偏好 |
编码数字是 K3 的头牌。DeepSWE 和 FrontierSWE 评估的是真实世界软件工程表现——解决开放的 GitHub issue、写生产代码——67.5% 和 81.2% 分别让 K3 跻身可用的最强编码模型之列。
LMArena Frontend Code Arena 的结果——以 Elo 1679 出道即第一——反映的是用户对 UI 和前端代码生成的偏好。对构建设计转代码管线、或从截图生成 React/Vue 组件的团队来说,这是有意义的信号。
GPQA Diamond 上,K3 落在约 88%,与大多数其他前沿模型同档。在科学推理的顶端,前沿模型之间的差距会压缩。
定价
Kimi K3 在整个上下文窗口采用统一定价,无长上下文附加费。
| 档位 | 价格 |
|---|---|
| 输入(缓存未命中) | $3.00 / M tokens |
| 输入(缓存命中) | $0.30 / M tokens |
| 输出 | $15.00 / M tokens |
输出 token 价格相对其他开放权重模型偏高。每百万 $15.00,K3 每个输出 token 比 GLM 5.2($4.40/M)贵 3.4 倍,比 Kimi K2.5($3.00/M)贵 5 倍。
缓存命中折扣很可观(相对缓存未命中价降 90%),适合有重复系统提示或大块静态上下文的应用——检索系统、固定语料的长文档问答、或把代码库装进上下文的编码智能体。缓存命中 $0.30/M 时,重复上下文调用的有效成本大幅下降。
对大多数开发者用例——30K 输入 + 10K 输出——单次 K3 调用大约 $0.24。同等 GLM 5.2 调用约 $0.086。规模化时,这 2.8 倍的单次调用差距会显著复利。
如何访问 Kimi K3
通过 API
Kimi K3 的 API 兼容 OpenAI SDK。Base URL 是 https://api.moonshot.ai/v1,模型 ID 是 kimi-k3。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "Explain the trade-offs between MoE and dense transformer architectures."}
],
max_completion_tokens=2048
)
print(response.choices[0].message.content)
几条 API 专属注意事项:
- 推理始终开启。 K3 没有
reasoning_effort设置——默认以最大推理强度运行,这推高了输出 token 数和价格。 - 省略
temperature、top_p和seed。 K3 使用固定采样;传这些参数可能报错。 - 图像需要 base64 或文件上传。 不支持公开图像 URL。要么把图像编码为 base64,要么通过 Kimi 文件 API 上传并用
ms://文件 ID 引用。 - 显式设置
max_completion_tokens。 默认是 131,072——一个 128K token 的答案预算。对大多数任务,更小的上限能显著省钱。
通过聊天界面
K3 立即在 kimi.com 以及 Kimi Work 和 Kimi Code 里可用,无需 API key。网页界面暴露完整推理能力,包括思考轨迹。
上下文窗口与图像输入
1M 上下文: K3 单次请求处理 1,048,576 token——大约 1,500 页文本。这与 GLM 5.2 的容量相同,明显大于 GPT-4o 的 128K 或许多其他前沿 API。对大型代码库分析、完整法律文档审查或长研究论文处理,1M 窗口消除了分块需求。
图像输入: K3 接受文本加图像。这让以下场景成为可能:
- 截图转代码(描述 UI 或线框,生成实现)
- 图表和架构图理解
- 带嵌入图像的 PDF 与文档处理
- 可视化调试(传一张报错状态的截图)
图像通过 base64 传递或经 Kimi 文件 API 引用。模型在同一个上下文窗口里处理图像和文本。
开源状态
Kimi K3 的权重计划于 2026 年 7 月 27 日开放发布——API 上线后十一天。许可证是修改版 MIT,允许商用但有一些限制。
7 月 27 日之前,K3 是专有的:可通过 API 和 Kimi 应用访问,但不可下载。7 月 27 日之后,它成为可用于自托管、微调或本地部署的最大开放权重模型之一。
如果现在就要开放权重,GLM 5.2 的权重已经在 Hugging Face 上,采用完整 MIT 许可。
什么时候用 Kimi K3
K3 很适合的情况:
- 你的任务受益于前沿级推理——复杂编码、多步分析、研究综合
- 你需要在同一次 API 调用里输入图像加文本
- GitHub 式编码是主要工作负载:K3 的 DeepSWE 67.5% 和 FrontierSWE 81.2% 反映真实的 SWE 表现
- 前端代码生成是核心用例——K3 在 LMArena Frontend Code Arena 排名第一,反映 UI 任务上强劲的用户偏好
- 你愿意为开放权重形态下当前可得的最高基准分数付费
K3 不是最佳选择的情况:
- 你的工作流纯文本且规模化时对成本敏感——GLM 5.2 输出 $4.40/M,便宜 71%
- 交互式用户在意响应速度——GLM 5.2 生成 158 t/s,K3 只有 62 t/s
- 你现在就要开放权重,等不到 7 月 27 日
- 任务是科学推理或逻辑——在这一档,GLM 5.2 和 K3 落在同一区间(GPQA Diamond 均约 88%),价格却天差地别
Kimi K3 vs GLM 5.2:简短版
| Kimi K3 | GLM 5.2 | |
|---|---|---|
| AA Intelligence Index | 57 | 51 |
| 输出价格 | $15.00/M | $4.40/M |
| 速度 | 62 t/s | 158 t/s |
| 图像输入 | 支持 | 不支持 |
| 开放权重 | 7 月 27 日 | 现在就有 |
K3 基准更高且支持图像。GLM 5.2 输出便宜 3.4 倍、速度快 2.5 倍,且现在就是 MIT 许可。带定价示例的完整对比见 GLM 5.2 vs Kimi K3。
常见问题
Kimi K3 是什么?
Kimi K3 是 Moonshot AI 的 2.8 万亿参数推理模型,2026 年 7 月 16 日发布。它是混合专家模型,1 百万 token 上下文窗口、原生图像输入、推理始终开启。它在 Artificial Analysis Intelligence Index 上拿到 57 分——与 Claude Opus 4.8 相当——是截至 2026 年 7 月得分最高的开放权重模型。
Kimi K3 开源吗?
Kimi K3 的 API 于 2026 年 7 月 16 日上线。开放权重计划于 2026 年 7 月 27 日以修改版 MIT 许可发布,允许商用。
Kimi K3 有多少参数?
2.8 万亿总参数。不过 K3 是混合专家模型——896 个专家中任意 token 只激活 16 个(约 1.8%)——所以实际计算量远小于头衔参数数字给人的印象。
Kimi K3 多少钱?
输入 token 每百万 $3.00(缓存未命中)、$0.30(缓存命中),输出 token 每百万 $15.00。无长上下文附加费。
Kimi K3 支持图像吗?
支持。K3 接受文本和图像输入(图像以 base64 或 Kimi 文件 ID 传递)。它不能生成图像——输出仅文本。
Kimi K3 的 API 用什么模型 ID?
模型 ID 是 kimi-k3,调用地址 https://api.moonshot.ai/v1。API 兼容 OpenAI SDK。
Kimi K3 和 GLM 5.2 比怎么样?
Kimi K3 在 AA Intelligence Index 上高 6 分(57 vs 51),且支持图像输入。GLM 5.2 每个输出 token 便宜 3.4 倍($4.40 vs $15.00/M),响应速度快 2.5 倍(158 vs 62 t/s)。带定价示例和基准拆解的完整对比见此。
Kimi K3 和 Kimi K2 是同一个吗?
不是。Kimi K3 是 K2 系列的继任者。关键差异:K3 有 2.8T 参数(对比 K2.6 更小的规模)、AA Intelligence Index 57 分(K2.6 更低)、新增始终开启的推理。K3 的定价也明显高于 K2.x。
总结
Kimi K3 是截至 2026 年 7 月能力最强的开放权重推理模型——2.8T 参数、前沿级基准成绩、1M 上下文,以及单次 API 调用内的图像输入。它在独立基准上与 Claude Opus 4.8 持平,在 LMArena 的 Frontend Code Arena 上排名第一。
约束是价格。输出 token $15.00/M 让 K3 相对其他开放权重模型偏贵。对纯文本、成本敏感或速度敏感的工作负载,GLM 5.2 以低 71% 的输出成本和 2.5 倍的吞吐,交付了强劲的基准表现。
对正在构建图像感知管线、高赌注编码智能体、或基准表现值得溢价的应用的开发者:K3 是当前开放权重类别的基准领跑者。对其他人,请评估这份智能溢价是否过得了成本关。
试用 Kimi K3——无需任何配置:glm5.app/chat?model=kimi-k3。或与 GLM 5.2 并排对比:glm5.app/chat。
来源
(来源链接)
- Kimi K3 技术博客:开放前沿智能——Moonshot AI(官方模型公告、架构细节)
- Kimi K3——智能、性能与价格分析——Artificial Analysis(Intelligence Index:57、速度:62 t/s、定价数据)
- Kimi K3 快速上手——Kimi API 平台(API 参数、模型 ID、推理设置)
- 中国的 2.8T Kimi K3 在 Frontend Code Arena 击败 Claude Fable 5——Tom's Hardware(LMArena Elo、参数量、开放权重时间线)
- Kimi K3 上线:定价、基准与公开权重的等待——Trilogy AI(定价结构、基准拆解)




