当月之暗面(Moonshot AI)在 2025 年 7 月发布 Kimi K3 时,最受关注的功能之一就是它的思考模式——一种扩展思维链推理能力,让它与 OpenAI o1 和 Claude 的扩展思考(extended thinking)直接同台竞技。但 Kimi K3 的价格让这些竞争对手显得贵得吓人。
本指南讲清 Kimi K3 思考模式到底是什么、底层如何运作、什么时候该用什么时候不该用,以及如何通过 API 启用它。
什么是 Kimi K3 思考模式?
Kimi K3 的思考模式是一种扩展思维链(CoT)推理系统。启用后,模型不会直接跳到答案——它先生成一段内部推理轨迹,逐步推演问题,然后产出最终回复。
这与 OpenAI 在 o1 上开创、Anthropic 在 Claude 的扩展思考中实现的架构模式相同。核心思想是:复杂问题——尤其是数学、逻辑和多步规划——受益于深思熟虑的结构化推理,而不是即时的模式化应答。
在思考模式下,Kimi K3 本质上是在内部「出声思考」。这些推理 token 在推理过程中生成,虽然模型可能根据 API 调用方式暴露部分或全部推理轨迹,但关键是最终答案已经通过显式的中间步骤验证。
痛点:什么时候用思考模式
**痛点:**开发者常常在不需要的任务上启用思考模式,浪费 token 和时间——或者反过来,因为从不启用它,在难题上拿到糟糕的结果。
思考模式不是万能升级。它是针对特定问题类别的特定工具。把它用在简单的摘要任务上不会提升质量;只会多生成 2–5 倍的 token,并在首个输出 token 出现前显著增加延迟。
经验法则:如果人类专家解题需要打草稿,思考模式就有帮助。如果一个合格的人能一口气答出来,普通模式就够了。
这些场景用思考模式:
- 数学奥赛级问题与竞赛编程挑战
- 多步逻辑演绎(如约束满足、形式证明)
- 需要先做算法规划再动笔的复杂代码生成
- 模型必须考虑并否决多种方案的问题
- 正确性要求严格、答错代价高昂的任务
这些场景留在普通模式:
- 摘要、翻译与抽取
- 事实查证式的简单问答
- 无复杂约束的创意写作
- 分类与路由任务
- 任何速度与低成本比极限准确度更重要的任务
API 怎么用
Kimi K3 使用 OpenAI 兼容 API,如果你已经在用 OpenAI SDK,上手很容易。base URL 是 https://api.moonshot.cn/v1。
要启用思考模式,你在 model 参数里指定一个支持思考的模型变体。截至撰写时,该变体的标识是 moonshot-v1-thinking-latest——最新模型名以月之暗面平台文档为准,新版本发布时可能变化。
下面是用 Python OpenAI SDK 调思考模式的标准调用:
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.cn/v1"
)
response = client.chat.completions.create(
model="moonshot-v1-thinking-latest",
messages=[
{
"role": "user",
"content": "A train leaves Station A at 9:00 AM traveling at 80 km/h. Another train leaves Station B (300 km away) at 10:00 AM traveling at 100 km/h toward Station A. At what time do they meet, and how far from Station A?"
}
],
max_tokens=4096
)
print(response.choices[0].message.content)这是一个更完整的示例,演示思考模式解决编程问题——模型先规划再动笔:
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.cn/v1"
)
problem = """
Implement an efficient algorithm to find all pairs of integers in an array
that sum to a target value. The array may contain duplicates and negative
numbers. Return all unique pairs sorted by the first element.
Time complexity should be O(n log n) or better.
"""
response = client.chat.completions.create(
model="moonshot-v1-thinking-latest",
messages=[
{
"role": "system",
"content": "You are an expert software engineer. Think carefully about edge cases and complexity before writing code."
},
{
"role": "user",
"content": problem
}
],
max_tokens=8192,
temperature=0.6
)
print(response.choices[0].message.content)
# Token usage — thinking tokens count toward billing
usage = response.usage
print(f"Prompt tokens: {usage.prompt_tokens}")
print(f"Completion tokens: {usage.completion_tokens}")
print(f"Total tokens: {usage.total_tokens}")使用 API 时的几条实用提醒:
- **思考 token 按输出费率计费。**响应里的
completion_tokens字段同时包含推理轨迹和最终答案。预算时请留意。 - **
max_tokens设得宽裕些。**困难的推理链可能很长。如果max_tokens太低,模型可能在推理中途被截断。 - **首 token 延迟显著更高。**模型在产出输出前至少要先完成一部分推理。复杂问题的延迟预计在几秒到几十秒。
- **1M token 上下文窗口依然适用。**思考 token 占用同一个上下文预算。极长的推理链加上大输入,在极复杂任务上可能逼近上下文上限。
竞争差异化:价格 vs 性能
**竞争差异化:**Kimi K3 思考模式以可比模型的零头价格提供扩展推理。
截至撰写时,Kimi K3 思考模式与其他扩展推理方案的对比:
| 模型 | 输入价格(每 1M token) | 输出价格(每 1M token) | 上下文窗口 | 推理风格 | 开放权重 |
|---|---|---|---|---|---|
| Kimi K3(Moonshot AI) | $0.30 | $1.10 | 1,000,000 | 扩展 CoT(思考模式) | 是(MoE) |
| OpenAI o1 | $15.00 | $60.00 | 128,000 | 扩展 CoT | 否 |
| OpenAI o3-mini | $1.10 | $4.40 | 200,000 | 扩展 CoT | 否 |
| Claude 3.5 Sonnet(扩展思考) | $3.00 | $15.00 | 200,000 | 扩展思考 | 否 |
| Claude 3.7 Sonnet(扩展思考) | $3.00 | $15.00 | 200,000 | 扩展思考 | 否 |
成本优势一目了然。在 Kimi K3 上跑一个思考模式任务,成本大约比 OpenAI o1 便宜 50 倍,比 Claude 扩展思考便宜约 10 倍。对跑大量推理任务的团队——自动评分、代码评审流水线、复杂文档分析——这个差异在实践中是巨大的。
Kimi K3 即使在思考模式下也保持 1M token 上下文窗口,而大多数竞品推理模型上限是 128K–200K。这让 Kimi K3 在长文档、大代码库或累积上下文的多轮对话推理上具有独特价值。
开放权重的可用性又加了一个维度:有合规或数据驻留要求的组织可以自托管 Kimi K3,在不把数据发给第三方 API 的情况下运行思考模式。
难题上的表现预期
在思考模式下,Kimi K3 在它设计针对的问题类别上表现出可测量的提升。对需要多步推导的数学问题,模型倾向于先列方程、检查中间结果、在提交最终答案前抓住代数错误——这种模式在普通模式下很少出现。
对竞赛编程问题,思考模式促使模型先勾勒解法思路、识别边界情况,再写处理它们的代码——而不是输出第一个看似合理的实现就收手。
对多步规划(旅行行程、项目排期、约束密集的决策),思考模式让模型显式枚举约束、检验提出的方案是否满足约束、在给出最终计划前修正。
话说回来,思考模式不是魔法。对真正超出模型知识或能力的问题,扩展推理产出的只是一份更花哨的错误答案,而不是正确答案。思考模式提升的是「可解难题」上的可靠性——它不会扩展模型的知识边界。
预算 token 的实用指南
因为思考 token 按输出费率计费(截至撰写时每 1M token $1.10),成本管理值得想想:
**近似倍数:**取决于问题复杂度,思考模式通常比普通模式多生成 2–5 倍输出 token。普通模式下 500 token 的回复,思考模式下可能变成 1,000–2,500 token。
**估算批处理成本:**假设你要跑 10,000 个推理问题,每个平均输出 2,000 个思考+最终 token,那就是 2,000 万输出 token,按 Kimi K3 的输出费率大约 $22。同样的负载在 OpenAI o1 上大约要 $1,200。
**什么时候做 A/B 测试:**对全新用例,先在普通模式和思考模式下各跑一小批,在评估集上比较准确度,按「每个正确答案的成本」而不是「每个 token 的成本」来计算。思考模式可能准确得多,即使每 token 更贵,按有用结果算反而更便宜。
放在 GLM 生态里看
如果你在基于中国 AI 模型构建、正在评估选项,值得弄明白 Kimi K3 在更大的版图里的位置。GLM 系模型(来自智谱 AI)在编程、推理和中英双语任务上同样表现出色。想详细了解 GLM 家族的 API 与能力,GLM-5.2 API 指南 覆盖了上下文窗口大小、定价与集成模式,是很有用的参考点。
Moonshot 的 Kimi 与智谱的 GLM 两个模型家族占据重叠但不同的生态位,理解两者能帮你为每种任务类型选对工具。
开始使用
在 platform.moonshot.cn 注册 API 访问获取你的 API key。上手流程很简单,OpenAI 兼容接口意味着大多数现有 SDK 无需修改即可工作——只需换 base URL 和模型名。
想在投入 API 集成之前先体验 Kimi K3 能力的团队,glm5.app 提供了一个动手环境来测试前沿中国 AI 模型——在写生产代码之前,这是建立「哪些任务最受益于扩展推理」直觉的有用方式。
总结
Kimi K3 的思考模式是扩展思维链推理,能在硬核数学、逻辑和编程问题上大幅提升准确度——而且价格点让所有可比模型相形见绌。核心权衡很直白:更多 token、更高延迟、在真正困难的问题上更好的答案。任务需要深思熟虑的多步推理时启用它;速度与成本比极限准确度更重要的简单任务则跳过。
1M token 上下文窗口、开放权重可用性和有竞争力的定价,让 Kimi K3 思考模式成为生产级推理负载的现实选择——不只是研究上的好奇。
想在前沿模型之间探索扩展推理能力的开发者,glm5.app 是很好的起点——在优化你的集成之前,先对比输出、建立直觉。
Sources
- 月之暗面 AI 平台(API 文档与模型详情):https://platform.moonshot.cn/
- 月之暗面 AI 官方 API base:https://api.moonshot.cn/v1
- OpenAI o1 定价与文档:https://openai.com/api/pricing/
- Anthropic Claude 定价:https://www.anthropic.com/pricing

