2025 年的开源模型版图不再由单一地理或实验室主导。Moonshot AI 于 2025 年 7 月发布 Kimi K3,提供带 1M token 上下文窗口和中英双语能力的大规模混合专家(MoE)模型。Google 则在同年早些时候以 Gemma 3 回应——一个紧凑、多模态、能在消费级硬件上舒适运行的模型家族。两者都带"开放权重",但设计优先级天差地别。
这篇指南拆解每一个有意义的差异——定价、上下文长度、基准表现、自托管成本、真实世界适配度——让你不带猜测地选对工具。
痛点:选错开源模型很贵
开源不等于零成本。GPU 租赁、内存要求和推理延迟都随模型规模增长。选一个对你的用例太大的模型,你在空闲算力上烧钱。选一个太小或缺少关键特性——多模态输入、长上下文检索、中文支持——的模型,你会在项目中途撞上能力墙。
Kimi K3 vs Gemma 3 的选择经常绊倒开发者,因为两个模型在价格上看着相似(通过托管 API 大约每百万输入 token $0.30–$0.35),但在架构、上下文容量和硬件足迹上根本不同。原型阶段选错,通常意味着后来迁移推理基础设施——既痛苦又昂贵。
快速概览
Kimi K3 是 Moonshot AI 于 2025 年 7 月发布的旗舰开放权重模型。它使用混合专家(MoE)架构,意味着总参数量很大,但每个 token 只有一部分参数激活,让推理成本可控。头条能力是原生的 1,000,000 token(1M)上下文窗口——约 750,000 个词——使其成为撰写本文时可用上下文最长的开放模型之一。API 与 OpenAI 兼容,托管在 https://api.moonshot.cn/v1。
Gemma 3 是 Google 2025 年 3 月的开放权重家族,四个尺寸:1B、4B、12B 和 27B。旗舰 27B 模型在文本之外支持图像输入,可在两块消费级 RTX 4090 GPU 上运行,并通过 Google AI Studio 免费使用(有限流)。Gemma 3 使用 Gemma License,允许广泛使用,但对超大规模商业部署有限制。
头对头对比表
| 维度 | Kimi K3 | Gemma 3 27B |
|---|---|---|
| 提供商 | Moonshot AI(中国) | Google DeepMind |
| 发布日期 | 2025 年 7 月 | 2025 年 3 月 |
| 上下文窗口 | 1,000,000 tokens | 128,000 tokens |
| 托管 API 定价(输入) | $0.30 / 1M tokens | 约 $0.35 / 1M tokens(Vertex AI) |
| 托管 API 定价(输出) | $1.10 / 1M tokens | 约 $1.05 / 1M tokens(Vertex AI) |
| 免费档 | 无(仅付费 API) | 有——Google AI Studio(有限流) |
| 多模态(图像输入) | 无(以文本为主) | 有(4B、12B、27B) |
| 架构 | MoE(总参数大) | 稠密 Transformer |
| 自托管硬件 | 需要大型 GPU 集群 | 2x RTX 4090(27B) |
| 思考 / 思维链 | 有(扩展推理模式) | 无原生思考模式 |
| 函数调用 | 有 | 有 |
| 中文质量 | 优秀(原生双语) | 有限 |
| 许可 | 开放权重 | Gemma License |
| MMLU 基准(27B) | 撰写本文时未披露 | 约 73.5% |
上下文窗口:最大的实际差距
Kimi K3 的 1M token 上下文不是营销噱头——它改变了模型能处理的问题类别。128K 上下文(Gemma 3 的上限)约装下一本 300 页的书或一个中等规模代码库。1M 上下文能装下完整法律文档库、多日聊天历史,或一个 monorepo 体量的代码连同测试和文档。
如果你的应用做下面任何一件事,Kimi K3 的上下文优势是决定性的:
- 跨几十个文件的完整代码库问答或重构
- 长文档总结(年报、研究语料)
- 不切分即可保留的多会话对话记忆
- 塞进更多上下文能减少检索错误的 RAG 管道
对其余一切——聊天机器人、单图分析、短文档任务——128K 通常绰绰有余,Gemma 3 更低的硬件成本开始有吸引力。
定价:纸面上相似,实践中不同
托管 API 价格接近得不应单独作为决定因素:
- Kimi K3: $0.30 / 1M 输入,$1.10 / 1M 输出
- Gemma 3 27B(Vertex AI): 约 $0.35 / 1M 输入,$1.05 / 1M 输出
真正的定价差异是 Gemma 3 在 Google AI Studio 上免费使用(有限流),这使它非常适合原型、黑客马拉松或低流量生产负载。Kimi K3 没有免费档。
对自托管负载,Gemma 3 27B 塞得进两块 RTX 4090 GPU——许多研究实验室和初创公司已经拥有的硬件。Kimi K3 的 MoE 架构需要多 GPU 服务器集群,意味着要么云租赁、要么大额资本支出。
多模态能力:Gemma 3 明确胜出
Gemma 3 在 4B、12B 和 27B 变体上支持图像输入。你可以把截图、图表、产品照片或文档连同文本提示词一起传入,模型跨两种模态推理。这是原生的——不是包装一个独立视觉模型。
Kimi K3 以文本为主。撰写本文时,它不接受通过公共 API 的图像输入。如果你的用例涉及任何视觉推理——OCR、图表解读、从截图做 UI 测试、视觉 QA——Gemma 3 是两者中唯一可行的选项。
中文:Kimi K3 明确胜出
Moonshot AI 把 Kimi K3 训练成真正双语的模型。中文是一等语言,不是翻译后的补充。Kimi K3 处理中文成语、字级推理、中英混合技术写作和领域特定中文术语,实质性地好于任何主要用英语语料训练的模型。
Gemma 3 作为 Google 产品重度为英语优化,提供的中文质量有限。对服务中文用户、处理中文文档或需要中文代码注释的应用,Kimi K3 是明确选择。
扩展推理:Kimi K3 的思考模式
Kimi K3 出厂带可选的思考模式,在产出最终答案前启用扩展思维链推理。这对数学问题、复杂逻辑谜题、多步骤编码任务,以及任何"展示过程能降低错误率"的查询都重要。
Gemma 3 撰写本文时没有原生思考模式。你可以用逐步指令提示它,诱导出思维链行为,但它缺少一条能为难题分配额外算力的专用推理路径。
自托管要求
这是两个模型对基础设施团队分歧最大的地方。
Gemma 3 27B 为可及性设计。它塞得进两块 RTX 4090 GPU(共 48 GB 显存),可通过 Hugging Face Transformers、llama.cpp 或 Ollama 运行,量化形式甚至能在单块高端消费卡上跑。12B 和更小变体在单块 GPU 上运行。想要完全数据驻留控制、又已拥有中端硬件的团队可以零摩擦自托管 Gemma 3。
Kimi K3 使用大型 MoE 架构。总参数量意味着自托管需要多 GPU 服务器或云集群。这对有推理基础设施的企业可行,但对大多数初创公司和个人开发者排除了自托管。Kimi K3 务实的自托管叙事是"用托管 API"。
竞争差异点:每个模型比谁都强在哪
Kimi K3 的独特差异点是单个开放权重模型里同时具备 1M token 上下文、思考模式和强中英双语能力。撰写本文时,没有任何其他公开可用的模型同时满足这三点。对中文长文档工作流、法律分析,或需要在内存中保留大量上下文而不做有损分块的智能体任务,Kimi K3 自成一类。
Gemma 3 的独特差异点是多模态能力、消费级 GPU 可及性和免费档的组合——价格与比它大得多的模型竞争。对需要"视觉 + 语言"打包、低进入门槛可自托管的团队,Gemma 3 27B 交付了一年前需要专有 API 才能获得的能力。免费的 Google AI Studio 档也让它成为原型速度最快的模型。
你该选哪个模型?
以下情况选 Kimi K3:
- 你的输入文档或对话历史经常超过 128K token
- 你服务中文用户或处理中文内容
- 你需要面向数学、逻辑或复杂编码的扩展推理(思考模式)
- 你接受付费 API,不需要图像理解
以下情况选 Gemma 3:
- 你需要图像输入(图表、截图、文档)
- 你想在消费级或中端硬件上自托管
- 你在原型阶段,想在投入付费推理前用免费档
- 你的用例以英语为主,上下文长度保持在 128K 以下
- 你想要面向边缘部署的最小可用模型(Gemma 3 1B 或 4B)
探索其他开放权重模型
Kimi K3 和 Gemma 3 是两个强劲选项,但开源模型空间变化很快。如果你在更广泛地评估中国开放权重模型,智谱 AI 的 GLM-5.2 是另一个值得对比的双语选项——它以 OpenAI 兼容 API 提供强劲的编码和推理表现。
想在一个地方探索最新一代中国开源模型?访问 glm5.app 运行实时对比、查看基准分数,无需任何配置即可用自己的提示词测试模型。
总结
Kimi K3 和 Gemma 3 解决不同的问题。8 倍的上下文差距(1M 对 128K)是最具后果的技术差异,但多模态能力、自托管硬件要求和中文质量各有各的重要性,取决于你的应用。托管 API 的定价足够接近,不应主导决策。让模型匹配你的约束——上下文长度、视觉需求、硬件预算和语言要求——而不是只看基准选。
如果你还在探索选项,glm5.app 汇集了最新的中国开源模型,用并排能力卡帮你快速缩小范围。
Sources
- Moonshot AI Kimi K3 official page: https://www.moonshot.cn
- Moonshot AI API documentation: https://platform.moonshot.cn/docs
- Google Gemma 3 model page: https://ai.google.dev/gemma/docs/gemma3
- Gemma 3 on Hugging Face: https://huggingface.co/collections/google/gemma-3-release-67c6c4f33f8f6e2a5c0b4f5f
- Google AI Studio (free tier): https://aistudio.google.com
- Vertex AI pricing: https://cloud.google.com/vertex-ai/generative-ai/pricing
- Gemma License: https://ai.google.dev/gemma/terms




