GLM 5.2 搭配 Ollama:在本地跑 GLM 模型
Aug 1, 2026

GLM 5.2 搭配 Ollama:在本地跑 GLM 模型

学习如何用 Ollama 在本地运行 GLM 模型:下载 GLM-4-9B 或兼容 GLM 模型、配置 Ollama,并对比本地性能与云端 GLM 5.2 API。

很多搜索「GLM 5.2 Ollama」的开发者目标都一样:在自己硬件上跑一个能干的 GLM 模型,省掉 API 账单,把数据留在本地。本指南会讲清楚哪些能做、哪些不能做 —— 并给出今天就用 Ollama 把 GLM 模型跑起来的实操步骤。

先弄清:GLM 5.2 API 与开放 GLM 模型

GLM 5.2(以 API 名称 glm-4-plus 对外提供)是 Zhipu AI 的纯云模型。它是一个庞大的 7530 亿参数混合专家架构,每次前向传播激活 40B 参数。你通过 Zhipu AI 的托管端点 https://open.bigmodel.cn/api/paas/v4/ 访问它 —— 完整的 GLM-4-Plus 模型没有公开可下载的权重文件。

Zhipu AI 确实开源的,是 GLM-4-9B-Chat,一个 90 亿参数的稠密模型,以 MIT 许可证发布在 HuggingFace 上。这才是你真正能在本地跑的模型,而且它相当能干 —— 中英双语推理强、支持工具使用、上下文窗口长。可以把 GLM-4-9B 想成那个更大云模型的蒸馏版、可本地运行的兄弟。

如果你需要 GLM 5.2 的完整能力(GPQA Diamond 89%、SWE-bench Pro 62.1%、1M token 上下文),云 API 是唯一路径。如果你需要隐私、离线使用或零 per-token 成本,经 Ollama 跑 GLM-4-9B 是正确的选择。两者各有各的位置 —— 本指南详细覆盖本地路径。

想深入了解云 API,请看我们的 GLM 5.2 API 使用指南

第 1 步 —— 检查 Ollama 是否有官方 GLM 模型

Ollama 的模型库一直在扩充。用任何变通方案之前,先访问 https://ollama.com/library 搜索「glm」或「glm4」。如果有官方条目(例如 ollama.com/library/glm4),拉取它只需一条命令:

ollama pull glm4

运行 ollama list 确认模型下载完成,然后立刻测试:

ollama run glm4 "Explain mixture-of-experts in two sentences."

如果你检查的时候还没有官方 Ollama 条目,跳到下面的 GGUF 部分 —— 社区在 HuggingFace 上维护着 GLM-4-9B-Chat 的 GGUF 量化版本。

第 2 步 —— 通过 GGUF 安装 GLM-4-9B(备选路径)

如果 Ollama 还没有打包好的 GLM 模型,你可以用社区的 GGUF。在 HuggingFace 上搜索量化版本:

找一个 Q4_K_M 或 Q5_K_M 量化 —— 它们提供最佳的质量与体积权衡。下载 .gguf 文件,然后创建一个简单的 Modelfile 让 Ollama 能导入它:

# Download the GGUF (example — check HuggingFace for the actual filename)
# huggingface-cli download THUDM/glm-4-9b-chat-gguf glm-4-9b-chat.Q4_K_M.gguf

# Create a Modelfile in the same directory
cat > Modelfile <<'EOF'
FROM ./glm-4-9b-chat.Q4_K_M.gguf
PARAMETER stop "<|endoftext|>"
PARAMETER stop "<|user|>"
PARAMETER stop "<|assistant|>"
SYSTEM "You are a helpful bilingual AI assistant."
EOF

# Import and tag it
ollama create glm4-local -f Modelfile

# Run it
ollama run glm4-local "Hello, what can you do?"

Ollama 会对权重做哈希并导入;之后这个模型的行为和任何其他 Ollama 模型完全一样。

第 3 步 —— 硬件要求

GLM-4-9B-Chat 以完整 BF16 精度运行大约需要 18 GB 显存 —— 超出大多数消费级显卡。量化把它拉到实用范围:

量化级别文件大小最低显存相对完整版的质量
Q8_0约 9.5 GB12 GB优秀
Q5_K_M约 6.2 GB8 GB很好
Q4_K_M约 5.0 GB6 GB良好
Q3_K_M约 4.0 GB6 GB可接受
仅 CPU(Q4)约 5.0 GB16 GB 内存慢但能用

对大多数开发者,Q4_K_M 或 Q5_K_M 在 8 GB 显卡(RTX 3070、RTX 4060、M2/M3 Mac 统一内存)上跑就是甜点区。16 GB 统一内存的 Apple Silicon Mac 跑 Q5_K_M 表现很好,因为 Ollama 会自动使用 Metal 加速。

第 4 步 —— 通过 Ollama 的 OpenAI 兼容 API 在本地使用 GLM

模型跑起来后,Ollama 会在 http://localhost:11434 暴露一个 OpenAI 兼容的 REST 端点。你可以用官方 OpenAI Python 库和它对话 —— 无需自定义 SDK:

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama",  # required by the library, any string works
)

response = client.chat.completions.create(
    model="glm4-local",  # or "glm4" if you used the official Ollama pull
    messages=[
        {
            "role": "system",
            "content": "You are a bilingual AI assistant fluent in English and Chinese.",
        },
        {
            "role": "user",
            "content": "Write a Python function to compute Fibonacci numbers recursively.",
        },
    ],
    temperature=0.7,
    max_tokens=512,
)

print(response.choices[0].message.content)

因为端点是 OpenAI 兼容的,任何支持自定义 base URL 的工具 —— LangChain、LlamaIndex、Continue.dev、Open WebUI —— 都能零改动直接工作。只需把 base_url 指向 http://localhost:11434/v1

第 5 步 —— 切换到云端 GLM 5.2 API

当本地性能不够,或者你需要完整的 1M token 上下文时,切到云 API 只差一个环境变量。同一个 OpenAI 客户端库就能用:

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://open.bigmodel.cn/api/paas/v4/",
    api_key=os.environ["ZHIPU_API_KEY"],
)

response = client.chat.completions.create(
    model="glm-4-plus",
    messages=[{"role": "user", "content": "Summarize this 500-page document..."}],
)

https://open.bigmodel.cn 注册免费试用 —— Zhipu AI 在注册时赠送免费 token,让你在投入付费使用之前轻松测试。GLM-4-Plus 的定价是每百万输入 token $1.40、每百万输出 token $4.40。

你也可以直接在 glm5.app 的网页界面里体验 GLM 5.2 —— 上手不需要配置 API key。

本地 GLM-4-9B vs 云端 GLM 5.2:并排对比

维度本地 GLM-4-9B (Ollama)云端 GLM 5.2 (glm-4-plus)
模型规模9B 参数753B 总 / 40B 激活(MoE)
上下文窗口最高 128K tokens1,048,576 tokens (1M)
GPQA Diamond 分数未公布89%
SWE-bench Pro未公布62.1%
每 1M 输入 token 成本$0(只花硬件钱)$1.40
隐私完全本地,数据不出机器数据发送到 Zhipu AI 服务器
需要联网不需要(下载后)需要
配置时间10–30 分钟5 分钟(API key + 一次 pip install)
中文质量优秀(母语级)
视觉支持基础 GLM-4-9B 没有有(GLM-4V 变体)
流式支持有(Ollama 内置)
工具 / 函数调用有(有限)有(健壮)

9B 和 753B 模型之间的性能差距是真实的。对直接的任务 —— 摘要、问答、翻译、常见语言的代码生成 —— GLM-4-9B 能交出扎实的结果。对复杂的多步推理、长文档分析或困难的编程 benchmark,云模型明显更强。

什么时候用本地,什么时候用云端

选本地(Ollama + GLM-4-9B),当:

  • 你的输入数据是机密的 —— 医疗记录、法律文档、专有代码 —— 不能离开你的基础设施
  • 你有很高的请求量,硬件成本比 per-token 定价更划算
  • 你需要离线或气隙环境运行
  • 你在搭建和测试流水线,希望开发期间零 API 成本
  • 你的用户对到中国云服务器的延迟有顾虑

选云端(GLM 5.2 API),当:

  • 任务质量是关键的,你需要可用的最强模型
  • 你需要 1M token 上下文窗口来处理大文档或长程智能体会话
  • 需要视觉输入(GLM-4V)
  • 你想要零基础设施维护
  • 你在快速原型,不想管理硬件

很多生产系统两者都用:本地 GLM 做便宜、私密的预处理,云端 GLM 对标记出的或复杂的输入做最终推理。

常见问题排查

运行 ollama run glm4 报「Model not found」: 模型库的条目可能变了。运行 ollama list 看装了什么,并重新检查 https://ollama.com/library 上的当前模型标签。

CPU 上生成很慢: 如果你没有 GPU,或者 Ollama 没有检测到 GPU,生成会很慢(每秒几个 token)。模型运行期间用 ollama ps 确认 GPU 检测。在 macOS 上,确保你用是 Apple Silicon 原生版 Ollama,而不是 Rosetta 版。

内存不足崩溃: 降到更低的量化(Q4_K_M 或 Q3_K_M),或者在 Modelfile 里调小 num_ctx。更短的上下文窗口按比例占用更少的显存。

中文输出质量低于预期: 基础版 GLM-4-9B-Chat 专门为中英双语任务调优过。确保你用的是 -Chat 变体,而不是需要额外指令微调的基础预训练权重。

在云端开始用 GLM 5.2

用 Ollama 在本地跑 GLM 很有成就感,但如果你想零搭建开销地体验 GLM 5.2 的完整能力,glm5.app 通过一个干净的界面让你立即访问云模型。在决定本地或 API 部署之前,这是快速 benchmark 你用例的方式。

Sources

立即开始使用 GLM 5

免费试用 GLM 5 — 推理、编程、智能体和图像生成,一个平台全搞定。

GLM 5.2 搭配 Ollama:在本地跑 GLM 模型 - GLM 5