GLM 5.2——官方名称为 GLM-4-Plus,由 Zhipu AI(智谱 AI)开发——是截至 2025 年年中可用的最强大型语言模型之一。凭借 100 万 token 的上下文窗口、强劲的编程与推理基准成绩,以及原生中英双语支持,它吸引了大量想在本地运行或集成进自己应用的开发者。
本指南覆盖使用 GLM 5.2 的全部路径:你到底能下载什么、最适合本地部署的开放权重版本、分步配置说明,以及本地硬件不可行时如何通过 API 接入全规模的 753B 模型。
理解 GLM 5.2 模型家族
下载任何东西之前,先搞清楚「GLM 5.2」在不同语境下指什么:
- GLM-4-Plus(GLM 5.2 API 模型):旗舰专有模型——753B 总参数 / 40B 激活的 Mixture-of-Experts 架构。该模型只能通过 Zhipu AI 的 API 使用(
glm-4-plus,地址https://open.bigmodel.cn/api/paas/v4/)。完整 753B 权重没有本地下载。 - GLM-4-9B-Chat:同代的开放权重模型,以 MIT 许可证发布。这个 9B 参数模型托管在 HuggingFace 上,是本地部署的主要选项。
- GLM-4-9B-Chat-1M:GLM-4-9B 的长上下文变体,支持最高 100 万 token。
- GLM-Z1 系列:同样以开放权重提供的推理导向模型系列,面向复杂多步骤问题求解。
- GLM-4V:支持视觉的变体,除文本外还能理解图像。
如果你的目标是在本地复现 GLM 5.2 的完整性能,实话实说:做不到——完整模型并未公开发布。你能下载的是 GLM-4-9B-Chat,它在消费级硬件要求下能提供扎实的性能;要全规模访问,则走 API。
方案 1:下载 GLM-4-9B-Chat(开放权重,MIT 许可证)
GLM-4-9B-Chat 是任何想在本地部署 GLM 模型的用户的首选路径。权重托管在 HuggingFace 的 THUDM/glm-4-9b-chat 下,在 MIT 许可证下可免费下载并商用。
第 1 步:安装 HuggingFace Hub CLI
pip install huggingface_hub
第 2 步:登录 HuggingFace
部分模型仓库需要认证。用你的 HuggingFace 账号 token 登录一次:
huggingface-cli login
按提示粘贴你的访问 token。你可以到 huggingface.co/settings/tokens 生成一个。
第 3 步:下载模型权重
huggingface-cli download THUDM/glm-4-9b-chat --local-dir ./glm-4-9b-chat
这会把所有模型分片、tokenizer 文件和配置下载到 ./glm-4-9b-chat 目录。全精度权重预计占用约 18–20 GB 磁盘空间。
长上下文变体:
huggingface-cli download THUDM/glm-4-9b-chat-1m --local-dir ./glm-4-9b-chat-1m
方案 2:用 Hugging Face Transformers 本地运行
下载完成后,可以用 transformers 库跑推理。GLM-4-9B-Chat 支持标准的 AutoModelForCausalLM 接口。
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch
model_path = "./glm-4-9b-chat"
tokenizer = AutoTokenizer.from_pretrained(model_path, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_path,
torch_dtype=torch.bfloat16,
device_map="auto",
trust_remote_code=True,
)
model.eval()
messages = [
{"role": "user", "content": "Explain the difference between MoE and dense transformer architectures."}
]
inputs = tokenizer.apply_chat_template(
messages,
tokenize=True,
add_generation_prompt=True,
return_tensors="pt"
).to(model.device)
with torch.no_grad():
outputs = model.generate(inputs, max_new_tokens=512, do_sample=False)
response = tokenizer.decode(outputs[0][inputs.shape[-1]:], skip_special_tokens=True)
print(response)
硬件要求:bfloat16 推理大约需要 20 GB GPU 显存。一块 NVIDIA RTX 4090(24 GB)或两块 RTX 3090(各 24 GB)通常就够。纯 CPU 或 CPU/GPU 混合方案,见下面的量化选项。
方案 3:用 vLLM 跑高吞吐推理
如果要给多个用户提供服务,或需要高吞吐,vLLM 是推荐的引擎。它通过标准 API 支持 GLM-4-9B-Chat。
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model ./glm-4-9b-chat \
--dtype bfloat16 \
--trust-remote-code \
--port 8000
启动后,用任何 OpenAI 兼容客户端查询:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "glm-4-9b-chat",
"messages": [{"role": "user", "content": "Hello, what can you do?"}]
}'
方案 4:用 llama.cpp 或 Ollama 跑量化 GGUF 版本
没有独立 GPU 的用户,量化 GGUF 版本能显著降低内存需求。HuggingFace 上的社区贡献者会定期发布 GLM-4-9B-Chat 的 GGUF 量化版——在 HuggingFace 上搜 glm-4-9b GGUF 可找到当前社区维护的版本。社区量化的可用性和质量可能有差异,下载前先看模型卡和仓库活跃度。
用 Ollama(最简单路径)
如果 GLM-4 GGUF 在 Ollama 模型库中可用:
# Install Ollama first: https://ollama.com/download
ollama pull glm4 # check https://ollama.com/library for current availability
ollama run glm4
直接用 llama.cpp
# Build llama.cpp
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make
# Download a GGUF file (search HuggingFace for community quantizations)
# Then run:
./llama-cli -m glm-4-9b-chat.Q4_K_M.gguf \
-p "You are a helpful assistant." \
--ctx-size 4096 \
-n 512
9B 模型的 Q4_K_M 量化通常只需要约 6–8 GB 内存,大多数现代笔记本都能跑。
方案 5:通过 API 接入完整 GLM 5.2(753B)
对于全规模的 GLM-4-Plus——也就是 GPQA Diamond 89%、LiveCodeBench 74.3% 这些基准成绩背后的模型——本地部署不可行。完整的 753B MoE 模型只能通过 Zhipu AI 的 API 使用。
价格(按官方文档,请在 open.bigmodel.cn 核实):
- 输入:每百万 token 1.40 美元
- 输出:每百万 token 4.40 美元
API 快速上手
- 在 open.bigmodel.cn 注册——新账号会获得免费试用 token。
- 在控制台生成 API key。
- 安装 SDK:
pip install zhipuai
- 发起第一次调用:
from zhipuai import ZhipuAI
client = ZhipuAI(api_key="your_api_key_here")
response = client.chat.completions.create(
model="glm-4-plus",
messages=[
{"role": "user", "content": "Summarize the key differences between MoE and dense LLMs."}
],
max_tokens=1024,
temperature=0.7,
)
print(response.choices[0].message.content)
该 API 兼容 OpenAI,因此使用 openai Python 客户端的现有集成通常只需极小改动即可指向 GLM 的端点。
选择正确的 GLM 5.2 部署路径
| 部署方式 | 模型规模 | 所需显存 | 最适合 |
|---|---|---|---|
| Hugging Face Transformers (bf16) | GLM-4-9B-Chat | ~20 GB GPU | 开发、原型 |
| vLLM 服务 | GLM-4-9B-Chat | ~20 GB GPU | 生产、多用户服务 |
| llama.cpp / GGUF (Q4_K_M) | GLM-4-9B-Chat | ~6–8 GB RAM | 笔记本、CPU 推理 |
| Ollama | GLM-4-9B-Chat | ~6–8 GB RAM | 快速本地部署、零配置 |
| Zhipu AI API (glm-4-plus) | 753B MoE(托管) | 无 | 完整能力、无需硬件 |
| glm5.app 托管访问 | 753B MoE(托管) | 无 | 免 API 配置、浏览器即用 |
完全跳过下载
如果你想在投入 API 集成或本地部署之前评估 GLM 5.2 的完整能力,glm5.app 提供托管访问——无需下载、无需注册账号、无需配置。这是在你真实使用场景上测试模型的最快方式——无论是长文档分析、代码生成还是双语任务。
API 集成路径的更深入讲解,见我们关于 GLM 5.2 API 接入与认证 的相关指南。
常见问题排查
「Trust remote code」错误:GLM-4-9B-Chat 使用自定义模型代码。用 transformers 加载时始终传 trust_remote_code=True。只对可信仓库的代码这样做。
内存不足错误:bfloat16 显存不够时,试试 torch_dtype=torch.float16 或使用量化 GGUF 版本。也可以在多张 GPU 上试 device_map="auto"。
下载速度慢:HuggingFace 在部分区域很慢。设置环境变量 HF_ENDPOINT=https://hf-mirror.com 使用镜像(先确认你所在区域当前可用的镜像)。
Chat template 错误:GLM-4-9B-Chat 使用特定的对话格式。始终用 tokenizer.apply_chat_template(),不要手动拼消息。
总结
GLM 5.2(GLM-4-Plus)代表了 Zhipu AI 当前的最先进水平,但完整的 753B 模型仅限 API。本地部署的话,GLM-4-9B-Chat 是你的最佳选择——MIT 许可、HuggingFace 上支持完善、配上合适的量化能在消费级硬件上运行。要无任何硬件负担地获得最大能力,Zhipu API 或 glm5.app 能立刻满足你。
请记住 GLM 模型家族仍在持续演进。Zhipu AI 会定期发布新的检查点、推理变体(GLM-Z1)和支持视觉的模型(GLM-4V),所以值得关注 THUDM HuggingFace 组织 和官方开放平台的最新动态。无论你是为了隐私和成本控制走本地路线,还是为了简单和完整模型能力走 API 路线,GLM 5.2 对中英文工作负载都是强劲的选择。
Sources
- Zhipu AI 开放平台:https://open.bigmodel.cn
- THUDM on HuggingFace(GLM-4-9B-Chat 及相关模型):https://huggingface.co/THUDM
- GLM-4-9B-Chat 模型卡:https://huggingface.co/THUDM/glm-4-9b-chat
- vLLM 文档:https://docs.vllm.ai
- llama.cpp GitHub:https://github.com/ggerganov/llama.cpp
- Ollama:https://ollama.com
- ZhipuAI Python SDK:https://github.com/zhipuai/zhipuai-sdk-python-v4




