如何下载 GLM 5.2:开放权重、API 接入与本地部署
Aug 1, 2026

如何下载 GLM 5.2:开放权重、API 接入与本地部署

从 HuggingFace 下载 GLM 5.2 开放权重的分步指南,用 llama.cpp 或 vLLM 本地运行,或不下载直接通过 API 接入。

GLM 5.2——官方名称为 GLM-4-Plus,由 Zhipu AI(智谱 AI)开发——是截至 2025 年年中可用的最强大型语言模型之一。凭借 100 万 token 的上下文窗口、强劲的编程与推理基准成绩,以及原生中英双语支持,它吸引了大量想在本地运行或集成进自己应用的开发者。

本指南覆盖使用 GLM 5.2 的全部路径:你到底能下载什么、最适合本地部署的开放权重版本、分步配置说明,以及本地硬件不可行时如何通过 API 接入全规模的 753B 模型。


理解 GLM 5.2 模型家族

下载任何东西之前,先搞清楚「GLM 5.2」在不同语境下指什么:

  • GLM-4-Plus(GLM 5.2 API 模型):旗舰专有模型——753B 总参数 / 40B 激活的 Mixture-of-Experts 架构。该模型只能通过 Zhipu AI 的 API 使用(glm-4-plus,地址 https://open.bigmodel.cn/api/paas/v4/)。完整 753B 权重没有本地下载。
  • GLM-4-9B-Chat:同代的开放权重模型,以 MIT 许可证发布。这个 9B 参数模型托管在 HuggingFace 上,是本地部署的主要选项。
  • GLM-4-9B-Chat-1M:GLM-4-9B 的长上下文变体,支持最高 100 万 token。
  • GLM-Z1 系列:同样以开放权重提供的推理导向模型系列,面向复杂多步骤问题求解。
  • GLM-4V:支持视觉的变体,除文本外还能理解图像。

如果你的目标是在本地复现 GLM 5.2 的完整性能,实话实说:做不到——完整模型并未公开发布。你能下载的是 GLM-4-9B-Chat,它在消费级硬件要求下能提供扎实的性能;要全规模访问,则走 API。


方案 1:下载 GLM-4-9B-Chat(开放权重,MIT 许可证)

GLM-4-9B-Chat 是任何想在本地部署 GLM 模型的用户的首选路径。权重托管在 HuggingFace 的 THUDM/glm-4-9b-chat 下,在 MIT 许可证下可免费下载并商用。

第 1 步:安装 HuggingFace Hub CLI

pip install huggingface_hub

第 2 步:登录 HuggingFace

部分模型仓库需要认证。用你的 HuggingFace 账号 token 登录一次:

huggingface-cli login

按提示粘贴你的访问 token。你可以到 huggingface.co/settings/tokens 生成一个。

第 3 步:下载模型权重

huggingface-cli download THUDM/glm-4-9b-chat --local-dir ./glm-4-9b-chat

这会把所有模型分片、tokenizer 文件和配置下载到 ./glm-4-9b-chat 目录。全精度权重预计占用约 18–20 GB 磁盘空间。

长上下文变体:

huggingface-cli download THUDM/glm-4-9b-chat-1m --local-dir ./glm-4-9b-chat-1m

方案 2:用 Hugging Face Transformers 本地运行

下载完成后,可以用 transformers 库跑推理。GLM-4-9B-Chat 支持标准的 AutoModelForCausalLM 接口。

from transformers import AutoTokenizer, AutoModelForCausalLM
import torch

model_path = "./glm-4-9b-chat"

tokenizer = AutoTokenizer.from_pretrained(model_path, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_path,
    torch_dtype=torch.bfloat16,
    device_map="auto",
    trust_remote_code=True,
)
model.eval()

messages = [
    {"role": "user", "content": "Explain the difference between MoE and dense transformer architectures."}
]

inputs = tokenizer.apply_chat_template(
    messages,
    tokenize=True,
    add_generation_prompt=True,
    return_tensors="pt"
).to(model.device)

with torch.no_grad():
    outputs = model.generate(inputs, max_new_tokens=512, do_sample=False)

response = tokenizer.decode(outputs[0][inputs.shape[-1]:], skip_special_tokens=True)
print(response)

硬件要求:bfloat16 推理大约需要 20 GB GPU 显存。一块 NVIDIA RTX 4090(24 GB)或两块 RTX 3090(各 24 GB)通常就够。纯 CPU 或 CPU/GPU 混合方案,见下面的量化选项。


方案 3:用 vLLM 跑高吞吐推理

如果要给多个用户提供服务,或需要高吞吐,vLLM 是推荐的引擎。它通过标准 API 支持 GLM-4-9B-Chat。

pip install vllm

python -m vllm.entrypoints.openai.api_server \
  --model ./glm-4-9b-chat \
  --dtype bfloat16 \
  --trust-remote-code \
  --port 8000

启动后,用任何 OpenAI 兼容客户端查询:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-4-9b-chat",
    "messages": [{"role": "user", "content": "Hello, what can you do?"}]
  }'

方案 4:用 llama.cpp 或 Ollama 跑量化 GGUF 版本

没有独立 GPU 的用户,量化 GGUF 版本能显著降低内存需求。HuggingFace 上的社区贡献者会定期发布 GLM-4-9B-Chat 的 GGUF 量化版——在 HuggingFace 上搜 glm-4-9b GGUF 可找到当前社区维护的版本。社区量化的可用性和质量可能有差异,下载前先看模型卡和仓库活跃度。

用 Ollama(最简单路径)

如果 GLM-4 GGUF 在 Ollama 模型库中可用:

# Install Ollama first: https://ollama.com/download
ollama pull glm4  # check https://ollama.com/library for current availability
ollama run glm4

直接用 llama.cpp

# Build llama.cpp
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make

# Download a GGUF file (search HuggingFace for community quantizations)
# Then run:
./llama-cli -m glm-4-9b-chat.Q4_K_M.gguf \
  -p "You are a helpful assistant." \
  --ctx-size 4096 \
  -n 512

9B 模型的 Q4_K_M 量化通常只需要约 6–8 GB 内存,大多数现代笔记本都能跑。


方案 5:通过 API 接入完整 GLM 5.2(753B)

对于全规模的 GLM-4-Plus——也就是 GPQA Diamond 89%、LiveCodeBench 74.3% 这些基准成绩背后的模型——本地部署不可行。完整的 753B MoE 模型只能通过 Zhipu AI 的 API 使用。

价格(按官方文档,请在 open.bigmodel.cn 核实):

  • 输入:每百万 token 1.40 美元
  • 输出:每百万 token 4.40 美元

API 快速上手

  1. 在 open.bigmodel.cn 注册——新账号会获得免费试用 token。
  2. 在控制台生成 API key。
  3. 安装 SDK:
pip install zhipuai
  1. 发起第一次调用:
from zhipuai import ZhipuAI

client = ZhipuAI(api_key="your_api_key_here")

response = client.chat.completions.create(
    model="glm-4-plus",
    messages=[
        {"role": "user", "content": "Summarize the key differences between MoE and dense LLMs."}
    ],
    max_tokens=1024,
    temperature=0.7,
)

print(response.choices[0].message.content)

该 API 兼容 OpenAI,因此使用 openai Python 客户端的现有集成通常只需极小改动即可指向 GLM 的端点。


选择正确的 GLM 5.2 部署路径

部署方式模型规模所需显存最适合
Hugging Face Transformers (bf16)GLM-4-9B-Chat~20 GB GPU开发、原型
vLLM 服务GLM-4-9B-Chat~20 GB GPU生产、多用户服务
llama.cpp / GGUF (Q4_K_M)GLM-4-9B-Chat~6–8 GB RAM笔记本、CPU 推理
OllamaGLM-4-9B-Chat~6–8 GB RAM快速本地部署、零配置
Zhipu AI API (glm-4-plus)753B MoE(托管)无完整能力、无需硬件
glm5.app 托管访问753B MoE(托管)无免 API 配置、浏览器即用

完全跳过下载

如果你想在投入 API 集成或本地部署之前评估 GLM 5.2 的完整能力,glm5.app 提供托管访问——无需下载、无需注册账号、无需配置。这是在你真实使用场景上测试模型的最快方式——无论是长文档分析、代码生成还是双语任务。

API 集成路径的更深入讲解,见我们关于 GLM 5.2 API 接入与认证 的相关指南。


常见问题排查

「Trust remote code」错误:GLM-4-9B-Chat 使用自定义模型代码。用 transformers 加载时始终传 trust_remote_code=True。只对可信仓库的代码这样做。

内存不足错误:bfloat16 显存不够时,试试 torch_dtype=torch.float16 或使用量化 GGUF 版本。也可以在多张 GPU 上试 device_map="auto"。

下载速度慢:HuggingFace 在部分区域很慢。设置环境变量 HF_ENDPOINT=https://hf-mirror.com 使用镜像(先确认你所在区域当前可用的镜像)。

Chat template 错误:GLM-4-9B-Chat 使用特定的对话格式。始终用 tokenizer.apply_chat_template(),不要手动拼消息。


总结

GLM 5.2(GLM-4-Plus)代表了 Zhipu AI 当前的最先进水平,但完整的 753B 模型仅限 API。本地部署的话,GLM-4-9B-Chat 是你的最佳选择——MIT 许可、HuggingFace 上支持完善、配上合适的量化能在消费级硬件上运行。要无任何硬件负担地获得最大能力,Zhipu API 或 glm5.app 能立刻满足你。

请记住 GLM 模型家族仍在持续演进。Zhipu AI 会定期发布新的检查点、推理变体(GLM-Z1)和支持视觉的模型(GLM-4V),所以值得关注 THUDM HuggingFace 组织 和官方开放平台的最新动态。无论你是为了隐私和成本控制走本地路线,还是为了简单和完整模型能力走 API 路线,GLM 5.2 对中英文工作负载都是强劲的选择。


Sources

Start Using GLM 5 Today

Try GLM 5 free — reasoning, coding, agents, and image generation in one platform.