本地运行 GLM 5.2:Ollama、显存与硬件指南
Jun 28, 2026

本地运行 GLM 5.2:Ollama、显存与硬件指南

诚实的 GLM 5.2 本地指南:Ollama 的 cloud 标签不是本地推理。这里给出各量化档需要的显存,以及 Mac 和 Linux 上精确的 llama.cpp 步骤。

当我第一次搜「GLM 5.2 Ollama」时,我期待一行命令:ollama run glm-5.2。我找到的东西更有意思——也诚实得多。Ollama 确实有一个 GLM 5.2 选项,但它不是多数人说的「本地运行」的意思。本指南拆解每种配置方案你到底得到的是什么、你需要什么硬件,以及如果你手头没有 256 GB 内存,最快的 GLM 5.2 路径是什么。

glm-5.2:cloud 到底意味着什么

如果你打开 Ollama 库搜索 GLM 5.2,你会找到它——但有个坑。唯一可用的标签是 :cloud。运行 ollama run glm-5.2:cloud 会把你的提示词路由到 Z.AI 的托管基础设施,而不是你的本地 GPU 或 CPU。它是一个披着 Ollama 操作体验的便捷 API 包装,不是设备端推理。

这个区别很重要:如果你的目标是设备端隐私、断网部署,或者不想付 API 账单的推理,Ollama 的 cloud 标签给不了你。 真正的本地推理需要另一条路。

你真的能本地运行 GLM 5.2 吗?

能——但硬件门槛是实打实的。按 Z.AI 的官方发布,GLM 5.2 是一个 7440 亿参数的 Mixture-of-Experts 模型,每个 token 激活约 400 亿参数。即使压缩后,它也是可用的最大开放权重模型之一,内存需求与之相称。

这是按量化级别的实用拆解,基于 Unsloth 发布的 GGUF 变体

量化级别所需内存最低硬件
UD-IQ1_S(1-bit 动态)约 223 GB256 GB 统一内存 Mac
UD-IQ2_M(2-bit 动态)约 239 GB256 GB Mac Studio / 1×24 GB GPU + 256 GB RAM
Q4_K_M(4-bit)约 376 GB多 GPU 或 512 GB RAM 工作站
FP8 via vLLM753 GB+8×H200 或同级

2-bit 量化(UD-IQ2_M)是消费级硬件的甜点位——它是最可达的选项,同时保留强劲的编码性能。预计每秒约 3–9 token,视你的配置而定。

方案 1:256 GB 统一内存的 Mac Studio

如果你有 M3 Ultra 或 M4 Ultra 的 Mac Studio,192–256 GB 统一内存,这是消费级硬件上最干净的本地路径。Apple Silicon 的统一内存意味着 CPU 和 GPU 共享同一个池子,所以你可以加载 2-bit GGUF,不必处理其他方案里 GPU-CPU 分离的麻烦。

步骤:

1. 安装 llama.cpp(推理后端):

brew install llama.cpp

或者从源码构建以获得最新的 Metal 优化:

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && cmake -B build -DGGML_METAL=ON && cmake --build build -j

2. 从 Unsloth 下载 2-bit GGUF(共 239 GB——六个分片,全部下载):

huggingface-cli download unsloth/GLM-5.2-GGUF \
  --include "UD-IQ2_M/*.gguf" \
  --local-dir ./glm52-gguf

你需要 pip install huggingface_hub 和足够的 NVMe 存储。下载很耗时——提前开始。

3. 运行推理:

llama-cli \
  -m ./glm52-gguf/UD-IQ2_M/GLM-5.2-UD-IQ2_M-00001-of-00006.gguf \
  -ngl 99 \
  --temp 0.7 \
  -p "Write a Python function that parses a JSON log file..."

-ngl 99 把所有层卸载到 Metal GPU。256 GB 统一内存下,编程提示词大约每秒 4–9 token。

GUI 替代: 不想用 CLI 的话,LM Studio 把 llama.cpp 包进桌面应用,带可视化模型浏览器和内置聊天 UI。下载后手动导入 GGUF 文件夹,剩下的交给它。

方案 2:Linux GPU 工作站

你不需要 Mac 就能本地运行 GLM 5.2——但确实需要相当可观的内存。Linux 上的关键技术是 MoE expert 卸载:把激活专家(约 40B 参数)加载到 GPU 显存,把其余专家池留在系统内存,按需换入。

可行的实用最低配置: 1× RTX 4090(24 GB 显存)+ 256 GB DDR5 系统内存。

约 40B 激活参数基本能塞进 24 GB GPU;其余休眠专家待在内存里。它比 Mac Studio 慢——约每秒 2–5 token——但对开发和批量工作负载足够。

步骤:

1. 安装带 CUDA 支持的 llama.cpp:

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && cmake -B build -DGGML_CUDA=ON && cmake --build build -j

2. 下载 2-bit GGUF(命令同上)。

3. 用 GPU + CPU 卸载运行:

./build/bin/llama-cli \
  -m ./glm52-gguf/UD-IQ2_M/GLM-5.2-UD-IQ2_M-00001-of-00006.gguf \
  -ngl 30 \
  --temp 0.7 \
  -p "Write a Python function that..."

更低的 -ngl 值把更少的层卸载到 GPU,其余留给 CPU 和系统内存。从 30 起步往上调,直到撞上显存 OOM,再退 5。GPU 更小就从更低开始。

方案 3:企业级——8×H200 上的 vLLM

要在生产中以全精度运行 GLM 5.2 的团队,vLLM 或 SGLang 是推荐路径。FP8 变体需要约 860 GB 显存——8× NVIDIA H200(各 141 GB)可提供约 1.1 TB 总余量。

pip install "vllm>=0.23.0"
vllm serve zai-org/GLM-5.2 --dtype fp8 --tensor-parallel-size 8

这给你全质量推理、高并发吞吐,以及 localhost:8000 上的 OpenAI 兼容端点,现有工具无需改动即可指向它。

投入前值得算笔账:8×H200 节点自持或租用都很贵。拿它对比 Z.AI API 约 $1.40/1M 输入 token 的价格,按你的量决定哪个划算。对大多数团队,云 API 赢,直到吞吐需求变得非常大。

零硬件方案

这里说句实话:多数开发者没有 256 GB 统一内存,也没有一架子 H200。 如果你是这种情况,通往 GLM 5.2 最快的路是浏览器。

glm5.app 在浏览器里免费给你 GLM 5.2——无需安装、无需 API key、不需要 239 GB 存储。它背后是同一份 MIT 许可的权重,即时启动,试用零成本。

只在你有明确需求时用本地方案:断网运行、微调权重,或你的硬件值得这么折腾。评估、日常编程辅助,以及任何不需要严格设备端隐私的场景,用 glm5.app

常见问题

GLM 5.2 本地运行免费吗? 权重是 MIT 许可的——下载、运行、修改都免费。成本在硬件:2-bit 量化最少需要约 239 GB 内存/显存,这把真正的本地推理限制在高端 Mac 或定制工作站上。

Ollama 支持本地运行 GLM 5.2 吗? Ollama 收录了 GLM 5.2,但只有 :cloud 标签——它把你的提示词路由到 Z.AI 的 API 基础设施,而不是你的本地硬件。要真正的本地推理,直接用 llama.cpp 跑 Unsloth 的 GGUF 文件。

本地运行 GLM 5.2 的最低硬件是什么? 实用最低配置是 M3 Ultra 或 M4 Ultra Mac Studio 配 256 GB 统一内存,或者 24 GB GPU + 256 GB 系统内存的 Linux 工作站。低于这个,连 1-bit 量化都放不进内存。

GLM 5.2 本地运行有多快? 256 GB Mac Studio(M4 Ultra)配 2-bit GGUF,预计约 4–9 token/秒。24 GB GPU + 256 GB RAM 的 Linux 配置,预计 2–5 token/秒。开发和批量任务可用,交互式等每个响应的工作流不理想。

本地 GLM 5.2 能接 OpenAI SDK 工具吗? 能。llama.cpp 的 server 模式和 LM Studio 都暴露 OpenAI 兼容的 REST API(通常在 localhost:11434localhost:1234)。任何基于 OpenAI SDK 的工具都能用一行配置改动指向那个端点。

底线

本地运行 GLM 5.2 是真的——但它要求诚实的硬件。Ollama 的 :cloud 标签是 API 包装,不是本地推理。真正的设备端运行,最可达的路径是 Unsloth 的 2-bit GGUF 配 llama.cpp,跑在 256 GB Mac Studio 或高内存 Linux 工作站上,在当今最好的消费级硬件上给出 3–9 token/秒。

想在建好 256 GB Mac 之前先试 GLM 5.2,从这里开始:在 glm5.app 免费试用 GLM 5.2——无需下载、无需密钥、无需存储。确认它适合你的使用场景后,你对硬件投入是否值得就会有清晰判断。评估期间,顺便看看 GLM 5.2 在基准上的表现API 与订阅方案的价格

Sources

硬件要求和量化体积反映 Unsloth 发布的 GGUF 规格及截至 2026 年年中的社区基准。购买硬件前请在各来源核实当前数据。

立即开始使用 GLM 5

免费试用 GLM 5 — 推理、编程、智能体和图像生成,一个平台全搞定。

本地运行 GLM 5.2:Ollama、显存与硬件指南 - GLM 5