GLM 5.3 Flash

Z.ai 在 GLM 5 家族中的高效級距:總參數 320B、啟用 18B 的混合專家模型,支援文字、圖片與影片輸入,100 萬 token 脈絡,權重以 MIT 授權開源。

用 GLM 5 創作

GLM 5.3 Flash 是什麼?

GLM 5.3 Flash 於 2026 年 8 月 26 日發布,在此之前它已在 OpenRouter 上以匿名模型 Ox Alpha 的身分運行了六天。

01

總參數 320B,啟用 18B

每個 token 只啟用 288 位專家中的 8 位:記憶體吃 320B,算力只按 18B 計。

02

原生多模態

視覺能力來自 30T token 的預訓練語料,而不是事後外掛的視覺編碼器。

03

Flash 指的是便宜,不是快

Artificial Analysis 實測輸出 50.2 token/秒,低於同級距 67 t/s 的中位數。

GLM 5.3 Flash 規格、體積與開源狀態

架構、權重與授權資訊取自 Hugging Face 模型卡與 zai-org/GLM-5 儲存庫。

模型卡

架構

總參數量
320B

MoE,45 層,288 選 8 位專家。

啟用參數量
18B

算力開銷相當於 18B 稠密模型。

脈絡視窗
1,048,576 token

Io Net 上限 262,144,Cloudflare 為 1,310,720。

最大輸出
131,072 token

也有服務商標示可達 1,179,648。

模態
文字、圖片、影片

多模態輸入,文字輸出。

權重與授權

體積與授權

權重授權
MIT

可商用、可再散布,沒有門檻限制。

Hugging Face
zai-org/GLM-5.3-Flash

另有 -BF16 版本與 ModelScope 鏡像。

GitHub
zai-org/GLM-5

沒有獨立儲存庫;GLM-5 採 Apache-2.0。

checkpoint 體積
約 328 GB(FP8)

需要多機多卡,單台工作站跑不動。

推論框架
SGLang、vLLM

另有 TokenSpeed、KTransformers 與社群 GGUF。

資料取自模型卡與 OpenRouter endpoints API,2026 年 8 月。

價格 / 04

GLM 5.3 Flash 價格:官方定價與上線折扣

Z.ai 官方定價為每百萬 token 輸入 $0.15、輸出 $0.50。各處引用的 $0.075 / $0.25 是限時 5 折的上線優惠價。

01

官方定價

$0.15

每百萬輸入 token

試算 GLM 5.3 Flash 成本請以此為準,別用促銷價。

02

官方定價

$0.50

每百萬輸出 token

1:3.3 的陡峭比例,先把輸出長度壓下來。

03

官方定價

$0.03

每百萬快取輸入 token

只有全新輸入的五分之一,長脈絡就是靠它才划算。

04

第三方測算

$0.10

混合單價

Artificial Analysis 依快取/輸入/輸出 7:2:1 的比例估算。

同一份權重價差可達 2 倍:Z.AI、Novita、GMICloud 打折,其餘照官方定價收費。

基準測試 / 05

GLM 5.3 Flash 基準測試:官方公布值與第三方實測

Z.ai 自己發表格、自己挑對照組。與 GLM 5.2 的差距以及 Artificial Analysis 的數據經得起檢驗。

01

Z.ai 公布

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra 為 87.4;任務愈難,差距愈明顯。

02

Z.ai 公布

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

同一家族、同一套方法,價格只有十分之一。AutomationBench 為 48.8 對 26.2。

03

Z.ai 公布

OfficeQA Pro

5.3 Flash62.4

文件與視覺推理,官方稱領先 Opus 4.8。

04

Artificial Analysis

57

Intelligence Index

第三方實測;同類開源權重模型的中位數約為 27。

評估 GLM 5.3 Flash 最可靠的基準,是你自己的待辦清單。

能力 / 06

GLM 5.3 Flash 能做什麼

為 Agent 框架而設計:可控推理強度、工具呼叫、結構化輸出,以及百萬 token 視窗上的串流回應。

01

可調強度的推理

預設開啟,推理強度可依需求調整。

02

函式呼叫

支援工具與工具選擇;每個動作仍需由你的應用自行驗證。

03

結構化輸出

指定回應格式即可取得可直接解析的 JSON。

04

串流回應

首個 token 1.47 秒優於中位數,但吞吐量並不佔優勢。

05

圖片與影片輸入

可以把截圖、示意圖或螢幕錄影連同提示詞一起貼上。

06

百萬 token 脈絡

$0.03 的快取輸入價,讓後續回合一直很便宜。

比較 / 07

GLM 5.3 Flash 對比 DeepSeek V4 Flash

兩者都是前沿家族中以 MIT 權重發布的低價級距,差異集中在模態、推理與硬體門檻上。

Z.ai

GLM 5.3 Flash

架構
320B / 啟用 18B

混合 KDA 加 NoPE 稀疏 MLA 注意力。

輸入
文字、圖片、影片

原生多模態。

脈絡 / 輸出
1M / 131K

輸出上限因服務商而異。

官方定價
$0.15 / $0.50

上線折扣之前的價格。

自建部署
約 328 GB FP8

雖是 MIT,但需要多機多卡。

DeepSeek

DeepSeek V4 Flash

架構
284B / 啟用約 13B

預設不做推理。

輸入
僅文字

截圖必須先轉成文字。

脈絡 / 輸出
1M / 384K

可用的回覆額度大得多。

官方定價
$0.14 / $0.28

第一方供應,1:2 的比例更平緩。

自建部署
MIT 權重

體量較小,部署成本更低。

兩者都在 glm5.app 的模型清單裡,同一則提示詞可以各跑一次。

發布時間軸 / 08

GLM 5.3 Flash 發布時間軸:從 Ox Alpha 到開源權重

先以匿名模型運行六天,隨後完整開源權重正式發布。

01

8 月 20 日 — Ox Alpha 現身

`stealth/ox-alpha` 出現在 OpenRouter,未標示供應方,按 token 免費。

02

8 月 20-26 日 — Agent 工具蜂擁而至

用量前五名全是 Agent 程式工具,OpenCode 直接免費提供。

03

8 月 26 日 — GLM 5.3 Flash 發布

Z.ai 確認它就是 Ox Alpha;模型卡、MIT 權重與價格同時公開。

04

預覽版跑在中國晶片上

採用基於 SGLang 改造的自研引擎,據稱提速約 3 倍,晶片廠商未公開。

05

權重已上架 Hugging Face

`zai-org/GLM-5.3-Flash`,另有 BF16 版本與 ModelScope 鏡像,沒有 GitHub 儲存庫。

06

消息最先出現在哪裡

價格看 OpenRouter,量化看 Hugging Face;想找實測心得,Reddit 上仍要搜 Ox Alpha。

適合誰 / 09

誰在用 GLM 5.3 Flash?

那些為「本來就不需要旗艦深度」的工作付旗艦價的團隊——以及它並不適合的情境。

01

高頻次的 Agent 程式開發

工具呼叫只花 GLM 5.3 十分之一的 token 單價,長 Agent 迴圈才跑得起。

02

儲存庫規模的工作

百萬 token 視窗能把整個程式庫放進脈絡,跨檔案提問不必再做檢索。

03

看圖除錯

跑版的版面、重現流程錄影、畫成圖的資料結構。

04

在 Z.ai 與競品之間選型的團隊

可在 glm5.app 聊天中與 DeepSeek V4 Flash、Qwen 直接比較。

05

有叢集的自建部署方

MIT 權重與 vLLM 支援都是真的,但 FP8 的 328 GB 單機裝不下。

06

不適合對延遲敏感的介面

每秒約 50 個輸出 token,落後於同價位的多數模型。

如何使用 GLM 5.3 Flash / 10

如何使用 GLM 5.3 Flash

三條路徑:瀏覽器裡免費聊天、呼叫 glm5.app 的 API,或在自己的硬體上跑 MIT 權重。

01
01

免費與 GLM 5.3 Flash 聊天

在聊天中選擇 GLM 5.3 Flash 並上傳截圖。新帳號可獲得免費額度。

02
02

呼叫 glm5.app 的 API

向 `https://glm5.app/api/v1` 發送 OpenAI 相容請求,模型 ID 填 `glm-5.3-flash`。

03
03

或自行部署權重

取得 `zai-org/GLM-5.3-Flash`,以 SGLang 或 vLLM 部署,FP8 約 328 GB。

Integration specimen

從 GLM 5.3 Flash API 開始

OpenAI 相容的 Chat Completions 端點。在 `https://glm5.app/api/v1` 使用模型 ID `glm-5.3-flash`。

開啟 API 文件
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

GLM 5.3 Flash 常見問題

關於 Ox Alpha、價格、基準測試、參數量、Hugging Face、vLLM、DGX Spark 以及 DeepSeek V4 Flash。

GLM 5.3 Flash 和 Ox Alpha 是同一個模型嗎?

是的——它自 2026 年 8 月 20 日起以 `stealth/ox-alpha` 的名義運行了六天。已儲存的 Ox Alpha 對話會自動對應過來。


GLM 5.3 Flash 和 GLM 5.3 是同一個嗎?

不是,兩者屬於不同級距,價格差約 10 倍。Flash 是 320B-A18B 的多模態模型,GLM 5.3 則是文字旗艦。


GLM 5.3 Flash 怎麼收費?

Z.ai 定價為每百萬 token 輸入 $0.15、快取 $0.03、輸出 $0.50。被廣泛引用的 $0.075 / $0.25 是限時 5 折的上線優惠。


GLM 5.3 Flash 免費嗎?

Ox Alpha 預覽期免費,現在改為按量計費。你仍然可以在 glm5.app 的聊天裡免費試用。


GLM 5.3 Flash 有多少參數?體積多大?

總參數 320B,每個 token 啟用 18B,45 層從 288 位專家中路由 8 位。FP8 checkpoint 約 328 GB。


GLM 5.3 Flash 在 Hugging Face 和 GitHub 上嗎?

權重以 MIT 授權發布在 Hugging Face 的 `zai-org/GLM-5.3-Flash`。沒有獨立 GitHub 儲存庫,相關腳本放在 `zai-org/GLM-5`。


可以用 vLLM 或 DGX Spark 跑 GLM 5.3 Flash 嗎?

vLLM、SGLang、TokenSpeed 與 KTransformers 都支援。328 GB 裝不進單台 DGX Spark,社群回報可用 4 bit 量化把兩台串起來跑。


GLM 5.3 Flash 和 DeepSeek V4 Flash 該選哪個?

需要視覺輸入或深度推理選 Flash;想要 1:2 更平緩的比例或 384K 輸出,就選 DeepSeek V4 Flash。


Reddit 上怎麼評價 GLM 5.3 Flash?

多數實測心得仍掛在預覽版名稱之下,所以在 Reddit 上請直接搜 Ox Alpha。


Start here

今天就開始用 GLM 5.3 Flash

先在瀏覽器裡免費用 GLM 5.3 Flash 跑一次你最難的任務,再把模型 ID 接進自己的流程。