官方定價
$0.15
每百萬輸入 token
試算 GLM 5.3 Flash 成本請以此為準,別用促銷價。
Z.ai 在 GLM 5 家族中的高效級距:總參數 320B、啟用 18B 的混合專家模型,支援文字、圖片與影片輸入,100 萬 token 脈絡,權重以 MIT 授權開源。
GLM 5.3 Flash 於 2026 年 8 月 26 日發布,在此之前它已在 OpenRouter 上以匿名模型 Ox Alpha 的身分運行了六天。
每個 token 只啟用 288 位專家中的 8 位:記憶體吃 320B,算力只按 18B 計。
視覺能力來自 30T token 的預訓練語料,而不是事後外掛的視覺編碼器。
Artificial Analysis 實測輸出 50.2 token/秒,低於同級距 67 t/s 的中位數。
架構、權重與授權資訊取自 Hugging Face 模型卡與 zai-org/GLM-5 儲存庫。
模型卡
MoE,45 層,288 選 8 位專家。
算力開銷相當於 18B 稠密模型。
Io Net 上限 262,144,Cloudflare 為 1,310,720。
也有服務商標示可達 1,179,648。
多模態輸入,文字輸出。
權重與授權
可商用、可再散布,沒有門檻限制。
另有 -BF16 版本與 ModelScope 鏡像。
沒有獨立儲存庫;GLM-5 採 Apache-2.0。
需要多機多卡,單台工作站跑不動。
另有 TokenSpeed、KTransformers 與社群 GGUF。
資料取自模型卡與 OpenRouter endpoints API,2026 年 8 月。
價格 / 04
Z.ai 官方定價為每百萬 token 輸入 $0.15、輸出 $0.50。各處引用的 $0.075 / $0.25 是限時 5 折的上線優惠價。
官方定價
$0.15
試算 GLM 5.3 Flash 成本請以此為準,別用促銷價。
官方定價
$0.50
1:3.3 的陡峭比例,先把輸出長度壓下來。
官方定價
$0.03
只有全新輸入的五分之一,長脈絡就是靠它才划算。
第三方測算
$0.10
Artificial Analysis 依快取/輸入/輸出 7:2:1 的比例估算。
基準測試 / 05
Z.ai 自己發表格、自己挑對照組。與 GLM 5.2 的差距以及 Artificial Analysis 的數據經得起檢驗。
Z.ai 公布
GPT-5.6 Terra 為 87.4;任務愈難,差距愈明顯。
Z.ai 公布
同一家族、同一套方法,價格只有十分之一。AutomationBench 為 48.8 對 26.2。
Z.ai 公布
文件與視覺推理,官方稱領先 Opus 4.8。
Artificial Analysis
57
第三方實測;同類開源權重模型的中位數約為 27。
能力 / 06
為 Agent 框架而設計:可控推理強度、工具呼叫、結構化輸出,以及百萬 token 視窗上的串流回應。
預設開啟,推理強度可依需求調整。
支援工具與工具選擇;每個動作仍需由你的應用自行驗證。
指定回應格式即可取得可直接解析的 JSON。
首個 token 1.47 秒優於中位數,但吞吐量並不佔優勢。
可以把截圖、示意圖或螢幕錄影連同提示詞一起貼上。
$0.03 的快取輸入價,讓後續回合一直很便宜。
比較 / 07
兩者都是前沿家族中以 MIT 權重發布的低價級距,差異集中在模態、推理與硬體門檻上。
Z.ai
混合 KDA 加 NoPE 稀疏 MLA 注意力。
原生多模態。
輸出上限因服務商而異。
上線折扣之前的價格。
雖是 MIT,但需要多機多卡。
DeepSeek
預設不做推理。
截圖必須先轉成文字。
可用的回覆額度大得多。
第一方供應,1:2 的比例更平緩。
體量較小,部署成本更低。
兩者都在 glm5.app 的模型清單裡,同一則提示詞可以各跑一次。
發布時間軸 / 08
先以匿名模型運行六天,隨後完整開源權重正式發布。
`stealth/ox-alpha` 出現在 OpenRouter,未標示供應方,按 token 免費。
用量前五名全是 Agent 程式工具,OpenCode 直接免費提供。
Z.ai 確認它就是 Ox Alpha;模型卡、MIT 權重與價格同時公開。
採用基於 SGLang 改造的自研引擎,據稱提速約 3 倍,晶片廠商未公開。
`zai-org/GLM-5.3-Flash`,另有 BF16 版本與 ModelScope 鏡像,沒有 GitHub 儲存庫。
價格看 OpenRouter,量化看 Hugging Face;想找實測心得,Reddit 上仍要搜 Ox Alpha。
適合誰 / 09
那些為「本來就不需要旗艦深度」的工作付旗艦價的團隊——以及它並不適合的情境。
工具呼叫只花 GLM 5.3 十分之一的 token 單價,長 Agent 迴圈才跑得起。
百萬 token 視窗能把整個程式庫放進脈絡,跨檔案提問不必再做檢索。
跑版的版面、重現流程錄影、畫成圖的資料結構。
可在 glm5.app 聊天中與 DeepSeek V4 Flash、Qwen 直接比較。
MIT 權重與 vLLM 支援都是真的,但 FP8 的 328 GB 單機裝不下。
每秒約 50 個輸出 token,落後於同價位的多數模型。
三條路徑:瀏覽器裡免費聊天、呼叫 glm5.app 的 API,或在自己的硬體上跑 MIT 權重。
在聊天中選擇 GLM 5.3 Flash 並上傳截圖。新帳號可獲得免費額度。
向 `https://glm5.app/api/v1` 發送 OpenAI 相容請求,模型 ID 填 `glm-5.3-flash`。
取得 `zai-org/GLM-5.3-Flash`,以 SGLang 或 vLLM 部署,FP8 約 328 GB。
Integration specimen
OpenAI 相容的 Chat Completions 端點。在 `https://glm5.app/api/v1` 使用模型 ID `glm-5.3-flash`。
開啟 API 文件curl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'關於 Ox Alpha、價格、基準測試、參數量、Hugging Face、vLLM、DGX Spark 以及 DeepSeek V4 Flash。
是的——它自 2026 年 8 月 20 日起以 `stealth/ox-alpha` 的名義運行了六天。已儲存的 Ox Alpha 對話會自動對應過來。
不是,兩者屬於不同級距,價格差約 10 倍。Flash 是 320B-A18B 的多模態模型,GLM 5.3 則是文字旗艦。
Z.ai 定價為每百萬 token 輸入 $0.15、快取 $0.03、輸出 $0.50。被廣泛引用的 $0.075 / $0.25 是限時 5 折的上線優惠。
Ox Alpha 預覽期免費,現在改為按量計費。你仍然可以在 glm5.app 的聊天裡免費試用。
總參數 320B,每個 token 啟用 18B,45 層從 288 位專家中路由 8 位。FP8 checkpoint 約 328 GB。
權重以 MIT 授權發布在 Hugging Face 的 `zai-org/GLM-5.3-Flash`。沒有獨立 GitHub 儲存庫,相關腳本放在 `zai-org/GLM-5`。
vLLM、SGLang、TokenSpeed 與 KTransformers 都支援。328 GB 裝不進單台 DGX Spark,社群回報可用 4 bit 量化把兩台串起來跑。
需要視覺輸入或深度推理選 Flash;想要 1:2 更平緩的比例或 384K 輸出,就選 DeepSeek V4 Flash。
多數實測心得仍掛在預覽版名稱之下,所以在 Reddit 上請直接搜 Ox Alpha。
Start here
先在瀏覽器裡免費用 GLM 5.3 Flash 跑一次你最難的任務,再把模型 ID 接進自己的流程。