Listepris
$0.15
Pr. 1M input
Beregn dine GLM 5.3 Flash-omkostninger her, ikke ud fra kampagneprisen.
Z.ai's effektivitetsniveau i GLM 5-familien: en Mixture-of-Experts på 320B med 18B aktive, input af tekst, billeder og video, 1M kontekst og åbne MIT-vægte.
GLM 5.3 Flash udkom den 26. august 2026 efter seks dage på OpenRouter som stealth-modellen Ox Alpha.
Kun 8 ud af 288 eksperter aktiveres pr. token: hukommelse som en 320B-model, beregning som en 18B.
Synet kommer fra prætræningskorpusset på 30T tokens, ikke fra en encoder sat på bagefter.
Artificial Analysis måler 50,2 output-tokens i sekundet, under klassens median på 67 t/s.
Arkitektur, vægte og licenser fra modelkortet på Hugging Face og repositoriet zai-org/GLM-5.
Modelkort
MoE, 45 lag, 8 ud af 288 eksperter.
Beregning som en tæt 18B-model.
Io Net topper ved 262.144, Cloudflare ved 1.310.720.
Andre angiver op til 1.179.648.
Multimodalt ind, tekst ud.
Vægte og licens
Kommerciel brug og videredistribution uden tærskel.
En -BF16-variant og et spejl på ModelScope.
Intet selvstændigt repo; GLM-5 er Apache-2.0.
Et job på flere noder, ikke en arbejdsstation.
Plus TokenSpeed, KTransformers og GGUF fra fællesskabet.
Modelkort og OpenRouters endpoints-API, august 2026.
Priser / 04
Z.ai angiver 0,15 $ for input og 0,50 $ for output pr. 1M tokens. De 0,075 $ / 0,25 $, der citeres overalt, er en midlertidig lanceringsrabat på 50 %.
Listepris
$0.15
Beregn dine GLM 5.3 Flash-omkostninger her, ikke ud fra kampagneprisen.
Listepris
$0.50
Et stejlt forhold på 1:3,3 — sæt loft over outputtet først.
Listepris
$0.03
En femtedel af friskt input — det er det, der gør lang kontekst overkommelig.
Uafhængig
$0.10
Artificial Analysis, på en blanding af 7:2:1 cache/input/output.
Benchmarks / 05
Z.ai udgiver sin egen tabel og vælger sammenligningerne. Forspringet til GLM 5.2 og tallene fra Artificial Analysis holder til et nærmere eftersyn.
Rapporteret af Z.ai
GPT-5.6 Terra får 87,4; afstanden vokser på de svære opgaver.
Rapporteret af Z.ai
Samme familie og metode til en tiendedel af prisen. AutomationBench: 48,8 mod 26,2.
Rapporteret af Z.ai
Ræsonnement over dokumenter og billeder, ifølge leverandøren foran Opus 4.8.
Artificial Analysis
57
Uafhængigt målt mod en median på ~27 for tilsvarende open-weight-modeller.
Funktioner / 06
Bygget til agent-harnesses: styring af ræsonnement, værktøjer, struktureret output og streaming over et vindue på en million tokens.
Slået til som standard, med et justerbart indsatsniveau.
Værktøjer og valg af værktøj; din app validerer stadig hver handling.
En begrænsning på svarformatet giver JSON, der kan parses.
1,47 s til første token slår medianen; gennemløbet gør ikke.
Indsæt et skærmbillede, et diagram eller en skærmoptagelse sammen med din prompt.
Cache-prisen på 0,03 $ holder de senere ture billige.
Sammenligning / 07
Begge er det billige niveau i en topfamilie med MIT-vægte. De skilles ad på modalitet, ræsonnement og hardware.
Z.ai
Hybrid KDA plus NoPE sparse MLA-attention.
Multimodal fra bunden.
Loftet for output varierer fra udbyder til udbyder.
Før lanceringsrabatten.
MIT, men et job på flere noder.
DeepSeek
Uden ræsonnement som standard.
Skærmbilleder skal transskriberes først.
Et langt større svarbudget.
Direkte fra udbyderen, med et fladere forhold på 1:2.
Mindre snit, billigere at servere.
Begge findes på modellisten hos glm5.app, så én prompt kan køres gennem hver af dem.
Udgivelsestidslinje / 08
Seks dage som anonym stealth-model og derefter en fuld lancering med åbne vægte.
`stealth/ox-alpha` lander på OpenRouter uden oplyst udbyder og gratis pr. token.
De fem største forbrugere er agentiske kodeværktøjer; OpenCode tilbyder den gratis.
Z.ai bekræfter slægtskabet med Ox Alpha; modelkort, MIT-vægte og priser kommer samtidig.
En egen motor afledt af SGLang, rapporteret til omkring 3x. Leverandøren er ikke oplyst.
`zai-org/GLM-5.3-Flash` plus en BF16-variant og et ModelScope-spejl. Intet GitHub-repo.
OpenRouter først med priser, Hugging Face med kvantiseringer. For erfaringer fra praksis taler Reddit stadig om Ox Alpha.
Hvem den er til / 09
Teams, der betaler flagskibspriser for arbejde, som aldrig krævede den dybde — og de tilfælde, hvor det er en dårlig idé.
Værktøjskald til en tiendedel af GLM 5.3's tokenpris gør lange agent-løkker overkommelige.
Et vindue på en million tokens holder kodebasen i hukommelsen, så spørgsmål på tværs af filer springer opslag over.
Ødelagte layouts, optagelser af fejl og skemaer i diagrammer.
Sammenlign med DeepSeek V4 Flash og Qwen i chatten på glm5.app.
MIT-vægtene og vLLM-understøttelsen er reelle, men 328 GB i FP8 udelukker én maskine.
Med omkring 50 output-tokens i sekundet ligger den efter de fleste i samme prisklasse.
Tre veje: gratis chat i browseren, API'et på glm5.app eller MIT-vægtene på din egen hardware.
Vælg GLM 5.3 Flash i chatten, og vedhæft skærmbilleder. Nye konti får gratis kreditter.
Send OpenAI-kompatible forespørgsler til `https://glm5.app/api/v1` med model-id'et `glm-5.3-flash`.
Hent `zai-org/GLM-5.3-Flash`, og server den med SGLang eller vLLM — omkring 328 GB i FP8.
Integration specimen
Et OpenAI-kompatibelt Chat Completions-endpoint. Brug model-id'et `glm-5.3-flash` på `https://glm5.app/api/v1`.
Åbn API-dokumentationencurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, priser, benchmarks, parametre, Hugging Face, vLLM, DGX Spark og DeepSeek V4 Flash.
Ja — den kørte som `stealth/ox-alpha` i seks dage fra den 20. august 2026. Gemte Ox Alpha-chats bliver automatisk knyttet til den nye model.
Nej — forskellige niveauer med omkring 10x prisforskel. Flash er den multimodale 320B-A18B-model; GLM 5.3 er tekstflagskibet.
Z.ai angiver 0,15 $ pr. 1M input, 0,03 $ cachet og 0,50 $ output. De citerede 0,075 $ / 0,25 $ er en midlertidig lanceringsrabat på 50 %.
Ox Alpha-prøveversionen var gratis; nu afregnes den efter forbrug. Du kan stadig prøve den gratis i chatten på glm5.app.
320B i alt, 18B aktive pr. token og 45 lag, der router 8 ud af 288 eksperter. FP8-checkpointet fylder omkring 328 GB.
Vægtene ligger på Hugging Face under `zai-org/GLM-5.3-Flash` med MIT-licens. Der er intet dedikeret GitHub-repo — opskrifterne findes i `zai-org/GLM-5`.
vLLM, SGLang, TokenSpeed og KTransformers understøttes. 328 GB kan ikke være i én DGX Spark; fællesskabet rapporterer at koble to sammen på 4 bit.
Flash til visuelt input eller ræsonnement; DeepSeek V4 Flash til et fladere 1:2-forhold eller 384K output.
De fleste praktiske erfaringer er skrevet under prøveversionens navn, så søg efter Ox Alpha på Reddit i stedet.
Start here
Kør din sværeste opgave gennem GLM 5.3 Flash gratis i browseren, og sæt derefter model-id'et ind i din pipeline.