Listepris
$0.15
Per 1M inndata
Beregn GLM 5.3 Flash-kostnaden din her, ikke ut fra kampanjeprisen.
Effektivitetsnivået til Z.ai i GLM 5-familien: en Mixture-of-Experts på 320B med 18B aktive, inndata som tekst, bilde og video, 1M kontekst og åpne MIT-vekter.
GLM 5.3 Flash kom 26. august 2026, etter seks dager på OpenRouter som stealth-modellen Ox Alpha.
Bare 8 av 288 eksperter fyrer per token: minnebruk som en 320B-modell, regnekraft som en 18B.
Synet kommer fra førtreningskorpuset på 30T tokens, ikke fra en encoder påmontert i etterkant.
Artificial Analysis måler 50,2 utdata-tokens per sekund, under klassemedianen på 67 t/s.
Arkitektur, vekter og lisenser fra modellkortet på Hugging Face og repoet zai-org/GLM-5.
Modellkort
MoE, 45 lag, 8 av 288 eksperter.
Regnekraft som en tett 18B-modell.
Io Net stopper på 262 144, Cloudflare på 1 310 720.
Andre oppgir opptil 1 179 648.
Multimodalt inn, tekst ut.
Vekter og lisens
Kommersiell bruk og videredistribusjon, uten terskel.
En -BF16-variant og et speil på ModelScope.
Ikke noe eget repo; GLM-5 er Apache-2.0.
En jobb over flere noder, ikke en arbeidsstasjon.
I tillegg TokenSpeed, KTransformers og GGUF fra fellesskapet.
Modellkort og endpoints-API-et til OpenRouter, august 2026.
Priser / 04
Z.ai oppgir 0,15 $ for inndata og 0,50 $ for utdata per 1M tokens. De 0,075 $ / 0,25 $ som siteres overalt, er en midlertidig lanseringsrabatt på 50 %.
Listepris
$0.15
Beregn GLM 5.3 Flash-kostnaden din her, ikke ut fra kampanjeprisen.
Listepris
$0.50
Et bratt forhold på 1:3,3 — sett tak på utdataene først.
Listepris
$0.03
En femtedel av ferske inndata — det er dette som gjør lang kontekst overkommelig.
Uavhengig
$0.10
Artificial Analysis, med en miks på 7:2:1 buffer/inndata/utdata.
Benchmarks / 05
Z.ai publiserer sin egen tabell og velger sammenligningene selv. Forspranget til GLM 5.2 og tallene fra Artificial Analysis tåler et nærmere blikk.
Rapportert av Z.ai
GPT-5.6 Terra får 87,4; avstanden øker på de vanskelige oppgavene.
Rapportert av Z.ai
Samme familie og metode, til en tidel av prisen. AutomationBench: 48,8 mot 26,2.
Rapportert av Z.ai
Resonnering over dokumenter og bilder, ifølge leverandøren foran Opus 4.8.
Artificial Analysis
57
Uavhengig målt, mot en median på ~27 for tilsvarende modeller med åpne vekter.
Funksjoner / 06
Bygget for agent-harnesses: styring av resonnering, verktøy, strukturert utdata og streaming over et vindu på en million tokens.
På som standard, med justerbart innsatsnivå.
Verktøy og verktøyvalg; appen din validerer fortsatt hver handling.
En begrensning på svarformatet gir JSON som kan parses.
1,47 s til første token slår medianen; gjennomstrømningen gjør det ikke.
Lim inn et skjermbilde, et diagram eller et skjermopptak sammen med ledeteksten.
Bufferprisen på 0,03 $ holder de senere rundene billige.
Sammenligning / 07
Begge er det rimelige nivået i en toppfamilie med MIT-vekter. De skiller lag på modalitet, resonnering og maskinvare.
Z.ai
Hybrid KDA pluss NoPE sparse MLA-attention.
Multimodal fra bunnen.
Taket for utdata varierer mellom leverandører.
Før lanseringsrabatten.
MIT, men en jobb over flere noder.
DeepSeek
Uten resonnering som standard.
Skjermbilder må transkriberes først.
Langt større svarbudsjett.
Direkte fra leverandøren, med et flatere 1:2-forhold.
Mindre modell, billigere å kjøre.
Begge finnes i modellisten på glm5.app, så én ledetekst kan kjøres gjennom hver av dem.
Lanseringstidslinje / 08
Seks dager som anonym stealth-modell, deretter en full lansering med åpne vekter.
`stealth/ox-alpha` lander på OpenRouter uten oppgitt leverandør, gratis per token.
De fem største forbrukerne er agentiske kodeverktøy; OpenCode tilbyr den gratis.
Z.ai bekrefter slektskapet med Ox Alpha; modellkort, MIT-vekter og priser kommer samtidig.
En egen motor avledet fra SGLang, rapportert til rundt 3x. Leverandøren er ikke oppgitt.
`zai-org/GLM-5.3-Flash` pluss en BF16-variant og et ModelScope-speil. Ingen GitHub-repo.
OpenRouter først på priser, Hugging Face på kvantiseringer. For erfaringer fra praksis snakker Reddit fortsatt om Ox Alpha.
Hvem den passer for / 09
Team som betaler flaggskippris for arbeid som aldri trengte den dybden — og tilfellene der det er feil valg.
Verktøykall til en tidel av tokenprisen for GLM 5.3 gjør lange agentsløyfer overkommelige.
Et vindu på en million tokens holder kodebasen i minnet, så spørsmål på tvers av filer slipper oppslag.
Ødelagte oppsett, opptak som viser feilen, skjemaer i diagrammer.
Sammenlign med DeepSeek V4 Flash og Qwen i chatten på glm5.app.
MIT-vektene og vLLM-støtten er reelle, men 328 GB i FP8 utelukker én maskin.
Med rundt 50 utdata-tokens per sekund ligger den bak de fleste i samme prisklasse.
Tre veier: gratis chat i nettleseren, API-et på glm5.app, eller MIT-vektene på din egen maskinvare.
Velg GLM 5.3 Flash i chatten og legg ved skjermbilder. Nye kontoer får gratis kreditter.
Send OpenAI-kompatible forespørsler til `https://glm5.app/api/v1` med modell-ID-en `glm-5.3-flash`.
Hent `zai-org/GLM-5.3-Flash` og kjør den med SGLang eller vLLM — rundt 328 GB i FP8.
Integration specimen
Et OpenAI-kompatibelt Chat Completions-endepunkt. Bruk modell-ID-en `glm-5.3-flash` på `https://glm5.app/api/v1`.
Åpne API-dokumentasjonencurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, priser, benchmarks, parametere, Hugging Face, vLLM, DGX Spark og DeepSeek V4 Flash.
Ja — den kjørte som `stealth/ox-alpha` i seks dager fra 20. august 2026. Lagrede Ox Alpha-samtaler knyttes automatisk til den nye modellen.
Nei — ulike nivåer, med rundt 10x prisforskjell. Flash er den multimodale 320B-A18B-modellen; GLM 5.3 er tekstflaggskipet.
Z.ai oppgir 0,15 $ per 1M inndata, 0,03 $ bufret og 0,50 $ utdata. De siterte 0,075 $ / 0,25 $ er en midlertidig lanseringsrabatt på 50 %.
Ox Alpha-forhåndsversjonen var gratis; nå betaler du per bruk. Du kan fortsatt prøve den gratis i chatten på glm5.app.
320B totalt, 18B aktive per token, 45 lag som ruter 8 av 288 eksperter. FP8-sjekkpunktet er rundt 328 GB.
Vektene ligger på Hugging Face under `zai-org/GLM-5.3-Flash` med MIT-lisens. Det finnes ikke noe eget GitHub-repo — oppskriftene ligger i `zai-org/GLM-5`.
vLLM, SGLang, TokenSpeed og KTransformers støttes. 328 GB får ikke plass i én DGX Spark; fellesskapet rapporterer om å koble sammen to på 4 bit.
Flash for visuelle inndata eller resonnering; DeepSeek V4 Flash for et flatere 1:2-forhold eller 384K utdata.
Det meste av praktisk erfaring er skrevet under navnet på forhåndsversjonen, så søk heller etter Ox Alpha på Reddit.
Start here
Kjør den vanskeligste oppgaven din gjennom GLM 5.3 Flash gratis i nettleseren, og koble deretter modell-ID-en inn i pipelinen din.