GLM 5.3 Flash

Effektivitetsnivået til Z.ai i GLM 5-familien: en Mixture-of-Experts på 320B med 18B aktive, inndata som tekst, bilde og video, 1M kontekst og åpne MIT-vekter.

Skap med GLM 5

Hva er GLM 5.3 Flash?

GLM 5.3 Flash kom 26. august 2026, etter seks dager på OpenRouter som stealth-modellen Ox Alpha.

01

320B totalt, 18B aktive

Bare 8 av 288 eksperter fyrer per token: minnebruk som en 320B-modell, regnekraft som en 18B.

02

Multimodal fra bunnen

Synet kommer fra førtreningskorpuset på 30T tokens, ikke fra en encoder påmontert i etterkant.

03

Flash betyr billig, ikke rask

Artificial Analysis måler 50,2 utdata-tokens per sekund, under klassemedianen på 67 t/s.

GLM 5.3 Flash: spesifikasjoner, størrelse og åpen kildekode

Arkitektur, vekter og lisenser fra modellkortet på Hugging Face og repoet zai-org/GLM-5.

Modellkort

Arkitektur

Totale parametere
320B

MoE, 45 lag, 8 av 288 eksperter.

Aktive parametere
18B

Regnekraft som en tett 18B-modell.

Kontekstvindu
1 048 576 tokens

Io Net stopper på 262 144, Cloudflare på 1 310 720.

Maksimal utdata
131 072 tokens

Andre oppgir opptil 1 179 648.

Modalitet
Tekst, bilde, video

Multimodalt inn, tekst ut.

Vekter og lisens

Størrelse og lisens

Lisens på vektene
MIT

Kommersiell bruk og videredistribusjon, uten terskel.

Hugging Face
zai-org/GLM-5.3-Flash

En -BF16-variant og et speil på ModelScope.

GitHub
zai-org/GLM-5

Ikke noe eget repo; GLM-5 er Apache-2.0.

Størrelse på sjekkpunktet
~328 GB (FP8)

En jobb over flere noder, ikke en arbeidsstasjon.

Serving-stakker
SGLang, vLLM

I tillegg TokenSpeed, KTransformers og GGUF fra fellesskapet.

Modellkort og endpoints-API-et til OpenRouter, august 2026.

Priser / 04

GLM 5.3 Flash-priser: listepris mot lanseringsrabatt

Z.ai oppgir 0,15 $ for inndata og 0,50 $ for utdata per 1M tokens. De 0,075 $ / 0,25 $ som siteres overalt, er en midlertidig lanseringsrabatt på 50 %.

01

Listepris

$0.15

Per 1M inndata

Beregn GLM 5.3 Flash-kostnaden din her, ikke ut fra kampanjeprisen.

02

Listepris

$0.50

Per 1M utdata

Et bratt forhold på 1:3,3 — sett tak på utdataene først.

03

Listepris

$0.03

Per 1M bufret inndata

En femtedel av ferske inndata — det er dette som gjør lang kontekst overkommelig.

04

Uavhengig

$0.10

Blandet pris

Artificial Analysis, med en miks på 7:2:1 buffer/inndata/utdata.

Dobbel spredning for identiske vekter: Z.AI, Novita og GMICloud rabatterer, andre tar listeprisen.

Benchmarks / 05

GLM 5.3 Flash-benchmarks: leverandørens tall og uavhengige tall

Z.ai publiserer sin egen tabell og velger sammenligningene selv. Forspranget til GLM 5.2 og tallene fra Artificial Analysis tåler et nærmere blikk.

01

Rapportert av Z.ai

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra får 87,4; avstanden øker på de vanskelige oppgavene.

02

Rapportert av Z.ai

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

Samme familie og metode, til en tidel av prisen. AutomationBench: 48,8 mot 26,2.

03

Rapportert av Z.ai

OfficeQA Pro

5.3 Flash62.4

Resonnering over dokumenter og bilder, ifølge leverandøren foran Opus 4.8.

04

Artificial Analysis

57

Intelligence Index

Uavhengig målt, mot en median på ~27 for tilsvarende modeller med åpne vekter.

Den mest pålitelige GLM 5.3 Flash-benchmarken er din egen backlog.

Funksjoner / 06

Hva GLM 5.3 Flash kan

Bygget for agent-harnesses: styring av resonnering, verktøy, strukturert utdata og streaming over et vindu på en million tokens.

01

Resonnering med styrt innsats

På som standard, med justerbart innsatsnivå.

02

Function calling

Verktøy og verktøyvalg; appen din validerer fortsatt hver handling.

03

Strukturert utdata

En begrensning på svarformatet gir JSON som kan parses.

04

Strømmede svar

1,47 s til første token slår medianen; gjennomstrømningen gjør det ikke.

05

Bilde- og videoinndata

Lim inn et skjermbilde, et diagram eller et skjermopptak sammen med ledeteksten.

06

Kontekst på en million tokens

Bufferprisen på 0,03 $ holder de senere rundene billige.

Sammenligning / 07

GLM 5.3 Flash mot DeepSeek V4 Flash

Begge er det rimelige nivået i en toppfamilie med MIT-vekter. De skiller lag på modalitet, resonnering og maskinvare.

Z.ai

GLM 5.3 Flash

Arkitektur
320B / 18B aktive

Hybrid KDA pluss NoPE sparse MLA-attention.

Inndata
Tekst, bilde, video

Multimodal fra bunnen.

Kontekst / utdata
1M / 131K

Taket for utdata varierer mellom leverandører.

Listepris
$0.15 / $0.50

Før lanseringsrabatten.

Selvhosting
~328 GB FP8

MIT, men en jobb over flere noder.

DeepSeek

DeepSeek V4 Flash

Arkitektur
284B / ~13B aktive

Uten resonnering som standard.

Inndata
Bare tekst

Skjermbilder må transkriberes først.

Kontekst / utdata
1M / 384K

Langt større svarbudsjett.

Listepris
$0.14 / $0.28

Direkte fra leverandøren, med et flatere 1:2-forhold.

Selvhosting
MIT-vekter

Mindre modell, billigere å kjøre.

Begge finnes i modellisten på glm5.app, så én ledetekst kan kjøres gjennom hver av dem.

Lanseringstidslinje / 08

GLM 5.3 Flash-tidslinjen, fra Ox Alpha til åpne vekter

Seks dager som anonym stealth-modell, deretter en full lansering med åpne vekter.

01

20. aug. — Ox Alpha dukker opp

`stealth/ox-alpha` lander på OpenRouter uten oppgitt leverandør, gratis per token.

02

20.-26. aug. — agentverktøyene strømmer til

De fem største forbrukerne er agentiske kodeverktøy; OpenCode tilbyr den gratis.

03

26. aug. — GLM 5.3 Flash lanseres

Z.ai bekrefter slektskapet med Ox Alpha; modellkort, MIT-vekter og priser kommer samtidig.

04

Forhåndsversjonen kjørte på kinesiske brikker

En egen motor avledet fra SGLang, rapportert til rundt 3x. Leverandøren er ikke oppgitt.

05

Vektene kom på Hugging Face

`zai-org/GLM-5.3-Flash` pluss en BF16-variant og et ModelScope-speil. Ingen GitHub-repo.

06

Hvor nyhetene kommer først

OpenRouter først på priser, Hugging Face på kvantiseringer. For erfaringer fra praksis snakker Reddit fortsatt om Ox Alpha.

Hvem den passer for / 09

Hvem bruker GLM 5.3 Flash?

Team som betaler flaggskippris for arbeid som aldri trengte den dybden — og tilfellene der det er feil valg.

01

Agentisk koding i stort volum

Verktøykall til en tidel av tokenprisen for GLM 5.3 gjør lange agentsløyfer overkommelige.

02

Arbeid på repo-nivå

Et vindu på en million tokens holder kodebasen i minnet, så spørsmål på tvers av filer slipper oppslag.

03

Visuell feilsøking

Ødelagte oppsett, opptak som viser feilen, skjemaer i diagrammer.

04

Team som priser Z.ai mot konkurrentene

Sammenlign med DeepSeek V4 Flash og Qwen i chatten på glm5.app.

05

Selvhostere med en klynge

MIT-vektene og vLLM-støtten er reelle, men 328 GB i FP8 utelukker én maskin.

06

Ikke for latenskritiske grensesnitt

Med rundt 50 utdata-tokens per sekund ligger den bak de fleste i samme prisklasse.

Slik bruker du GLM 5.3 Flash / 10

Slik bruker du GLM 5.3 Flash

Tre veier: gratis chat i nettleseren, API-et på glm5.app, eller MIT-vektene på din egen maskinvare.

01
01

Chat gratis med GLM 5.3 Flash

Velg GLM 5.3 Flash i chatten og legg ved skjermbilder. Nye kontoer får gratis kreditter.

02
02

Kall API-et på glm5.app

Send OpenAI-kompatible forespørsler til `https://glm5.app/api/v1` med modell-ID-en `glm-5.3-flash`.

03
03

Eller host vektene selv

Hent `zai-org/GLM-5.3-Flash` og kjør den med SGLang eller vLLM — rundt 328 GB i FP8.

Integration specimen

Kom i gang med GLM 5.3 Flash-API-et

Et OpenAI-kompatibelt Chat Completions-endepunkt. Bruk modell-ID-en `glm-5.3-flash` på `https://glm5.app/api/v1`.

Åpne API-dokumentasjonen
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

Vanlige spørsmål om GLM 5.3 Flash

Ox Alpha, priser, benchmarks, parametere, Hugging Face, vLLM, DGX Spark og DeepSeek V4 Flash.

Er GLM 5.3 Flash den samme modellen som Ox Alpha?

Ja — den kjørte som `stealth/ox-alpha` i seks dager fra 20. august 2026. Lagrede Ox Alpha-samtaler knyttes automatisk til den nye modellen.


Er GLM 5.3 Flash det samme som GLM 5.3?

Nei — ulike nivåer, med rundt 10x prisforskjell. Flash er den multimodale 320B-A18B-modellen; GLM 5.3 er tekstflaggskipet.


Hva koster GLM 5.3 Flash?

Z.ai oppgir 0,15 $ per 1M inndata, 0,03 $ bufret og 0,50 $ utdata. De siterte 0,075 $ / 0,25 $ er en midlertidig lanseringsrabatt på 50 %.


Er GLM 5.3 Flash gratis?

Ox Alpha-forhåndsversjonen var gratis; nå betaler du per bruk. Du kan fortsatt prøve den gratis i chatten på glm5.app.


Hvor mange parametere har GLM 5.3 Flash, og hvor stor er den?

320B totalt, 18B aktive per token, 45 lag som ruter 8 av 288 eksperter. FP8-sjekkpunktet er rundt 328 GB.


Finnes GLM 5.3 Flash på Hugging Face og GitHub?

Vektene ligger på Hugging Face under `zai-org/GLM-5.3-Flash` med MIT-lisens. Det finnes ikke noe eget GitHub-repo — oppskriftene ligger i `zai-org/GLM-5`.


Kan jeg kjøre GLM 5.3 Flash på vLLM eller en DGX Spark?

vLLM, SGLang, TokenSpeed og KTransformers støttes. 328 GB får ikke plass i én DGX Spark; fellesskapet rapporterer om å koble sammen to på 4 bit.


GLM 5.3 Flash eller DeepSeek V4 Flash — hva bør jeg velge?

Flash for visuelle inndata eller resonnering; DeepSeek V4 Flash for et flatere 1:2-forhold eller 384K utdata.


Hva sier Reddit om GLM 5.3 Flash?

Det meste av praktisk erfaring er skrevet under navnet på forhåndsversjonen, så søk heller etter Ox Alpha på Reddit.


Start here

Kom i gang med GLM 5.3 Flash i dag

Kjør den vanskeligste oppgaven din gjennom GLM 5.3 Flash gratis i nettleseren, og koble deretter modell-ID-en inn i pipelinen din.