GLM 5.3 Flash

De efficiëntielaag van Z.ai binnen de GLM 5-familie: een Mixture-of-Experts van 320B met 18B actief, invoer van tekst, beeld en video, 1M context en open MIT-gewichten.

Maak iets met GLM 5

Wat is GLM 5.3 Flash?

GLM 5.3 Flash verscheen op 26 augustus 2026, na zes dagen op OpenRouter als stealthmodel Ox Alpha.

01

320B totaal, 18B actief

Per token vuren slechts 8 van de 288 experts: het geheugen van een 320B-model, de rekenkracht van een 18B.

02

Van origine multimodaal

Het zicht komt uit het pretrainingscorpus van 30T tokens, niet uit een later aangebouwde encoder.

03

Flash betekent goedkoop, niet snel

Artificial Analysis meet 50,2 uitvoertokens per seconde, onder de klassemediaan van 67 t/s.

GLM 5.3 Flash: specificaties, omvang en opensourcestatus

Architectuur, gewichten en licenties volgens de Hugging Face-modelkaart en de repository zai-org/GLM-5.

Modelkaart

Architectuur

Totale parameters
320B

MoE, 45 lagen, 8 van de 288 experts.

Actieve parameters
18B

De rekenkracht van een dicht 18B-model.

Contextvenster
1.048.576 tokens

Io Net stopt bij 262.144, Cloudflare bij 1.310.720.

Maximale uitvoer
131.072 tokens

Anderen noemen tot 1.179.648.

Modaliteit
Tekst, beeld, video

Multimodaal erin, tekst eruit.

Gewichten en licentie

Omvang en licentie

Licentie van de gewichten
MIT

Commercieel gebruik en herdistributie, zonder drempel.

Hugging Face
zai-org/GLM-5.3-Flash

Een -BF16-variant en een ModelScope-mirror.

GitHub
zai-org/GLM-5

Geen eigen repo; GLM-5 valt onder Apache-2.0.

Grootte van het checkpoint
~328 GB (FP8)

Een multi-nodetaak, geen werkstation.

Serving-stacks
SGLang, vLLM

Plus TokenSpeed, KTransformers en GGUF uit de community.

Modelkaart en de endpoints-API van OpenRouter, augustus 2026.

Prijzen / 04

GLM 5.3 Flash-prijzen: lijstprijs tegenover lanceringskorting

Z.ai noemt $0,15 invoer en $0,50 uitvoer per 1M tokens. De overal geciteerde $0,075 / $0,25 is een tijdelijke lanceringskorting van 50%.

01

Lijstprijs

$0.15

Per 1M invoer

Raam je kosten voor GLM 5.3 Flash hierop, niet op het actietarief.

02

Lijstprijs

$0.50

Per 1M uitvoer

Een steile verhouding van 1:3,3 — begrens eerst de uitvoer.

03

Lijstprijs

$0.03

Per 1M invoer uit cache

Een vijfde van verse invoer — dat maakt lange context betaalbaar.

04

Onafhankelijk

$0.10

Gemengde prijs

Artificial Analysis, op een mix van 7:2:1 cache/invoer/uitvoer.

Een spreiding van 2x bij identieke gewichten: Z.AI, Novita en GMICloud geven korting, anderen rekenen de lijstprijs.

Benchmarks / 05

GLM 5.3 Flash-benchmarks: van de leverancier en onafhankelijk

Z.ai publiceert een eigen tabel en kiest de vergelijkingen. Het verschil met GLM 5.2 en de cijfers van Artificial Analysis houden stand.

01

Gemeld door Z.ai

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra scoort 87,4; bij zware taken wordt het gat groter.

02

Gemeld door Z.ai

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

Dezelfde familie en methode, voor een tiende van de prijs. AutomationBench: 48,8 tegen 26,2.

03

Gemeld door Z.ai

OfficeQA Pro

5.3 Flash62.4

Redeneren over documenten en beeld, volgens de leverancier vóór Opus 4.8.

04

Artificial Analysis

57

Intelligence Index

Onafhankelijk, tegenover een mediaan van ~27 bij vergelijkbare open-weight modellen.

De betrouwbaarste GLM 5.3 Flash-benchmark is je eigen backlog.

Mogelijkheden / 06

Wat GLM 5.3 Flash kan

Gebouwd voor agent-harnassen: sturing van het redeneren, tools, gestructureerde uitvoer en streaming over een venster van een miljoen tokens.

01

Redeneren met effort-instelling

Standaard aan, met een instelbaar effortniveau.

02

Function calling

Tools en toolkeuze; je app blijft elke actie valideren.

03

Gestructureerde uitvoer

Een beperking op het antwoordformaat levert parseerbare JSON.

04

Streamende antwoorden

1,47 s tot het eerste token verslaat de mediaan; de doorvoer niet.

05

Invoer van beeld en video

Plak een screenshot, diagram of schermopname bij je prompt.

06

Context van een miljoen tokens

Het cachetarief van $0,03 houdt latere beurten goedkoop.

Vergelijking / 07

GLM 5.3 Flash tegenover DeepSeek V4 Flash

Allebei de goedkope laag van een topfamilie met MIT-gewichten. Ze verschillen in modaliteit, redeneren en hardware.

Z.ai

GLM 5.3 Flash

Architectuur
320B / 18B actief

Hybride KDA plus NoPE sparse MLA-attentie.

Invoer
Tekst, beeld, video

Van origine multimodaal.

Context / uitvoer
1M / 131K

Het uitvoerplafond verschilt per provider.

Lijstprijs
$0.15 / $0.50

Vóór de lanceringskorting.

Zelf hosten
~328 GB FP8

MIT, maar een multi-nodetaak.

DeepSeek

DeepSeek V4 Flash

Architectuur
284B / ~13B actief

Standaard zonder redeneren.

Invoer
Alleen tekst

Screenshots moeten eerst worden uitgeschreven.

Context / uitvoer
1M / 384K

Een veel groter antwoordbudget.

Lijstprijs
$0.14 / $0.28

Rechtstreeks, met een vlakkere 1:2-verhouding.

Zelf hosten
MIT-gewichten

Kleinere plak, goedkoper te serveren.

Beide staan in de modellenlijst van glm5.app, dus één prompt gaat door allebei.

Releasetijdlijn / 08

GLM 5.3 Flash-tijdlijn, van Ox Alpha tot open gewichten

Zes dagen als anoniem stealthmodel, daarna een volledige open-weight lancering.

01

20 aug — Ox Alpha duikt op

`stealth/ox-alpha` verschijnt op OpenRouter zonder bekende aanbieder, gratis per token.

02

20-26 aug — agenttools stromen toe

De vijf grootste verbruikers zijn agentische codetools; OpenCode biedt het gratis aan.

03

26 aug — GLM 5.3 Flash wordt gelanceerd

Z.ai bevestigt de Ox Alpha-afkomst; modelkaart, MIT-gewichten en prijzen komen samen.

04

De preview draaide op Chinese chips

Een eigen, van SGLang afgeleide engine, gerapporteerd op ongeveer 3x. Leverancier niet bekendgemaakt.

05

De gewichten kwamen op Hugging Face

`zai-org/GLM-5.3-Flash` plus een BF16-variant en een ModelScope-mirror. Geen GitHub-repo.

06

Waar het nieuws landt

OpenRouter eerst met prijzen, Hugging Face met kwantisaties. Voor praktijkverhalen spreekt Reddit nog van Ox Alpha.

Voor wie / 09

Wie gebruikt GLM 5.3 Flash?

Teams die vlaggenschiptarieven betalen voor werk dat die diepgang nooit nodig had — en de gevallen waarin het misgaat.

01

Agentisch coderen op volume

Tools aanroepen voor een tiende van de tokenprijs van GLM 5.3 maakt lange agentlussen betaalbaar.

02

Werk op repositoryschaal

Een venster van een miljoen tokens houdt de codebase paraat, zodat vragen over meerdere bestanden geen retrieval nodig hebben.

03

Visueel debuggen

Kapotte layouts, reproductieopnamen, schema's in diagrammen.

04

Teams die Z.ai naast rivalen leggen

Vergelijk het met DeepSeek V4 Flash en Qwen in de chat van glm5.app.

05

Zelfhosters met een cluster

De MIT-gewichten en vLLM-ondersteuning zijn echt, maar 328 GB FP8 sluit één machine uit.

06

Niet voor latentiekritische interfaces

Met zo'n 50 uitvoertokens per seconde blijft het achter bij de meeste modellen in dezelfde prijsklasse.

GLM 5.3 Flash gebruiken / 10

Hoe je GLM 5.3 Flash gebruikt

Drie routes: gratis chatten in de browser, de API van glm5.app, of de MIT-gewichten op je eigen hardware.

01
01

Gratis chatten met GLM 5.3 Flash

Kies GLM 5.3 Flash in de chat en voeg screenshots toe. Nieuwe accounts krijgen gratis credits.

02
02

Roep de glm5.app-API aan

Stuur OpenAI-compatibele requests naar `https://glm5.app/api/v1` met model-ID `glm-5.3-flash`.

03
03

Of host de gewichten zelf

Haal `zai-org/GLM-5.3-Flash` op en serveer het met SGLang of vLLM — zo'n 328 GB in FP8.

Integration specimen

Begin met de GLM 5.3 Flash-API

Een OpenAI-compatibel Chat Completions-endpoint. Gebruik model-ID `glm-5.3-flash` op `https://glm5.app/api/v1`.

API-documentatie openen
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

Veelgestelde vragen over GLM 5.3 Flash

Ox Alpha, prijzen, benchmarks, parameters, Hugging Face, vLLM, DGX Spark en DeepSeek V4 Flash.

Is GLM 5.3 Flash hetzelfde model als Ox Alpha?

Ja — het draaide vanaf 20 augustus 2026 zes dagen als `stealth/ox-alpha`. Opgeslagen Ox Alpha-chats worden automatisch omgezet.


Is GLM 5.3 Flash hetzelfde als GLM 5.3?

Nee — andere laag, met ongeveer 10x prijsverschil. Flash is het multimodale 320B-A18B-model; GLM 5.3 is het vlaggenschip voor tekst.


Wat kost GLM 5.3 Flash?

Z.ai noemt $0,15 per 1M invoer, $0,03 uit cache en $0,50 uitvoer. De geciteerde $0,075 / $0,25 is een tijdelijke lanceringskorting van 50%.


Is GLM 5.3 Flash gratis?

De Ox Alpha-preview was gratis; nu wordt er per gebruik afgerekend. Je kunt het nog steeds gratis proberen in de chat van glm5.app.


Hoeveel parameters heeft GLM 5.3 Flash en hoe groot is het?

320B in totaal, 18B actief per token, 45 lagen die 8 van de 288 experts aansturen. Het FP8-checkpoint is zo'n 328 GB.


Staat GLM 5.3 Flash op Hugging Face en GitHub?

De gewichten staan op Hugging Face onder `zai-org/GLM-5.3-Flash` met MIT-licentie. Er is geen eigen GitHub-repo — de recepten staan in `zai-org/GLM-5`.


Kan ik GLM 5.3 Flash draaien op vLLM of een DGX Spark?

vLLM, SGLang, TokenSpeed en KTransformers worden ondersteund. 328 GB past niet op één DGX Spark; de community koppelt er twee op 4 bits.


GLM 5.3 Flash of DeepSeek V4 Flash — wat moet ik kiezen?

Flash voor visuele invoer of afweging; DeepSeek V4 Flash voor een vlakkere 1:2-verhouding of 384K uitvoer.


Wat zegt Reddit over GLM 5.3 Flash?

De meeste praktijkverslagen staan onder de previewnaam, dus zoek op Reddit liever naar Ox Alpha.


Start here

Begin vandaag met GLM 5.3 Flash

Laat je lastigste taak gratis in de browser door GLM 5.3 Flash lopen en zet daarna het model-ID in je pipeline.