Lijstprijs
$0.15
Per 1M invoer
Raam je kosten voor GLM 5.3 Flash hierop, niet op het actietarief.
De efficiëntielaag van Z.ai binnen de GLM 5-familie: een Mixture-of-Experts van 320B met 18B actief, invoer van tekst, beeld en video, 1M context en open MIT-gewichten.
GLM 5.3 Flash verscheen op 26 augustus 2026, na zes dagen op OpenRouter als stealthmodel Ox Alpha.
Per token vuren slechts 8 van de 288 experts: het geheugen van een 320B-model, de rekenkracht van een 18B.
Het zicht komt uit het pretrainingscorpus van 30T tokens, niet uit een later aangebouwde encoder.
Artificial Analysis meet 50,2 uitvoertokens per seconde, onder de klassemediaan van 67 t/s.
Architectuur, gewichten en licenties volgens de Hugging Face-modelkaart en de repository zai-org/GLM-5.
Modelkaart
MoE, 45 lagen, 8 van de 288 experts.
De rekenkracht van een dicht 18B-model.
Io Net stopt bij 262.144, Cloudflare bij 1.310.720.
Anderen noemen tot 1.179.648.
Multimodaal erin, tekst eruit.
Gewichten en licentie
Commercieel gebruik en herdistributie, zonder drempel.
Een -BF16-variant en een ModelScope-mirror.
Geen eigen repo; GLM-5 valt onder Apache-2.0.
Een multi-nodetaak, geen werkstation.
Plus TokenSpeed, KTransformers en GGUF uit de community.
Modelkaart en de endpoints-API van OpenRouter, augustus 2026.
Prijzen / 04
Z.ai noemt $0,15 invoer en $0,50 uitvoer per 1M tokens. De overal geciteerde $0,075 / $0,25 is een tijdelijke lanceringskorting van 50%.
Lijstprijs
$0.15
Raam je kosten voor GLM 5.3 Flash hierop, niet op het actietarief.
Lijstprijs
$0.50
Een steile verhouding van 1:3,3 — begrens eerst de uitvoer.
Lijstprijs
$0.03
Een vijfde van verse invoer — dat maakt lange context betaalbaar.
Onafhankelijk
$0.10
Artificial Analysis, op een mix van 7:2:1 cache/invoer/uitvoer.
Benchmarks / 05
Z.ai publiceert een eigen tabel en kiest de vergelijkingen. Het verschil met GLM 5.2 en de cijfers van Artificial Analysis houden stand.
Gemeld door Z.ai
GPT-5.6 Terra scoort 87,4; bij zware taken wordt het gat groter.
Gemeld door Z.ai
Dezelfde familie en methode, voor een tiende van de prijs. AutomationBench: 48,8 tegen 26,2.
Gemeld door Z.ai
Redeneren over documenten en beeld, volgens de leverancier vóór Opus 4.8.
Artificial Analysis
57
Onafhankelijk, tegenover een mediaan van ~27 bij vergelijkbare open-weight modellen.
Mogelijkheden / 06
Gebouwd voor agent-harnassen: sturing van het redeneren, tools, gestructureerde uitvoer en streaming over een venster van een miljoen tokens.
Standaard aan, met een instelbaar effortniveau.
Tools en toolkeuze; je app blijft elke actie valideren.
Een beperking op het antwoordformaat levert parseerbare JSON.
1,47 s tot het eerste token verslaat de mediaan; de doorvoer niet.
Plak een screenshot, diagram of schermopname bij je prompt.
Het cachetarief van $0,03 houdt latere beurten goedkoop.
Vergelijking / 07
Allebei de goedkope laag van een topfamilie met MIT-gewichten. Ze verschillen in modaliteit, redeneren en hardware.
Z.ai
Hybride KDA plus NoPE sparse MLA-attentie.
Van origine multimodaal.
Het uitvoerplafond verschilt per provider.
Vóór de lanceringskorting.
MIT, maar een multi-nodetaak.
DeepSeek
Standaard zonder redeneren.
Screenshots moeten eerst worden uitgeschreven.
Een veel groter antwoordbudget.
Rechtstreeks, met een vlakkere 1:2-verhouding.
Kleinere plak, goedkoper te serveren.
Beide staan in de modellenlijst van glm5.app, dus één prompt gaat door allebei.
Releasetijdlijn / 08
Zes dagen als anoniem stealthmodel, daarna een volledige open-weight lancering.
`stealth/ox-alpha` verschijnt op OpenRouter zonder bekende aanbieder, gratis per token.
De vijf grootste verbruikers zijn agentische codetools; OpenCode biedt het gratis aan.
Z.ai bevestigt de Ox Alpha-afkomst; modelkaart, MIT-gewichten en prijzen komen samen.
Een eigen, van SGLang afgeleide engine, gerapporteerd op ongeveer 3x. Leverancier niet bekendgemaakt.
`zai-org/GLM-5.3-Flash` plus een BF16-variant en een ModelScope-mirror. Geen GitHub-repo.
OpenRouter eerst met prijzen, Hugging Face met kwantisaties. Voor praktijkverhalen spreekt Reddit nog van Ox Alpha.
Voor wie / 09
Teams die vlaggenschiptarieven betalen voor werk dat die diepgang nooit nodig had — en de gevallen waarin het misgaat.
Tools aanroepen voor een tiende van de tokenprijs van GLM 5.3 maakt lange agentlussen betaalbaar.
Een venster van een miljoen tokens houdt de codebase paraat, zodat vragen over meerdere bestanden geen retrieval nodig hebben.
Kapotte layouts, reproductieopnamen, schema's in diagrammen.
Vergelijk het met DeepSeek V4 Flash en Qwen in de chat van glm5.app.
De MIT-gewichten en vLLM-ondersteuning zijn echt, maar 328 GB FP8 sluit één machine uit.
Met zo'n 50 uitvoertokens per seconde blijft het achter bij de meeste modellen in dezelfde prijsklasse.
Drie routes: gratis chatten in de browser, de API van glm5.app, of de MIT-gewichten op je eigen hardware.
Kies GLM 5.3 Flash in de chat en voeg screenshots toe. Nieuwe accounts krijgen gratis credits.
Stuur OpenAI-compatibele requests naar `https://glm5.app/api/v1` met model-ID `glm-5.3-flash`.
Haal `zai-org/GLM-5.3-Flash` op en serveer het met SGLang of vLLM — zo'n 328 GB in FP8.
Integration specimen
Een OpenAI-compatibel Chat Completions-endpoint. Gebruik model-ID `glm-5.3-flash` op `https://glm5.app/api/v1`.
API-documentatie openencurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, prijzen, benchmarks, parameters, Hugging Face, vLLM, DGX Spark en DeepSeek V4 Flash.
Ja — het draaide vanaf 20 augustus 2026 zes dagen als `stealth/ox-alpha`. Opgeslagen Ox Alpha-chats worden automatisch omgezet.
Nee — andere laag, met ongeveer 10x prijsverschil. Flash is het multimodale 320B-A18B-model; GLM 5.3 is het vlaggenschip voor tekst.
Z.ai noemt $0,15 per 1M invoer, $0,03 uit cache en $0,50 uitvoer. De geciteerde $0,075 / $0,25 is een tijdelijke lanceringskorting van 50%.
De Ox Alpha-preview was gratis; nu wordt er per gebruik afgerekend. Je kunt het nog steeds gratis proberen in de chat van glm5.app.
320B in totaal, 18B actief per token, 45 lagen die 8 van de 288 experts aansturen. Het FP8-checkpoint is zo'n 328 GB.
De gewichten staan op Hugging Face onder `zai-org/GLM-5.3-Flash` met MIT-licentie. Er is geen eigen GitHub-repo — de recepten staan in `zai-org/GLM-5`.
vLLM, SGLang, TokenSpeed en KTransformers worden ondersteund. 328 GB past niet op één DGX Spark; de community koppelt er twee op 4 bits.
Flash voor visuele invoer of afweging; DeepSeek V4 Flash voor een vlakkere 1:2-verhouding of 384K uitvoer.
De meeste praktijkverslagen staan onder de previewnaam, dus zoek op Reddit liever naar Ox Alpha.
Start here
Laat je lastigste taak gratis in de browser door GLM 5.3 Flash lopen en zet daarna het model-ID in je pipeline.