GLM 5.3 Flash

Z.ai's effektivitetsniveau i GLM 5-familien: en Mixture-of-Experts på 320B med 18B aktive, input af tekst, billeder og video, 1M kontekst og åbne MIT-vægte.

Skab med GLM 5

Hvad er GLM 5.3 Flash?

GLM 5.3 Flash udkom den 26. august 2026 efter seks dage på OpenRouter som stealth-modellen Ox Alpha.

01

320B i alt, 18B aktive

Kun 8 ud af 288 eksperter aktiveres pr. token: hukommelse som en 320B-model, beregning som en 18B.

02

Multimodal fra bunden

Synet kommer fra prætræningskorpusset på 30T tokens, ikke fra en encoder sat på bagefter.

03

Flash betyder billig, ikke hurtig

Artificial Analysis måler 50,2 output-tokens i sekundet, under klassens median på 67 t/s.

GLM 5.3 Flash: specifikationer, størrelse og open source-status

Arkitektur, vægte og licenser fra modelkortet på Hugging Face og repositoriet zai-org/GLM-5.

Modelkort

Arkitektur

Parametre i alt
320B

MoE, 45 lag, 8 ud af 288 eksperter.

Aktive parametre
18B

Beregning som en tæt 18B-model.

Kontekstvindue
1.048.576 tokens

Io Net topper ved 262.144, Cloudflare ved 1.310.720.

Maksimalt output
131.072 tokens

Andre angiver op til 1.179.648.

Modalitet
Tekst, billede, video

Multimodalt ind, tekst ud.

Vægte og licens

Størrelse og licens

Licens på vægtene
MIT

Kommerciel brug og videredistribution uden tærskel.

Hugging Face
zai-org/GLM-5.3-Flash

En -BF16-variant og et spejl på ModelScope.

GitHub
zai-org/GLM-5

Intet selvstændigt repo; GLM-5 er Apache-2.0.

Checkpoint-størrelse
~328 GB (FP8)

Et job på flere noder, ikke en arbejdsstation.

Serving-stakke
SGLang, vLLM

Plus TokenSpeed, KTransformers og GGUF fra fællesskabet.

Modelkort og OpenRouters endpoints-API, august 2026.

Priser / 04

GLM 5.3 Flash-priser: listepris kontra lanceringsrabat

Z.ai angiver 0,15 $ for input og 0,50 $ for output pr. 1M tokens. De 0,075 $ / 0,25 $, der citeres overalt, er en midlertidig lanceringsrabat på 50 %.

01

Listepris

$0.15

Pr. 1M input

Beregn dine GLM 5.3 Flash-omkostninger her, ikke ud fra kampagneprisen.

02

Listepris

$0.50

Pr. 1M output

Et stejlt forhold på 1:3,3 — sæt loft over outputtet først.

03

Listepris

$0.03

Pr. 1M cachet input

En femtedel af friskt input — det er det, der gør lang kontekst overkommelig.

04

Uafhængig

$0.10

Blandet pris

Artificial Analysis, på en blanding af 7:2:1 cache/input/output.

Faktor 2 i spredning for identiske vægte: Z.AI, Novita og GMICloud giver rabat, andre tager listeprisen.

Benchmarks / 05

GLM 5.3 Flash-benchmarks: leverandørens tal og uafhængige tal

Z.ai udgiver sin egen tabel og vælger sammenligningerne. Forspringet til GLM 5.2 og tallene fra Artificial Analysis holder til et nærmere eftersyn.

01

Rapporteret af Z.ai

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra får 87,4; afstanden vokser på de svære opgaver.

02

Rapporteret af Z.ai

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

Samme familie og metode til en tiendedel af prisen. AutomationBench: 48,8 mod 26,2.

03

Rapporteret af Z.ai

OfficeQA Pro

5.3 Flash62.4

Ræsonnement over dokumenter og billeder, ifølge leverandøren foran Opus 4.8.

04

Artificial Analysis

57

Intelligence Index

Uafhængigt målt mod en median på ~27 for tilsvarende open-weight-modeller.

Den mest pålidelige GLM 5.3 Flash-benchmark er din egen backlog.

Funktioner / 06

Hvad GLM 5.3 Flash kan

Bygget til agent-harnesses: styring af ræsonnement, værktøjer, struktureret output og streaming over et vindue på en million tokens.

01

Ræsonnement med styret indsats

Slået til som standard, med et justerbart indsatsniveau.

02

Function calling

Værktøjer og valg af værktøj; din app validerer stadig hver handling.

03

Struktureret output

En begrænsning på svarformatet giver JSON, der kan parses.

04

Streamede svar

1,47 s til første token slår medianen; gennemløbet gør ikke.

05

Billede- og videoinput

Indsæt et skærmbillede, et diagram eller en skærmoptagelse sammen med din prompt.

06

Kontekst på en million tokens

Cache-prisen på 0,03 $ holder de senere ture billige.

Sammenligning / 07

GLM 5.3 Flash mod DeepSeek V4 Flash

Begge er det billige niveau i en topfamilie med MIT-vægte. De skilles ad på modalitet, ræsonnement og hardware.

Z.ai

GLM 5.3 Flash

Arkitektur
320B / 18B aktive

Hybrid KDA plus NoPE sparse MLA-attention.

Input
Tekst, billede, video

Multimodal fra bunden.

Kontekst / output
1M / 131K

Loftet for output varierer fra udbyder til udbyder.

Listepris
$0.15 / $0.50

Før lanceringsrabatten.

Selv-hosting
~328 GB FP8

MIT, men et job på flere noder.

DeepSeek

DeepSeek V4 Flash

Arkitektur
284B / ~13B aktive

Uden ræsonnement som standard.

Input
Kun tekst

Skærmbilleder skal transskriberes først.

Kontekst / output
1M / 384K

Et langt større svarbudget.

Listepris
$0.14 / $0.28

Direkte fra udbyderen, med et fladere forhold på 1:2.

Selv-hosting
MIT-vægte

Mindre snit, billigere at servere.

Begge findes på modellisten hos glm5.app, så én prompt kan køres gennem hver af dem.

Udgivelsestidslinje / 08

GLM 5.3 Flash-tidslinje, fra Ox Alpha til åbne vægte

Seks dage som anonym stealth-model og derefter en fuld lancering med åbne vægte.

01

20. aug. — Ox Alpha dukker op

`stealth/ox-alpha` lander på OpenRouter uden oplyst udbyder og gratis pr. token.

02

20.-26. aug. — agentværktøjerne strømmer til

De fem største forbrugere er agentiske kodeværktøjer; OpenCode tilbyder den gratis.

03

26. aug. — GLM 5.3 Flash lanceres

Z.ai bekræfter slægtskabet med Ox Alpha; modelkort, MIT-vægte og priser kommer samtidig.

04

Prøveversionen kørte på kinesiske chips

En egen motor afledt af SGLang, rapporteret til omkring 3x. Leverandøren er ikke oplyst.

05

Vægtene kom på Hugging Face

`zai-org/GLM-5.3-Flash` plus en BF16-variant og et ModelScope-spejl. Intet GitHub-repo.

06

Hvor nyhederne lander

OpenRouter først med priser, Hugging Face med kvantiseringer. For erfaringer fra praksis taler Reddit stadig om Ox Alpha.

Hvem den er til / 09

Hvem bruger GLM 5.3 Flash?

Teams, der betaler flagskibspriser for arbejde, som aldrig krævede den dybde — og de tilfælde, hvor det er en dårlig idé.

01

Agentisk kodning i stor skala

Værktøjskald til en tiendedel af GLM 5.3's tokenpris gør lange agent-løkker overkommelige.

02

Arbejde på repository-niveau

Et vindue på en million tokens holder kodebasen i hukommelsen, så spørgsmål på tværs af filer springer opslag over.

03

Visuel fejlfinding

Ødelagte layouts, optagelser af fejl og skemaer i diagrammer.

04

Teams, der prissætter Z.ai mod konkurrenterne

Sammenlign med DeepSeek V4 Flash og Qwen i chatten på glm5.app.

05

Selv-hostere med en klynge

MIT-vægtene og vLLM-understøttelsen er reelle, men 328 GB i FP8 udelukker én maskine.

06

Ikke til latenskritiske brugerflader

Med omkring 50 output-tokens i sekundet ligger den efter de fleste i samme prisklasse.

Sådan bruger du GLM 5.3 Flash / 10

Sådan bruger du GLM 5.3 Flash

Tre veje: gratis chat i browseren, API'et på glm5.app eller MIT-vægtene på din egen hardware.

01
01

Chat gratis med GLM 5.3 Flash

Vælg GLM 5.3 Flash i chatten, og vedhæft skærmbilleder. Nye konti får gratis kreditter.

02
02

Kald API'et på glm5.app

Send OpenAI-kompatible forespørgsler til `https://glm5.app/api/v1` med model-id'et `glm-5.3-flash`.

03
03

Eller host vægtene selv

Hent `zai-org/GLM-5.3-Flash`, og server den med SGLang eller vLLM — omkring 328 GB i FP8.

Integration specimen

Kom i gang med GLM 5.3 Flash-API'et

Et OpenAI-kompatibelt Chat Completions-endpoint. Brug model-id'et `glm-5.3-flash` på `https://glm5.app/api/v1`.

Åbn API-dokumentationen
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

Ofte stillede spørgsmål om GLM 5.3 Flash

Ox Alpha, priser, benchmarks, parametre, Hugging Face, vLLM, DGX Spark og DeepSeek V4 Flash.

Er GLM 5.3 Flash den samme model som Ox Alpha?

Ja — den kørte som `stealth/ox-alpha` i seks dage fra den 20. august 2026. Gemte Ox Alpha-chats bliver automatisk knyttet til den nye model.


Er GLM 5.3 Flash det samme som GLM 5.3?

Nej — forskellige niveauer med omkring 10x prisforskel. Flash er den multimodale 320B-A18B-model; GLM 5.3 er tekstflagskibet.


Hvad koster GLM 5.3 Flash?

Z.ai angiver 0,15 $ pr. 1M input, 0,03 $ cachet og 0,50 $ output. De citerede 0,075 $ / 0,25 $ er en midlertidig lanceringsrabat på 50 %.


Er GLM 5.3 Flash gratis?

Ox Alpha-prøveversionen var gratis; nu afregnes den efter forbrug. Du kan stadig prøve den gratis i chatten på glm5.app.


Hvor mange parametre har GLM 5.3 Flash, og hvor stor er den?

320B i alt, 18B aktive pr. token og 45 lag, der router 8 ud af 288 eksperter. FP8-checkpointet fylder omkring 328 GB.


Findes GLM 5.3 Flash på Hugging Face og GitHub?

Vægtene ligger på Hugging Face under `zai-org/GLM-5.3-Flash` med MIT-licens. Der er intet dedikeret GitHub-repo — opskrifterne findes i `zai-org/GLM-5`.


Kan jeg køre GLM 5.3 Flash på vLLM eller en DGX Spark?

vLLM, SGLang, TokenSpeed og KTransformers understøttes. 328 GB kan ikke være i én DGX Spark; fællesskabet rapporterer at koble to sammen på 4 bit.


GLM 5.3 Flash eller DeepSeek V4 Flash — hvad skal jeg vælge?

Flash til visuelt input eller ræsonnement; DeepSeek V4 Flash til et fladere 1:2-forhold eller 384K output.


Hvad siger Reddit om GLM 5.3 Flash?

De fleste praktiske erfaringer er skrevet under prøveversionens navn, så søg efter Ox Alpha på Reddit i stedet.


Start here

Kom i gang med GLM 5.3 Flash i dag

Kør din sværeste opgave gennem GLM 5.3 Flash gratis i browseren, og sæt derefter model-id'et ind i din pipeline.