GLM 5.3 Flash

Z.ai:s effektivitetsnivå i GLM 5-familjen: en Mixture-of-Experts på 320B med 18B aktiva, indata som text, bild och video, 1M kontext och öppna MIT-vikter.

Skapa med GLM 5

Vad är GLM 5.3 Flash?

GLM 5.3 Flash lanserades den 26 augusti 2026, efter sex dagar på OpenRouter som stealth-modellen Ox Alpha.

01

320B totalt, 18B aktiva

Bara 8 av 288 experter aktiveras per token: minnesbehov som en 320B-modell, beräkning som en 18B.

02

Multimodal från grunden

Synförmågan kommer från förträningskorpusen på 30T tokens, inte från en encoder som byggts på i efterhand.

03

Flash betyder billig, inte snabb

Artificial Analysis mäter 50,2 utdatatokens per sekund, under klassens median på 67 t/s.

GLM 5.3 Flash: specifikationer, storlek och öppen källkod

Arkitektur, vikter och licenser från modellkortet på Hugging Face och repot zai-org/GLM-5.

Modellkort

Arkitektur

Totala parametrar
320B

MoE, 45 lager, 8 av 288 experter.

Aktiva parametrar
18B

Beräkning som en tät 18B-modell.

Kontextfönster
1 048 576 tokens

Io Net stannar vid 262 144, Cloudflare vid 1 310 720.

Maximal utdata
131 072 tokens

Andra anger upp till 1 179 648.

Modalitet
Text, bild, video

Multimodalt in, text ut.

Vikter och licens

Storlek och licens

Licens för vikterna
MIT

Kommersiell användning och vidaredistribution, utan tröskel.

Hugging Face
zai-org/GLM-5.3-Flash

En -BF16-variant och en spegel på ModelScope.

GitHub
zai-org/GLM-5

Inget eget repo; GLM-5 är Apache-2.0.

Checkpointens storlek
~328 GB (FP8)

Ett jobb över flera noder, inte en arbetsstation.

Serving-stackar
SGLang, vLLM

Plus TokenSpeed, KTransformers och GGUF från communityn.

Modellkort och OpenRouters endpoints-API, augusti 2026.

Priser / 04

GLM 5.3 Flash-priser: listpris mot lanseringsrabatt

Z.ai anger 0,15 $ för indata och 0,50 $ för utdata per 1M tokens. De 0,075 $ / 0,25 $ som citeras överallt är en tillfällig lanseringsrabatt på 50 %.

01

Listpris

$0.15

Per 1M indata

Räkna på din GLM 5.3 Flash-kostnad här, inte på kampanjpriset.

02

Listpris

$0.50

Per 1M utdata

Ett brant förhållande på 1:3,3 — sätt tak på utdata först.

03

Listpris

$0.03

Per 1M cachad indata

En femtedel av färsk indata — det är det som gör lång kontext överkomlig.

04

Oberoende

$0.10

Blandat pris

Artificial Analysis, på en mix om 7:2:1 cache/indata/utdata.

Dubbla spannet för identiska vikter: Z.AI, Novita och GMICloud rabatterar, andra tar listpris.

Benchmarks / 05

GLM 5.3 Flash-benchmarks: leverantörens och oberoende siffror

Z.ai publicerar en egen tabell och väljer jämförelserna själv. Försprånget mot GLM 5.2 och siffrorna från Artificial Analysis håller för granskning.

01

Rapporterat av Z.ai

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra får 87,4; avståndet växer på de svåra uppgifterna.

02

Rapporterat av Z.ai

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

Samma familj och metod, till en tiondel av priset. AutomationBench: 48,8 mot 26,2.

03

Rapporterat av Z.ai

OfficeQA Pro

5.3 Flash62.4

Resonemang kring dokument och bilder, enligt leverantören före Opus 4.8.

04

Artificial Analysis

57

Intelligence Index

Oberoende mätt, mot en median på ~27 för jämförbara modeller med öppna vikter.

Den mest tillförlitliga GLM 5.3 Flash-benchmarken är din egen backlogg.

Funktioner / 06

Vad GLM 5.3 Flash kan

Byggd för agent-harnesses: styrning av resonemang, verktyg, strukturerad utdata och streaming över ett fönster på en miljon tokens.

01

Resonemang med styrd ansträngning

På som standard, med justerbar ansträngningsnivå.

02

Function calling

Verktyg och verktygsval; din app validerar fortfarande varje åtgärd.

03

Strukturerad utdata

En begränsning av svarsformatet ger JSON som går att parsa.

04

Strömmade svar

1,47 s till första token slår medianen; genomströmningen gör det inte.

05

Bild- och videoindata

Klistra in en skärmbild, ett diagram eller en skärminspelning tillsammans med prompten.

06

Kontext på en miljon tokens

Cachepriset på 0,03 $ håller senare turer billiga.

Jämförelse / 07

GLM 5.3 Flash mot DeepSeek V4 Flash

Båda är den billiga nivån i en toppfamilj med MIT-vikter. De skiljer sig åt i modalitet, resonemang och hårdvara.

Z.ai

GLM 5.3 Flash

Arkitektur
320B / 18B aktiva

Hybrid KDA plus NoPE sparse MLA-attention.

Indata
Text, bild, video

Multimodal från grunden.

Kontext / utdata
1M / 131K

Taket för utdata varierar mellan leverantörer.

Listpris
$0.15 / $0.50

Före lanseringsrabatten.

Egen drift
~328 GB FP8

MIT, men ett jobb över flera noder.

DeepSeek

DeepSeek V4 Flash

Arkitektur
284B / ~13B aktiva

Utan resonemang som standard.

Indata
Endast text

Skärmbilder måste transkriberas först.

Kontext / utdata
1M / 384K

Betydligt större svarsbudget.

Listpris
$0.14 / $0.28

Direkt från leverantören, med ett plattare 1:2-förhållande.

Egen drift
MIT-vikter

Mindre modell, billigare att köra.

Båda finns i modellistan på glm5.app, så samma prompt kan köras genom var och en.

Lanseringstidslinje / 08

GLM 5.3 Flash-tidslinjen, från Ox Alpha till öppna vikter

Sex dagar som anonym stealth-modell, sedan en full lansering med öppna vikter.

01

20 aug — Ox Alpha dyker upp

`stealth/ox-alpha` landar på OpenRouter utan angiven leverantör, gratis per token.

02

20-26 aug — agentverktygen strömmar till

De fem största förbrukarna är agentiska kodverktyg; OpenCode erbjuder den gratis.

03

26 aug — GLM 5.3 Flash lanseras

Z.ai bekräftar släktskapet med Ox Alpha; modellkort, MIT-vikter och priser kommer samtidigt.

04

Förhandsversionen kördes på kinesiska chip

En egen motor härledd från SGLang, rapporterad till omkring 3x. Leverantören är inte offentliggjord.

05

Vikterna kom på Hugging Face

`zai-org/GLM-5.3-Flash` plus en BF16-variant och en ModelScope-spegel. Inget GitHub-repo.

06

Var nyheterna dyker upp

OpenRouter först med priser, Hugging Face med kvantiseringar. För praktiska erfarenheter talar Reddit fortfarande om Ox Alpha.

Vem den passar / 09

Vem använder GLM 5.3 Flash?

Team som betalar flaggskeppspris för arbete som aldrig krävde det djupet — och fallen där det blir fel.

01

Agentisk kodning i stor volym

Verktygsanrop till en tiondel av tokenpriset för GLM 5.3 gör långa agentloopar överkomliga.

02

Arbete på repo-nivå

Ett fönster på en miljon tokens håller kodbasen i minnet, så frågor tvärs över filer slipper hämtning.

03

Visuell felsökning

Trasiga layouter, inspelningar som visar felet, scheman i diagram.

04

Team som prissätter Z.ai mot konkurrenterna

Jämför med DeepSeek V4 Flash och Qwen i chatten på glm5.app.

05

Egen drift med ett kluster

MIT-vikterna och vLLM-stödet är verkliga, men 328 GB i FP8 utesluter en enda maskin.

06

Inte för latenskritiska gränssnitt

Med omkring 50 utdatatokens per sekund ligger den efter de flesta i samma prisklass.

Så använder du GLM 5.3 Flash / 10

Så använder du GLM 5.3 Flash

Tre vägar: gratis chatt i webbläsaren, API:et på glm5.app, eller MIT-vikterna på din egen hårdvara.

01
01

Chatta gratis med GLM 5.3 Flash

Välj GLM 5.3 Flash i chatten och bifoga skärmbilder. Nya konton får gratis krediter.

02
02

Anropa API:et på glm5.app

Skicka OpenAI-kompatibla anrop till `https://glm5.app/api/v1` med modell-ID:t `glm-5.3-flash`.

03
03

Eller kör vikterna själv

Hämta `zai-org/GLM-5.3-Flash` och kör den med SGLang eller vLLM — omkring 328 GB i FP8.

Integration specimen

Kom igång med GLM 5.3 Flash-API:et

En OpenAI-kompatibel Chat Completions-endpoint. Använd modell-ID:t `glm-5.3-flash` på `https://glm5.app/api/v1`.

Öppna API-dokumentationen
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

Vanliga frågor om GLM 5.3 Flash

Ox Alpha, priser, benchmarks, parametrar, Hugging Face, vLLM, DGX Spark och DeepSeek V4 Flash.

Är GLM 5.3 Flash samma modell som Ox Alpha?

Ja — den kördes som `stealth/ox-alpha` i sex dagar från den 20 augusti 2026. Sparade Ox Alpha-chattar kopplas om automatiskt.


Är GLM 5.3 Flash samma sak som GLM 5.3?

Nej — olika nivåer, med ungefär 10x prisskillnad. Flash är den multimodala 320B-A18B-modellen; GLM 5.3 är textflaggskeppet.


Vad kostar GLM 5.3 Flash?

Z.ai anger 0,15 $ per 1M indata, 0,03 $ cachat och 0,50 $ utdata. De citerade 0,075 $ / 0,25 $ är en tillfällig lanseringsrabatt på 50 %.


Är GLM 5.3 Flash gratis?

Ox Alpha-förhandsversionen var gratis; nu debiteras den per användning. Du kan fortfarande testa den gratis i chatten på glm5.app.


Hur många parametrar har GLM 5.3 Flash, och hur stor är den?

320B totalt, 18B aktiva per token, 45 lager som dirigerar 8 av 288 experter. FP8-checkpointen är omkring 328 GB.


Finns GLM 5.3 Flash på Hugging Face och GitHub?

Vikterna finns på Hugging Face under `zai-org/GLM-5.3-Flash` med MIT-licens. Det finns inget eget GitHub-repo — recepten ligger i `zai-org/GLM-5`.


Kan jag köra GLM 5.3 Flash på vLLM eller en DGX Spark?

vLLM, SGLang, TokenSpeed och KTransformers stöds. 328 GB får inte plats i en DGX Spark; communityn rapporterar att man kopplar ihop två på 4 bitar.


GLM 5.3 Flash eller DeepSeek V4 Flash — vilken ska jag välja?

Flash för visuell indata eller resonemang; DeepSeek V4 Flash för ett plattare 1:2-förhållande eller 384K utdata.


Vad säger Reddit om GLM 5.3 Flash?

Det mesta av den praktiska rapporteringen ligger under förhandsversionens namn, så sök efter Ox Alpha på Reddit i stället.


Start here

Kom igång med GLM 5.3 Flash i dag

Kör din svåraste uppgift genom GLM 5.3 Flash gratis i webbläsaren och koppla sedan in modell-ID:t i din pipeline.