Listpris
$0.15
Per 1M indata
Räkna på din GLM 5.3 Flash-kostnad här, inte på kampanjpriset.
Z.ai:s effektivitetsnivå i GLM 5-familjen: en Mixture-of-Experts på 320B med 18B aktiva, indata som text, bild och video, 1M kontext och öppna MIT-vikter.
GLM 5.3 Flash lanserades den 26 augusti 2026, efter sex dagar på OpenRouter som stealth-modellen Ox Alpha.
Bara 8 av 288 experter aktiveras per token: minnesbehov som en 320B-modell, beräkning som en 18B.
Synförmågan kommer från förträningskorpusen på 30T tokens, inte från en encoder som byggts på i efterhand.
Artificial Analysis mäter 50,2 utdatatokens per sekund, under klassens median på 67 t/s.
Arkitektur, vikter och licenser från modellkortet på Hugging Face och repot zai-org/GLM-5.
Modellkort
MoE, 45 lager, 8 av 288 experter.
Beräkning som en tät 18B-modell.
Io Net stannar vid 262 144, Cloudflare vid 1 310 720.
Andra anger upp till 1 179 648.
Multimodalt in, text ut.
Vikter och licens
Kommersiell användning och vidaredistribution, utan tröskel.
En -BF16-variant och en spegel på ModelScope.
Inget eget repo; GLM-5 är Apache-2.0.
Ett jobb över flera noder, inte en arbetsstation.
Plus TokenSpeed, KTransformers och GGUF från communityn.
Modellkort och OpenRouters endpoints-API, augusti 2026.
Priser / 04
Z.ai anger 0,15 $ för indata och 0,50 $ för utdata per 1M tokens. De 0,075 $ / 0,25 $ som citeras överallt är en tillfällig lanseringsrabatt på 50 %.
Listpris
$0.15
Räkna på din GLM 5.3 Flash-kostnad här, inte på kampanjpriset.
Listpris
$0.50
Ett brant förhållande på 1:3,3 — sätt tak på utdata först.
Listpris
$0.03
En femtedel av färsk indata — det är det som gör lång kontext överkomlig.
Oberoende
$0.10
Artificial Analysis, på en mix om 7:2:1 cache/indata/utdata.
Benchmarks / 05
Z.ai publicerar en egen tabell och väljer jämförelserna själv. Försprånget mot GLM 5.2 och siffrorna från Artificial Analysis håller för granskning.
Rapporterat av Z.ai
GPT-5.6 Terra får 87,4; avståndet växer på de svåra uppgifterna.
Rapporterat av Z.ai
Samma familj och metod, till en tiondel av priset. AutomationBench: 48,8 mot 26,2.
Rapporterat av Z.ai
Resonemang kring dokument och bilder, enligt leverantören före Opus 4.8.
Artificial Analysis
57
Oberoende mätt, mot en median på ~27 för jämförbara modeller med öppna vikter.
Funktioner / 06
Byggd för agent-harnesses: styrning av resonemang, verktyg, strukturerad utdata och streaming över ett fönster på en miljon tokens.
På som standard, med justerbar ansträngningsnivå.
Verktyg och verktygsval; din app validerar fortfarande varje åtgärd.
En begränsning av svarsformatet ger JSON som går att parsa.
1,47 s till första token slår medianen; genomströmningen gör det inte.
Klistra in en skärmbild, ett diagram eller en skärminspelning tillsammans med prompten.
Cachepriset på 0,03 $ håller senare turer billiga.
Jämförelse / 07
Båda är den billiga nivån i en toppfamilj med MIT-vikter. De skiljer sig åt i modalitet, resonemang och hårdvara.
Z.ai
Hybrid KDA plus NoPE sparse MLA-attention.
Multimodal från grunden.
Taket för utdata varierar mellan leverantörer.
Före lanseringsrabatten.
MIT, men ett jobb över flera noder.
DeepSeek
Utan resonemang som standard.
Skärmbilder måste transkriberas först.
Betydligt större svarsbudget.
Direkt från leverantören, med ett plattare 1:2-förhållande.
Mindre modell, billigare att köra.
Båda finns i modellistan på glm5.app, så samma prompt kan köras genom var och en.
Lanseringstidslinje / 08
Sex dagar som anonym stealth-modell, sedan en full lansering med öppna vikter.
`stealth/ox-alpha` landar på OpenRouter utan angiven leverantör, gratis per token.
De fem största förbrukarna är agentiska kodverktyg; OpenCode erbjuder den gratis.
Z.ai bekräftar släktskapet med Ox Alpha; modellkort, MIT-vikter och priser kommer samtidigt.
En egen motor härledd från SGLang, rapporterad till omkring 3x. Leverantören är inte offentliggjord.
`zai-org/GLM-5.3-Flash` plus en BF16-variant och en ModelScope-spegel. Inget GitHub-repo.
OpenRouter först med priser, Hugging Face med kvantiseringar. För praktiska erfarenheter talar Reddit fortfarande om Ox Alpha.
Vem den passar / 09
Team som betalar flaggskeppspris för arbete som aldrig krävde det djupet — och fallen där det blir fel.
Verktygsanrop till en tiondel av tokenpriset för GLM 5.3 gör långa agentloopar överkomliga.
Ett fönster på en miljon tokens håller kodbasen i minnet, så frågor tvärs över filer slipper hämtning.
Trasiga layouter, inspelningar som visar felet, scheman i diagram.
Jämför med DeepSeek V4 Flash och Qwen i chatten på glm5.app.
MIT-vikterna och vLLM-stödet är verkliga, men 328 GB i FP8 utesluter en enda maskin.
Med omkring 50 utdatatokens per sekund ligger den efter de flesta i samma prisklass.
Tre vägar: gratis chatt i webbläsaren, API:et på glm5.app, eller MIT-vikterna på din egen hårdvara.
Välj GLM 5.3 Flash i chatten och bifoga skärmbilder. Nya konton får gratis krediter.
Skicka OpenAI-kompatibla anrop till `https://glm5.app/api/v1` med modell-ID:t `glm-5.3-flash`.
Hämta `zai-org/GLM-5.3-Flash` och kör den med SGLang eller vLLM — omkring 328 GB i FP8.
Integration specimen
En OpenAI-kompatibel Chat Completions-endpoint. Använd modell-ID:t `glm-5.3-flash` på `https://glm5.app/api/v1`.
Öppna API-dokumentationencurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, priser, benchmarks, parametrar, Hugging Face, vLLM, DGX Spark och DeepSeek V4 Flash.
Ja — den kördes som `stealth/ox-alpha` i sex dagar från den 20 augusti 2026. Sparade Ox Alpha-chattar kopplas om automatiskt.
Nej — olika nivåer, med ungefär 10x prisskillnad. Flash är den multimodala 320B-A18B-modellen; GLM 5.3 är textflaggskeppet.
Z.ai anger 0,15 $ per 1M indata, 0,03 $ cachat och 0,50 $ utdata. De citerade 0,075 $ / 0,25 $ är en tillfällig lanseringsrabatt på 50 %.
Ox Alpha-förhandsversionen var gratis; nu debiteras den per användning. Du kan fortfarande testa den gratis i chatten på glm5.app.
320B totalt, 18B aktiva per token, 45 lager som dirigerar 8 av 288 experter. FP8-checkpointen är omkring 328 GB.
Vikterna finns på Hugging Face under `zai-org/GLM-5.3-Flash` med MIT-licens. Det finns inget eget GitHub-repo — recepten ligger i `zai-org/GLM-5`.
vLLM, SGLang, TokenSpeed och KTransformers stöds. 328 GB får inte plats i en DGX Spark; communityn rapporterar att man kopplar ihop två på 4 bitar.
Flash för visuell indata eller resonemang; DeepSeek V4 Flash för ett plattare 1:2-förhållande eller 384K utdata.
Det mesta av den praktiska rapporteringen ligger under förhandsversionens namn, så sök efter Ox Alpha på Reddit i stället.
Start here
Kör din svåraste uppgift genom GLM 5.3 Flash gratis i webbläsaren och koppla sedan in modell-ID:t i din pipeline.