GLM 5.3 Flash

Die Effizienzstufe von Z.ai in der GLM-5-Familie: ein Mixture-of-Experts mit 320B Parametern und 18B aktiv, Text-, Bild- und Video-Input, 1M Kontext und offene MIT-Gewichte.

Mit GLM 5 erstellen

Was ist GLM 5.3 Flash?

GLM 5.3 Flash erschien am 26. August 2026 – nach sechs Tagen auf OpenRouter als Stealth-Modell Ox Alpha.

01

320B gesamt, 18B aktiv

Pro Token feuern nur 8 von 288 Experten: Speicherbedarf eines 320B-Modells, Rechenaufwand eines 18B.

02

Nativ multimodal

Das Sehvermögen stammt aus dem 30T-Token-Vortrainingskorpus, nicht aus einem nachgerüsteten Encoder.

03

Flash heißt günstig, nicht schnell

Artificial Analysis misst 50,2 Output-Tokens pro Sekunde – unter dem Klassenmedian von 67 t/s.

GLM 5.3 Flash: Spezifikationen, Größe und Open-Source-Status

Architektur, Gewichte und Lizenzen laut Hugging-Face-Model-Card und dem Repository zai-org/GLM-5.

Model Card

Architektur

Parameter gesamt
320B

MoE, 45 Layer, 8 von 288 Experten.

Aktive Parameter
18B

Rechenaufwand eines dichten 18B-Modells.

Kontextfenster
1.048.576 Tokens

Io Net deckelt bei 262.144, Cloudflare bei 1.310.720.

Maximaler Output
131.072 Tokens

Andere nennen bis zu 1.179.648.

Modalitäten
Text, Bild, Video

Multimodal hinein, Text hinaus.

Gewichte und Lizenz

Größe und Lizenz

Lizenz der Gewichte
MIT

Kommerzielle Nutzung und Weitergabe, ohne Schwelle.

Hugging Face
zai-org/GLM-5.3-Flash

Eine -BF16-Variante und ein ModelScope-Spiegel.

GitHub
zai-org/GLM-5

Kein eigenes Repo; GLM-5 steht unter Apache-2.0.

Checkpoint-Größe
~328 GB (FP8)

Ein Multi-Node-Job, keine Workstation.

Serving-Stacks
SGLang, vLLM

Dazu TokenSpeed, KTransformers und Community-GGUF.

Model Card und OpenRouter-Endpoints-API, August 2026.

Preise / 04

GLM 5.3 Flash Preise: Listenpreis gegen Launch-Rabatt

Z.ai listet 0,15 $ Input und 0,50 $ Output je 1M Tokens. Die überall zitierten 0,075 $ / 0,25 $ sind ein befristeter Launch-Rabatt von 50 %.

01

Listenpreis

$0.15

Je 1M Input

Kalkuliere deine GLM-5.3-Flash-Kosten hiermit, nicht mit dem Aktionspreis.

02

Listenpreis

$0.50

Je 1M Output

Ein steiles Verhältnis von 1:3,3 – deckle zuerst den Output.

03

Listenpreis

$0.03

Je 1M gecachter Input

Ein Fünftel des frischen Inputs – das macht langen Kontext bezahlbar.

04

Unabhängig

$0.10

Mischpreis

Artificial Analysis, bei einem Mix von 7:2:1 aus Cache, Input und Output.

Faktor 2 Spannweite bei identischen Gewichten: Z.AI, Novita und GMICloud rabattieren, andere berechnen Liste.

Benchmarks / 05

GLM 5.3 Flash Benchmarks: Herstellerangaben und unabhängige Werte

Z.ai veröffentlicht eine eigene Tabelle und wählt die Vergleiche aus. Der Abstand zu GLM 5.2 und die Werte von Artificial Analysis halten der Prüfung stand.

01

Von Z.ai gemeldet

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra erreicht 87,4; bei schweren Aufgaben wächst der Abstand.

02

Von Z.ai gemeldet

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

Gleiche Familie, gleiche Methode, ein Zehntel des Preises. AutomationBench: 48,8 gegen 26,2.

03

Von Z.ai gemeldet

OfficeQA Pro

5.3 Flash62.4

Dokument- und Bildverständnis, laut Hersteller vor Opus 4.8.

04

Artificial Analysis

57

Intelligence Index

Unabhängig gemessen, gegen einen Median von rund 27 bei vergleichbaren Open-Weight-Modellen.

Der verlässlichste GLM-5.3-Flash-Benchmark ist dein eigener Backlog.

Fähigkeiten / 06

Was GLM 5.3 Flash kann

Für Agenten-Harnesses gebaut: Reasoning-Steuerung, Tools, strukturierte Ausgabe und Streaming über ein Fenster von einer Million Tokens.

01

Reasoning mit Effort-Steuerung

Standardmäßig aktiv, mit einstellbarem Effort-Level.

02

Function Calling

Tools und Tool-Auswahl; deine App validiert weiterhin jede Aktion.

03

Strukturierte Ausgabe

Eine Response-Format-Vorgabe liefert parsebares JSON.

04

Streaming-Antworten

1,47 s bis zum ersten Token schlagen den Median; der Durchsatz nicht.

05

Bild- und Video-Input

Füge Screenshot, Diagramm oder Bildschirmaufnahme direkt zum Prompt hinzu.

06

Kontext von einer Million Tokens

Der Cache-Input-Preis von 0,03 $ hält spätere Turns günstig.

Vergleich / 07

GLM 5.3 Flash gegen DeepSeek V4 Flash

Beide sind die günstige Stufe einer Spitzenfamilie mit MIT-Gewichten. Sie trennen sich bei Modalität, Reasoning und Hardware.

Z.ai

GLM 5.3 Flash

Architektur
320B / 18B aktiv

Hybrides KDA plus NoPE-Sparse-MLA-Attention.

Input
Text, Bild, Video

Nativ multimodal.

Kontext / Output
1M / 131K

Die Output-Obergrenze hängt vom Anbieter ab.

Listenpreis
$0.15 / $0.50

Vor dem Launch-Rabatt.

Selbst hosten
~328 GB FP8

MIT, aber ein Multi-Node-Job.

DeepSeek

DeepSeek V4 Flash

Architektur
284B / ~13B aktiv

Standardmäßig ohne Reasoning.

Input
Nur Text

Screenshots müssen vorher transkribiert werden.

Kontext / Output
1M / 384K

Deutlich größeres Antwortbudget.

Listenpreis
$0.14 / $0.28

Direkt vom Anbieter, mit flacherem 1:2-Verhältnis.

Selbst hosten
MIT-Gewichte

Kleinerer Zuschnitt, günstiger im Betrieb.

Beide stehen in der Modellliste von glm5.app – ein Prompt läuft durch beide.

Release-Zeitleiste / 08

GLM 5.3 Flash Release-Zeitleiste, von Ox Alpha zu offenen Gewichten

Sechs Tage als anonymes Stealth-Modell, dann ein vollständiger Open-Weight-Launch.

01

20. Aug. – Ox Alpha taucht auf

`stealth/ox-alpha` erscheint auf OpenRouter ohne genannten Anbieter, pro Token kostenlos.

02

20.–26. Aug. – Agenten-Tools strömen herein

Die fünf größten Verbraucher sind agentische Coding-Tools; OpenCode bietet es gratis an.

03

26. Aug. – GLM 5.3 Flash erscheint

Z.ai bestätigt die Ox-Alpha-Herkunft; Model Card, MIT-Gewichte und Preise kommen gemeinsam.

04

Die Preview lief auf chinesischen Chips

Eine eigene, von SGLang abgeleitete Engine, gemeldet mit rund 3x. Hersteller nicht genannt.

05

Die Gewichte kamen auf Hugging Face

`zai-org/GLM-5.3-Flash` plus eine BF16-Variante und ein ModelScope-Spiegel. Kein GitHub-Repo.

06

Wo die Neuigkeiten zuerst stehen

OpenRouter zuerst bei den Preisen, Hugging Face bei den Quantisierungen. Für Praxisberichte heißt es auf Reddit weiter Ox Alpha.

Für wen es ist / 09

Wer nutzt GLM 5.3 Flash?

Teams, die Flaggschiffpreise für Arbeit zahlen, die diese Tiefe nie gebraucht hat – und die Fälle, in denen es die falsche Wahl ist.

01

Agentisches Coding mit hohem Volumen

Tool-Aufrufe zu einem Zehntel des GLM-5.3-Tokenpreises machen lange Agentenschleifen bezahlbar.

02

Arbeit auf Repository-Ebene

Ein Fenster von einer Million Tokens hält die Codebasis präsent, dateiübergreifende Fragen sparen sich das Retrieval.

03

Visuelles Debugging

Kaputte Layouts, Reproduktionsaufnahmen, Schemata in Diagrammen.

04

Teams, die Z.ai gegen die Konkurrenz stellen

Vergleiche es mit DeepSeek V4 Flash und Qwen im glm5.app-Chat.

05

Selbsthoster mit Cluster

MIT-Gewichte und vLLM-Support sind real, aber 328 GB FP8 schließen eine einzelne Maschine aus.

06

Nicht für latenzkritische Oberflächen

Mit rund 50 Output-Tokens pro Sekunde liegt es hinter den meisten Modellen derselben Preisklasse.

GLM 5.3 Flash nutzen / 10

So nutzt du GLM 5.3 Flash

Drei Wege: kostenloser Chat im Browser, die glm5.app-API oder die MIT-Gewichte auf eigener Hardware.

01
01

Gratis mit GLM 5.3 Flash chatten

Wähle GLM 5.3 Flash im Chat und hänge Screenshots an. Neue Konten erhalten Gratis-Credits.

02
02

Die glm5.app-API aufrufen

Schicke OpenAI-kompatible Requests an `https://glm5.app/api/v1` mit der Modell-ID `glm-5.3-flash`.

03
03

Oder die Gewichte selbst hosten

Lade `zai-org/GLM-5.3-Flash` und betreibe es mit SGLang oder vLLM – rund 328 GB in FP8.

Integration specimen

Los geht's mit der GLM-5.3-Flash-API

Ein OpenAI-kompatibler Chat-Completions-Endpoint. Nutze die Modell-ID `glm-5.3-flash` unter `https://glm5.app/api/v1`.

API-Dokumentation öffnen
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

GLM 5.3 Flash FAQ

Ox Alpha, Preise, Benchmarks, Parameter, Hugging Face, vLLM, DGX Spark und DeepSeek V4 Flash.

Ist GLM 5.3 Flash dasselbe Modell wie Ox Alpha?

Ja – es lief ab dem 20. August 2026 sechs Tage lang als `stealth/ox-alpha`. Gespeicherte Ox-Alpha-Chats werden automatisch umgehängt.


Ist GLM 5.3 Flash dasselbe wie GLM 5.3?

Nein – unterschiedliche Stufen mit etwa 10-fachem Preisunterschied. Flash ist das multimodale 320B-A18B-Modell, GLM 5.3 das Text-Flaggschiff.


Was kostet GLM 5.3 Flash?

Z.ai listet 0,15 $ je 1M Input, 0,03 $ gecacht und 0,50 $ Output. Die zitierten 0,075 $ / 0,25 $ sind ein befristeter Launch-Rabatt von 50 %.


Ist GLM 5.3 Flash kostenlos?

Die Ox-Alpha-Preview war gratis, inzwischen wird nach Verbrauch abgerechnet. Im glm5.app-Chat kannst du es weiterhin kostenlos ausprobieren.


Wie viele Parameter hat GLM 5.3 Flash und wie groß ist es?

320B gesamt, 18B aktiv pro Token, 45 Layer, die 8 von 288 Experten ansteuern. Der FP8-Checkpoint umfasst rund 328 GB.


Gibt es GLM 5.3 Flash auf Hugging Face und GitHub?

Die Gewichte liegen auf Hugging Face unter `zai-org/GLM-5.3-Flash` mit MIT-Lizenz. Ein eigenes GitHub-Repo gibt es nicht – die Rezepte stehen in `zai-org/GLM-5`.


Läuft GLM 5.3 Flash auf vLLM oder einem DGX Spark?

vLLM, SGLang, TokenSpeed und KTransformers werden unterstützt. 328 GB passen nicht in einen DGX Spark; die Community koppelt zwei mit 4-Bit-Quantisierung.


GLM 5.3 Flash oder DeepSeek V4 Flash – was soll ich nehmen?

Flash für visuellen Input oder Abwägung; DeepSeek V4 Flash für ein flacheres 1:2-Verhältnis oder 384K Output.


Was sagt Reddit zu GLM 5.3 Flash?

Die meisten Praxisberichte stehen noch unter dem Preview-Namen – suche auf Reddit lieber nach Ox Alpha.


Start here

Starte heute mit GLM 5.3 Flash

Schick deine schwierigste Aufgabe gratis im Browser durch GLM 5.3 Flash und häng die Modell-ID danach in deine Pipeline.