Listenpreis
$0.15
Je 1M Input
Kalkuliere deine GLM-5.3-Flash-Kosten hiermit, nicht mit dem Aktionspreis.
Die Effizienzstufe von Z.ai in der GLM-5-Familie: ein Mixture-of-Experts mit 320B Parametern und 18B aktiv, Text-, Bild- und Video-Input, 1M Kontext und offene MIT-Gewichte.
GLM 5.3 Flash erschien am 26. August 2026 – nach sechs Tagen auf OpenRouter als Stealth-Modell Ox Alpha.
Pro Token feuern nur 8 von 288 Experten: Speicherbedarf eines 320B-Modells, Rechenaufwand eines 18B.
Das Sehvermögen stammt aus dem 30T-Token-Vortrainingskorpus, nicht aus einem nachgerüsteten Encoder.
Artificial Analysis misst 50,2 Output-Tokens pro Sekunde – unter dem Klassenmedian von 67 t/s.
Architektur, Gewichte und Lizenzen laut Hugging-Face-Model-Card und dem Repository zai-org/GLM-5.
Model Card
MoE, 45 Layer, 8 von 288 Experten.
Rechenaufwand eines dichten 18B-Modells.
Io Net deckelt bei 262.144, Cloudflare bei 1.310.720.
Andere nennen bis zu 1.179.648.
Multimodal hinein, Text hinaus.
Gewichte und Lizenz
Kommerzielle Nutzung und Weitergabe, ohne Schwelle.
Eine -BF16-Variante und ein ModelScope-Spiegel.
Kein eigenes Repo; GLM-5 steht unter Apache-2.0.
Ein Multi-Node-Job, keine Workstation.
Dazu TokenSpeed, KTransformers und Community-GGUF.
Model Card und OpenRouter-Endpoints-API, August 2026.
Preise / 04
Z.ai listet 0,15 $ Input und 0,50 $ Output je 1M Tokens. Die überall zitierten 0,075 $ / 0,25 $ sind ein befristeter Launch-Rabatt von 50 %.
Listenpreis
$0.15
Kalkuliere deine GLM-5.3-Flash-Kosten hiermit, nicht mit dem Aktionspreis.
Listenpreis
$0.50
Ein steiles Verhältnis von 1:3,3 – deckle zuerst den Output.
Listenpreis
$0.03
Ein Fünftel des frischen Inputs – das macht langen Kontext bezahlbar.
Unabhängig
$0.10
Artificial Analysis, bei einem Mix von 7:2:1 aus Cache, Input und Output.
Benchmarks / 05
Z.ai veröffentlicht eine eigene Tabelle und wählt die Vergleiche aus. Der Abstand zu GLM 5.2 und die Werte von Artificial Analysis halten der Prüfung stand.
Von Z.ai gemeldet
GPT-5.6 Terra erreicht 87,4; bei schweren Aufgaben wächst der Abstand.
Von Z.ai gemeldet
Gleiche Familie, gleiche Methode, ein Zehntel des Preises. AutomationBench: 48,8 gegen 26,2.
Von Z.ai gemeldet
Dokument- und Bildverständnis, laut Hersteller vor Opus 4.8.
Artificial Analysis
57
Unabhängig gemessen, gegen einen Median von rund 27 bei vergleichbaren Open-Weight-Modellen.
Fähigkeiten / 06
Für Agenten-Harnesses gebaut: Reasoning-Steuerung, Tools, strukturierte Ausgabe und Streaming über ein Fenster von einer Million Tokens.
Standardmäßig aktiv, mit einstellbarem Effort-Level.
Tools und Tool-Auswahl; deine App validiert weiterhin jede Aktion.
Eine Response-Format-Vorgabe liefert parsebares JSON.
1,47 s bis zum ersten Token schlagen den Median; der Durchsatz nicht.
Füge Screenshot, Diagramm oder Bildschirmaufnahme direkt zum Prompt hinzu.
Der Cache-Input-Preis von 0,03 $ hält spätere Turns günstig.
Vergleich / 07
Beide sind die günstige Stufe einer Spitzenfamilie mit MIT-Gewichten. Sie trennen sich bei Modalität, Reasoning und Hardware.
Z.ai
Hybrides KDA plus NoPE-Sparse-MLA-Attention.
Nativ multimodal.
Die Output-Obergrenze hängt vom Anbieter ab.
Vor dem Launch-Rabatt.
MIT, aber ein Multi-Node-Job.
DeepSeek
Standardmäßig ohne Reasoning.
Screenshots müssen vorher transkribiert werden.
Deutlich größeres Antwortbudget.
Direkt vom Anbieter, mit flacherem 1:2-Verhältnis.
Kleinerer Zuschnitt, günstiger im Betrieb.
Beide stehen in der Modellliste von glm5.app – ein Prompt läuft durch beide.
Release-Zeitleiste / 08
Sechs Tage als anonymes Stealth-Modell, dann ein vollständiger Open-Weight-Launch.
`stealth/ox-alpha` erscheint auf OpenRouter ohne genannten Anbieter, pro Token kostenlos.
Die fünf größten Verbraucher sind agentische Coding-Tools; OpenCode bietet es gratis an.
Z.ai bestätigt die Ox-Alpha-Herkunft; Model Card, MIT-Gewichte und Preise kommen gemeinsam.
Eine eigene, von SGLang abgeleitete Engine, gemeldet mit rund 3x. Hersteller nicht genannt.
`zai-org/GLM-5.3-Flash` plus eine BF16-Variante und ein ModelScope-Spiegel. Kein GitHub-Repo.
OpenRouter zuerst bei den Preisen, Hugging Face bei den Quantisierungen. Für Praxisberichte heißt es auf Reddit weiter Ox Alpha.
Für wen es ist / 09
Teams, die Flaggschiffpreise für Arbeit zahlen, die diese Tiefe nie gebraucht hat – und die Fälle, in denen es die falsche Wahl ist.
Tool-Aufrufe zu einem Zehntel des GLM-5.3-Tokenpreises machen lange Agentenschleifen bezahlbar.
Ein Fenster von einer Million Tokens hält die Codebasis präsent, dateiübergreifende Fragen sparen sich das Retrieval.
Kaputte Layouts, Reproduktionsaufnahmen, Schemata in Diagrammen.
Vergleiche es mit DeepSeek V4 Flash und Qwen im glm5.app-Chat.
MIT-Gewichte und vLLM-Support sind real, aber 328 GB FP8 schließen eine einzelne Maschine aus.
Mit rund 50 Output-Tokens pro Sekunde liegt es hinter den meisten Modellen derselben Preisklasse.
Drei Wege: kostenloser Chat im Browser, die glm5.app-API oder die MIT-Gewichte auf eigener Hardware.
Wähle GLM 5.3 Flash im Chat und hänge Screenshots an. Neue Konten erhalten Gratis-Credits.
Schicke OpenAI-kompatible Requests an `https://glm5.app/api/v1` mit der Modell-ID `glm-5.3-flash`.
Lade `zai-org/GLM-5.3-Flash` und betreibe es mit SGLang oder vLLM – rund 328 GB in FP8.
Integration specimen
Ein OpenAI-kompatibler Chat-Completions-Endpoint. Nutze die Modell-ID `glm-5.3-flash` unter `https://glm5.app/api/v1`.
API-Dokumentation öffnencurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, Preise, Benchmarks, Parameter, Hugging Face, vLLM, DGX Spark und DeepSeek V4 Flash.
Ja – es lief ab dem 20. August 2026 sechs Tage lang als `stealth/ox-alpha`. Gespeicherte Ox-Alpha-Chats werden automatisch umgehängt.
Nein – unterschiedliche Stufen mit etwa 10-fachem Preisunterschied. Flash ist das multimodale 320B-A18B-Modell, GLM 5.3 das Text-Flaggschiff.
Z.ai listet 0,15 $ je 1M Input, 0,03 $ gecacht und 0,50 $ Output. Die zitierten 0,075 $ / 0,25 $ sind ein befristeter Launch-Rabatt von 50 %.
Die Ox-Alpha-Preview war gratis, inzwischen wird nach Verbrauch abgerechnet. Im glm5.app-Chat kannst du es weiterhin kostenlos ausprobieren.
320B gesamt, 18B aktiv pro Token, 45 Layer, die 8 von 288 Experten ansteuern. Der FP8-Checkpoint umfasst rund 328 GB.
Die Gewichte liegen auf Hugging Face unter `zai-org/GLM-5.3-Flash` mit MIT-Lizenz. Ein eigenes GitHub-Repo gibt es nicht – die Rezepte stehen in `zai-org/GLM-5`.
vLLM, SGLang, TokenSpeed und KTransformers werden unterstützt. 328 GB passen nicht in einen DGX Spark; die Community koppelt zwei mit 4-Bit-Quantisierung.
Flash für visuellen Input oder Abwägung; DeepSeek V4 Flash für ein flacheres 1:2-Verhältnis oder 384K Output.
Die meisten Praxisberichte stehen noch unter dem Preview-Namen – suche auf Reddit lieber nach Ox Alpha.
Start here
Schick deine schwierigste Aufgabe gratis im Browser durch GLM 5.3 Flash und häng die Modell-ID danach in deine Pipeline.