GLM 5.3 Flash

Le palier efficace de Z.ai dans la famille GLM 5 : un Mixture-of-Experts de 320B avec 18B actifs, entrée texte, image et vidéo, contexte de 1M et poids ouverts MIT.

Créer avec GLM 5

Qu'est-ce que GLM 5.3 Flash ?

GLM 5.3 Flash est sorti le 26 août 2026, après six jours sur OpenRouter sous le nom de modèle furtif Ox Alpha.

01

320B au total, 18B actifs

Seuls 8 des 288 experts s'activent par token : la mémoire d'un modèle 320B, le calcul d'un 18B.

02

Multimodal nativement

La vision vient du corpus de pré-entraînement de 30T tokens, pas d'un encodeur ajouté après coup.

03

Flash veut dire bon marché, pas rapide

Artificial Analysis mesure 50,2 tokens de sortie par seconde, sous la médiane de 67 t/s de sa catégorie.

Spécifications, taille et statut open source de GLM 5.3 Flash

Architecture, poids et licences d'après la fiche modèle Hugging Face et le dépôt zai-org/GLM-5.

Fiche modèle

Architecture

Paramètres totaux
320B

MoE, 45 couches, 8 experts sur 288.

Paramètres actifs
18B

Le calcul d'un modèle dense de 18B.

Fenêtre de contexte
1 048 576 tokens

Io Net plafonne à 262 144 ; Cloudflare à 1 310 720.

Sortie maximale
131 072 tokens

D'autres annoncent jusqu'à 1 179 648.

Modalités
Texte, image, vidéo

Entrée multimodale, sortie texte.

Poids et licence

Taille et licence

Licence des poids
MIT

Usage commercial et redistribution, sans seuil.

Hugging Face
zai-org/GLM-5.3-Flash

Une variante -BF16 et un miroir ModelScope.

GitHub
zai-org/GLM-5

Pas de dépôt dédié ; GLM-5 est en Apache-2.0.

Taille du checkpoint
~328 Go (FP8)

Un job multi-nœuds, pas une station de travail.

Piles de service
SGLang, vLLM

Plus TokenSpeed, KTransformers et les GGUF communautaires.

Fiche modèle et API endpoints d'OpenRouter, août 2026.

Tarifs / 04

Tarifs de GLM 5.3 Flash : prix catalogue contre remise de lancement

Z.ai affiche 0,15 $ en entrée et 0,50 $ en sortie par 1M de tokens. Les 0,075 $ / 0,25 $ cités partout sont une remise de lancement temporaire de 50 %.

01

Prix catalogue

$0.15

Par 1M en entrée

Prévoyez votre coût GLM 5.3 Flash sur cette base, pas sur le tarif promotionnel.

02

Prix catalogue

$0.50

Par 1M en sortie

Un rapport marqué de 1:3,3 — plafonnez d'abord la sortie.

03

Prix catalogue

$0.03

Par 1M en entrée mise en cache

Un cinquième de l'entrée fraîche : c'est ce qui rend le contexte long abordable.

04

Indépendant

$0.10

Prix mixte

Artificial Analysis, sur un mélange 7:2:1 cache/entrée/sortie.

Un écart de 2x pour des poids identiques : Z.AI, Novita et GMICloud remisent ; les autres facturent le prix catalogue.

Benchmarks / 05

Benchmarks de GLM 5.3 Flash : annoncés par l'éditeur et indépendants

Z.ai publie son propre tableau et choisit ses comparaisons. L'écart avec GLM 5.2 et les mesures d'Artificial Analysis résistent à l'examen.

01

Annoncé par Z.ai

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra atteint 87,4 ; l'écart se creuse sur les tâches difficiles.

02

Annoncé par Z.ai

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

Même famille et même méthode, à un dixième du prix. AutomationBench : 48,8 contre 26,2.

03

Annoncé par Z.ai

OfficeQA Pro

5.3 Flash62.4

Raisonnement documentaire et visuel, annoncé devant Opus 4.8.

04

Artificial Analysis

57

Intelligence Index

Indépendant, face à une médiane d'environ 27 pour des modèles à poids ouverts comparables.

Le benchmark le plus fiable pour GLM 5.3 Flash reste votre propre backlog.

Capacités / 06

Ce que GLM 5.3 Flash sait faire

Conçu pour les harnais d'agents : contrôle du raisonnement, outils, sortie structurée et streaming sur une fenêtre d'un million de tokens.

01

Raisonnement avec contrôle de l'effort

Activé par défaut, avec un niveau d'effort réglable.

02

Appel de fonctions

Outils et choix d'outil ; votre application valide toujours chaque action.

03

Sortie structurée

Une contrainte de format de réponse renvoie du JSON exploitable.

04

Réponses en streaming

1,47 s avant le premier token, mieux que la médiane ; le débit, non.

05

Entrée image et vidéo

Collez une capture, un schéma ou un enregistrement d'écran avec votre prompt.

06

Contexte d'un million de tokens

Le tarif de 0,03 $ en entrée mise en cache garde les tours suivants bon marché.

Comparatif / 07

GLM 5.3 Flash face à DeepSeek V4 Flash

Deux paliers économiques de familles de pointe livrées en poids MIT. Ils divergent sur les modalités, le raisonnement et le matériel.

Z.ai

GLM 5.3 Flash

Architecture
320B / 18B actifs

KDA hybride plus attention MLA creuse NoPE.

Entrée
Texte, image, vidéo

Multimodal nativement.

Contexte / sortie
1M / 131K

Le plafond de sortie varie selon le fournisseur.

Prix catalogue
$0.15 / $0.50

Avant la remise de lancement.

Auto-hébergement
~328 Go FP8

MIT, mais un job multi-nœuds.

DeepSeek

DeepSeek V4 Flash

Architecture
284B / ~13B actifs

Sans raisonnement par défaut.

Entrée
Texte uniquement

Les captures doivent d'abord être transcrites.

Contexte / sortie
1M / 384K

Un budget de réponse bien plus large.

Prix catalogue
$0.14 / $0.28

En direct, avec un rapport plus plat de 1:2.

Auto-hébergement
Poids MIT

Tranche plus petite, moins chère à servir.

Les deux figurent dans la liste de modèles de glm5.app : un même prompt passe par chacun.

Chronologie de sortie / 08

Chronologie de GLM 5.3 Flash, d'Ox Alpha aux poids ouverts

Six jours en modèle furtif anonyme, puis un lancement complet en poids ouverts.

01

20 août — Ox Alpha apparaît

`stealth/ox-alpha` arrive sur OpenRouter sans fournisseur déclaré, gratuit au token.

02

20-26 août — les outils d'agents affluent

Les cinq plus gros consommateurs sont des outils de coding agentique ; OpenCode le propose gratuitement.

03

26 août — GLM 5.3 Flash est lancé

Z.ai confirme la filiation Ox Alpha ; fiche modèle, poids MIT et tarifs arrivent ensemble.

04

La préversion tournait sur des puces chinoises

Un moteur maison dérivé de SGLang, annoncé à environ 3x. Fournisseur non divulgué.

05

Les poids sont sortis sur Hugging Face

`zai-org/GLM-5.3-Flash` plus une variante BF16 et un miroir ModelScope. Aucun dépôt GitHub.

06

Où tombe l'information

OpenRouter d'abord sur les tarifs, Hugging Face sur les quantifications. Pour les retours terrain, Reddit parle encore d'Ox Alpha.

À qui ça s'adresse / 09

Qui utilise GLM 5.3 Flash ?

Les équipes qui paient le tarif d'un modèle phare pour un travail qui n'a jamais eu besoin de cette profondeur — et les cas où c'est une erreur.

01

Coding agentique à gros volume

L'appel d'outils à un dixième du prix par token de GLM 5.3 rend les longues boucles d'agent abordables.

02

Travail à l'échelle du dépôt

Une fenêtre d'un million de tokens garde la base de code en mémoire : les questions inter-fichiers se passent de recherche.

03

Débogage visuel

Mises en page cassées, enregistrements de reproduction, schémas dans des diagrammes.

04

Équipes qui comparent Z.ai à ses rivaux

Comparez-le à DeepSeek V4 Flash et Qwen dans le chat glm5.app.

05

Auto-hébergeurs disposant d'un cluster

Les poids MIT et le support vLLM sont bien réels, mais 328 Go en FP8 excluent une seule machine.

06

Pas pour les interfaces sensibles à la latence

À environ 50 tokens de sortie par seconde, il reste derrière la plupart de ses pairs tarifaires.

Comment utiliser GLM 5.3 Flash / 10

Comment utiliser GLM 5.3 Flash

Trois voies : le chat gratuit dans le navigateur, l'API glm5.app, ou les poids MIT sur votre propre matériel.

01
01

Discutez gratuitement avec GLM 5.3 Flash

Choisissez GLM 5.3 Flash dans le chat et joignez des captures. Les nouveaux comptes reçoivent des crédits gratuits.

02
02

Appelez l'API glm5.app

Envoyez des requêtes compatibles OpenAI à `https://glm5.app/api/v1` avec l'ID de modèle `glm-5.3-flash`.

03
03

Ou hébergez les poids vous-même

Récupérez `zai-org/GLM-5.3-Flash` et servez-le avec SGLang ou vLLM — environ 328 Go en FP8.

Integration specimen

Démarrez avec l'API GLM 5.3 Flash

Un endpoint Chat Completions compatible OpenAI. Utilisez l'ID de modèle `glm-5.3-flash` sur `https://glm5.app/api/v1`.

Ouvrir la documentation de l'API
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

FAQ GLM 5.3 Flash

Ox Alpha, tarifs, benchmarks, paramètres, Hugging Face, vLLM, DGX Spark et DeepSeek V4 Flash.

GLM 5.3 Flash est-il le même modèle qu'Ox Alpha ?

Oui — il a tourné sous `stealth/ox-alpha` pendant six jours à partir du 20 août 2026. Les chats Ox Alpha enregistrés sont réaffectés automatiquement.


GLM 5.3 Flash est-il identique à GLM 5.3 ?

Non — ce sont deux paliers différents, avec un écart de prix d'environ 10x. Flash est le modèle multimodal 320B-A18B ; GLM 5.3 est le modèle phare en texte.


Quel est le tarif de GLM 5.3 Flash ?

Z.ai affiche 0,15 $ par 1M en entrée, 0,03 $ en cache et 0,50 $ en sortie. Les 0,075 $ / 0,25 $ cités sont une remise de lancement temporaire de 50 %.


GLM 5.3 Flash est-il gratuit ?

La préversion Ox Alpha était gratuite ; le modèle est désormais facturé à l'usage. Vous pouvez toujours l'essayer gratuitement dans le chat glm5.app.


Combien de paramètres compte GLM 5.3 Flash, et quelle est sa taille ?

320B au total, 18B actifs par token, 45 couches routant 8 experts sur 288. Le checkpoint FP8 pèse environ 328 Go.


GLM 5.3 Flash est-il sur Hugging Face et GitHub ?

Les poids sont sur Hugging Face sous `zai-org/GLM-5.3-Flash` en licence MIT. Pas de dépôt GitHub dédié — les recettes vivent dans `zai-org/GLM-5`.


Puis-je faire tourner GLM 5.3 Flash sur vLLM ou une DGX Spark ?

vLLM, SGLang, TokenSpeed et KTransformers sont pris en charge. 328 Go ne tiendront pas sur une seule DGX Spark ; la communauté rapporte d'en associer deux en 4 bits.


GLM 5.3 Flash ou DeepSeek V4 Flash : lequel choisir ?

Flash pour l'entrée visuelle ou la délibération ; DeepSeek V4 Flash pour un rapport plus plat de 1:2 ou 384K de sortie.


Que dit Reddit à propos de GLM 5.3 Flash ?

L'essentiel des retours pratiques est publié sous le nom de la préversion : cherchez plutôt Ox Alpha sur Reddit.


Start here

Lancez-vous avec GLM 5.3 Flash dès aujourd'hui

Passez votre tâche la plus difficile dans GLM 5.3 Flash gratuitement dans le navigateur, puis branchez l'ID du modèle dans votre pipeline.