Prix catalogue
$0.15
Par 1M en entrée
Prévoyez votre coût GLM 5.3 Flash sur cette base, pas sur le tarif promotionnel.
Le palier efficace de Z.ai dans la famille GLM 5 : un Mixture-of-Experts de 320B avec 18B actifs, entrée texte, image et vidéo, contexte de 1M et poids ouverts MIT.
GLM 5.3 Flash est sorti le 26 août 2026, après six jours sur OpenRouter sous le nom de modèle furtif Ox Alpha.
Seuls 8 des 288 experts s'activent par token : la mémoire d'un modèle 320B, le calcul d'un 18B.
La vision vient du corpus de pré-entraînement de 30T tokens, pas d'un encodeur ajouté après coup.
Artificial Analysis mesure 50,2 tokens de sortie par seconde, sous la médiane de 67 t/s de sa catégorie.
Architecture, poids et licences d'après la fiche modèle Hugging Face et le dépôt zai-org/GLM-5.
Fiche modèle
MoE, 45 couches, 8 experts sur 288.
Le calcul d'un modèle dense de 18B.
Io Net plafonne à 262 144 ; Cloudflare à 1 310 720.
D'autres annoncent jusqu'à 1 179 648.
Entrée multimodale, sortie texte.
Poids et licence
Usage commercial et redistribution, sans seuil.
Une variante -BF16 et un miroir ModelScope.
Pas de dépôt dédié ; GLM-5 est en Apache-2.0.
Un job multi-nœuds, pas une station de travail.
Plus TokenSpeed, KTransformers et les GGUF communautaires.
Fiche modèle et API endpoints d'OpenRouter, août 2026.
Tarifs / 04
Z.ai affiche 0,15 $ en entrée et 0,50 $ en sortie par 1M de tokens. Les 0,075 $ / 0,25 $ cités partout sont une remise de lancement temporaire de 50 %.
Prix catalogue
$0.15
Prévoyez votre coût GLM 5.3 Flash sur cette base, pas sur le tarif promotionnel.
Prix catalogue
$0.50
Un rapport marqué de 1:3,3 — plafonnez d'abord la sortie.
Prix catalogue
$0.03
Un cinquième de l'entrée fraîche : c'est ce qui rend le contexte long abordable.
Indépendant
$0.10
Artificial Analysis, sur un mélange 7:2:1 cache/entrée/sortie.
Benchmarks / 05
Z.ai publie son propre tableau et choisit ses comparaisons. L'écart avec GLM 5.2 et les mesures d'Artificial Analysis résistent à l'examen.
Annoncé par Z.ai
GPT-5.6 Terra atteint 87,4 ; l'écart se creuse sur les tâches difficiles.
Annoncé par Z.ai
Même famille et même méthode, à un dixième du prix. AutomationBench : 48,8 contre 26,2.
Annoncé par Z.ai
Raisonnement documentaire et visuel, annoncé devant Opus 4.8.
Artificial Analysis
57
Indépendant, face à une médiane d'environ 27 pour des modèles à poids ouverts comparables.
Capacités / 06
Conçu pour les harnais d'agents : contrôle du raisonnement, outils, sortie structurée et streaming sur une fenêtre d'un million de tokens.
Activé par défaut, avec un niveau d'effort réglable.
Outils et choix d'outil ; votre application valide toujours chaque action.
Une contrainte de format de réponse renvoie du JSON exploitable.
1,47 s avant le premier token, mieux que la médiane ; le débit, non.
Collez une capture, un schéma ou un enregistrement d'écran avec votre prompt.
Le tarif de 0,03 $ en entrée mise en cache garde les tours suivants bon marché.
Comparatif / 07
Deux paliers économiques de familles de pointe livrées en poids MIT. Ils divergent sur les modalités, le raisonnement et le matériel.
Z.ai
KDA hybride plus attention MLA creuse NoPE.
Multimodal nativement.
Le plafond de sortie varie selon le fournisseur.
Avant la remise de lancement.
MIT, mais un job multi-nœuds.
DeepSeek
Sans raisonnement par défaut.
Les captures doivent d'abord être transcrites.
Un budget de réponse bien plus large.
En direct, avec un rapport plus plat de 1:2.
Tranche plus petite, moins chère à servir.
Les deux figurent dans la liste de modèles de glm5.app : un même prompt passe par chacun.
Chronologie de sortie / 08
Six jours en modèle furtif anonyme, puis un lancement complet en poids ouverts.
`stealth/ox-alpha` arrive sur OpenRouter sans fournisseur déclaré, gratuit au token.
Les cinq plus gros consommateurs sont des outils de coding agentique ; OpenCode le propose gratuitement.
Z.ai confirme la filiation Ox Alpha ; fiche modèle, poids MIT et tarifs arrivent ensemble.
Un moteur maison dérivé de SGLang, annoncé à environ 3x. Fournisseur non divulgué.
`zai-org/GLM-5.3-Flash` plus une variante BF16 et un miroir ModelScope. Aucun dépôt GitHub.
OpenRouter d'abord sur les tarifs, Hugging Face sur les quantifications. Pour les retours terrain, Reddit parle encore d'Ox Alpha.
À qui ça s'adresse / 09
Les équipes qui paient le tarif d'un modèle phare pour un travail qui n'a jamais eu besoin de cette profondeur — et les cas où c'est une erreur.
L'appel d'outils à un dixième du prix par token de GLM 5.3 rend les longues boucles d'agent abordables.
Une fenêtre d'un million de tokens garde la base de code en mémoire : les questions inter-fichiers se passent de recherche.
Mises en page cassées, enregistrements de reproduction, schémas dans des diagrammes.
Comparez-le à DeepSeek V4 Flash et Qwen dans le chat glm5.app.
Les poids MIT et le support vLLM sont bien réels, mais 328 Go en FP8 excluent une seule machine.
À environ 50 tokens de sortie par seconde, il reste derrière la plupart de ses pairs tarifaires.
Trois voies : le chat gratuit dans le navigateur, l'API glm5.app, ou les poids MIT sur votre propre matériel.
Choisissez GLM 5.3 Flash dans le chat et joignez des captures. Les nouveaux comptes reçoivent des crédits gratuits.
Envoyez des requêtes compatibles OpenAI à `https://glm5.app/api/v1` avec l'ID de modèle `glm-5.3-flash`.
Récupérez `zai-org/GLM-5.3-Flash` et servez-le avec SGLang ou vLLM — environ 328 Go en FP8.
Integration specimen
Un endpoint Chat Completions compatible OpenAI. Utilisez l'ID de modèle `glm-5.3-flash` sur `https://glm5.app/api/v1`.
Ouvrir la documentation de l'APIcurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, tarifs, benchmarks, paramètres, Hugging Face, vLLM, DGX Spark et DeepSeek V4 Flash.
Oui — il a tourné sous `stealth/ox-alpha` pendant six jours à partir du 20 août 2026. Les chats Ox Alpha enregistrés sont réaffectés automatiquement.
Non — ce sont deux paliers différents, avec un écart de prix d'environ 10x. Flash est le modèle multimodal 320B-A18B ; GLM 5.3 est le modèle phare en texte.
Z.ai affiche 0,15 $ par 1M en entrée, 0,03 $ en cache et 0,50 $ en sortie. Les 0,075 $ / 0,25 $ cités sont une remise de lancement temporaire de 50 %.
La préversion Ox Alpha était gratuite ; le modèle est désormais facturé à l'usage. Vous pouvez toujours l'essayer gratuitement dans le chat glm5.app.
320B au total, 18B actifs par token, 45 couches routant 8 experts sur 288. Le checkpoint FP8 pèse environ 328 Go.
Les poids sont sur Hugging Face sous `zai-org/GLM-5.3-Flash` en licence MIT. Pas de dépôt GitHub dédié — les recettes vivent dans `zai-org/GLM-5`.
vLLM, SGLang, TokenSpeed et KTransformers sont pris en charge. 328 Go ne tiendront pas sur une seule DGX Spark ; la communauté rapporte d'en associer deux en 4 bits.
Flash pour l'entrée visuelle ou la délibération ; DeepSeek V4 Flash pour un rapport plus plat de 1:2 ou 384K de sortie.
L'essentiel des retours pratiques est publié sous le nom de la préversion : cherchez plutôt Ox Alpha sur Reddit.
Start here
Passez votre tâche la plus difficile dans GLM 5.3 Flash gratuitement dans le navigateur, puis branchez l'ID du modèle dans votre pipeline.