GLM 5.3 Flash

Il livello efficiente di Z.ai nella famiglia GLM 5: un Mixture-of-Experts da 320B con 18B attivi, input testo, immagini e video, contesto da 1M e pesi aperti MIT.

Crea con GLM 5

Che cos'è GLM 5.3 Flash?

GLM 5.3 Flash è uscito il 26 agosto 2026, dopo sei giorni su OpenRouter come modello stealth Ox Alpha.

01

320B totali, 18B attivi

Solo 8 esperti su 288 si attivano per token: memoria di un modello da 320B, calcolo di uno da 18B.

02

Multimodale per costruzione

La visione arriva dal corpus di pre-addestramento da 30T token, non da un encoder aggiunto dopo.

03

Flash vuol dire economico, non veloce

Artificial Analysis misura 50,2 token di output al secondo, sotto la mediana di 67 t/s della categoria.

Specifiche, dimensioni e stato open source di GLM 5.3 Flash

Architettura, pesi e licenze dalla model card su Hugging Face e dal repository zai-org/GLM-5.

Model card

Architettura

Parametri totali
320B

MoE, 45 livelli, 8 esperti su 288.

Parametri attivi
18B

Il calcolo di un modello denso da 18B.

Finestra di contesto
1.048.576 token

Io Net si ferma a 262.144; Cloudflare a 1.310.720.

Output massimo
131.072 token

Altri indicano fino a 1.179.648.

Modalità
Testo, immagini, video

Input multimodale, output testuale.

Pesi e licenza

Dimensioni e licenza

Licenza dei pesi
MIT

Uso commerciale e redistribuzione, senza soglie.

Hugging Face
zai-org/GLM-5.3-Flash

Una variante -BF16 e un mirror su ModelScope.

GitHub
zai-org/GLM-5

Nessun repo dedicato; GLM-5 è Apache-2.0.

Dimensione del checkpoint
~328 GB (FP8)

Un job multi-nodo, non una workstation.

Stack di serving
SGLang, vLLM

Più TokenSpeed, KTransformers e GGUF della community.

Model card e API endpoints di OpenRouter, agosto 2026.

Prezzi / 04

Prezzi di GLM 5.3 Flash: listino contro sconto di lancio

Z.ai indica 0,15 $ in input e 0,50 $ in output per 1M di token. I 0,075 $ / 0,25 $ citati ovunque sono uno sconto di lancio temporaneo del 50%.

01

Listino

$0.15

Per 1M in input

Fai le tue stime di costo di GLM 5.3 Flash qui, non sulla tariffa promozionale.

02

Listino

$0.50

Per 1M in output

Un rapporto marcato di 1:3,3 — limita prima l'output.

03

Listino

$0.03

Per 1M in input dalla cache

Un quinto dell'input nuovo: è ciò che rende sostenibile il contesto lungo.

04

Indipendente

$0.10

Prezzo combinato

Artificial Analysis, su un mix 7:2:1 tra cache, input e output.

Una forbice di 2x per pesi identici: Z.AI, Novita e GMICloud scontano; gli altri applicano il listino.

Benchmark / 05

Benchmark di GLM 5.3 Flash: dichiarati dal vendor e indipendenti

Z.ai pubblica la propria tabella e sceglie i confronti. Il distacco da GLM 5.2 e i dati di Artificial Analysis reggono all'esame.

01

Dichiarato da Z.ai

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra segna 87,4; il divario cresce sui compiti difficili.

02

Dichiarato da Z.ai

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

Stessa famiglia e stesso metodo, a un decimo del prezzo. AutomationBench: 48,8 contro 26,2.

03

Dichiarato da Z.ai

OfficeQA Pro

5.3 Flash62.4

Ragionamento su documenti e immagini, dichiarato davanti a Opus 4.8.

04

Artificial Analysis

57

Intelligence Index

Indipendente, contro una mediana di ~27 per modelli a pesi aperti simili.

Il benchmark più affidabile per GLM 5.3 Flash è il tuo backlog.

Funzionalità / 06

Che cosa sa fare GLM 5.3 Flash

Pensato per gli harness ad agenti: controllo del ragionamento, strumenti, output strutturato e streaming su una finestra da un milione di token.

01

Ragionamento con controllo dello sforzo

Attivo di default, con livello di sforzo regolabile.

02

Function calling

Strumenti e scelta dello strumento; la tua app continua a validare ogni azione.

03

Output strutturato

Un vincolo sul formato di risposta restituisce JSON analizzabile.

04

Risposte in streaming

1,47 s al primo token batte la mediana; il throughput no.

05

Input di immagini e video

Incolla uno screenshot, un diagramma o una registrazione dello schermo insieme al prompt.

06

Contesto da un milione di token

La tariffa di 0,03 $ sull'input in cache tiene bassi i turni successivi.

Confronto / 07

GLM 5.3 Flash contro DeepSeek V4 Flash

Entrambi sono il livello economico di una famiglia di punta con pesi MIT. Si dividono su modalità, ragionamento e hardware.

Z.ai

GLM 5.3 Flash

Architettura
320B / 18B attivi

KDA ibrida più attenzione MLA sparsa NoPE.

Input
Testo, immagini, video

Multimodale per costruzione.

Contesto / output
1M / 131K

Il tetto di output varia in base al provider.

Listino
$0.15 / $0.50

Prima dello sconto di lancio.

Self-hosting
~328 GB FP8

MIT, ma un job multi-nodo.

DeepSeek

DeepSeek V4 Flash

Architettura
284B / ~13B attivi

Senza ragionamento di default.

Input
Solo testo

Gli screenshot vanno prima trascritti.

Contesto / output
1M / 384K

Budget di risposta molto più ampio.

Listino
$0.14 / $0.28

Diretto dal vendor, con un rapporto più piatto di 1:2.

Self-hosting
Pesi MIT

Fetta più piccola, più economica da servire.

Entrambi sono nell'elenco modelli di glm5.app: uno stesso prompt passa da tutti e due.

Cronologia del rilascio / 08

Cronologia di GLM 5.3 Flash, da Ox Alpha ai pesi aperti

Sei giorni da modello stealth anonimo, poi un lancio completo a pesi aperti.

01

20 agosto — compare Ox Alpha

`stealth/ox-alpha` arriva su OpenRouter senza provider dichiarato, gratis per token.

02

20-26 agosto — si accumulano gli strumenti per agenti

I cinque maggiori consumatori sono strumenti di coding agentico; OpenCode lo offre gratis.

03

26 agosto — GLM 5.3 Flash viene lanciato

Z.ai conferma la discendenza da Ox Alpha; model card, pesi MIT e prezzi arrivano insieme.

04

L'anteprima girava su chip cinesi

Un motore proprietario derivato da SGLang, dichiarato a circa 3x. Fornitore non divulgato.

05

I pesi sono usciti su Hugging Face

`zai-org/GLM-5.3-Flash` più una variante BF16 e un mirror su ModelScope. Nessun repo GitHub.

06

Dove esce la notizia

OpenRouter per primo sui prezzi, Hugging Face sulle quantizzazioni. Per i test sul campo, su Reddit si parla ancora di Ox Alpha.

A chi serve / 09

Chi usa GLM 5.3 Flash?

Team che pagano tariffe da modello di punta per lavori che non hanno mai richiesto quella profondità — e i casi in cui è la scelta sbagliata.

01

Coding agentico ad alto volume

Chiamare strumenti a un decimo del prezzo per token di GLM 5.3 rende sostenibili i loop lunghi degli agenti.

02

Lavoro su scala di repository

Una finestra da un milione di token tiene il codice in memoria: le domande tra file saltano il retrieval.

03

Debug visivo

Layout rotti, registrazioni di riproduzione, schemi nei diagrammi.

04

Team che confrontano Z.ai con i rivali

Mettilo a confronto con DeepSeek V4 Flash e Qwen nella chat di glm5.app.

05

Chi fa self-hosting con un cluster

I pesi MIT e il supporto vLLM sono reali, ma 328 GB in FP8 escludono una singola macchina.

06

Non per interfacce sensibili alla latenza

A circa 50 token di output al secondo resta dietro a quasi tutti i rivali di pari prezzo.

Come usare GLM 5.3 Flash / 10

Come usare GLM 5.3 Flash

Tre strade: la chat gratuita nel browser, l'API di glm5.app oppure i pesi MIT sul tuo hardware.

01
01

Chatta gratis con GLM 5.3 Flash

Scegli GLM 5.3 Flash nella chat e allega screenshot. I nuovi account ricevono crediti gratuiti.

02
02

Chiama l'API di glm5.app

Invia richieste compatibili con OpenAI a `https://glm5.app/api/v1` con l'ID modello `glm-5.3-flash`.

03
03

Oppure ospita i pesi da solo

Scarica `zai-org/GLM-5.3-Flash` e servilo con SGLang o vLLM — circa 328 GB in FP8.

Integration specimen

Inizia con l'API di GLM 5.3 Flash

Un endpoint Chat Completions compatibile con OpenAI. Usa l'ID modello `glm-5.3-flash` su `https://glm5.app/api/v1`.

Apri la documentazione dell'API
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

Domande frequenti su GLM 5.3 Flash

Ox Alpha, prezzi, benchmark, parametri, Hugging Face, vLLM, DGX Spark e DeepSeek V4 Flash.

GLM 5.3 Flash è lo stesso modello di Ox Alpha?

Sì — è girato come `stealth/ox-alpha` per sei giorni dal 20 agosto 2026. Le chat Ox Alpha salvate vengono rimappate in automatico.


GLM 5.3 Flash è lo stesso di GLM 5.3?

No — sono livelli diversi, con circa 10x di differenza di prezzo. Flash è il modello multimodale 320B-A18B; GLM 5.3 è l'ammiraglia testuale.


Quanto costa GLM 5.3 Flash?

Z.ai indica 0,15 $ per 1M in input, 0,03 $ dalla cache e 0,50 $ in output. I 0,075 $ / 0,25 $ citati sono uno sconto di lancio temporaneo del 50%.


GLM 5.3 Flash è gratis?

L'anteprima Ox Alpha era gratuita; ora è a consumo. Puoi comunque provarlo gratis nella chat di glm5.app.


Quanti parametri ha GLM 5.3 Flash e quanto occupa?

320B totali, 18B attivi per token, 45 livelli che instradano 8 esperti su 288. Il checkpoint FP8 pesa circa 328 GB.


GLM 5.3 Flash è su Hugging Face e GitHub?

I pesi sono su Hugging Face in `zai-org/GLM-5.3-Flash` con licenza MIT. Nessun repo GitHub dedicato: le ricette stanno in `zai-org/GLM-5`.


Posso eseguire GLM 5.3 Flash su vLLM o su una DGX Spark?

vLLM, SGLang, TokenSpeed e KTransformers sono supportati. 328 GB non stanno in una sola DGX Spark; la community riporta di unirne due a 4 bit.


GLM 5.3 Flash o DeepSeek V4 Flash: quale scegliere?

Flash per input visivo o ragionamento; DeepSeek V4 Flash per un rapporto più piatto di 1:2 o 384K di output.


Che cosa si dice di GLM 5.3 Flash su Reddit?

Quasi tutte le prove sul campo sono pubblicate con il nome dell'anteprima: cerca Ox Alpha su Reddit.


Start here

Inizia oggi con GLM 5.3 Flash

Passa il tuo compito più difficile a GLM 5.3 Flash gratis nel browser, poi collega l'ID del modello alla tua pipeline.