Listino
$0.15
Per 1M in input
Fai le tue stime di costo di GLM 5.3 Flash qui, non sulla tariffa promozionale.
Il livello efficiente di Z.ai nella famiglia GLM 5: un Mixture-of-Experts da 320B con 18B attivi, input testo, immagini e video, contesto da 1M e pesi aperti MIT.
GLM 5.3 Flash è uscito il 26 agosto 2026, dopo sei giorni su OpenRouter come modello stealth Ox Alpha.
Solo 8 esperti su 288 si attivano per token: memoria di un modello da 320B, calcolo di uno da 18B.
La visione arriva dal corpus di pre-addestramento da 30T token, non da un encoder aggiunto dopo.
Artificial Analysis misura 50,2 token di output al secondo, sotto la mediana di 67 t/s della categoria.
Architettura, pesi e licenze dalla model card su Hugging Face e dal repository zai-org/GLM-5.
Model card
MoE, 45 livelli, 8 esperti su 288.
Il calcolo di un modello denso da 18B.
Io Net si ferma a 262.144; Cloudflare a 1.310.720.
Altri indicano fino a 1.179.648.
Input multimodale, output testuale.
Pesi e licenza
Uso commerciale e redistribuzione, senza soglie.
Una variante -BF16 e un mirror su ModelScope.
Nessun repo dedicato; GLM-5 è Apache-2.0.
Un job multi-nodo, non una workstation.
Più TokenSpeed, KTransformers e GGUF della community.
Model card e API endpoints di OpenRouter, agosto 2026.
Prezzi / 04
Z.ai indica 0,15 $ in input e 0,50 $ in output per 1M di token. I 0,075 $ / 0,25 $ citati ovunque sono uno sconto di lancio temporaneo del 50%.
Listino
$0.15
Fai le tue stime di costo di GLM 5.3 Flash qui, non sulla tariffa promozionale.
Listino
$0.50
Un rapporto marcato di 1:3,3 — limita prima l'output.
Listino
$0.03
Un quinto dell'input nuovo: è ciò che rende sostenibile il contesto lungo.
Indipendente
$0.10
Artificial Analysis, su un mix 7:2:1 tra cache, input e output.
Benchmark / 05
Z.ai pubblica la propria tabella e sceglie i confronti. Il distacco da GLM 5.2 e i dati di Artificial Analysis reggono all'esame.
Dichiarato da Z.ai
GPT-5.6 Terra segna 87,4; il divario cresce sui compiti difficili.
Dichiarato da Z.ai
Stessa famiglia e stesso metodo, a un decimo del prezzo. AutomationBench: 48,8 contro 26,2.
Dichiarato da Z.ai
Ragionamento su documenti e immagini, dichiarato davanti a Opus 4.8.
Artificial Analysis
57
Indipendente, contro una mediana di ~27 per modelli a pesi aperti simili.
Funzionalità / 06
Pensato per gli harness ad agenti: controllo del ragionamento, strumenti, output strutturato e streaming su una finestra da un milione di token.
Attivo di default, con livello di sforzo regolabile.
Strumenti e scelta dello strumento; la tua app continua a validare ogni azione.
Un vincolo sul formato di risposta restituisce JSON analizzabile.
1,47 s al primo token batte la mediana; il throughput no.
Incolla uno screenshot, un diagramma o una registrazione dello schermo insieme al prompt.
La tariffa di 0,03 $ sull'input in cache tiene bassi i turni successivi.
Confronto / 07
Entrambi sono il livello economico di una famiglia di punta con pesi MIT. Si dividono su modalità, ragionamento e hardware.
Z.ai
KDA ibrida più attenzione MLA sparsa NoPE.
Multimodale per costruzione.
Il tetto di output varia in base al provider.
Prima dello sconto di lancio.
MIT, ma un job multi-nodo.
DeepSeek
Senza ragionamento di default.
Gli screenshot vanno prima trascritti.
Budget di risposta molto più ampio.
Diretto dal vendor, con un rapporto più piatto di 1:2.
Fetta più piccola, più economica da servire.
Entrambi sono nell'elenco modelli di glm5.app: uno stesso prompt passa da tutti e due.
Cronologia del rilascio / 08
Sei giorni da modello stealth anonimo, poi un lancio completo a pesi aperti.
`stealth/ox-alpha` arriva su OpenRouter senza provider dichiarato, gratis per token.
I cinque maggiori consumatori sono strumenti di coding agentico; OpenCode lo offre gratis.
Z.ai conferma la discendenza da Ox Alpha; model card, pesi MIT e prezzi arrivano insieme.
Un motore proprietario derivato da SGLang, dichiarato a circa 3x. Fornitore non divulgato.
`zai-org/GLM-5.3-Flash` più una variante BF16 e un mirror su ModelScope. Nessun repo GitHub.
OpenRouter per primo sui prezzi, Hugging Face sulle quantizzazioni. Per i test sul campo, su Reddit si parla ancora di Ox Alpha.
A chi serve / 09
Team che pagano tariffe da modello di punta per lavori che non hanno mai richiesto quella profondità — e i casi in cui è la scelta sbagliata.
Chiamare strumenti a un decimo del prezzo per token di GLM 5.3 rende sostenibili i loop lunghi degli agenti.
Una finestra da un milione di token tiene il codice in memoria: le domande tra file saltano il retrieval.
Layout rotti, registrazioni di riproduzione, schemi nei diagrammi.
Mettilo a confronto con DeepSeek V4 Flash e Qwen nella chat di glm5.app.
I pesi MIT e il supporto vLLM sono reali, ma 328 GB in FP8 escludono una singola macchina.
A circa 50 token di output al secondo resta dietro a quasi tutti i rivali di pari prezzo.
Tre strade: la chat gratuita nel browser, l'API di glm5.app oppure i pesi MIT sul tuo hardware.
Scegli GLM 5.3 Flash nella chat e allega screenshot. I nuovi account ricevono crediti gratuiti.
Invia richieste compatibili con OpenAI a `https://glm5.app/api/v1` con l'ID modello `glm-5.3-flash`.
Scarica `zai-org/GLM-5.3-Flash` e servilo con SGLang o vLLM — circa 328 GB in FP8.
Integration specimen
Un endpoint Chat Completions compatibile con OpenAI. Usa l'ID modello `glm-5.3-flash` su `https://glm5.app/api/v1`.
Apri la documentazione dell'APIcurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, prezzi, benchmark, parametri, Hugging Face, vLLM, DGX Spark e DeepSeek V4 Flash.
Sì — è girato come `stealth/ox-alpha` per sei giorni dal 20 agosto 2026. Le chat Ox Alpha salvate vengono rimappate in automatico.
No — sono livelli diversi, con circa 10x di differenza di prezzo. Flash è il modello multimodale 320B-A18B; GLM 5.3 è l'ammiraglia testuale.
Z.ai indica 0,15 $ per 1M in input, 0,03 $ dalla cache e 0,50 $ in output. I 0,075 $ / 0,25 $ citati sono uno sconto di lancio temporaneo del 50%.
L'anteprima Ox Alpha era gratuita; ora è a consumo. Puoi comunque provarlo gratis nella chat di glm5.app.
320B totali, 18B attivi per token, 45 livelli che instradano 8 esperti su 288. Il checkpoint FP8 pesa circa 328 GB.
I pesi sono su Hugging Face in `zai-org/GLM-5.3-Flash` con licenza MIT. Nessun repo GitHub dedicato: le ricette stanno in `zai-org/GLM-5`.
vLLM, SGLang, TokenSpeed e KTransformers sono supportati. 328 GB non stanno in una sola DGX Spark; la community riporta di unirne due a 4 bit.
Flash per input visivo o ragionamento; DeepSeek V4 Flash per un rapporto più piatto di 1:2 o 384K di output.
Quasi tutte le prove sul campo sono pubblicate con il nome dell'anteprima: cerca Ox Alpha su Reddit.
Start here
Passa il tuo compito più difficile a GLM 5.3 Flash gratis nel browser, poi collega l'ID del modello alla tua pipeline.