GLM 5.3 Flash

El nivel eficiente de Z.ai dentro de la familia GLM 5: un Mixture-of-Experts de 320B con 18B activos, entrada de texto, imagen y vídeo, contexto de 1M y pesos abiertos MIT.

Crea con GLM 5

¿Qué es GLM 5.3 Flash?

GLM 5.3 Flash se lanzó el 26 de agosto de 2026, tras seis días en OpenRouter como el modelo sigiloso Ox Alpha.

01

320B totales, 18B activos

Solo 8 de 288 expertos se activan por token: memoria de un modelo de 320B, cómputo de uno de 18B.

02

Multimodal de origen

La visión viene del corpus de preentrenamiento de 30T tokens, no de un codificador añadido después.

03

Flash significa barato, no rápido

Artificial Analysis mide 50,2 tokens de salida por segundo, por debajo de la mediana de 67 t/s de su categoría.

Especificaciones, tamaño y estado open source de GLM 5.3 Flash

Arquitectura, pesos y licencias según la ficha del modelo en Hugging Face y el repositorio zai-org/GLM-5.

Ficha del modelo

Arquitectura

Parámetros totales
320B

MoE, 45 capas, 8 de 288 expertos.

Parámetros activos
18B

Cómputo de un modelo denso de 18B.

Ventana de contexto
1.048.576 tokens

Io Net limita a 262.144; Cloudflare a 1.310.720.

Salida máxima
131.072 tokens

Otros indican hasta 1.179.648.

Modalidad
Texto, imagen, vídeo

Entrada multimodal, salida de texto.

Pesos y licencia

Tamaño y licencia

Licencia de los pesos
MIT

Uso comercial y redistribución, sin umbral.

Hugging Face
zai-org/GLM-5.3-Flash

Una variante -BF16 y un espejo en ModelScope.

GitHub
zai-org/GLM-5

Sin repositorio propio; GLM-5 es Apache-2.0.

Tamaño del checkpoint
~328 GB (FP8)

Un trabajo multinodo, no una estación de trabajo.

Stacks de servicio
SGLang, vLLM

Más TokenSpeed, KTransformers y GGUF de la comunidad.

Ficha del modelo y API de endpoints de OpenRouter, agosto de 2026.

Precios / 04

Precios de GLM 5.3 Flash: tarifa de lista frente al descuento de lanzamiento

Z.ai publica 0,15 $ de entrada y 0,50 $ de salida por 1M de tokens. Los 0,075 $ / 0,25 $ que se citan por todas partes son un descuento temporal de lanzamiento del 50 %.

01

Tarifa de lista

$0.15

Por 1M de entrada

Calcula aquí tu coste de GLM 5.3 Flash, no con la tarifa promocional.

02

Tarifa de lista

$0.50

Por 1M de salida

Una relación pronunciada de 1:3,3 — limita primero la salida.

03

Tarifa de lista

$0.03

Por 1M de entrada en caché

Una quinta parte de la entrada nueva: eso hace asequible el contexto largo.

04

Independiente

$0.10

Precio combinado

Artificial Analysis, con una mezcla 7:2:1 de caché/entrada/salida.

Una horquilla de 2x para pesos idénticos: Z.AI, Novita y GMICloud descuentan; el resto cobra la tarifa de lista.

Benchmarks / 05

Benchmarks de GLM 5.3 Flash: del proveedor e independientes

Z.ai publica su propia tabla y elige las comparaciones. La diferencia con GLM 5.2 y los datos de Artificial Analysis resisten el escrutinio.

01

Reportado por Z.ai

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra logra 87,4; la distancia crece en las tareas difíciles.

02

Reportado por Z.ai

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

Misma familia y método, a una décima parte del precio. AutomationBench: 48,8 frente a 26,2.

03

Reportado por Z.ai

OfficeQA Pro

5.3 Flash62.4

Razonamiento documental y visual, por delante de Opus 4.8 según el proveedor.

04

Artificial Analysis

57

Intelligence Index

Independiente, frente a una mediana de ~27 en modelos de pesos abiertos similares.

El benchmark más fiable de GLM 5.3 Flash es tu propio backlog.

Capacidades / 06

Qué puede hacer GLM 5.3 Flash

Pensado para arneses de agentes: control del razonamiento, herramientas, salida estructurada y streaming sobre una ventana de un millón de tokens.

01

Razonamiento con control de esfuerzo

Activado por defecto, con un nivel de esfuerzo ajustable.

02

Llamada a funciones

Herramientas y selección de herramientas; tu app sigue validando cada acción.

03

Salida estructurada

Una restricción de formato de respuesta devuelve JSON parseable.

04

Respuestas en streaming

1,47 s hasta el primer token supera la mediana; el rendimiento sostenido no.

05

Entrada de imagen y vídeo

Pega una captura, un diagrama o una grabación de pantalla junto a tu prompt.

06

Contexto de un millón de tokens

La tarifa de 0,03 $ por entrada en caché abarata los turnos posteriores.

Comparativa / 07

GLM 5.3 Flash frente a DeepSeek V4 Flash

Ambos son el nivel económico de una familia puntera con pesos MIT. Se separan en modalidad, razonamiento y hardware.

Z.ai

GLM 5.3 Flash

Arquitectura
320B / 18B activos

KDA híbrida más atención MLA dispersa NoPE.

Entrada
Texto, imagen, vídeo

Multimodal de origen.

Contexto / salida
1M / 131K

El techo de salida varía según el proveedor.

Tarifa de lista
$0.15 / $0.50

Antes del descuento de lanzamiento.

Autoalojamiento
~328 GB FP8

MIT, pero un trabajo multinodo.

DeepSeek

DeepSeek V4 Flash

Arquitectura
284B / ~13B activos

Sin razonamiento por defecto.

Entrada
Solo texto

Las capturas hay que transcribirlas antes.

Contexto / salida
1M / 384K

Un presupuesto de respuesta mucho mayor.

Tarifa de lista
$0.14 / $0.28

De primera mano, con una relación más plana de 1:2.

Autoalojamiento
Pesos MIT

Porción menor, más barata de servir.

Ambos están en la lista de modelos de glm5.app, así que un mismo prompt pasa por los dos.

Cronología del lanzamiento / 08

Cronología de GLM 5.3 Flash, de Ox Alpha a los pesos abiertos

Seis días como modelo sigiloso anónimo y después un lanzamiento completo con pesos abiertos.

01

20 de agosto — aparece Ox Alpha

`stealth/ox-alpha` llega a OpenRouter sin proveedor declarado y gratis por token.

02

20-26 de agosto — se acumulan las herramientas de agentes

Los cinco mayores consumidores son herramientas de coding agéntico; OpenCode lo ofrece gratis.

03

26 de agosto — se lanza GLM 5.3 Flash

Z.ai confirma el linaje de Ox Alpha; ficha del modelo, pesos MIT y precios llegan a la vez.

04

La preview corrió sobre chips chinos

Un motor propio derivado de SGLang, con un rendimiento reportado de unas 3x. Proveedor no revelado.

05

Los pesos salieron en Hugging Face

`zai-org/GLM-5.3-Flash` más una variante BF16 y un espejo en ModelScope. Sin repositorio de GitHub.

06

Dónde salta la noticia

OpenRouter va primero en precios y Hugging Face en cuantizaciones. Para pruebas de campo, Reddit sigue hablando de Ox Alpha.

Para quién es / 09

¿Quién usa GLM 5.3 Flash?

Equipos que pagan tarifas de buque insignia por trabajo que nunca necesitó esa profundidad — y los casos en que es mala idea.

01

Coding agéntico de alto volumen

Llamar herramientas a una décima parte del precio por token de GLM 5.3 hace asequibles los bucles largos de agente.

02

Trabajo a escala de repositorio

Una ventana de un millón de tokens mantiene el código en contexto, así que las preguntas entre archivos se saltan la recuperación.

03

Depuración visual

Layouts rotos, grabaciones de reproducción, esquemas en diagramas.

04

Equipos que comparan Z.ai con sus rivales

Compáralo con DeepSeek V4 Flash y Qwen en el chat de glm5.app.

05

Autoalojadores con un clúster

Los pesos MIT y el soporte de vLLM son reales, pero 328 GB en FP8 descartan una sola máquina.

06

No para interfaces sensibles a la latencia

A unos 50 tokens de salida por segundo va por detrás de casi todos sus rivales de precio.

Cómo usar GLM 5.3 Flash / 10

Cómo usar GLM 5.3 Flash

Tres vías: chat gratuito en el navegador, la API de glm5.app o los pesos MIT en tu propio hardware.

01
01

Chatea gratis con GLM 5.3 Flash

Elige GLM 5.3 Flash en el chat y adjunta capturas. Las cuentas nuevas reciben créditos gratis.

02
02

Llama a la API de glm5.app

Envía peticiones compatibles con OpenAI a `https://glm5.app/api/v1` con el ID de modelo `glm-5.3-flash`.

03
03

O aloja tú mismo los pesos

Descarga `zai-org/GLM-5.3-Flash` y sírvelo con SGLang o vLLM — unos 328 GB en FP8.

Integration specimen

Empieza con la API de GLM 5.3 Flash

Un endpoint de Chat Completions compatible con OpenAI. Usa el ID de modelo `glm-5.3-flash` en `https://glm5.app/api/v1`.

Abrir la documentación de la API
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

Preguntas frecuentes sobre GLM 5.3 Flash

Ox Alpha, precios, benchmarks, parámetros, Hugging Face, vLLM, DGX Spark y DeepSeek V4 Flash.

¿GLM 5.3 Flash es el mismo modelo que Ox Alpha?

Sí — funcionó como `stealth/ox-alpha` durante seis días desde el 20 de agosto de 2026. Los chats guardados de Ox Alpha se reasignan automáticamente.


¿GLM 5.3 Flash es lo mismo que GLM 5.3?

No — son niveles distintos, con una diferencia de precio de unas 10x. Flash es el modelo multimodal 320B-A18B; GLM 5.3 es el buque insignia de texto.


¿Cuánto cuesta GLM 5.3 Flash?

Z.ai publica 0,15 $ por 1M de entrada, 0,03 $ en caché y 0,50 $ de salida. Los 0,075 $ / 0,25 $ que se citan son un descuento temporal de lanzamiento del 50 %.


¿GLM 5.3 Flash es gratis?

La preview de Ox Alpha fue gratuita; ahora se cobra por uso. Aun así puedes probarlo gratis en el chat de glm5.app.


¿Cuántos parámetros tiene GLM 5.3 Flash y cuánto ocupa?

320B en total, 18B activos por token, 45 capas que enrutan 8 de 288 expertos. El checkpoint FP8 ocupa unos 328 GB.


¿Está GLM 5.3 Flash en Hugging Face y GitHub?

Los pesos están en Hugging Face en `zai-org/GLM-5.3-Flash` bajo licencia MIT. No hay repositorio propio en GitHub: las recetas viven en `zai-org/GLM-5`.


¿Puedo ejecutar GLM 5.3 Flash en vLLM o en una DGX Spark?

vLLM, SGLang, TokenSpeed y KTransformers están soportados. 328 GB no caben en una sola DGX Spark; la comunidad reporta unir dos a 4 bits.


GLM 5.3 Flash frente a DeepSeek V4 Flash: ¿cuál elegir?

Flash para entrada visual o deliberación; DeepSeek V4 Flash para una relación más plana de 1:2 o 384K de salida.


¿Qué se dice de GLM 5.3 Flash en Reddit?

Casi todas las pruebas prácticas están bajo el nombre de la preview, así que busca Ox Alpha en Reddit.


Start here

Empieza hoy con GLM 5.3 Flash

Pasa tu tarea más difícil por GLM 5.3 Flash gratis en el navegador y después integra el ID del modelo en tu pipeline.