Tarifa de lista
$0.15
Por 1M de entrada
Calcula aquí tu coste de GLM 5.3 Flash, no con la tarifa promocional.
El nivel eficiente de Z.ai dentro de la familia GLM 5: un Mixture-of-Experts de 320B con 18B activos, entrada de texto, imagen y vídeo, contexto de 1M y pesos abiertos MIT.
GLM 5.3 Flash se lanzó el 26 de agosto de 2026, tras seis días en OpenRouter como el modelo sigiloso Ox Alpha.
Solo 8 de 288 expertos se activan por token: memoria de un modelo de 320B, cómputo de uno de 18B.
La visión viene del corpus de preentrenamiento de 30T tokens, no de un codificador añadido después.
Artificial Analysis mide 50,2 tokens de salida por segundo, por debajo de la mediana de 67 t/s de su categoría.
Arquitectura, pesos y licencias según la ficha del modelo en Hugging Face y el repositorio zai-org/GLM-5.
Ficha del modelo
MoE, 45 capas, 8 de 288 expertos.
Cómputo de un modelo denso de 18B.
Io Net limita a 262.144; Cloudflare a 1.310.720.
Otros indican hasta 1.179.648.
Entrada multimodal, salida de texto.
Pesos y licencia
Uso comercial y redistribución, sin umbral.
Una variante -BF16 y un espejo en ModelScope.
Sin repositorio propio; GLM-5 es Apache-2.0.
Un trabajo multinodo, no una estación de trabajo.
Más TokenSpeed, KTransformers y GGUF de la comunidad.
Ficha del modelo y API de endpoints de OpenRouter, agosto de 2026.
Precios / 04
Z.ai publica 0,15 $ de entrada y 0,50 $ de salida por 1M de tokens. Los 0,075 $ / 0,25 $ que se citan por todas partes son un descuento temporal de lanzamiento del 50 %.
Tarifa de lista
$0.15
Calcula aquí tu coste de GLM 5.3 Flash, no con la tarifa promocional.
Tarifa de lista
$0.50
Una relación pronunciada de 1:3,3 — limita primero la salida.
Tarifa de lista
$0.03
Una quinta parte de la entrada nueva: eso hace asequible el contexto largo.
Independiente
$0.10
Artificial Analysis, con una mezcla 7:2:1 de caché/entrada/salida.
Benchmarks / 05
Z.ai publica su propia tabla y elige las comparaciones. La diferencia con GLM 5.2 y los datos de Artificial Analysis resisten el escrutinio.
Reportado por Z.ai
GPT-5.6 Terra logra 87,4; la distancia crece en las tareas difíciles.
Reportado por Z.ai
Misma familia y método, a una décima parte del precio. AutomationBench: 48,8 frente a 26,2.
Reportado por Z.ai
Razonamiento documental y visual, por delante de Opus 4.8 según el proveedor.
Artificial Analysis
57
Independiente, frente a una mediana de ~27 en modelos de pesos abiertos similares.
Capacidades / 06
Pensado para arneses de agentes: control del razonamiento, herramientas, salida estructurada y streaming sobre una ventana de un millón de tokens.
Activado por defecto, con un nivel de esfuerzo ajustable.
Herramientas y selección de herramientas; tu app sigue validando cada acción.
Una restricción de formato de respuesta devuelve JSON parseable.
1,47 s hasta el primer token supera la mediana; el rendimiento sostenido no.
Pega una captura, un diagrama o una grabación de pantalla junto a tu prompt.
La tarifa de 0,03 $ por entrada en caché abarata los turnos posteriores.
Comparativa / 07
Ambos son el nivel económico de una familia puntera con pesos MIT. Se separan en modalidad, razonamiento y hardware.
Z.ai
KDA híbrida más atención MLA dispersa NoPE.
Multimodal de origen.
El techo de salida varía según el proveedor.
Antes del descuento de lanzamiento.
MIT, pero un trabajo multinodo.
DeepSeek
Sin razonamiento por defecto.
Las capturas hay que transcribirlas antes.
Un presupuesto de respuesta mucho mayor.
De primera mano, con una relación más plana de 1:2.
Porción menor, más barata de servir.
Ambos están en la lista de modelos de glm5.app, así que un mismo prompt pasa por los dos.
Cronología del lanzamiento / 08
Seis días como modelo sigiloso anónimo y después un lanzamiento completo con pesos abiertos.
`stealth/ox-alpha` llega a OpenRouter sin proveedor declarado y gratis por token.
Los cinco mayores consumidores son herramientas de coding agéntico; OpenCode lo ofrece gratis.
Z.ai confirma el linaje de Ox Alpha; ficha del modelo, pesos MIT y precios llegan a la vez.
Un motor propio derivado de SGLang, con un rendimiento reportado de unas 3x. Proveedor no revelado.
`zai-org/GLM-5.3-Flash` más una variante BF16 y un espejo en ModelScope. Sin repositorio de GitHub.
OpenRouter va primero en precios y Hugging Face en cuantizaciones. Para pruebas de campo, Reddit sigue hablando de Ox Alpha.
Para quién es / 09
Equipos que pagan tarifas de buque insignia por trabajo que nunca necesitó esa profundidad — y los casos en que es mala idea.
Llamar herramientas a una décima parte del precio por token de GLM 5.3 hace asequibles los bucles largos de agente.
Una ventana de un millón de tokens mantiene el código en contexto, así que las preguntas entre archivos se saltan la recuperación.
Layouts rotos, grabaciones de reproducción, esquemas en diagramas.
Compáralo con DeepSeek V4 Flash y Qwen en el chat de glm5.app.
Los pesos MIT y el soporte de vLLM son reales, pero 328 GB en FP8 descartan una sola máquina.
A unos 50 tokens de salida por segundo va por detrás de casi todos sus rivales de precio.
Tres vías: chat gratuito en el navegador, la API de glm5.app o los pesos MIT en tu propio hardware.
Elige GLM 5.3 Flash en el chat y adjunta capturas. Las cuentas nuevas reciben créditos gratis.
Envía peticiones compatibles con OpenAI a `https://glm5.app/api/v1` con el ID de modelo `glm-5.3-flash`.
Descarga `zai-org/GLM-5.3-Flash` y sírvelo con SGLang o vLLM — unos 328 GB en FP8.
Integration specimen
Un endpoint de Chat Completions compatible con OpenAI. Usa el ID de modelo `glm-5.3-flash` en `https://glm5.app/api/v1`.
Abrir la documentación de la APIcurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, precios, benchmarks, parámetros, Hugging Face, vLLM, DGX Spark y DeepSeek V4 Flash.
Sí — funcionó como `stealth/ox-alpha` durante seis días desde el 20 de agosto de 2026. Los chats guardados de Ox Alpha se reasignan automáticamente.
No — son niveles distintos, con una diferencia de precio de unas 10x. Flash es el modelo multimodal 320B-A18B; GLM 5.3 es el buque insignia de texto.
Z.ai publica 0,15 $ por 1M de entrada, 0,03 $ en caché y 0,50 $ de salida. Los 0,075 $ / 0,25 $ que se citan son un descuento temporal de lanzamiento del 50 %.
La preview de Ox Alpha fue gratuita; ahora se cobra por uso. Aun así puedes probarlo gratis en el chat de glm5.app.
320B en total, 18B activos por token, 45 capas que enrutan 8 de 288 expertos. El checkpoint FP8 ocupa unos 328 GB.
Los pesos están en Hugging Face en `zai-org/GLM-5.3-Flash` bajo licencia MIT. No hay repositorio propio en GitHub: las recetas viven en `zai-org/GLM-5`.
vLLM, SGLang, TokenSpeed y KTransformers están soportados. 328 GB no caben en una sola DGX Spark; la comunidad reporta unir dos a 4 bits.
Flash para entrada visual o deliberación; DeepSeek V4 Flash para una relación más plana de 1:2 o 384K de salida.
Casi todas las pruebas prácticas están bajo el nombre de la preview, así que busca Ox Alpha en Reddit.
Start here
Pasa tu tarea más difícil por GLM 5.3 Flash gratis en el navegador y después integra el ID del modelo en tu pipeline.