Benchmarks de Ox Alpha: qué dicen los datos reales
Aug 22, 2026

Benchmarks de Ox Alpha: qué dicen los datos reales

Benchmarks de Ox Alpha: no existen puntuaciones oficiales. Los resultados de DeepSWE y Kingbench no están verificados — aprende a leerlos y prueba el modelo.

Respuesta rápida: Ox Alpha no tiene puntuaciones oficiales de benchmark. La página del modelo stealth/ox-alpha en OpenRouter no incluye benchmarks de inteligencia, programación ni agentic, y el rastreador independiente Artificial Analysis no lista el modelo (comprobado el 22 de agosto de 2026). Las cifras que circulan —alrededor del 80 % en un subconjunto de 10 tareas de DeepSWE y un 87,5 % en «Kingbench»— proceden de la comunidad, se basan en muestras diminutas y no están verificadas de forma independiente. Si estás evaluando Ox Alpha, este artículo explica qué significan realmente esas cifras y en qué señales conviene fijarse en su lugar.

Si has estado buscando benchmarks de Ox Alpha, probablemente chocaste con el mismo muro: aparece un modelo nuevo el 20 de agosto de 2026, la gente habla de él en X y en el anuncio de OpenCode, pero en cuanto buscas números duros, las páginas oficiales callan y las publicaciones de la comunidad se contradicen en la metodología. En un modelo stealth —cuyo proveedor permanece anónimo durante la preview— ese silencio se malinterpreta fácilmente como debilidad, o se tapa con capturas de leaderboards. Esta guía se basa en el listado del modelo en OpenRouter, los datos públicos de la API y los anuncios públicos, actualizada al 22 de agosto de 2026. No hemos ejecutado benchmarks formales por nuestra cuenta; el objetivo es un marco para leer las afirmaciones que verás en otros sitios, además de los datos oficiales que sí existen.

El marcador oficial está vacío — a propósito

Ox Alpha se publicó en OpenRouter el 20 de agosto de 2026. El listado oficial es detallado donde importa para la integración: una ventana de contexto de 1.048.576 tokens (1M), hasta 131.072 tokens de salida, entrada de texto/imagen/vídeo con salida de texto, un precio de preview de 0 $ por millón de tokens en ambos sentidos, razonamiento obligatorio con esfuerzo máximo por defecto, y soporte para herramientas, tool choice y salida estructurada. El posicionamiento es explícito: «un modelo de razonamiento diseñado para programación, trabajo agentic sostenido y cargas de producción», adecuado para «ingeniería de software de largo recorrido, razonamiento complejo y flujos que combinan texto con contexto visual».

Lo que el listado no incluye son puntuaciones de benchmark. No hay índice de inteligencia, ni cifra de leaderboard de programación, ni puntuación agentic en la sección de rendimiento. Artificial Analysis —el rastreador independiente que la mayoría consulta primero— no sigue este modelo (comprobado el 22 de agosto de 2026). Y los datos que normalmente se necesitan para contextualizar una puntuación —identidad del proveedor, arquitectura, número de parámetros y precio tras la preview— no se revelan durante esta preview.

Conviene decirlo con claridad: la ausencia de puntuaciones oficiales es un hecho sobre el listado, no una prueba sobre la capacidad del modelo. Los modelos stealth suelen omitir benchmarks, en parte para no quedar encasillados antes de un lanzamiento completo. La pregunta correcta no es «¿por qué no hay puntuaciones?», sino «¿en qué señal puedo confiar en su lugar?» — que es lo que responde el resto de este artículo.

Qué está reportando la comunidad

Circulan dos cifras:

1. Alrededor del 80 % en un subconjunto de 10 tareas de DeepSWE. Una prueba de la comunidad sitúa a Ox Alpha en torno al 80 % en un subconjunto de 10 tareas de DeepSWE (reportado por la comunidad, no verificado de forma independiente). La misma comparación de muestra pequeña coloca a Fable en el 65 % y a GPT-5.6 Sol en el 52 %. Fíjate en la metodología: es un subconjunto del benchmark —diez tareas, no la suite completa—, así que la distancia entre el 80 % y el 65 % es literalmente un puñado de tareas en cualquier dirección.

2. 87,5 % en Kingbench. Un artículo de la comunidad sitúa a Ox Alpha en el 87,5 % en Kingbench, en segundo lugar tras GLM-5.3 con un 91,25 % (reportado por la comunidad, no verificado de forma independiente). Kingbench no es un benchmark estándar: no tiene metodología publicada ni auditable, y ningún laboratorio independiente lo ejecuta. Trata la cifra como orientativa, como mucho.

También circula la especulación —basada en comparaciones de fingerprint, tokenizador y codificador de vídeo— de que Ox Alpha podría ser una variante multimodal oculta de un modelo de la serie GLM (sin confirmar, pura especulación). No respaldamos esa suposición y no debería influir en tu decisión, pero explica por qué algunos hilos tratan al modelo como «se espera que sea bueno programando» en lugar de «está demostrado que es bueno programando».

Cómo leer los benchmarks de la comunidad: un marco práctico

La mayoría de los artículos se limitan a repetir las cifras. Esto es lo que suelen omitir: cuatro preguntas antes de que una puntuación de la comunidad se gane tu confianza.

Pregunta 1: ¿De qué tamaño es la muestra? Un resultado de 10 tareas se mueve unos 10 puntos por tarea. Una sola ejecución afortunada o desafortunada cambia todo el titular. Regla práctica: trata cualquier puntuación basada en menos de 50 tareas como una señal, no una conclusión. Te dice que vale la pena probar un modelo; no te dice en qué puesto está.

Pregunta 2: ¿Qué mide realmente el benchmark? DeepSWE es un benchmark de ingeniería de software de largo recorrido: el modelo tiene que trabajar sobre un repositorio real durante muchos turnos para resolver una incidencia. Eso se parece al trabajo agentic en producción. La metodología de Kingbench no está clara (no es estándar), así que ni siquiera puedes decir qué mide. Una puntuación de preguntas y respuestas de un solo turno no te diría casi nada sobre un modelo de programación agentic, y viceversa. Haz coincidir la carga de trabajo del benchmark con la tuya antes de dar peso a la cifra.

Pregunta 3: ¿Quién la ejecutó y se verificó de forma independiente? Las pruebas de la comunidad no son revisión por pares. Si quien ejecuta la prueba tiene interés en el resultado —un proveedor, un afiliado, una cuenta de hype—, descuéntalo. La prueba de una prueba es la reproducibilidad: ¿puedes ver el conjunto exacto de tareas, el harness y la configuración del modelo? Si no, la cifra es una afirmación, no una medición.

Pregunta 4: ¿Son comparaciones equivalentes? ¿Se usó el mismo subconjunto de tareas para cada modelo? ¿La misma temperatura, el mismo tooling, el mismo número de intentos? La comparación del 80 % en DeepSWE parece internamente coherente, pero sigue siendo un subconjunto autoseleccionado ejecutado por una sola parte. Si algún modelo de la tabla se ejecutó en condiciones distintas, la tabla entera queda anulada.

El resumen en una línea: las puntuaciones de la comunidad sirven exactamente para una cosa: elaborar una lista corta. No sirven para clasificar a Ox Alpha frente a otros modelos, y son especialmente débiles con un modelo stealth que nadie ha podido auditar.

Mejores señales: qué dice el uso real

Aquí está la parte de los datos oficiales que la mayoría de los artículos cazadores de benchmarks omiten. La vista Apps/Activity de OpenRouter muestra tráfico de producción real y, en los dos días posteriores al lanzamiento, Ox Alpha consumió aproximadamente 657.000 millones de tokens de prompt y 7.950 millones de tokens de completado. Las cinco aplicaciones que generan más tráfico son todas herramientas de programación agentic: Hermes Agent (120.000 millones de tokens), Claude Code (108.000 millones), Oh-My-Pi (93.500 millones), DeepSeek Harness con su puente multimodal (84.800 millones) y ZCode (51.500 millones).

¿Por qué esto supera a una captura de 10 tareas sin verificar? Porque está agregado sobre miles de usuarios que ejecutan cargas reales y de largo recorrido de forma continua. Las herramientas agentic son la prueba de esfuerzo más dura que existe: mantienen contexto a lo largo de muchos turnos, llaman a herramientas, se recuperan de errores y siguen adelante. Si los equipos están enrutando 657.000 millones de tokens de prompt por un modelo en dos días, eso es evidencia de utilidad bajo carga realista: no es prueba de posición en un leaderboard, pero es una señal mucho más fuerte que una afirmación basada en 10 tareas.

En lo operativo, la monitorización oficial (P50 durante unos tres días) reporta un rendimiento de 24 tokens por segundo, una latencia de 5,81 segundos, un uptime del 99,99 % y una disponibilidad del 99,14 %. La adopción en el ecosistema confirma la tendencia: Ox Alpha («Ox Alpha Free») figura en OpenCode Go con una ventana gratuita limitada durante la próxima semana, uso casi ilimitado que no computa contra el plan Go, retención cero de datos y el mismo contexto de 1M. Eso es un compromiso público de un proveedor de herramientas, no un rumor.

Si tu trabajo es programación de largo recorrido y tareas agentic —exactamente el perfil que muestran los datos de uso—, puedes probar Ox Alpha gratis en glm5.app ahora mismo.

Cómo hacer tu propio benchmark de Ox Alpha

Dado el estado de los datos públicos, el benchmark más fiable para tu caso de uso es el que ejecutas tú. En concreto:

  1. Elige entre 3 y 5 tareas de tu trabajo real. Una refactorización en un repositorio que conoces, una sesión de depuración en varios pasos, una ejecución agentic larga con llamadas a herramientas, o una tarea que mezcle una captura o un documento con instrucciones: el modelo acepta entrada de imagen y vídeo.
  2. Pasa el mismo prompt por Ox Alpha y por tu modelo actual. Las mismas instrucciones, las mismas herramientas, la misma temperatura. No cambies la configuración entre ejecuciones.
  3. Puntúa finalización y calidad, no sensaciones. ¿Terminó la tarea? ¿Fue correcta la salida al primer intento? ¿Cuánto acompañamiento necesitó?
  4. Fuerza el largo recorrido. Con una ventana de contexto de 1M tokens y razonamiento en esfuerzo máximo por defecto, Ox Alpha está hecho para trabajo sostenido. Una pregunta de un solo turno no te dirá de qué es capaz; una ejecución agentic de 20 turnos, sí.
  5. Ajústalo con equidad. La API admite esfuerzo de razonamiento (max/high/low), herramientas y tool choice, salida estructurada, temperatura y top_p/top_k, así que puedes comparar en condiciones idénticas y reproducibles.

Algunas advertencias para calibrar expectativas: el proveedor es anónimo durante esta preview, la ventana de precio gratuito en OpenRouter y la semana gratis de OpenCode pueden cambiar, y nada de este artículo sustituye a las páginas oficiales. Lo que estás probando es el modelo tal como existe hoy, que es la forma honesta de evaluar un lanzamiento stealth.

Si prefieres no configurar una clave de API para empezar, chatea con Ox Alpha en tu navegador en glm5.app —el punto de entrada web gratuito— y resuelve tu primera tarea en los próximos cinco minutos.

FAQ

¿Tiene Ox Alpha benchmarks oficiales? No. El listado de OpenRouter incluye especificaciones, precios y monitorización de rendimiento, pero ninguna puntuación de benchmark de inteligencia, programación o agentic. Artificial Analysis no lista el modelo (comprobado el 22 de agosto de 2026).

¿Qué puntuación obtuvo Ox Alpha en DeepSWE y Kingbench? Según pruebas de la comunidad: alrededor del 80 % en un subconjunto de 10 tareas de DeepSWE (con Fable en el 65 % y GPT-5.6 Sol en el 52 % en la misma ejecución de muestra pequeña) y un 87,5 % en Kingbench, por detrás de GLM-5.3 con un 91,25 %. Ambos resultados son reportados por la comunidad y no están verificados de forma independiente; Kingbench no es un benchmark estándar.

¿Puedo fiarme de las puntuaciones de la comunidad? Como señales, sí; como conclusiones, no. Provienen de muestras diminutas sin verificación independiente. Pásalas por el marco de cuatro preguntas de arriba —tamaño de muestra, qué se mide, quién la ejecutó, metodología comparable— antes de dar peso a ninguna cifra.

¿Es rápido Ox Alpha? La monitorización de OpenRouter (P50, unos tres días) reporta 24 tokens por segundo de rendimiento y 5,81 segundos de latencia, con un 99,99 % de uptime y un 99,14 % de disponibilidad. Ten en cuenta que el razonamiento es obligatorio y por defecto está en esfuerzo máximo, así que espera tiempo de reflexión en tareas difíciles.

¿Cómo puedo hacer un benchmark de Ox Alpha yo mismo? Ejecuta tus propias tareas reales cara a cara con tu modelo actual: mismos prompts, mismas herramientas, mismos ajustes. La forma más rápida de empezar es el chat web gratuito en glm5.app; la API a través de OpenRouter (gratis durante la preview) te permite probar de forma programática con herramientas y salida estructurada.

Sources

Última actualización: 22 de agosto de 2026

Comienza a usar GLM 5 hoy

Prueba GLM 5 gratis — razonamiento, programación, agentes y generación de imágenes en una sola plataforma.

Benchmarks de Ox Alpha: qué dicen los datos reales - GLM 5