GLM 5.3 Flash

O nível eficiente da Z.ai na família GLM 5: um Mixture-of-Experts de 320B com 18B ativos, entrada de texto, imagem e vídeo, contexto de 1M e pesos abertos MIT.

Crie com o GLM 5

O que é o GLM 5.3 Flash?

O GLM 5.3 Flash foi lançado em 26 de agosto de 2026, depois de seis dias no OpenRouter como o modelo furtivo Ox Alpha.

01

320B no total, 18B ativos

Apenas 8 de 288 especialistas disparam por token: memória de um modelo de 320B, computação de um de 18B.

02

Multimodal de origem

A visão veio do corpus de pré-treinamento de 30T tokens, não de um codificador acoplado depois.

03

Flash significa barato, não rápido

A Artificial Analysis mede 50,2 tokens de saída por segundo, abaixo da mediana de 67 t/s da categoria.

Especificações, tamanho e status open source do GLM 5.3 Flash

Arquitetura, pesos e licenciamento conforme o model card no Hugging Face e o repositório zai-org/GLM-5.

Model card

Arquitetura

Parâmetros totais
320B

MoE, 45 camadas, 8 de 288 especialistas.

Parâmetros ativos
18B

Computação de um modelo denso de 18B.

Janela de contexto
1.048.576 tokens

A Io Net limita a 262.144; a Cloudflare, a 1.310.720.

Saída máxima
131.072 tokens

Outros informam até 1.179.648.

Modalidade
Texto, imagem, vídeo

Entrada multimodal, saída em texto.

Pesos e licenciamento

Tamanho e licença

Licença dos pesos
MIT

Uso comercial e redistribuição, sem limite.

Hugging Face
zai-org/GLM-5.3-Flash

Uma variante -BF16 e um espelho no ModelScope.

GitHub
zai-org/GLM-5

Sem repositório próprio; o GLM-5 é Apache-2.0.

Tamanho do checkpoint
~328 GB (FP8)

Um job multinó, não uma workstation.

Stacks de serving
SGLang, vLLM

Mais TokenSpeed, KTransformers e GGUF da comunidade.

Model card e API de endpoints do OpenRouter, agosto de 2026.

Preços / 04

Preços do GLM 5.3 Flash: tabela cheia vs. desconto de lançamento

A Z.ai lista US$ 0,15 de entrada e US$ 0,50 de saída por 1M de tokens. Os US$ 0,075 / US$ 0,25 citados em todo lugar são um desconto temporário de lançamento de 50%.

01

Preço de tabela

$0.15

Por 1M de entrada

Projete seu custo do GLM 5.3 Flash por aqui, não pela tarifa promocional.

02

Preço de tabela

$0.50

Por 1M de saída

Uma proporção acentuada de 1:3,3 — limite a saída primeiro.

03

Preço de tabela

$0.03

Por 1M de entrada em cache

Um quinto da entrada nova — é o que torna o contexto longo viável.

04

Independente

$0.10

Preço combinado

Artificial Analysis, em uma mistura 7:2:1 de cache/entrada/saída.

Uma diferença de 2x para pesos idênticos: Z.AI, Novita e GMICloud dão desconto; os demais cobram a tabela.

Benchmarks / 05

Benchmarks do GLM 5.3 Flash: do fornecedor e independentes

A Z.ai publica a própria tabela e escolhe as comparações. A diferença para o GLM 5.2 e os dados da Artificial Analysis resistem ao escrutínio.

01

Reportado pela Z.ai

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

O GPT-5.6 Terra marca 87,4; a distância aumenta nas tarefas difíceis.

02

Reportado pela Z.ai

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

Mesma família e método, por um décimo do preço. AutomationBench: 48,8 contra 26,2.

03

Reportado pela Z.ai

OfficeQA Pro

5.3 Flash62.4

Raciocínio documental e visual, reportado à frente do Opus 4.8.

04

Artificial Analysis

57

Intelligence Index

Independente, contra uma mediana de ~27 em modelos de pesos abertos semelhantes.

O benchmark mais confiável do GLM 5.3 Flash é o seu próprio backlog.

Recursos / 06

O que o GLM 5.3 Flash faz

Feito para harnesses de agentes: controle de raciocínio, ferramentas, saída estruturada e streaming sobre uma janela de um milhão de tokens.

01

Raciocínio com controle de esforço

Ligado por padrão, com nível de esforço ajustável.

02

Function calling

Ferramentas e escolha de ferramenta; seu app continua validando cada ação.

03

Saída estruturada

Uma restrição de formato de resposta devolve JSON parseável.

04

Respostas em streaming

1,47 s até o primeiro token supera a mediana; a taxa de saída, não.

05

Entrada de imagem e vídeo

Cole uma captura de tela, um diagrama ou uma gravação junto do seu prompt.

06

Contexto de um milhão de tokens

A tarifa de US$ 0,03 por entrada em cache mantém os turnos seguintes baratos.

Comparação / 07

GLM 5.3 Flash vs. DeepSeek V4 Flash

Ambos são o nível barato de uma família de ponta que publica pesos MIT. Divergem em modalidade, raciocínio e hardware.

Z.ai

GLM 5.3 Flash

Arquitetura
320B / 18B ativos

KDA híbrida mais atenção MLA esparsa NoPE.

Entrada
Texto, imagem, vídeo

Multimodal de origem.

Contexto / saída
1M / 131K

O teto de saída varia por provedor.

Preço de tabela
$0.15 / $0.50

Antes do desconto de lançamento.

Self-hosting
~328 GB FP8

MIT, mas um job multinó.

DeepSeek

DeepSeek V4 Flash

Arquitetura
284B / ~13B ativos

Sem raciocínio por padrão.

Entrada
Somente texto

Capturas precisam ser transcritas antes.

Contexto / saída
1M / 384K

Orçamento de resposta bem maior.

Preço de tabela
$0.14 / $0.28

Direto do fornecedor, com proporção mais plana de 1:2.

Self-hosting
Pesos MIT

Fatia menor, mais barata de servir.

Os dois estão na lista de modelos do glm5.app, então um mesmo prompt passa por cada um.

Linha do tempo / 08

Linha do tempo do GLM 5.3 Flash, do Ox Alpha aos pesos abertos

Seis dias como modelo furtivo anônimo e então um lançamento completo com pesos abertos.

01

20 de ago — o Ox Alpha aparece

`stealth/ox-alpha` chega ao OpenRouter sem provedor declarado, grátis por token.

02

20-26 de ago — as ferramentas de agentes se acumulam

Os cinco maiores consumidores são ferramentas de coding agêntico; o OpenCode o oferece de graça.

03

26 de ago — o GLM 5.3 Flash é lançado

A Z.ai confirma a linhagem do Ox Alpha; model card, pesos MIT e preços chegam juntos.

04

A prévia rodou em chips chineses

Um motor próprio derivado do SGLang, reportado em cerca de 3x. Fornecedor não revelado.

05

Os pesos saíram no Hugging Face

`zai-org/GLM-5.3-Flash` mais uma variante BF16 e um espelho no ModelScope. Sem repositório no GitHub.

06

Onde a notícia aparece primeiro

OpenRouter na frente em preços, Hugging Face nas quantizações. Para relatos de campo, o Reddit ainda fala em Ox Alpha.

Para quem é / 09

Quem usa o GLM 5.3 Flash?

Times que pagam tarifa de modelo topo de linha por trabalho que nunca precisou dessa profundidade — e onde isso é um erro.

01

Coding agêntico de alto volume

Chamar ferramentas por um décimo do preço por token do GLM 5.3 torna loops longos de agente viáveis.

02

Trabalho na escala do repositório

Uma janela de um milhão de tokens mantém a base de código residente, então perguntas entre arquivos dispensam recuperação.

03

Depuração visual

Layouts quebrados, gravações de reprodução, esquemas em diagramas.

04

Times comparando a Z.ai com rivais

Compare com DeepSeek V4 Flash e Qwen no chat do glm5.app.

05

Quem hospeda com um cluster

Os pesos MIT e o suporte a vLLM são reais, mas 328 GB em FP8 descartam uma única máquina.

06

Não para interfaces sensíveis à latência

A cerca de 50 tokens de saída por segundo, fica atrás da maioria dos concorrentes de mesmo preço.

Como usar o GLM 5.3 Flash / 10

Como usar o GLM 5.3 Flash

Três caminhos: chat grátis no navegador, a API do glm5.app ou os pesos MIT no seu próprio hardware.

01
01

Converse grátis com o GLM 5.3 Flash

Escolha GLM 5.3 Flash no chat e anexe capturas de tela. Contas novas ganham créditos grátis.

02
02

Chame a API do glm5.app

Envie requisições compatíveis com OpenAI para `https://glm5.app/api/v1` com o ID de modelo `glm-5.3-flash`.

03
03

Ou hospede os pesos você mesmo

Baixe `zai-org/GLM-5.3-Flash` e sirva com SGLang ou vLLM — cerca de 328 GB em FP8.

Integration specimen

Comece pela API do GLM 5.3 Flash

Um endpoint de Chat Completions compatível com OpenAI. Use o ID de modelo `glm-5.3-flash` em `https://glm5.app/api/v1`.

Abrir a documentação da API
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

Perguntas frequentes sobre o GLM 5.3 Flash

Ox Alpha, preços, benchmarks, parâmetros, Hugging Face, vLLM, DGX Spark e DeepSeek V4 Flash.

O GLM 5.3 Flash é o mesmo modelo que o Ox Alpha?

Sim — ele rodou como `stealth/ox-alpha` por seis dias a partir de 20 de agosto de 2026. Conversas salvas do Ox Alpha são remapeadas automaticamente.


O GLM 5.3 Flash é igual ao GLM 5.3?

Não — são níveis diferentes, com uma diferença de preço de cerca de 10x. O Flash é o modelo multimodal 320B-A18B; o GLM 5.3 é o carro-chefe em texto.


Qual é o preço do GLM 5.3 Flash?

A Z.ai lista US$ 0,15 por 1M de entrada, US$ 0,03 em cache e US$ 0,50 de saída. Os US$ 0,075 / US$ 0,25 citados são um desconto temporário de lançamento de 50%.


O GLM 5.3 Flash é grátis?

A prévia do Ox Alpha era gratuita; agora é cobrado por uso. Você ainda pode testá-lo grátis no chat do glm5.app.


Quantos parâmetros o GLM 5.3 Flash tem e qual é o tamanho dele?

320B no total, 18B ativos por token, 45 camadas roteando 8 de 288 especialistas. O checkpoint FP8 tem cerca de 328 GB.


O GLM 5.3 Flash está no Hugging Face e no GitHub?

Os pesos estão no Hugging Face em `zai-org/GLM-5.3-Flash` sob MIT. Não há repositório dedicado no GitHub — as receitas ficam em `zai-org/GLM-5`.


Dá para rodar o GLM 5.3 Flash em vLLM ou em uma DGX Spark?

vLLM, SGLang, TokenSpeed e KTransformers são suportados. 328 GB não cabem em uma DGX Spark; a comunidade relata unir duas em 4 bits.


GLM 5.3 Flash ou DeepSeek V4 Flash — qual usar?

Flash para entrada visual ou deliberação; DeepSeek V4 Flash para uma proporção mais plana de 1:2 ou 384K de saída.


O que o Reddit diz sobre o GLM 5.3 Flash?

A maior parte dos relatos práticos está sob o nome da prévia, então procure por Ox Alpha no Reddit.


Start here

Comece hoje com o GLM 5.3 Flash

Rode sua tarefa mais difícil no GLM 5.3 Flash grátis no navegador e depois ligue o ID do modelo ao seu pipeline.