Preço de tabela
$0.15
Por 1M de entrada
Projete seu custo do GLM 5.3 Flash por aqui, não pela tarifa promocional.
O nível eficiente da Z.ai na família GLM 5: um Mixture-of-Experts de 320B com 18B ativos, entrada de texto, imagem e vídeo, contexto de 1M e pesos abertos MIT.
O GLM 5.3 Flash foi lançado em 26 de agosto de 2026, depois de seis dias no OpenRouter como o modelo furtivo Ox Alpha.
Apenas 8 de 288 especialistas disparam por token: memória de um modelo de 320B, computação de um de 18B.
A visão veio do corpus de pré-treinamento de 30T tokens, não de um codificador acoplado depois.
A Artificial Analysis mede 50,2 tokens de saída por segundo, abaixo da mediana de 67 t/s da categoria.
Arquitetura, pesos e licenciamento conforme o model card no Hugging Face e o repositório zai-org/GLM-5.
Model card
MoE, 45 camadas, 8 de 288 especialistas.
Computação de um modelo denso de 18B.
A Io Net limita a 262.144; a Cloudflare, a 1.310.720.
Outros informam até 1.179.648.
Entrada multimodal, saída em texto.
Pesos e licenciamento
Uso comercial e redistribuição, sem limite.
Uma variante -BF16 e um espelho no ModelScope.
Sem repositório próprio; o GLM-5 é Apache-2.0.
Um job multinó, não uma workstation.
Mais TokenSpeed, KTransformers e GGUF da comunidade.
Model card e API de endpoints do OpenRouter, agosto de 2026.
Preços / 04
A Z.ai lista US$ 0,15 de entrada e US$ 0,50 de saída por 1M de tokens. Os US$ 0,075 / US$ 0,25 citados em todo lugar são um desconto temporário de lançamento de 50%.
Preço de tabela
$0.15
Projete seu custo do GLM 5.3 Flash por aqui, não pela tarifa promocional.
Preço de tabela
$0.50
Uma proporção acentuada de 1:3,3 — limite a saída primeiro.
Preço de tabela
$0.03
Um quinto da entrada nova — é o que torna o contexto longo viável.
Independente
$0.10
Artificial Analysis, em uma mistura 7:2:1 de cache/entrada/saída.
Benchmarks / 05
A Z.ai publica a própria tabela e escolhe as comparações. A diferença para o GLM 5.2 e os dados da Artificial Analysis resistem ao escrutínio.
Reportado pela Z.ai
O GPT-5.6 Terra marca 87,4; a distância aumenta nas tarefas difíceis.
Reportado pela Z.ai
Mesma família e método, por um décimo do preço. AutomationBench: 48,8 contra 26,2.
Reportado pela Z.ai
Raciocínio documental e visual, reportado à frente do Opus 4.8.
Artificial Analysis
57
Independente, contra uma mediana de ~27 em modelos de pesos abertos semelhantes.
Recursos / 06
Feito para harnesses de agentes: controle de raciocínio, ferramentas, saída estruturada e streaming sobre uma janela de um milhão de tokens.
Ligado por padrão, com nível de esforço ajustável.
Ferramentas e escolha de ferramenta; seu app continua validando cada ação.
Uma restrição de formato de resposta devolve JSON parseável.
1,47 s até o primeiro token supera a mediana; a taxa de saída, não.
Cole uma captura de tela, um diagrama ou uma gravação junto do seu prompt.
A tarifa de US$ 0,03 por entrada em cache mantém os turnos seguintes baratos.
Comparação / 07
Ambos são o nível barato de uma família de ponta que publica pesos MIT. Divergem em modalidade, raciocínio e hardware.
Z.ai
KDA híbrida mais atenção MLA esparsa NoPE.
Multimodal de origem.
O teto de saída varia por provedor.
Antes do desconto de lançamento.
MIT, mas um job multinó.
DeepSeek
Sem raciocínio por padrão.
Capturas precisam ser transcritas antes.
Orçamento de resposta bem maior.
Direto do fornecedor, com proporção mais plana de 1:2.
Fatia menor, mais barata de servir.
Os dois estão na lista de modelos do glm5.app, então um mesmo prompt passa por cada um.
Linha do tempo / 08
Seis dias como modelo furtivo anônimo e então um lançamento completo com pesos abertos.
`stealth/ox-alpha` chega ao OpenRouter sem provedor declarado, grátis por token.
Os cinco maiores consumidores são ferramentas de coding agêntico; o OpenCode o oferece de graça.
A Z.ai confirma a linhagem do Ox Alpha; model card, pesos MIT e preços chegam juntos.
Um motor próprio derivado do SGLang, reportado em cerca de 3x. Fornecedor não revelado.
`zai-org/GLM-5.3-Flash` mais uma variante BF16 e um espelho no ModelScope. Sem repositório no GitHub.
OpenRouter na frente em preços, Hugging Face nas quantizações. Para relatos de campo, o Reddit ainda fala em Ox Alpha.
Para quem é / 09
Times que pagam tarifa de modelo topo de linha por trabalho que nunca precisou dessa profundidade — e onde isso é um erro.
Chamar ferramentas por um décimo do preço por token do GLM 5.3 torna loops longos de agente viáveis.
Uma janela de um milhão de tokens mantém a base de código residente, então perguntas entre arquivos dispensam recuperação.
Layouts quebrados, gravações de reprodução, esquemas em diagramas.
Compare com DeepSeek V4 Flash e Qwen no chat do glm5.app.
Os pesos MIT e o suporte a vLLM são reais, mas 328 GB em FP8 descartam uma única máquina.
A cerca de 50 tokens de saída por segundo, fica atrás da maioria dos concorrentes de mesmo preço.
Três caminhos: chat grátis no navegador, a API do glm5.app ou os pesos MIT no seu próprio hardware.
Escolha GLM 5.3 Flash no chat e anexe capturas de tela. Contas novas ganham créditos grátis.
Envie requisições compatíveis com OpenAI para `https://glm5.app/api/v1` com o ID de modelo `glm-5.3-flash`.
Baixe `zai-org/GLM-5.3-Flash` e sirva com SGLang ou vLLM — cerca de 328 GB em FP8.
Integration specimen
Um endpoint de Chat Completions compatível com OpenAI. Use o ID de modelo `glm-5.3-flash` em `https://glm5.app/api/v1`.
Abrir a documentação da APIcurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, preços, benchmarks, parâmetros, Hugging Face, vLLM, DGX Spark e DeepSeek V4 Flash.
Sim — ele rodou como `stealth/ox-alpha` por seis dias a partir de 20 de agosto de 2026. Conversas salvas do Ox Alpha são remapeadas automaticamente.
Não — são níveis diferentes, com uma diferença de preço de cerca de 10x. O Flash é o modelo multimodal 320B-A18B; o GLM 5.3 é o carro-chefe em texto.
A Z.ai lista US$ 0,15 por 1M de entrada, US$ 0,03 em cache e US$ 0,50 de saída. Os US$ 0,075 / US$ 0,25 citados são um desconto temporário de lançamento de 50%.
A prévia do Ox Alpha era gratuita; agora é cobrado por uso. Você ainda pode testá-lo grátis no chat do glm5.app.
320B no total, 18B ativos por token, 45 camadas roteando 8 de 288 especialistas. O checkpoint FP8 tem cerca de 328 GB.
Os pesos estão no Hugging Face em `zai-org/GLM-5.3-Flash` sob MIT. Não há repositório dedicado no GitHub — as receitas ficam em `zai-org/GLM-5`.
vLLM, SGLang, TokenSpeed e KTransformers são suportados. 328 GB não cabem em uma DGX Spark; a comunidade relata unir duas em 4 bits.
Flash para entrada visual ou deliberação; DeepSeek V4 Flash para uma proporção mais plana de 1:2 ou 384K de saída.
A maior parte dos relatos práticos está sob o nome da prévia, então procure por Ox Alpha no Reddit.
Start here
Rode sua tarefa mais difícil no GLM 5.3 Flash grátis no navegador e depois ligue o ID do modelo ao seu pipeline.