GLM 5.3 Flash

Ekonomiczny wariant Z.ai w rodzinie GLM 5: Mixture-of-Experts o 320B parametrów przy 18B aktywnych, wejście tekstowe, obrazowe i wideo, kontekst 1M oraz otwarte wagi MIT.

Twórz z GLM 5

Czym jest GLM 5.3 Flash?

GLM 5.3 Flash zadebiutował 26 sierpnia 2026 roku, po sześciu dniach na OpenRouterze jako ukryty model Ox Alpha.

01

320B łącznie, 18B aktywnych

Na token uruchamia się tylko 8 z 288 ekspertów: pamięć jak w modelu 320B, obliczenia jak w 18B.

02

Multimodalny od podstaw

Zdolność widzenia pochodzi z korpusu pretreningowego o 30T tokenów, a nie z dołożonego później enkodera.

03

Flash znaczy tani, nie szybki

Artificial Analysis mierzy 50,2 tokena wyjściowego na sekundę — poniżej mediany klasy wynoszącej 67 t/s.

GLM 5.3 Flash: specyfikacja, rozmiar i status open source

Architektura, wagi i licencje według karty modelu na Hugging Face oraz repozytorium zai-org/GLM-5.

Karta modelu

Architektura

Wszystkie parametry
320B

MoE, 45 warstw, 8 z 288 ekspertów.

Aktywne parametry
18B

Obliczenia jak w gęstym modelu 18B.

Okno kontekstu
1 048 576 tokenów

Io Net ogranicza do 262 144, Cloudflare do 1 310 720.

Maksymalne wyjście
131 072 tokeny

Inni podają nawet 1 179 648.

Modalności
Tekst, obraz, wideo

Wejście multimodalne, wyjście tekstowe.

Wagi i licencja

Rozmiar i licencja

Licencja wag
MIT

Użycie komercyjne i redystrybucja bez progów.

Hugging Face
zai-org/GLM-5.3-Flash

Jest też wariant -BF16 i kopia na ModelScope.

GitHub
zai-org/GLM-5

Brak osobnego repo; GLM-5 jest na Apache-2.0.

Rozmiar checkpointu
~328 GB (FP8)

Zadanie na kilka węzłów, nie na stację roboczą.

Stosy serwujące
SGLang, vLLM

Plus TokenSpeed, KTransformers i społecznościowe GGUF.

Karta modelu i API endpoints OpenRoutera, sierpień 2026.

Cennik / 04

Ceny GLM 5.3 Flash: cennik podstawowy a rabat na start

Z.ai podaje 0,15 $ za wejście i 0,50 $ za wyjście na 1M tokenów. Cytowane wszędzie 0,075 $ / 0,25 $ to tymczasowy rabat startowy 50%.

01

Cena katalogowa

$0.15

Za 1M tokenów wejścia

Koszty GLM 5.3 Flash prognozuj według tej stawki, nie promocyjnej.

02

Cena katalogowa

$0.50

Za 1M tokenów wyjścia

Stromy stosunek 1:3,3 — najpierw ogranicz długość odpowiedzi.

03

Cena katalogowa

$0.03

Za 1M tokenów wejścia z cache

Jedna piąta świeżego wejścia — to właśnie czyni długi kontekst opłacalnym.

04

Niezależnie

$0.10

Cena mieszana

Artificial Analysis, przy proporcji cache/wejście/wyjście 7:2:1.

Dwukrotny rozrzut przy identycznych wagach: Z.AI, Novita i GMICloud dają rabat, reszta liczy cennik.

Benchmarki / 05

Benchmarki GLM 5.3 Flash: dane producenta i niezależne

Z.ai publikuje własną tabelę i sam dobiera porównania. Przewaga nad GLM 5.2 oraz wyniki Artificial Analysis bronią się przy weryfikacji.

01

Dane Z.ai

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra osiąga 87,4; przy trudnych zadaniach dystans rośnie.

02

Dane Z.ai

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

Ta sama rodzina i metoda, za dziesiątą część ceny. AutomationBench: 48,8 wobec 26,2.

03

Dane Z.ai

OfficeQA Pro

5.3 Flash62.4

Wnioskowanie po dokumentach i obrazach — według producenta przed Opus 4.8.

04

Artificial Analysis

57

Intelligence Index

Pomiar niezależny, przy medianie około 27 dla podobnych modeli z otwartymi wagami.

Najbardziej wiarygodnym benchmarkiem GLM 5.3 Flash jest twój własny backlog.

Możliwości / 06

Co potrafi GLM 5.3 Flash

Zbudowany pod obudowy agentowe: sterowanie rozumowaniem, narzędzia, uporządkowane wyjście i streaming w oknie miliona tokenów.

01

Rozumowanie z kontrolą wysiłku

Włączone domyślnie, z regulowanym poziomem wysiłku.

02

Wywoływanie funkcji

Narzędzia i wybór narzędzia; każdą akcję nadal waliduje twoja aplikacja.

03

Uporządkowane wyjście

Ograniczenie formatu odpowiedzi zwraca JSON gotowy do sparsowania.

04

Odpowiedzi strumieniowe

1,47 s do pierwszego tokena bije medianę; przepustowość już nie.

05

Wejście obrazu i wideo

Wklej zrzut ekranu, diagram albo nagranie ekranu razem z promptem.

06

Kontekst miliona tokenów

Stawka 0,03 $ za wejście z cache utrzymuje niskie koszty kolejnych tur.

Porównanie / 07

GLM 5.3 Flash kontra DeepSeek V4 Flash

Oba to tani wariant czołowej rodziny z wagami na MIT. Różnią się modalnościami, rozumowaniem i wymaganiami sprzętowymi.

Z.ai

GLM 5.3 Flash

Architektura
320B / 18B aktywnych

Hybrydowe KDA plus rzadka uwaga MLA w wariancie NoPE.

Wejście
Tekst, obraz, wideo

Multimodalny od podstaw.

Kontekst / wyjście
1M / 131K

Limit wyjścia zależy od dostawcy.

Cena katalogowa
$0.15 / $0.50

Przed rabatem startowym.

Własny hosting
~328 GB FP8

MIT, ale zadanie na kilka węzłów.

DeepSeek

DeepSeek V4 Flash

Architektura
284B / ~13B aktywnych

Domyślnie bez rozumowania.

Wejście
Tylko tekst

Zrzuty ekranu trzeba najpierw przepisać.

Kontekst / wyjście
1M / 384K

Znacznie większy budżet na odpowiedź.

Cena katalogowa
$0.14 / $0.28

Od producenta, z łagodniejszym stosunkiem 1:2.

Własny hosting
Wagi na MIT

Mniejszy model, tańszy w serwowaniu.

Oba są na liście modeli glm5.app, więc ten sam prompt przejdzie przez każdy z nich.

Oś czasu premiery / 08

Oś czasu GLM 5.3 Flash — od Ox Alpha do otwartych wag

Sześć dni jako anonimowy ukryty model, a potem pełna premiera z otwartymi wagami.

01

20 sierpnia — pojawia się Ox Alpha

`stealth/ox-alpha` trafia na OpenRouter bez ujawnionego dostawcy i bezpłatnie za token.

02

20-26 sierpnia — zjeżdżają się narzędzia agentowe

Pięciu największych odbiorców to agentowe narzędzia do kodu; OpenCode udostępnia model za darmo.

03

26 sierpnia — premiera GLM 5.3 Flash

Z.ai potwierdza pochodzenie od Ox Alpha; karta modelu, wagi MIT i cennik pojawiają się razem.

04

Wersja zapoznawcza działała na chińskich układach

Autorski silnik wywodzący się z SGLang, raportowany na około 3x. Dostawca nieujawniony.

05

Wagi trafiły na Hugging Face

`zai-org/GLM-5.3-Flash` plus wariant BF16 i kopia na ModelScope. Bez repozytorium na GitHubie.

06

Gdzie najpierw pojawiają się nowości

Ceny — OpenRouter, kwantyzacje — Hugging Face. Po relacje z praktyki idź na Reddita, tam wciąż mówi się Ox Alpha.

Dla kogo / 09

Kto korzysta z GLM 5.3 Flash?

Zespoły płacące stawki flagowca za pracę, która nigdy nie wymagała takiej głębi — i przypadki, gdy to zły wybór.

01

Agentowe kodowanie na dużą skalę

Wywołania narzędzi za dziesiątą część ceny tokena GLM 5.3 sprawiają, że długie pętle agentowe stają się opłacalne.

02

Praca w skali repozytorium

Okno miliona tokenów utrzymuje całą bazę kodu, więc pytania obejmujące wiele plików obywają się bez wyszukiwania.

03

Debugowanie wizualne

Rozjechane układy, nagrania odtwarzające błąd, schematy na diagramach.

04

Zespoły porównujące Z.ai z rywalami

Zestaw go z DeepSeek V4 Flash i Qwen w czacie glm5.app.

05

Hostujący u siebie, z klastrem

Wagi na MIT i wsparcie vLLM są prawdziwe, ale 328 GB w FP8 wyklucza jedną maszynę.

06

Nie dla interfejsów wrażliwych na opóźnienia

Przy około 50 tokenach wyjścia na sekundę wypada gorzej niż większość modeli w tej cenie.

Jak używać GLM 5.3 Flash / 10

Jak używać GLM 5.3 Flash

Trzy drogi: darmowy czat w przeglądarce, API glm5.app albo wagi MIT na własnym sprzęcie.

01
01

Czatuj z GLM 5.3 Flash za darmo

Wybierz GLM 5.3 Flash w czacie i dołącz zrzuty ekranu. Nowe konta dostają darmowe kredyty.

02
02

Wywołaj API glm5.app

Wysyłaj zapytania zgodne z OpenAI na `https://glm5.app/api/v1`, podając ID modelu `glm-5.3-flash`.

03
03

Albo uruchom wagi u siebie

Pobierz `zai-org/GLM-5.3-Flash` i serwuj go przez SGLang lub vLLM — około 328 GB w FP8.

Integration specimen

Zacznij od API GLM 5.3 Flash

Endpoint Chat Completions zgodny z OpenAI. Użyj ID modelu `glm-5.3-flash` pod adresem `https://glm5.app/api/v1`.

Otwórz dokumentację API
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

GLM 5.3 Flash — najczęstsze pytania

Ox Alpha, ceny, benchmarki, parametry, Hugging Face, vLLM, DGX Spark i DeepSeek V4 Flash.

Czy GLM 5.3 Flash to ten sam model co Ox Alpha?

Tak — działał jako `stealth/ox-alpha` przez sześć dni od 20 sierpnia 2026 roku. Zapisane rozmowy z Ox Alpha są przepinane automatycznie.


Czy GLM 5.3 Flash to to samo co GLM 5.3?

Nie — to inne warianty, różnica w cenie sięga około 10x. Flash to multimodalny model 320B-A18B, a GLM 5.3 to tekstowy flagowiec.


Ile kosztuje GLM 5.3 Flash?

Z.ai podaje 0,15 $ za 1M tokenów wejścia, 0,03 $ z cache i 0,50 $ za wyjście. Cytowane 0,075 $ / 0,25 $ to tymczasowy rabat startowy 50%.


Czy GLM 5.3 Flash jest darmowy?

Wersja zapoznawcza Ox Alpha była darmowa; teraz obowiązuje rozliczenie za użycie. Wciąż możesz przetestować model za darmo w czacie glm5.app.


Ile parametrów ma GLM 5.3 Flash i ile waży?

320B łącznie, 18B aktywnych na token, 45 warstw kierujących do 8 z 288 ekspertów. Checkpoint FP8 zajmuje około 328 GB.


Czy GLM 5.3 Flash jest na Hugging Face i GitHubie?

Wagi są na Hugging Face pod `zai-org/GLM-5.3-Flash` na licencji MIT. Nie ma dedykowanego repo na GitHubie — przepisy leżą w `zai-org/GLM-5`.


Czy uruchomię GLM 5.3 Flash na vLLM albo DGX Spark?

vLLM, SGLang, TokenSpeed i KTransformers są wspierane. 328 GB nie zmieści się w jednym DGX Spark; społeczność łączy dwa przy kwantyzacji 4-bitowej.


GLM 5.3 Flash czy DeepSeek V4 Flash — co wybrać?

Flash, gdy potrzebujesz wejścia wizualnego lub rozumowania; DeepSeek V4 Flash, gdy liczy się łagodniejszy stosunek 1:2 albo wyjście 384K.


Co o GLM 5.3 Flash mówią na Reddicie?

Większość relacji z praktyki powstała pod nazwą wersji zapoznawczej, więc na Reddicie szukaj raczej Ox Alpha.


Start here

Zacznij korzystać z GLM 5.3 Flash już dziś

Przepuść najtrudniejsze zadanie przez GLM 5.3 Flash za darmo w przeglądarce, a potem wepnij ID modelu w swój pipeline.