Cena katalogowa
$0.15
Za 1M tokenów wejścia
Koszty GLM 5.3 Flash prognozuj według tej stawki, nie promocyjnej.
Ekonomiczny wariant Z.ai w rodzinie GLM 5: Mixture-of-Experts o 320B parametrów przy 18B aktywnych, wejście tekstowe, obrazowe i wideo, kontekst 1M oraz otwarte wagi MIT.
GLM 5.3 Flash zadebiutował 26 sierpnia 2026 roku, po sześciu dniach na OpenRouterze jako ukryty model Ox Alpha.
Na token uruchamia się tylko 8 z 288 ekspertów: pamięć jak w modelu 320B, obliczenia jak w 18B.
Zdolność widzenia pochodzi z korpusu pretreningowego o 30T tokenów, a nie z dołożonego później enkodera.
Artificial Analysis mierzy 50,2 tokena wyjściowego na sekundę — poniżej mediany klasy wynoszącej 67 t/s.
Architektura, wagi i licencje według karty modelu na Hugging Face oraz repozytorium zai-org/GLM-5.
Karta modelu
MoE, 45 warstw, 8 z 288 ekspertów.
Obliczenia jak w gęstym modelu 18B.
Io Net ogranicza do 262 144, Cloudflare do 1 310 720.
Inni podają nawet 1 179 648.
Wejście multimodalne, wyjście tekstowe.
Wagi i licencja
Użycie komercyjne i redystrybucja bez progów.
Jest też wariant -BF16 i kopia na ModelScope.
Brak osobnego repo; GLM-5 jest na Apache-2.0.
Zadanie na kilka węzłów, nie na stację roboczą.
Plus TokenSpeed, KTransformers i społecznościowe GGUF.
Karta modelu i API endpoints OpenRoutera, sierpień 2026.
Cennik / 04
Z.ai podaje 0,15 $ za wejście i 0,50 $ za wyjście na 1M tokenów. Cytowane wszędzie 0,075 $ / 0,25 $ to tymczasowy rabat startowy 50%.
Cena katalogowa
$0.15
Koszty GLM 5.3 Flash prognozuj według tej stawki, nie promocyjnej.
Cena katalogowa
$0.50
Stromy stosunek 1:3,3 — najpierw ogranicz długość odpowiedzi.
Cena katalogowa
$0.03
Jedna piąta świeżego wejścia — to właśnie czyni długi kontekst opłacalnym.
Niezależnie
$0.10
Artificial Analysis, przy proporcji cache/wejście/wyjście 7:2:1.
Benchmarki / 05
Z.ai publikuje własną tabelę i sam dobiera porównania. Przewaga nad GLM 5.2 oraz wyniki Artificial Analysis bronią się przy weryfikacji.
Dane Z.ai
GPT-5.6 Terra osiąga 87,4; przy trudnych zadaniach dystans rośnie.
Dane Z.ai
Ta sama rodzina i metoda, za dziesiątą część ceny. AutomationBench: 48,8 wobec 26,2.
Dane Z.ai
Wnioskowanie po dokumentach i obrazach — według producenta przed Opus 4.8.
Artificial Analysis
57
Pomiar niezależny, przy medianie około 27 dla podobnych modeli z otwartymi wagami.
Możliwości / 06
Zbudowany pod obudowy agentowe: sterowanie rozumowaniem, narzędzia, uporządkowane wyjście i streaming w oknie miliona tokenów.
Włączone domyślnie, z regulowanym poziomem wysiłku.
Narzędzia i wybór narzędzia; każdą akcję nadal waliduje twoja aplikacja.
Ograniczenie formatu odpowiedzi zwraca JSON gotowy do sparsowania.
1,47 s do pierwszego tokena bije medianę; przepustowość już nie.
Wklej zrzut ekranu, diagram albo nagranie ekranu razem z promptem.
Stawka 0,03 $ za wejście z cache utrzymuje niskie koszty kolejnych tur.
Porównanie / 07
Oba to tani wariant czołowej rodziny z wagami na MIT. Różnią się modalnościami, rozumowaniem i wymaganiami sprzętowymi.
Z.ai
Hybrydowe KDA plus rzadka uwaga MLA w wariancie NoPE.
Multimodalny od podstaw.
Limit wyjścia zależy od dostawcy.
Przed rabatem startowym.
MIT, ale zadanie na kilka węzłów.
DeepSeek
Domyślnie bez rozumowania.
Zrzuty ekranu trzeba najpierw przepisać.
Znacznie większy budżet na odpowiedź.
Od producenta, z łagodniejszym stosunkiem 1:2.
Mniejszy model, tańszy w serwowaniu.
Oba są na liście modeli glm5.app, więc ten sam prompt przejdzie przez każdy z nich.
Oś czasu premiery / 08
Sześć dni jako anonimowy ukryty model, a potem pełna premiera z otwartymi wagami.
`stealth/ox-alpha` trafia na OpenRouter bez ujawnionego dostawcy i bezpłatnie za token.
Pięciu największych odbiorców to agentowe narzędzia do kodu; OpenCode udostępnia model za darmo.
Z.ai potwierdza pochodzenie od Ox Alpha; karta modelu, wagi MIT i cennik pojawiają się razem.
Autorski silnik wywodzący się z SGLang, raportowany na około 3x. Dostawca nieujawniony.
`zai-org/GLM-5.3-Flash` plus wariant BF16 i kopia na ModelScope. Bez repozytorium na GitHubie.
Ceny — OpenRouter, kwantyzacje — Hugging Face. Po relacje z praktyki idź na Reddita, tam wciąż mówi się Ox Alpha.
Dla kogo / 09
Zespoły płacące stawki flagowca za pracę, która nigdy nie wymagała takiej głębi — i przypadki, gdy to zły wybór.
Wywołania narzędzi za dziesiątą część ceny tokena GLM 5.3 sprawiają, że długie pętle agentowe stają się opłacalne.
Okno miliona tokenów utrzymuje całą bazę kodu, więc pytania obejmujące wiele plików obywają się bez wyszukiwania.
Rozjechane układy, nagrania odtwarzające błąd, schematy na diagramach.
Zestaw go z DeepSeek V4 Flash i Qwen w czacie glm5.app.
Wagi na MIT i wsparcie vLLM są prawdziwe, ale 328 GB w FP8 wyklucza jedną maszynę.
Przy około 50 tokenach wyjścia na sekundę wypada gorzej niż większość modeli w tej cenie.
Trzy drogi: darmowy czat w przeglądarce, API glm5.app albo wagi MIT na własnym sprzęcie.
Wybierz GLM 5.3 Flash w czacie i dołącz zrzuty ekranu. Nowe konta dostają darmowe kredyty.
Wysyłaj zapytania zgodne z OpenAI na `https://glm5.app/api/v1`, podając ID modelu `glm-5.3-flash`.
Pobierz `zai-org/GLM-5.3-Flash` i serwuj go przez SGLang lub vLLM — około 328 GB w FP8.
Integration specimen
Endpoint Chat Completions zgodny z OpenAI. Użyj ID modelu `glm-5.3-flash` pod adresem `https://glm5.app/api/v1`.
Otwórz dokumentację APIcurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, ceny, benchmarki, parametry, Hugging Face, vLLM, DGX Spark i DeepSeek V4 Flash.
Tak — działał jako `stealth/ox-alpha` przez sześć dni od 20 sierpnia 2026 roku. Zapisane rozmowy z Ox Alpha są przepinane automatycznie.
Nie — to inne warianty, różnica w cenie sięga około 10x. Flash to multimodalny model 320B-A18B, a GLM 5.3 to tekstowy flagowiec.
Z.ai podaje 0,15 $ za 1M tokenów wejścia, 0,03 $ z cache i 0,50 $ za wyjście. Cytowane 0,075 $ / 0,25 $ to tymczasowy rabat startowy 50%.
Wersja zapoznawcza Ox Alpha była darmowa; teraz obowiązuje rozliczenie za użycie. Wciąż możesz przetestować model za darmo w czacie glm5.app.
320B łącznie, 18B aktywnych na token, 45 warstw kierujących do 8 z 288 ekspertów. Checkpoint FP8 zajmuje około 328 GB.
Wagi są na Hugging Face pod `zai-org/GLM-5.3-Flash` na licencji MIT. Nie ma dedykowanego repo na GitHubie — przepisy leżą w `zai-org/GLM-5`.
vLLM, SGLang, TokenSpeed i KTransformers są wspierane. 328 GB nie zmieści się w jednym DGX Spark; społeczność łączy dwa przy kwantyzacji 4-bitowej.
Flash, gdy potrzebujesz wejścia wizualnego lub rozumowania; DeepSeek V4 Flash, gdy liczy się łagodniejszy stosunek 1:2 albo wyjście 384K.
Większość relacji z praktyki powstała pod nazwą wersji zapoznawczej, więc na Reddicie szukaj raczej Ox Alpha.
Start here
Przepuść najtrudniejsze zadanie przez GLM 5.3 Flash za darmo w przeglądarce, a potem wepnij ID modelu w swój pipeline.