GLM 5.3 Flash

Z.ai'nin GLM 5 ailesindeki verimlilik katmanı: 18B aktif parametreyle çalışan 320B'lik bir Mixture-of-Experts; metin, görsel ve video girişi, 1M bağlam ve açık MIT ağırlıkları.

GLM 5 ile üret

GLM 5.3 Flash nedir?

GLM 5.3 Flash 26 Ağustos 2026'da yayımlandı; öncesinde altı gün boyunca OpenRouter'da gizli model Ox Alpha olarak çalışıyordu.

01

Toplam 320B, aktif 18B

Her token için 288 uzmandan yalnızca 8'i devreye girer: bellek 320B'lik, hesap yükü 18B'lik.

02

Doğuştan çok modlu

Görme yetisi 30T token'lık ön eğitim külliyatından geliyor, sonradan eklenen bir kodlayıcıdan değil.

03

Flash ucuz demek, hızlı değil

Artificial Analysis saniyede 50,2 çıktı token'ı ölçüyor; sınıf ortancası olan 67 t/s'nin altında.

GLM 5.3 Flash teknik özellikleri, boyutu ve açık kaynak durumu

Mimari, ağırlıklar ve lisanslar Hugging Face model kartı ile zai-org/GLM-5 deposundan alınmıştır.

Model kartı

Mimari

Toplam parametre
320B

MoE, 45 katman, 288 uzmandan 8'i.

Aktif parametre
18B

18B'lik yoğun bir modelin hesap yükü.

Bağlam penceresi
1.048.576 token

Io Net 262.144 ile, Cloudflare 1.310.720 ile sınırlı.

Azami çıktı
131.072 token

Bazı sağlayıcılar 1.179.648'e kadar belirtiyor.

Modalite
Metin, görsel, video

Giriş çok modlu, çıkış metin.

Ağırlıklar ve lisans

Boyut ve lisans

Ağırlık lisansı
MIT

Ticari kullanım ve yeniden dağıtım, eşik yok.

Hugging Face
zai-org/GLM-5.3-Flash

Bir -BF16 sürümü ve ModelScope aynası var.

GitHub
zai-org/GLM-5

Ayrı depo yok; GLM-5 Apache-2.0 lisanslı.

Checkpoint boyutu
~328 GB (FP8)

İş istasyonu değil, çok düğümlü bir iş.

Sunum yığınları
SGLang, vLLM

Ayrıca TokenSpeed, KTransformers ve topluluk GGUF'ları.

Model kartı ve OpenRouter endpoints API'si, Ağustos 2026.

Fiyatlandırma / 04

GLM 5.3 Flash fiyatları: liste fiyatı ve lansman indirimi

Z.ai 1M token başına 0,15 $ giriş ve 0,50 $ çıkış açıklıyor. Her yerde alıntılanan 0,075 $ / 0,25 $ ise geçici %50'lik lansman indirimidir.

01

Liste fiyatı

$0.15

1M giriş token'ı başına

GLM 5.3 Flash maliyetini kampanya fiyatıyla değil, bu rakamla planlayın.

02

Liste fiyatı

$0.50

1M çıkış token'ı başına

Sert bir 1:3,3 oranı — önce çıktıya tavan koyun.

03

Liste fiyatı

$0.03

1M önbellekli giriş token'ı başına

Yeni girişin beşte biri — uzun bağlamı karşılanabilir kılan şey bu.

04

Bağımsız

$0.10

Karma fiyat

Artificial Analysis, 7:2:1 önbellek/giriş/çıkış karışımına göre.

Aynı ağırlıklarda 2 kat fiyat farkı: Z.AI, Novita ve GMICloud indirim yapıyor, diğerleri liste fiyatı alıyor.

Testler / 05

GLM 5.3 Flash test sonuçları: üretici verileri ve bağımsız ölçümler

Z.ai kendi tablosunu yayımlıyor ve karşılaştırmaları kendisi seçiyor. GLM 5.2 ile arasındaki fark ve Artificial Analysis verileri incelemeye dayanıyor.

01

Z.ai verisi

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra 87,4 alıyor; zor görevlerde fark açılıyor.

02

Z.ai verisi

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

Aynı aile, aynı yöntem, onda bir fiyat. AutomationBench: 48,8'e karşı 26,2.

03

Z.ai verisi

OfficeQA Pro

5.3 Flash62.4

Belge ve görsel muhakemede, üreticiye göre Opus 4.8'in önünde.

04

Artificial Analysis

57

Intelligence Index

Bağımsız ölçüm; benzer açık ağırlıklı modellerin ortancası yaklaşık 27.

GLM 5.3 Flash için en güvenilir test, kendi iş listenizdir.

Yetenekler / 06

GLM 5.3 Flash neler yapabilir

Ajan koşumları için tasarlandı: muhakeme kontrolü, araçlar, yapılandırılmış çıktı ve bir milyon token'lık pencerede akış.

01

Efor kontrollü muhakeme

Varsayılan olarak açık, efor seviyesi ayarlanabilir.

02

Fonksiyon çağırma

Araçlar ve araç seçimi; her eylemi yine de uygulamanız doğrulamalı.

03

Yapılandırılmış çıktı

Yanıt biçimi kısıtı, ayrıştırılabilir JSON döndürür.

04

Akışlı yanıtlar

İlk token'a kadar 1,47 sn ortancayı geçiyor; işlem hacmi ise geçmiyor.

05

Görsel ve video girişi

Ekran görüntüsü, diyagram veya ekran kaydını isteminizle birlikte yapıştırın.

06

Bir milyon token'lık bağlam

0,03 $'lık önbellekli giriş ücreti, sonraki turları ucuz tutuyor.

Karşılaştırma / 07

GLM 5.3 Flash ile DeepSeek V4 Flash

İkisi de MIT ağırlıklarıyla çıkan üst düzey bir ailenin ucuz katmanı. Modalite, muhakeme ve donanımda ayrışıyorlar.

Z.ai

GLM 5.3 Flash

Mimari
320B / 18B aktif

Hibrit KDA ve NoPE seyrek MLA dikkat mekanizması.

Giriş
Metin, görsel, video

Doğuştan çok modlu.

Bağlam / çıktı
1M / 131K

Çıktı tavanı sağlayıcıya göre değişiyor.

Liste fiyatı
$0.15 / $0.50

Lansman indirimi öncesi.

Kendi sunucunda
~328 GB FP8

MIT, ama çok düğümlü bir iş.

DeepSeek

DeepSeek V4 Flash

Mimari
284B / ~13B aktif

Varsayılan olarak muhakemesiz.

Giriş
Yalnızca metin

Ekran görüntülerinin önce yazıya dökülmesi gerekir.

Bağlam / çıktı
1M / 384K

Yanıt için çok daha geniş bütçe.

Liste fiyatı
$0.14 / $0.28

Doğrudan üreticiden, daha düz bir 1:2 oranıyla.

Kendi sunucunda
MIT ağırlıkları

Daha küçük model, sunumu daha ucuz.

İkisi de glm5.app model listesinde, yani aynı istemi her ikisinden de geçirebilirsiniz.

Sürüm zaman çizelgesi / 08

GLM 5.3 Flash zaman çizelgesi: Ox Alpha'dan açık ağırlıklara

Altı gün isimsiz gizli model, ardından açık ağırlıklarla tam bir lansman.

01

20 Ağu — Ox Alpha ortaya çıkıyor

`stealth/ox-alpha`, sağlayıcısı açıklanmadan OpenRouter'a düşüyor ve token başına ücretsiz.

02

20-26 Ağu — ajan araçları akın ediyor

En çok tüketen beş uygulama ajan tabanlı kodlama araçları; OpenCode modeli ücretsiz sunuyor.

03

26 Ağu — GLM 5.3 Flash yayımlanıyor

Z.ai Ox Alpha bağlantısını doğruluyor; model kartı, MIT ağırlıkları ve fiyatlar birlikte geliyor.

04

Önizleme Çin üretimi çiplerde çalıştı

SGLang türevi özel bir motor, yaklaşık 3 kat olarak raporlandı. Tedarikçi açıklanmadı.

05

Ağırlıklar Hugging Face'e çıktı

`zai-org/GLM-5.3-Flash`, ayrıca bir BF16 sürümü ve ModelScope aynası. GitHub deposu yok.

06

Haberler önce nerede çıkıyor

Fiyatta OpenRouter, niceleme konusunda Hugging Face önde. Saha deneyimleri içinse Reddit hâlâ Ox Alpha diyor.

Kimin için / 09

GLM 5.3 Flash'ı kimler kullanıyor?

Hiç o derinliğe ihtiyaç duymamış işler için amiral gemisi ücreti ödeyen ekipler — ve modelin yanlış tercih olduğu durumlar.

01

Yüksek hacimli ajan tabanlı kodlama

GLM 5.3 token fiyatının onda birine araç çağırmak, uzun ajan döngülerini karşılanabilir kılıyor.

02

Depo ölçeğinde çalışma

Bir milyon token'lık pencere kod tabanını bellekte tutuyor, böylece dosyalar arası sorular arama gerektirmiyor.

03

Görsel hata ayıklama

Bozulan yerleşimler, hatayı gösteren ekran kayıtları, diyagrama dökülmüş şemalar.

04

Z.ai'yi rakiplerle kıyaslayan ekipler

glm5.app sohbetinde DeepSeek V4 Flash ve Qwen ile karşılaştırın.

05

Küme sahibi kendi sunucusunda çalıştıranlar

MIT ağırlıkları ve vLLM desteği gerçek, ama FP8'de 328 GB tek makineyi devre dışı bırakıyor.

06

Gecikmeye duyarlı arayüzler için uygun değil

Saniyede yaklaşık 50 çıktı token'ıyla aynı fiyat sınıfındaki çoğu modelin gerisinde kalıyor.

GLM 5.3 Flash nasıl kullanılır / 10

GLM 5.3 Flash nasıl kullanılır

Üç yol var: tarayıcıda ücretsiz sohbet, glm5.app API'si ya da kendi donanımınızda MIT ağırlıkları.

01
01

GLM 5.3 Flash ile ücretsiz sohbet edin

Sohbette GLM 5.3 Flash'ı seçip ekran görüntüsü ekleyin. Yeni hesaplara ücretsiz kredi tanımlanıyor.

02
02

glm5.app API'sini çağırın

`https://glm5.app/api/v1` adresine OpenAI uyumlu istekler gönderin, model kimliği `glm-5.3-flash` olsun.

03
03

Ya da ağırlıkları kendiniz barındırın

`zai-org/GLM-5.3-Flash`'ı indirip SGLang veya vLLM ile sunun — FP8'de yaklaşık 328 GB.

Integration specimen

GLM 5.3 Flash API'siyle başlayın

OpenAI uyumlu bir Chat Completions uç noktası. `https://glm5.app/api/v1` adresinde `glm-5.3-flash` model kimliğini kullanın.

API belgelerini aç
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

GLM 5.3 Flash sıkça sorulan sorular

Ox Alpha, fiyatlar, testler, parametreler, Hugging Face, vLLM, DGX Spark ve DeepSeek V4 Flash.

GLM 5.3 Flash, Ox Alpha ile aynı model mi?

Evet — 20 Ağustos 2026'dan itibaren altı gün boyunca `stealth/ox-alpha` olarak çalıştı. Kayıtlı Ox Alpha sohbetleri otomatik olarak yeni modele bağlanıyor.


GLM 5.3 Flash ile GLM 5.3 aynı şey mi?

Hayır — farklı katmanlar ve aralarında yaklaşık 10 kat fiyat farkı var. Flash, 320B-A18B çok modlu model; GLM 5.3 ise metin amiral gemisi.


GLM 5.3 Flash fiyatı nedir?

Z.ai 1M giriş için 0,15 $, önbellek için 0,03 $ ve çıkış için 0,50 $ açıklıyor. Alıntılanan 0,075 $ / 0,25 $ geçici %50 lansman indirimidir.


GLM 5.3 Flash ücretsiz mi?

Ox Alpha önizlemesi ücretsizdi; artık kullanıma göre ücretlendiriliyor. Yine de glm5.app sohbetinde ücretsiz deneyebilirsiniz.


GLM 5.3 Flash kaç parametreye sahip ve ne kadar yer kaplıyor?

Toplam 320B, token başına 18B aktif; 45 katman 288 uzmandan 8'ine yönlendiriyor. FP8 checkpoint'i yaklaşık 328 GB.


GLM 5.3 Flash Hugging Face ve GitHub'da mı?

Ağırlıklar Hugging Face'te `zai-org/GLM-5.3-Flash` altında MIT lisansıyla. Ayrı bir GitHub deposu yok — tarifler `zai-org/GLM-5` içinde.


GLM 5.3 Flash'ı vLLM veya DGX Spark üzerinde çalıştırabilir miyim?

vLLM, SGLang, TokenSpeed ve KTransformers destekleniyor. 328 GB tek bir DGX Spark'a sığmaz; toplulukta 4 bitle iki cihazı birleştirdiği bildiriliyor.


GLM 5.3 Flash mı DeepSeek V4 Flash mı?

Görsel giriş veya muhakeme gerekiyorsa Flash; daha düz 1:2 oranı ya da 384K çıktı gerekiyorsa DeepSeek V4 Flash.


Reddit'te GLM 5.3 Flash hakkında ne deniyor?

Uygulamalı deneyimlerin çoğu önizleme adıyla yazıldı; Reddit'te bunun yerine Ox Alpha aratın.


Start here

GLM 5.3 Flash'ı bugün kullanmaya başlayın

En zorlu işinizi tarayıcıda ücretsiz olarak GLM 5.3 Flash'tan geçirin, ardından model kimliğini kendi hattınıza bağlayın.