Liste fiyatı
$0.15
1M giriş token'ı başına
GLM 5.3 Flash maliyetini kampanya fiyatıyla değil, bu rakamla planlayın.
Z.ai'nin GLM 5 ailesindeki verimlilik katmanı: 18B aktif parametreyle çalışan 320B'lik bir Mixture-of-Experts; metin, görsel ve video girişi, 1M bağlam ve açık MIT ağırlıkları.
GLM 5.3 Flash 26 Ağustos 2026'da yayımlandı; öncesinde altı gün boyunca OpenRouter'da gizli model Ox Alpha olarak çalışıyordu.
Her token için 288 uzmandan yalnızca 8'i devreye girer: bellek 320B'lik, hesap yükü 18B'lik.
Görme yetisi 30T token'lık ön eğitim külliyatından geliyor, sonradan eklenen bir kodlayıcıdan değil.
Artificial Analysis saniyede 50,2 çıktı token'ı ölçüyor; sınıf ortancası olan 67 t/s'nin altında.
Mimari, ağırlıklar ve lisanslar Hugging Face model kartı ile zai-org/GLM-5 deposundan alınmıştır.
Model kartı
MoE, 45 katman, 288 uzmandan 8'i.
18B'lik yoğun bir modelin hesap yükü.
Io Net 262.144 ile, Cloudflare 1.310.720 ile sınırlı.
Bazı sağlayıcılar 1.179.648'e kadar belirtiyor.
Giriş çok modlu, çıkış metin.
Ağırlıklar ve lisans
Ticari kullanım ve yeniden dağıtım, eşik yok.
Bir -BF16 sürümü ve ModelScope aynası var.
Ayrı depo yok; GLM-5 Apache-2.0 lisanslı.
İş istasyonu değil, çok düğümlü bir iş.
Ayrıca TokenSpeed, KTransformers ve topluluk GGUF'ları.
Model kartı ve OpenRouter endpoints API'si, Ağustos 2026.
Fiyatlandırma / 04
Z.ai 1M token başına 0,15 $ giriş ve 0,50 $ çıkış açıklıyor. Her yerde alıntılanan 0,075 $ / 0,25 $ ise geçici %50'lik lansman indirimidir.
Liste fiyatı
$0.15
GLM 5.3 Flash maliyetini kampanya fiyatıyla değil, bu rakamla planlayın.
Liste fiyatı
$0.50
Sert bir 1:3,3 oranı — önce çıktıya tavan koyun.
Liste fiyatı
$0.03
Yeni girişin beşte biri — uzun bağlamı karşılanabilir kılan şey bu.
Bağımsız
$0.10
Artificial Analysis, 7:2:1 önbellek/giriş/çıkış karışımına göre.
Testler / 05
Z.ai kendi tablosunu yayımlıyor ve karşılaştırmaları kendisi seçiyor. GLM 5.2 ile arasındaki fark ve Artificial Analysis verileri incelemeye dayanıyor.
Z.ai verisi
GPT-5.6 Terra 87,4 alıyor; zor görevlerde fark açılıyor.
Z.ai verisi
Aynı aile, aynı yöntem, onda bir fiyat. AutomationBench: 48,8'e karşı 26,2.
Z.ai verisi
Belge ve görsel muhakemede, üreticiye göre Opus 4.8'in önünde.
Artificial Analysis
57
Bağımsız ölçüm; benzer açık ağırlıklı modellerin ortancası yaklaşık 27.
Yetenekler / 06
Ajan koşumları için tasarlandı: muhakeme kontrolü, araçlar, yapılandırılmış çıktı ve bir milyon token'lık pencerede akış.
Varsayılan olarak açık, efor seviyesi ayarlanabilir.
Araçlar ve araç seçimi; her eylemi yine de uygulamanız doğrulamalı.
Yanıt biçimi kısıtı, ayrıştırılabilir JSON döndürür.
İlk token'a kadar 1,47 sn ortancayı geçiyor; işlem hacmi ise geçmiyor.
Ekran görüntüsü, diyagram veya ekran kaydını isteminizle birlikte yapıştırın.
0,03 $'lık önbellekli giriş ücreti, sonraki turları ucuz tutuyor.
Karşılaştırma / 07
İkisi de MIT ağırlıklarıyla çıkan üst düzey bir ailenin ucuz katmanı. Modalite, muhakeme ve donanımda ayrışıyorlar.
Z.ai
Hibrit KDA ve NoPE seyrek MLA dikkat mekanizması.
Doğuştan çok modlu.
Çıktı tavanı sağlayıcıya göre değişiyor.
Lansman indirimi öncesi.
MIT, ama çok düğümlü bir iş.
DeepSeek
Varsayılan olarak muhakemesiz.
Ekran görüntülerinin önce yazıya dökülmesi gerekir.
Yanıt için çok daha geniş bütçe.
Doğrudan üreticiden, daha düz bir 1:2 oranıyla.
Daha küçük model, sunumu daha ucuz.
İkisi de glm5.app model listesinde, yani aynı istemi her ikisinden de geçirebilirsiniz.
Sürüm zaman çizelgesi / 08
Altı gün isimsiz gizli model, ardından açık ağırlıklarla tam bir lansman.
`stealth/ox-alpha`, sağlayıcısı açıklanmadan OpenRouter'a düşüyor ve token başına ücretsiz.
En çok tüketen beş uygulama ajan tabanlı kodlama araçları; OpenCode modeli ücretsiz sunuyor.
Z.ai Ox Alpha bağlantısını doğruluyor; model kartı, MIT ağırlıkları ve fiyatlar birlikte geliyor.
SGLang türevi özel bir motor, yaklaşık 3 kat olarak raporlandı. Tedarikçi açıklanmadı.
`zai-org/GLM-5.3-Flash`, ayrıca bir BF16 sürümü ve ModelScope aynası. GitHub deposu yok.
Fiyatta OpenRouter, niceleme konusunda Hugging Face önde. Saha deneyimleri içinse Reddit hâlâ Ox Alpha diyor.
Kimin için / 09
Hiç o derinliğe ihtiyaç duymamış işler için amiral gemisi ücreti ödeyen ekipler — ve modelin yanlış tercih olduğu durumlar.
GLM 5.3 token fiyatının onda birine araç çağırmak, uzun ajan döngülerini karşılanabilir kılıyor.
Bir milyon token'lık pencere kod tabanını bellekte tutuyor, böylece dosyalar arası sorular arama gerektirmiyor.
Bozulan yerleşimler, hatayı gösteren ekran kayıtları, diyagrama dökülmüş şemalar.
glm5.app sohbetinde DeepSeek V4 Flash ve Qwen ile karşılaştırın.
MIT ağırlıkları ve vLLM desteği gerçek, ama FP8'de 328 GB tek makineyi devre dışı bırakıyor.
Saniyede yaklaşık 50 çıktı token'ıyla aynı fiyat sınıfındaki çoğu modelin gerisinde kalıyor.
Üç yol var: tarayıcıda ücretsiz sohbet, glm5.app API'si ya da kendi donanımınızda MIT ağırlıkları.
Sohbette GLM 5.3 Flash'ı seçip ekran görüntüsü ekleyin. Yeni hesaplara ücretsiz kredi tanımlanıyor.
`https://glm5.app/api/v1` adresine OpenAI uyumlu istekler gönderin, model kimliği `glm-5.3-flash` olsun.
`zai-org/GLM-5.3-Flash`'ı indirip SGLang veya vLLM ile sunun — FP8'de yaklaşık 328 GB.
Integration specimen
OpenAI uyumlu bir Chat Completions uç noktası. `https://glm5.app/api/v1` adresinde `glm-5.3-flash` model kimliğini kullanın.
API belgelerini açcurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, fiyatlar, testler, parametreler, Hugging Face, vLLM, DGX Spark ve DeepSeek V4 Flash.
Evet — 20 Ağustos 2026'dan itibaren altı gün boyunca `stealth/ox-alpha` olarak çalıştı. Kayıtlı Ox Alpha sohbetleri otomatik olarak yeni modele bağlanıyor.
Hayır — farklı katmanlar ve aralarında yaklaşık 10 kat fiyat farkı var. Flash, 320B-A18B çok modlu model; GLM 5.3 ise metin amiral gemisi.
Z.ai 1M giriş için 0,15 $, önbellek için 0,03 $ ve çıkış için 0,50 $ açıklıyor. Alıntılanan 0,075 $ / 0,25 $ geçici %50 lansman indirimidir.
Ox Alpha önizlemesi ücretsizdi; artık kullanıma göre ücretlendiriliyor. Yine de glm5.app sohbetinde ücretsiz deneyebilirsiniz.
Toplam 320B, token başına 18B aktif; 45 katman 288 uzmandan 8'ine yönlendiriyor. FP8 checkpoint'i yaklaşık 328 GB.
Ağırlıklar Hugging Face'te `zai-org/GLM-5.3-Flash` altında MIT lisansıyla. Ayrı bir GitHub deposu yok — tarifler `zai-org/GLM-5` içinde.
vLLM, SGLang, TokenSpeed ve KTransformers destekleniyor. 328 GB tek bir DGX Spark'a sığmaz; toplulukta 4 bitle iki cihazı birleştirdiği bildiriliyor.
Görsel giriş veya muhakeme gerekiyorsa Flash; daha düz 1:2 oranı ya da 384K çıktı gerekiyorsa DeepSeek V4 Flash.
Uygulamalı deneyimlerin çoğu önizleme adıyla yazıldı; Reddit'te bunun yerine Ox Alpha aratın.
Start here
En zorlu işinizi tarayıcıda ücretsiz olarak GLM 5.3 Flash'tan geçirin, ardından model kimliğini kendi hattınıza bağlayın.