Harga resmi
$0.15
Per 1M token masukan
Hitung biaya GLM 5.3 Flash dari angka ini, bukan dari tarif promo.
Tingkat hemat dari Z.ai di keluarga GLM 5: Mixture-of-Experts 320B dengan 18B aktif, masukan teks, gambar, dan video, konteks 1M, serta bobot terbuka berlisensi MIT.
GLM 5.3 Flash dirilis pada 26 Agustus 2026, setelah enam hari beredar di OpenRouter sebagai model siluman Ox Alpha.
Hanya 8 dari 288 expert yang menyala per token: memori setara model 320B, komputasi setara 18B.
Kemampuan visualnya berasal dari korpus pralatih 30T token, bukan encoder yang dipasang belakangan.
Artificial Analysis mengukur 50,2 token keluaran per detik, di bawah median kelasnya yang 67 t/s.
Arsitektur, bobot, dan lisensi mengacu pada model card di Hugging Face serta repositori zai-org/GLM-5.
Model card
MoE, 45 lapisan, 8 dari 288 expert.
Beban komputasi setara model padat 18B.
Io Net dibatasi 262.144, Cloudflare 1.310.720.
Sebagian penyedia mencantumkan hingga 1.179.648.
Masukan multimodal, keluaran teks.
Bobot dan lisensi
Boleh dipakai komersial dan didistribusikan ulang, tanpa ambang.
Ada varian -BF16 dan mirror di ModelScope.
Tidak ada repo tersendiri; GLM-5 berlisensi Apache-2.0.
Pekerjaan multi-node, bukan satu workstation.
Plus TokenSpeed, KTransformers, dan GGUF komunitas.
Model card dan API endpoints OpenRouter, Agustus 2026.
Harga / 04
Z.ai mematok $0,15 untuk masukan dan $0,50 untuk keluaran per 1M token. Angka $0,075 / $0,25 yang dikutip di mana-mana adalah diskon peluncuran 50% yang sementara.
Harga resmi
$0.15
Hitung biaya GLM 5.3 Flash dari angka ini, bukan dari tarif promo.
Harga resmi
$0.50
Rasio 1:3,3 yang curam — batasi panjang keluaran lebih dulu.
Harga resmi
$0.03
Seperlima harga masukan baru — inilah yang membuat konteks panjang terjangkau.
Independen
$0.10
Artificial Analysis, dengan komposisi cache/masukan/keluaran 7:2:1.
Benchmark / 05
Z.ai menerbitkan tabelnya sendiri dan memilih pembandingnya sendiri. Selisih terhadap GLM 5.2 dan data Artificial Analysis tetap bertahan saat ditelaah.
Klaim Z.ai
GPT-5.6 Terra meraih 87,4; jaraknya melebar pada tugas sulit.
Klaim Z.ai
Keluarga dan metode yang sama, harga sepersepuluh. AutomationBench: 48,8 berbanding 26,2.
Klaim Z.ai
Penalaran dokumen dan visual, diklaim unggul atas Opus 4.8.
Artificial Analysis
57
Pengukuran independen, dibanding median ~27 untuk model bobot terbuka sekelas.
Kemampuan / 06
Dirancang untuk kerangka agen: kendali penalaran, tool calling, keluaran terstruktur, dan streaming di jendela sejuta token.
Aktif secara bawaan, dengan tingkat effort yang bisa diatur.
Mendukung tool dan pemilihan tool; validasi tiap aksi tetap tugas aplikasi Anda.
Batasan format respons menghasilkan JSON yang siap diparsing.
Token pertama dalam 1,47 detik mengalahkan median; throughput-nya tidak.
Tempelkan tangkapan layar, diagram, atau rekaman layar bersama prompt Anda.
Tarif masukan tercache $0,03 membuat giliran berikutnya tetap murah.
Perbandingan / 07
Keduanya tingkat murah dari keluarga papan atas yang merilis bobot MIT. Bedanya ada di modalitas, penalaran, dan kebutuhan perangkat keras.
Z.ai
KDA hibrida plus atensi MLA sparse NoPE.
Multimodal sejak awal.
Batas keluaran berbeda-beda per penyedia.
Sebelum diskon peluncuran.
MIT, tetapi butuh multi-node.
DeepSeek
Tanpa penalaran secara bawaan.
Tangkapan layar harus ditranskripsikan dulu.
Anggaran respons jauh lebih besar.
Langsung dari penyedia, rasio 1:2 yang lebih landai.
Model lebih kecil, lebih murah dilayani.
Keduanya ada di daftar model glm5.app, jadi satu prompt bisa dijalankan di masing-masing.
Linimasa rilis / 08
Enam hari sebagai model siluman anonim, lalu peluncuran penuh dengan bobot terbuka.
`stealth/ox-alpha` hadir di OpenRouter tanpa penyedia yang diungkap, gratis per token.
Lima pemakai terbesar semuanya perkakas coding agentik; OpenCode menyediakannya gratis.
Z.ai mengonfirmasi asal-usul Ox Alpha; model card, bobot MIT, dan harga rilis bersamaan.
Mesin khusus turunan SGLang, dilaporkan sekitar 3x. Vendornya tidak diungkap.
`zai-org/GLM-5.3-Flash` plus varian BF16 dan mirror ModelScope. Tidak ada repo GitHub.
OpenRouter unggul soal harga, Hugging Face soal kuantisasi. Untuk laporan lapangan, Reddit masih menyebutnya Ox Alpha.
Untuk siapa / 09
Tim yang membayar tarif model unggulan untuk pekerjaan yang tak pernah butuh kedalaman itu — sekaligus kapan pilihan ini keliru.
Tool calling dengan sepersepuluh harga token GLM 5.3 membuat loop agen yang panjang jadi terjangkau.
Jendela sejuta token menahan basis kode tetap di konteks, sehingga pertanyaan lintas berkas tak perlu retrieval.
Tata letak berantakan, rekaman langkah reproduksi, skema dalam bentuk diagram.
Bandingkan dengan DeepSeek V4 Flash dan Qwen langsung di chat glm5.app.
Bobot MIT dan dukungan vLLM memang nyata, tetapi 328 GB FP8 mustahil di satu mesin.
Dengan sekitar 50 token keluaran per detik, ia tertinggal dari kebanyakan model sekelas harganya.
Ada tiga jalur: chat gratis di browser, API glm5.app, atau bobot MIT di perangkat keras Anda sendiri.
Pilih GLM 5.3 Flash di chat lalu lampirkan tangkapan layar. Akun baru mendapat kredit gratis.
Kirim permintaan kompatibel OpenAI ke `https://glm5.app/api/v1` dengan ID model `glm-5.3-flash`.
Unduh `zai-org/GLM-5.3-Flash` lalu layani dengan SGLang atau vLLM — sekitar 328 GB dalam FP8.
Integration specimen
Endpoint Chat Completions yang kompatibel dengan OpenAI. Gunakan ID model `glm-5.3-flash` di `https://glm5.app/api/v1`.
Buka dokumentasi APIcurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, harga, benchmark, parameter, Hugging Face, vLLM, DGX Spark, dan DeepSeek V4 Flash.
Ya — ia berjalan sebagai `stealth/ox-alpha` selama enam hari sejak 20 Agustus 2026. Chat Ox Alpha yang tersimpan dipetakan ulang secara otomatis.
Tidak — keduanya tingkat berbeda dengan selisih harga sekitar 10x. Flash adalah model multimodal 320B-A18B; GLM 5.3 adalah unggulan untuk teks.
Z.ai mematok $0,15 per 1M masukan, $0,03 tercache, dan $0,50 keluaran. Angka $0,075 / $0,25 yang dikutip adalah diskon peluncuran 50% yang sementara.
Pratinjau Ox Alpha gratis; sekarang ditagih sesuai pemakaian. Anda tetap bisa mencobanya gratis di chat glm5.app.
Total 320B, aktif 18B per token, 45 lapisan yang merutekan 8 dari 288 expert. Checkpoint FP8-nya sekitar 328 GB.
Bobotnya ada di Hugging Face pada `zai-org/GLM-5.3-Flash` dengan lisensi MIT. Tidak ada repo GitHub khusus — resepnya ada di `zai-org/GLM-5`.
vLLM, SGLang, TokenSpeed, dan KTransformers didukung. 328 GB tidak muat di satu DGX Spark; komunitas melaporkan menggabungkan dua unit pada 4 bit.
Flash untuk masukan visual atau penalaran; DeepSeek V4 Flash untuk rasio 1:2 yang lebih landai atau keluaran 384K.
Sebagian besar laporan penggunaan ditulis dengan nama pratinjaunya, jadi carilah Ox Alpha di Reddit.
Start here
Jalankan tugas tersulit Anda lewat GLM 5.3 Flash gratis di browser, lalu pasang ID modelnya ke dalam pipeline Anda.