GLM 5.3 Flash

Tingkat hemat dari Z.ai di keluarga GLM 5: Mixture-of-Experts 320B dengan 18B aktif, masukan teks, gambar, dan video, konteks 1M, serta bobot terbuka berlisensi MIT.

Berkarya dengan GLM 5

Apa itu GLM 5.3 Flash?

GLM 5.3 Flash dirilis pada 26 Agustus 2026, setelah enam hari beredar di OpenRouter sebagai model siluman Ox Alpha.

01

Total 320B, aktif 18B

Hanya 8 dari 288 expert yang menyala per token: memori setara model 320B, komputasi setara 18B.

02

Multimodal sejak awal

Kemampuan visualnya berasal dari korpus pralatih 30T token, bukan encoder yang dipasang belakangan.

03

Flash berarti murah, bukan cepat

Artificial Analysis mengukur 50,2 token keluaran per detik, di bawah median kelasnya yang 67 t/s.

Spesifikasi, ukuran, dan status open source GLM 5.3 Flash

Arsitektur, bobot, dan lisensi mengacu pada model card di Hugging Face serta repositori zai-org/GLM-5.

Model card

Arsitektur

Total parameter
320B

MoE, 45 lapisan, 8 dari 288 expert.

Parameter aktif
18B

Beban komputasi setara model padat 18B.

Jendela konteks
1.048.576 token

Io Net dibatasi 262.144, Cloudflare 1.310.720.

Keluaran maksimum
131.072 token

Sebagian penyedia mencantumkan hingga 1.179.648.

Modalitas
Teks, gambar, video

Masukan multimodal, keluaran teks.

Bobot dan lisensi

Ukuran dan lisensi

Lisensi bobot
MIT

Boleh dipakai komersial dan didistribusikan ulang, tanpa ambang.

Hugging Face
zai-org/GLM-5.3-Flash

Ada varian -BF16 dan mirror di ModelScope.

GitHub
zai-org/GLM-5

Tidak ada repo tersendiri; GLM-5 berlisensi Apache-2.0.

Ukuran checkpoint
~328 GB (FP8)

Pekerjaan multi-node, bukan satu workstation.

Stack serving
SGLang, vLLM

Plus TokenSpeed, KTransformers, dan GGUF komunitas.

Model card dan API endpoints OpenRouter, Agustus 2026.

Harga / 04

Harga GLM 5.3 Flash: harga resmi vs diskon peluncuran

Z.ai mematok $0,15 untuk masukan dan $0,50 untuk keluaran per 1M token. Angka $0,075 / $0,25 yang dikutip di mana-mana adalah diskon peluncuran 50% yang sementara.

01

Harga resmi

$0.15

Per 1M token masukan

Hitung biaya GLM 5.3 Flash dari angka ini, bukan dari tarif promo.

02

Harga resmi

$0.50

Per 1M token keluaran

Rasio 1:3,3 yang curam — batasi panjang keluaran lebih dulu.

03

Harga resmi

$0.03

Per 1M token masukan tercache

Seperlima harga masukan baru — inilah yang membuat konteks panjang terjangkau.

04

Independen

$0.10

Harga campuran

Artificial Analysis, dengan komposisi cache/masukan/keluaran 7:2:1.

Selisih 2x untuk bobot yang sama: Z.AI, Novita, dan GMICloud memberi diskon; sisanya memakai harga resmi.

Benchmark / 05

Benchmark GLM 5.3 Flash: klaim vendor dan pengukuran independen

Z.ai menerbitkan tabelnya sendiri dan memilih pembandingnya sendiri. Selisih terhadap GLM 5.2 dan data Artificial Analysis tetap bertahan saat ditelaah.

01

Klaim Z.ai

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra meraih 87,4; jaraknya melebar pada tugas sulit.

02

Klaim Z.ai

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

Keluarga dan metode yang sama, harga sepersepuluh. AutomationBench: 48,8 berbanding 26,2.

03

Klaim Z.ai

OfficeQA Pro

5.3 Flash62.4

Penalaran dokumen dan visual, diklaim unggul atas Opus 4.8.

04

Artificial Analysis

57

Intelligence Index

Pengukuran independen, dibanding median ~27 untuk model bobot terbuka sekelas.

Benchmark GLM 5.3 Flash paling tepercaya adalah backlog Anda sendiri.

Kemampuan / 06

Apa yang bisa dilakukan GLM 5.3 Flash

Dirancang untuk kerangka agen: kendali penalaran, tool calling, keluaran terstruktur, dan streaming di jendela sejuta token.

01

Penalaran dengan kendali effort

Aktif secara bawaan, dengan tingkat effort yang bisa diatur.

02

Function calling

Mendukung tool dan pemilihan tool; validasi tiap aksi tetap tugas aplikasi Anda.

03

Keluaran terstruktur

Batasan format respons menghasilkan JSON yang siap diparsing.

04

Respons streaming

Token pertama dalam 1,47 detik mengalahkan median; throughput-nya tidak.

05

Masukan gambar dan video

Tempelkan tangkapan layar, diagram, atau rekaman layar bersama prompt Anda.

06

Konteks sejuta token

Tarif masukan tercache $0,03 membuat giliran berikutnya tetap murah.

Perbandingan / 07

GLM 5.3 Flash vs DeepSeek V4 Flash

Keduanya tingkat murah dari keluarga papan atas yang merilis bobot MIT. Bedanya ada di modalitas, penalaran, dan kebutuhan perangkat keras.

Z.ai

GLM 5.3 Flash

Arsitektur
320B / 18B aktif

KDA hibrida plus atensi MLA sparse NoPE.

Masukan
Teks, gambar, video

Multimodal sejak awal.

Konteks / keluaran
1M / 131K

Batas keluaran berbeda-beda per penyedia.

Harga resmi
$0.15 / $0.50

Sebelum diskon peluncuran.

Hosting sendiri
~328 GB FP8

MIT, tetapi butuh multi-node.

DeepSeek

DeepSeek V4 Flash

Arsitektur
284B / ~13B aktif

Tanpa penalaran secara bawaan.

Masukan
Hanya teks

Tangkapan layar harus ditranskripsikan dulu.

Konteks / keluaran
1M / 384K

Anggaran respons jauh lebih besar.

Harga resmi
$0.14 / $0.28

Langsung dari penyedia, rasio 1:2 yang lebih landai.

Hosting sendiri
Bobot MIT

Model lebih kecil, lebih murah dilayani.

Keduanya ada di daftar model glm5.app, jadi satu prompt bisa dijalankan di masing-masing.

Linimasa rilis / 08

Linimasa GLM 5.3 Flash, dari Ox Alpha ke bobot terbuka

Enam hari sebagai model siluman anonim, lalu peluncuran penuh dengan bobot terbuka.

01

20 Agu — Ox Alpha muncul

`stealth/ox-alpha` hadir di OpenRouter tanpa penyedia yang diungkap, gratis per token.

02

20-26 Agu — perkakas agen berdatangan

Lima pemakai terbesar semuanya perkakas coding agentik; OpenCode menyediakannya gratis.

03

26 Agu — GLM 5.3 Flash diluncurkan

Z.ai mengonfirmasi asal-usul Ox Alpha; model card, bobot MIT, dan harga rilis bersamaan.

04

Pratinjaunya berjalan di cip Tiongkok

Mesin khusus turunan SGLang, dilaporkan sekitar 3x. Vendornya tidak diungkap.

05

Bobot dirilis di Hugging Face

`zai-org/GLM-5.3-Flash` plus varian BF16 dan mirror ModelScope. Tidak ada repo GitHub.

06

Di mana kabarnya muncul lebih dulu

OpenRouter unggul soal harga, Hugging Face soal kuantisasi. Untuk laporan lapangan, Reddit masih menyebutnya Ox Alpha.

Untuk siapa / 09

Siapa yang memakai GLM 5.3 Flash?

Tim yang membayar tarif model unggulan untuk pekerjaan yang tak pernah butuh kedalaman itu — sekaligus kapan pilihan ini keliru.

01

Coding agentik bervolume tinggi

Tool calling dengan sepersepuluh harga token GLM 5.3 membuat loop agen yang panjang jadi terjangkau.

02

Pekerjaan skala repositori

Jendela sejuta token menahan basis kode tetap di konteks, sehingga pertanyaan lintas berkas tak perlu retrieval.

03

Debugging visual

Tata letak berantakan, rekaman langkah reproduksi, skema dalam bentuk diagram.

04

Tim yang membandingkan Z.ai dengan pesaing

Bandingkan dengan DeepSeek V4 Flash dan Qwen langsung di chat glm5.app.

05

Pengguna self-host dengan klaster

Bobot MIT dan dukungan vLLM memang nyata, tetapi 328 GB FP8 mustahil di satu mesin.

06

Bukan untuk antarmuka yang sensitif latensi

Dengan sekitar 50 token keluaran per detik, ia tertinggal dari kebanyakan model sekelas harganya.

Cara memakai GLM 5.3 Flash / 10

Cara memakai GLM 5.3 Flash

Ada tiga jalur: chat gratis di browser, API glm5.app, atau bobot MIT di perangkat keras Anda sendiri.

01
01

Chat gratis dengan GLM 5.3 Flash

Pilih GLM 5.3 Flash di chat lalu lampirkan tangkapan layar. Akun baru mendapat kredit gratis.

02
02

Panggil API glm5.app

Kirim permintaan kompatibel OpenAI ke `https://glm5.app/api/v1` dengan ID model `glm-5.3-flash`.

03
03

Atau host sendiri bobotnya

Unduh `zai-org/GLM-5.3-Flash` lalu layani dengan SGLang atau vLLM — sekitar 328 GB dalam FP8.

Integration specimen

Mulai dari API GLM 5.3 Flash

Endpoint Chat Completions yang kompatibel dengan OpenAI. Gunakan ID model `glm-5.3-flash` di `https://glm5.app/api/v1`.

Buka dokumentasi API
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

Tanya jawab GLM 5.3 Flash

Ox Alpha, harga, benchmark, parameter, Hugging Face, vLLM, DGX Spark, dan DeepSeek V4 Flash.

Apakah GLM 5.3 Flash model yang sama dengan Ox Alpha?

Ya — ia berjalan sebagai `stealth/ox-alpha` selama enam hari sejak 20 Agustus 2026. Chat Ox Alpha yang tersimpan dipetakan ulang secara otomatis.


Apakah GLM 5.3 Flash sama dengan GLM 5.3?

Tidak — keduanya tingkat berbeda dengan selisih harga sekitar 10x. Flash adalah model multimodal 320B-A18B; GLM 5.3 adalah unggulan untuk teks.


Berapa harga GLM 5.3 Flash?

Z.ai mematok $0,15 per 1M masukan, $0,03 tercache, dan $0,50 keluaran. Angka $0,075 / $0,25 yang dikutip adalah diskon peluncuran 50% yang sementara.


Apakah GLM 5.3 Flash gratis?

Pratinjau Ox Alpha gratis; sekarang ditagih sesuai pemakaian. Anda tetap bisa mencobanya gratis di chat glm5.app.


Berapa parameter GLM 5.3 Flash dan seberapa besar ukurannya?

Total 320B, aktif 18B per token, 45 lapisan yang merutekan 8 dari 288 expert. Checkpoint FP8-nya sekitar 328 GB.


Apakah GLM 5.3 Flash ada di Hugging Face dan GitHub?

Bobotnya ada di Hugging Face pada `zai-org/GLM-5.3-Flash` dengan lisensi MIT. Tidak ada repo GitHub khusus — resepnya ada di `zai-org/GLM-5`.


Bisakah GLM 5.3 Flash dijalankan di vLLM atau DGX Spark?

vLLM, SGLang, TokenSpeed, dan KTransformers didukung. 328 GB tidak muat di satu DGX Spark; komunitas melaporkan menggabungkan dua unit pada 4 bit.


GLM 5.3 Flash atau DeepSeek V4 Flash, pilih yang mana?

Flash untuk masukan visual atau penalaran; DeepSeek V4 Flash untuk rasio 1:2 yang lebih landai atau keluaran 384K.


Apa kata Reddit tentang GLM 5.3 Flash?

Sebagian besar laporan penggunaan ditulis dengan nama pratinjaunya, jadi carilah Ox Alpha di Reddit.


Start here

Mulai pakai GLM 5.3 Flash hari ini

Jalankan tugas tersulit Anda lewat GLM 5.3 Flash gratis di browser, lalu pasang ID modelnya ke dalam pipeline Anda.