GLM 5.3 Flash

ระดับประหยัดของ Z.ai ในตระกูล GLM 5: Mixture-of-Experts ขนาด 320B ที่ใช้งานจริง 18B รับอินพุตทั้งข้อความ ภาพ และวิดีโอ คอนเท็กซ์ 1M พร้อมน้ำหนักเปิดภายใต้ MIT

สร้างสรรค์ด้วย GLM 5

GLM 5.3 Flash คืออะไร

GLM 5.3 Flash เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026 หลังจากอยู่บน OpenRouter มาหกวันในชื่อโมเดลลับ Ox Alpha

01

รวม 320B ใช้งานจริง 18B

แต่ละโทเคนเรียกใช้ผู้เชี่ยวชาญเพียง 8 จาก 288 ตัว: กินหน่วยความจำเท่าโมเดล 320B แต่ใช้พลังประมวลผลเท่า 18B

02

มัลติโมดัลมาแต่ต้น

ความสามารถด้านภาพมาจากคลังข้อมูลก่อนฝึกขนาด 30T โทเคน ไม่ใช่ตัวเข้ารหัสที่มาต่อเติมภายหลัง

03

Flash แปลว่าถูก ไม่ใช่เร็ว

Artificial Analysis วัดได้ 50.2 โทเคนต่อวินาที ต่ำกว่าค่ามัธยฐานของกลุ่มที่ 67 t/s

สเปก ขนาด และสถานะโอเพนซอร์สของ GLM 5.3 Flash

สถาปัตยกรรม น้ำหนัก และสัญญาอนุญาต อ้างอิงจากโมเดลการ์ดบน Hugging Face และรีโป zai-org/GLM-5

โมเดลการ์ด

สถาปัตยกรรม

พารามิเตอร์ทั้งหมด
320B

MoE 45 เลเยอร์ เลือก 8 จาก 288 ผู้เชี่ยวชาญ

พารามิเตอร์ที่ทำงาน
18B

ภาระประมวลผลเทียบเท่าโมเดลหนาแน่น 18B

หน้าต่างคอนเท็กซ์
1,048,576 โทเคน

Io Net จำกัดที่ 262,144 ส่วน Cloudflare อยู่ที่ 1,310,720

เอาต์พุตสูงสุด
131,072 โทเคน

บางรายระบุไว้สูงถึง 1,179,648

โมดาลิตี
ข้อความ ภาพ วิดีโอ

อินพุตมัลติโมดัล เอาต์พุตเป็นข้อความ

น้ำหนักและสัญญาอนุญาต

ขนาดและสัญญาอนุญาต

สัญญาอนุญาตของน้ำหนัก
MIT

ใช้เชิงพาณิชย์และเผยแพร่ต่อได้ ไม่มีเงื่อนไขขั้นต่ำ

Hugging Face
zai-org/GLM-5.3-Flash

มีรุ่น -BF16 และมิเรอร์บน ModelScope

GitHub
zai-org/GLM-5

ไม่มีรีโปแยกต่างหาก ส่วน GLM-5 ใช้ Apache-2.0

ขนาดเช็กพอยต์
ประมาณ 328 GB (FP8)

ต้องรันหลายเครื่อง ไม่ใช่เวิร์กสเตชันเดียว

สแตกสำหรับให้บริการ
SGLang, vLLM

รวมถึง TokenSpeed, KTransformers และ GGUF จากคอมมิวนิตี

อ้างอิงโมเดลการ์ดและ endpoints API ของ OpenRouter เดือนสิงหาคม 2026

ราคา / 04

ราคา GLM 5.3 Flash: ราคาปกติเทียบส่วนลดเปิดตัว

Z.ai ตั้งราคาไว้ที่ $0.15 สำหรับอินพุตและ $0.50 สำหรับเอาต์พุตต่อ 1M โทเคน ส่วน $0.075 / $0.25 ที่ถูกอ้างถึงทั่วไปคือส่วนลดเปิดตัว 50% แบบชั่วคราว

01

ราคาปกติ

$0.15

ต่ออินพุต 1M โทเคน

ประเมินต้นทุน GLM 5.3 Flash จากราคานี้ ไม่ใช่จากราคาโปรโมชัน

02

ราคาปกติ

$0.50

ต่อเอาต์พุต 1M โทเคน

อัตราส่วน 1:3.3 ถือว่าชันมาก ควรคุมความยาวเอาต์พุตก่อน

03

ราคาปกติ

$0.03

ต่ออินพุตแคช 1M โทเคน

เท่ากับหนึ่งในห้าของอินพุตใหม่ นี่คือเหตุผลที่คอนเท็กซ์ยาวยังคุ้ม

04

แหล่งอิสระ

$0.10

ราคาผสม

จาก Artificial Analysis โดยคิดสัดส่วนแคช/อินพุต/เอาต์พุตที่ 7:2:1

น้ำหนักชุดเดียวกันแต่ราคาต่างกันได้ถึง 2 เท่า: Z.AI, Novita และ GMICloud ให้ส่วนลด ส่วนรายอื่นคิดราคาปกติ

เบนช์มาร์ก / 05

เบนช์มาร์ก GLM 5.3 Flash: ตัวเลขจากผู้ผลิตและจากแหล่งอิสระ

Z.ai เผยแพร่ตารางของตัวเองและเลือกคู่เปรียบเทียบเอง แต่ส่วนต่างจาก GLM 5.2 และข้อมูลของ Artificial Analysis นั้นตรวจสอบแล้วยังยืนอยู่ได้

01

Z.ai รายงาน

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra ได้ 87.4 และช่องว่างจะกว้างขึ้นในงานที่ยาก

02

Z.ai รายงาน

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

ตระกูลและวิธีเดียวกัน แต่ราคาถูกกว่าสิบเท่า ส่วน AutomationBench อยู่ที่ 48.8 ต่อ 26.2

03

Z.ai รายงาน

OfficeQA Pro

5.3 Flash62.4

การให้เหตุผลกับเอกสารและภาพ ซึ่งรายงานว่านำหน้า Opus 4.8

04

Artificial Analysis

57

Intelligence Index

วัดโดยแหล่งอิสระ เทียบกับค่ามัธยฐานราว 27 ของโมเดลน้ำหนักเปิดกลุ่มเดียวกัน

เบนช์มาร์กที่เชื่อถือได้ที่สุดของ GLM 5.3 Flash คืองานค้างในมือคุณเอง

ความสามารถ / 06

GLM 5.3 Flash ทำอะไรได้บ้าง

ออกแบบมาเพื่อระบบเอเจนต์: ควบคุมการให้เหตุผล เรียกใช้เครื่องมือ ส่งเอาต์พุตแบบมีโครงสร้าง และสตรีมบนหน้าต่างขนาดหนึ่งล้านโทเคน

01

ให้เหตุผลพร้อมปรับระดับความพยายาม

เปิดใช้งานเป็นค่าเริ่มต้น และปรับระดับความพยายามได้

02

การเรียกฟังก์ชัน

รองรับเครื่องมือและการเลือกเครื่องมือ แต่แอปของคุณยังต้องตรวจสอบทุกการกระทำเอง

03

เอาต์พุตแบบมีโครงสร้าง

กำหนดรูปแบบการตอบกลับแล้วจะได้ JSON ที่พาร์สได้ทันที

04

ตอบกลับแบบสตรีม

โทเคนแรกใน 1.47 วินาทีดีกว่าค่ามัธยฐาน แต่อัตราส่งข้อมูลรวมยังสู้ไม่ได้

05

อินพุตภาพและวิดีโอ

วางภาพหน้าจอ ไดอะแกรม หรือคลิปบันทึกหน้าจอไปพร้อมพรอมป์ต์ได้เลย

06

คอนเท็กซ์หนึ่งล้านโทเคน

อัตราอินพุตแคชที่ $0.03 ทำให้บทสนทนารอบหลัง ๆ ยังถูกอยู่

เปรียบเทียบ / 07

GLM 5.3 Flash เทียบกับ DeepSeek V4 Flash

ทั้งคู่คือรุ่นราคาประหยัดของตระกูลระดับแนวหน้าที่ปล่อยน้ำหนักแบบ MIT ต่างกันที่โมดาลิตี การให้เหตุผล และฮาร์ดแวร์

Z.ai

GLM 5.3 Flash

สถาปัตยกรรม
320B / ทำงานจริง 18B

KDA แบบไฮบริดร่วมกับ NoPE sparse MLA attention

อินพุต
ข้อความ ภาพ วิดีโอ

มัลติโมดัลมาแต่ต้น

คอนเท็กซ์ / เอาต์พุต
1M / 131K

เพดานเอาต์พุตต่างกันไปตามผู้ให้บริการ

ราคาปกติ
$0.15 / $0.50

ก่อนหักส่วนลดเปิดตัว

โฮสต์เอง
ประมาณ 328 GB FP8

เป็น MIT แต่ต้องรันหลายเครื่อง

DeepSeek

DeepSeek V4 Flash

สถาปัตยกรรม
284B / ทำงานจริงราว 13B

ค่าเริ่มต้นไม่เปิดโหมดให้เหตุผล

อินพุต
ข้อความเท่านั้น

ภาพหน้าจอต้องถอดเป็นข้อความก่อน

คอนเท็กซ์ / เอาต์พุต
1M / 384K

โควตาสำหรับคำตอบใหญ่กว่ามาก

ราคาปกติ
$0.14 / $0.28

จากผู้ผลิตโดยตรง อัตราส่วน 1:2 ที่ราบกว่า

โฮสต์เอง
น้ำหนัก MIT

ขนาดเล็กกว่า ต้นทุนให้บริการถูกกว่า

ทั้งสองรุ่นอยู่ในรายการโมเดลของ glm5.app จึงยิงพรอมป์ต์เดียวกันเทียบกันได้

ไทม์ไลน์การเปิดตัว / 08

ไทม์ไลน์ GLM 5.3 Flash จาก Ox Alpha สู่น้ำหนักเปิด

หกวันในฐานะโมเดลลับไร้ชื่อ ก่อนเปิดตัวเต็มรูปแบบพร้อมน้ำหนักเปิด

01

20 ส.ค. — Ox Alpha ปรากฏตัว

`stealth/ox-alpha` โผล่บน OpenRouter โดยไม่ระบุผู้ให้บริการ และใช้ฟรีต่อโทเคน

02

20-26 ส.ค. — เครื่องมือเอเจนต์แห่เข้ามา

ผู้ใช้งานหนักห้าอันดับแรกล้วนเป็นเครื่องมือเขียนโค้ดแบบเอเจนต์ ส่วน OpenCode เปิดให้ใช้ฟรี

03

26 ส.ค. — GLM 5.3 Flash เปิดตัว

Z.ai ยืนยันว่าสืบสายจาก Ox Alpha พร้อมปล่อยโมเดลการ์ด น้ำหนัก MIT และราคาไปพร้อมกัน

04

รุ่นพรีวิวรันบนชิปจีน

ใช้เอนจินเฉพาะที่ต่อยอดจาก SGLang รายงานว่าเร็วขึ้นราว 3 เท่า โดยไม่เปิดเผยผู้ผลิตชิป

05

น้ำหนักขึ้น Hugging Face แล้ว

`zai-org/GLM-5.3-Flash` พร้อมรุ่น BF16 และมิเรอร์บน ModelScope แต่ไม่มีรีโปบน GitHub

06

ข่าวออกที่ไหนก่อน

เรื่องราคาดูที่ OpenRouter เรื่องการควอนไทซ์ดูที่ Hugging Face ส่วนรีวิวจากการใช้จริง บน Reddit ยังเรียกว่า Ox Alpha

เหมาะกับใคร / 09

ใครใช้ GLM 5.3 Flash บ้าง

ทีมที่จ่ายค่าโมเดลเรือธงให้กับงานที่ไม่เคยต้องใช้ความลึกขนาดนั้น และกรณีที่มันไม่เหมาะ

01

งานเขียนโค้ดแบบเอเจนต์ปริมาณมาก

เรียกเครื่องมือด้วยราคาโทเคนเพียงหนึ่งในสิบของ GLM 5.3 ทำให้ลูปเอเจนต์ยาว ๆ คุ้มค่าขึ้น

02

งานระดับทั้งรีโปซิทอรี

หน้าต่างหนึ่งล้านโทเคนเก็บโค้ดเบสไว้ได้ทั้งชุด คำถามข้ามไฟล์จึงไม่ต้องพึ่งการค้นคืน

03

ดีบักด้วยภาพ

เลย์เอาต์ที่เพี้ยน คลิปบันทึกขั้นตอนที่ทำให้เกิดบั๊ก และสคีมาที่วาดเป็นไดอะแกรม

04

ทีมที่เทียบราคา Z.ai กับคู่แข่ง

เทียบกับ DeepSeek V4 Flash และ Qwen ได้ในแชทของ glm5.app

05

ผู้ที่โฮสต์เองและมีคลัสเตอร์

น้ำหนัก MIT และการรองรับ vLLM มีจริง แต่ 328 GB แบบ FP8 ไม่มีทางลงเครื่องเดียว

06

ไม่เหมาะกับ UI ที่แพ้ความหน่วง

ที่ราว 50 โทเคนต่อวินาที มันช้ากว่าโมเดลส่วนใหญ่ในระดับราคาเดียวกัน

วิธีใช้ GLM 5.3 Flash / 10

วิธีใช้ GLM 5.3 Flash

มีสามทาง: แชทฟรีบนเบราว์เซอร์ เรียก API ของ glm5.app หรือรันน้ำหนัก MIT บนฮาร์ดแวร์ของคุณเอง

01
01

แชทกับ GLM 5.3 Flash ฟรี

เลือก GLM 5.3 Flash ในแชทแล้วแนบภาพหน้าจอได้เลย บัญชีใหม่จะได้เครดิตฟรี

02
02

เรียก API ของ glm5.app

ส่งคำขอที่เข้ากันได้กับ OpenAI ไปยัง `https://glm5.app/api/v1` โดยใช้โมเดล ID `glm-5.3-flash`

03
03

หรือรันน้ำหนักเอง

ดึง `zai-org/GLM-5.3-Flash` มาให้บริการด้วย SGLang หรือ vLLM ขนาดราว 328 GB ในรูปแบบ FP8

Integration specimen

เริ่มต้นกับ API ของ GLM 5.3 Flash

เป็นเอ็นด์พอยต์ Chat Completions ที่เข้ากันได้กับ OpenAI ใช้โมเดล ID `glm-5.3-flash` ที่ `https://glm5.app/api/v1`

เปิดเอกสาร API
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

คำถามที่พบบ่อยเกี่ยวกับ GLM 5.3 Flash

Ox Alpha ราคา เบนช์มาร์ก พารามิเตอร์ Hugging Face vLLM DGX Spark และ DeepSeek V4 Flash

GLM 5.3 Flash เป็นโมเดลเดียวกับ Ox Alpha หรือไม่

ใช่ — มันรันในชื่อ `stealth/ox-alpha` เป็นเวลาหกวันนับจากวันที่ 20 สิงหาคม 2026 บทสนทนา Ox Alpha ที่บันทึกไว้จะถูกจับคู่ใหม่ให้อัตโนมัติ


GLM 5.3 Flash เหมือนกับ GLM 5.3 หรือไม่

ไม่เหมือน — คนละระดับ และราคาต่างกันราว 10 เท่า Flash คือโมเดลมัลติโมดัล 320B-A18B ส่วน GLM 5.3 คือรุ่นเรือธงด้านข้อความ


GLM 5.3 Flash ราคาเท่าไร

Z.ai ตั้งราคาไว้ที่ $0.15 ต่ออินพุต 1M โทเคน แคช $0.03 และเอาต์พุต $0.50 ส่วน $0.075 / $0.25 ที่ถูกอ้างถึงคือส่วนลดเปิดตัว 50% ชั่วคราว


GLM 5.3 Flash ใช้ฟรีไหม

ช่วงพรีวิว Ox Alpha ใช้ฟรี แต่ตอนนี้คิดค่าบริการตามการใช้งาน อย่างไรก็ตามคุณยังทดลองใช้ฟรีได้ในแชทของ glm5.app


GLM 5.3 Flash มีกี่พารามิเตอร์ และขนาดเท่าไร

รวม 320B ทำงานจริง 18B ต่อโทเคน มี 45 เลเยอร์ที่เลือกผู้เชี่ยวชาญ 8 จาก 288 ตัว เช็กพอยต์ FP8 มีขนาดราว 328 GB


GLM 5.3 Flash อยู่บน Hugging Face และ GitHub หรือไม่

น้ำหนักอยู่บน Hugging Face ที่ `zai-org/GLM-5.3-Flash` ภายใต้ MIT ไม่มีรีโป GitHub เฉพาะ ส่วนสูตรการรันอยู่ใน `zai-org/GLM-5`


รัน GLM 5.3 Flash บน vLLM หรือ DGX Spark ได้ไหม

รองรับ vLLM, SGLang, TokenSpeed และ KTransformers แต่ 328 GB ใส่ DGX Spark เครื่องเดียวไม่พอ คอมมิวนิตีรายงานว่าต่อสองเครื่องที่ 4 บิตได้


GLM 5.3 Flash กับ DeepSeek V4 Flash ควรเลือกตัวไหน

เลือก Flash ถ้าต้องใช้อินพุตภาพหรือการให้เหตุผล เลือก DeepSeek V4 Flash ถ้าต้องการอัตราส่วน 1:2 ที่ราบกว่า หรือเอาต์พุต 384K


Reddit พูดถึง GLM 5.3 Flash ว่าอย่างไร

รีวิวจากการใช้งานจริงส่วนใหญ่เขียนไว้ใต้ชื่อรุ่นพรีวิว ดังนั้นให้ค้นหา Ox Alpha บน Reddit แทน


Start here

เริ่มใช้ GLM 5.3 Flash วันนี้

ลองส่งงานที่ยากที่สุดของคุณให้ GLM 5.3 Flash ฟรีบนเบราว์เซอร์ แล้วค่อยนำโมเดล ID ไปต่อเข้ากับไปป์ไลน์ของคุณ