ราคาปกติ
$0.15
ต่ออินพุต 1M โทเคน
ประเมินต้นทุน GLM 5.3 Flash จากราคานี้ ไม่ใช่จากราคาโปรโมชัน
ระดับประหยัดของ Z.ai ในตระกูล GLM 5: Mixture-of-Experts ขนาด 320B ที่ใช้งานจริง 18B รับอินพุตทั้งข้อความ ภาพ และวิดีโอ คอนเท็กซ์ 1M พร้อมน้ำหนักเปิดภายใต้ MIT
GLM 5.3 Flash เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026 หลังจากอยู่บน OpenRouter มาหกวันในชื่อโมเดลลับ Ox Alpha
แต่ละโทเคนเรียกใช้ผู้เชี่ยวชาญเพียง 8 จาก 288 ตัว: กินหน่วยความจำเท่าโมเดล 320B แต่ใช้พลังประมวลผลเท่า 18B
ความสามารถด้านภาพมาจากคลังข้อมูลก่อนฝึกขนาด 30T โทเคน ไม่ใช่ตัวเข้ารหัสที่มาต่อเติมภายหลัง
Artificial Analysis วัดได้ 50.2 โทเคนต่อวินาที ต่ำกว่าค่ามัธยฐานของกลุ่มที่ 67 t/s
สถาปัตยกรรม น้ำหนัก และสัญญาอนุญาต อ้างอิงจากโมเดลการ์ดบน Hugging Face และรีโป zai-org/GLM-5
โมเดลการ์ด
MoE 45 เลเยอร์ เลือก 8 จาก 288 ผู้เชี่ยวชาญ
ภาระประมวลผลเทียบเท่าโมเดลหนาแน่น 18B
Io Net จำกัดที่ 262,144 ส่วน Cloudflare อยู่ที่ 1,310,720
บางรายระบุไว้สูงถึง 1,179,648
อินพุตมัลติโมดัล เอาต์พุตเป็นข้อความ
น้ำหนักและสัญญาอนุญาต
ใช้เชิงพาณิชย์และเผยแพร่ต่อได้ ไม่มีเงื่อนไขขั้นต่ำ
มีรุ่น -BF16 และมิเรอร์บน ModelScope
ไม่มีรีโปแยกต่างหาก ส่วน GLM-5 ใช้ Apache-2.0
ต้องรันหลายเครื่อง ไม่ใช่เวิร์กสเตชันเดียว
รวมถึง TokenSpeed, KTransformers และ GGUF จากคอมมิวนิตี
อ้างอิงโมเดลการ์ดและ endpoints API ของ OpenRouter เดือนสิงหาคม 2026
ราคา / 04
Z.ai ตั้งราคาไว้ที่ $0.15 สำหรับอินพุตและ $0.50 สำหรับเอาต์พุตต่อ 1M โทเคน ส่วน $0.075 / $0.25 ที่ถูกอ้างถึงทั่วไปคือส่วนลดเปิดตัว 50% แบบชั่วคราว
ราคาปกติ
$0.15
ประเมินต้นทุน GLM 5.3 Flash จากราคานี้ ไม่ใช่จากราคาโปรโมชัน
ราคาปกติ
$0.50
อัตราส่วน 1:3.3 ถือว่าชันมาก ควรคุมความยาวเอาต์พุตก่อน
ราคาปกติ
$0.03
เท่ากับหนึ่งในห้าของอินพุตใหม่ นี่คือเหตุผลที่คอนเท็กซ์ยาวยังคุ้ม
แหล่งอิสระ
$0.10
จาก Artificial Analysis โดยคิดสัดส่วนแคช/อินพุต/เอาต์พุตที่ 7:2:1
เบนช์มาร์ก / 05
Z.ai เผยแพร่ตารางของตัวเองและเลือกคู่เปรียบเทียบเอง แต่ส่วนต่างจาก GLM 5.2 และข้อมูลของ Artificial Analysis นั้นตรวจสอบแล้วยังยืนอยู่ได้
Z.ai รายงาน
GPT-5.6 Terra ได้ 87.4 และช่องว่างจะกว้างขึ้นในงานที่ยาก
Z.ai รายงาน
ตระกูลและวิธีเดียวกัน แต่ราคาถูกกว่าสิบเท่า ส่วน AutomationBench อยู่ที่ 48.8 ต่อ 26.2
Z.ai รายงาน
การให้เหตุผลกับเอกสารและภาพ ซึ่งรายงานว่านำหน้า Opus 4.8
Artificial Analysis
57
วัดโดยแหล่งอิสระ เทียบกับค่ามัธยฐานราว 27 ของโมเดลน้ำหนักเปิดกลุ่มเดียวกัน
ความสามารถ / 06
ออกแบบมาเพื่อระบบเอเจนต์: ควบคุมการให้เหตุผล เรียกใช้เครื่องมือ ส่งเอาต์พุตแบบมีโครงสร้าง และสตรีมบนหน้าต่างขนาดหนึ่งล้านโทเคน
เปิดใช้งานเป็นค่าเริ่มต้น และปรับระดับความพยายามได้
รองรับเครื่องมือและการเลือกเครื่องมือ แต่แอปของคุณยังต้องตรวจสอบทุกการกระทำเอง
กำหนดรูปแบบการตอบกลับแล้วจะได้ JSON ที่พาร์สได้ทันที
โทเคนแรกใน 1.47 วินาทีดีกว่าค่ามัธยฐาน แต่อัตราส่งข้อมูลรวมยังสู้ไม่ได้
วางภาพหน้าจอ ไดอะแกรม หรือคลิปบันทึกหน้าจอไปพร้อมพรอมป์ต์ได้เลย
อัตราอินพุตแคชที่ $0.03 ทำให้บทสนทนารอบหลัง ๆ ยังถูกอยู่
เปรียบเทียบ / 07
ทั้งคู่คือรุ่นราคาประหยัดของตระกูลระดับแนวหน้าที่ปล่อยน้ำหนักแบบ MIT ต่างกันที่โมดาลิตี การให้เหตุผล และฮาร์ดแวร์
Z.ai
KDA แบบไฮบริดร่วมกับ NoPE sparse MLA attention
มัลติโมดัลมาแต่ต้น
เพดานเอาต์พุตต่างกันไปตามผู้ให้บริการ
ก่อนหักส่วนลดเปิดตัว
เป็น MIT แต่ต้องรันหลายเครื่อง
DeepSeek
ค่าเริ่มต้นไม่เปิดโหมดให้เหตุผล
ภาพหน้าจอต้องถอดเป็นข้อความก่อน
โควตาสำหรับคำตอบใหญ่กว่ามาก
จากผู้ผลิตโดยตรง อัตราส่วน 1:2 ที่ราบกว่า
ขนาดเล็กกว่า ต้นทุนให้บริการถูกกว่า
ทั้งสองรุ่นอยู่ในรายการโมเดลของ glm5.app จึงยิงพรอมป์ต์เดียวกันเทียบกันได้
ไทม์ไลน์การเปิดตัว / 08
หกวันในฐานะโมเดลลับไร้ชื่อ ก่อนเปิดตัวเต็มรูปแบบพร้อมน้ำหนักเปิด
`stealth/ox-alpha` โผล่บน OpenRouter โดยไม่ระบุผู้ให้บริการ และใช้ฟรีต่อโทเคน
ผู้ใช้งานหนักห้าอันดับแรกล้วนเป็นเครื่องมือเขียนโค้ดแบบเอเจนต์ ส่วน OpenCode เปิดให้ใช้ฟรี
Z.ai ยืนยันว่าสืบสายจาก Ox Alpha พร้อมปล่อยโมเดลการ์ด น้ำหนัก MIT และราคาไปพร้อมกัน
ใช้เอนจินเฉพาะที่ต่อยอดจาก SGLang รายงานว่าเร็วขึ้นราว 3 เท่า โดยไม่เปิดเผยผู้ผลิตชิป
`zai-org/GLM-5.3-Flash` พร้อมรุ่น BF16 และมิเรอร์บน ModelScope แต่ไม่มีรีโปบน GitHub
เรื่องราคาดูที่ OpenRouter เรื่องการควอนไทซ์ดูที่ Hugging Face ส่วนรีวิวจากการใช้จริง บน Reddit ยังเรียกว่า Ox Alpha
เหมาะกับใคร / 09
ทีมที่จ่ายค่าโมเดลเรือธงให้กับงานที่ไม่เคยต้องใช้ความลึกขนาดนั้น และกรณีที่มันไม่เหมาะ
เรียกเครื่องมือด้วยราคาโทเคนเพียงหนึ่งในสิบของ GLM 5.3 ทำให้ลูปเอเจนต์ยาว ๆ คุ้มค่าขึ้น
หน้าต่างหนึ่งล้านโทเคนเก็บโค้ดเบสไว้ได้ทั้งชุด คำถามข้ามไฟล์จึงไม่ต้องพึ่งการค้นคืน
เลย์เอาต์ที่เพี้ยน คลิปบันทึกขั้นตอนที่ทำให้เกิดบั๊ก และสคีมาที่วาดเป็นไดอะแกรม
เทียบกับ DeepSeek V4 Flash และ Qwen ได้ในแชทของ glm5.app
น้ำหนัก MIT และการรองรับ vLLM มีจริง แต่ 328 GB แบบ FP8 ไม่มีทางลงเครื่องเดียว
ที่ราว 50 โทเคนต่อวินาที มันช้ากว่าโมเดลส่วนใหญ่ในระดับราคาเดียวกัน
มีสามทาง: แชทฟรีบนเบราว์เซอร์ เรียก API ของ glm5.app หรือรันน้ำหนัก MIT บนฮาร์ดแวร์ของคุณเอง
เลือก GLM 5.3 Flash ในแชทแล้วแนบภาพหน้าจอได้เลย บัญชีใหม่จะได้เครดิตฟรี
ส่งคำขอที่เข้ากันได้กับ OpenAI ไปยัง `https://glm5.app/api/v1` โดยใช้โมเดล ID `glm-5.3-flash`
ดึง `zai-org/GLM-5.3-Flash` มาให้บริการด้วย SGLang หรือ vLLM ขนาดราว 328 GB ในรูปแบบ FP8
Integration specimen
เป็นเอ็นด์พอยต์ Chat Completions ที่เข้ากันได้กับ OpenAI ใช้โมเดล ID `glm-5.3-flash` ที่ `https://glm5.app/api/v1`
เปิดเอกสาร APIcurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha ราคา เบนช์มาร์ก พารามิเตอร์ Hugging Face vLLM DGX Spark และ DeepSeek V4 Flash
ใช่ — มันรันในชื่อ `stealth/ox-alpha` เป็นเวลาหกวันนับจากวันที่ 20 สิงหาคม 2026 บทสนทนา Ox Alpha ที่บันทึกไว้จะถูกจับคู่ใหม่ให้อัตโนมัติ
ไม่เหมือน — คนละระดับ และราคาต่างกันราว 10 เท่า Flash คือโมเดลมัลติโมดัล 320B-A18B ส่วน GLM 5.3 คือรุ่นเรือธงด้านข้อความ
Z.ai ตั้งราคาไว้ที่ $0.15 ต่ออินพุต 1M โทเคน แคช $0.03 และเอาต์พุต $0.50 ส่วน $0.075 / $0.25 ที่ถูกอ้างถึงคือส่วนลดเปิดตัว 50% ชั่วคราว
ช่วงพรีวิว Ox Alpha ใช้ฟรี แต่ตอนนี้คิดค่าบริการตามการใช้งาน อย่างไรก็ตามคุณยังทดลองใช้ฟรีได้ในแชทของ glm5.app
รวม 320B ทำงานจริง 18B ต่อโทเคน มี 45 เลเยอร์ที่เลือกผู้เชี่ยวชาญ 8 จาก 288 ตัว เช็กพอยต์ FP8 มีขนาดราว 328 GB
น้ำหนักอยู่บน Hugging Face ที่ `zai-org/GLM-5.3-Flash` ภายใต้ MIT ไม่มีรีโป GitHub เฉพาะ ส่วนสูตรการรันอยู่ใน `zai-org/GLM-5`
รองรับ vLLM, SGLang, TokenSpeed และ KTransformers แต่ 328 GB ใส่ DGX Spark เครื่องเดียวไม่พอ คอมมิวนิตีรายงานว่าต่อสองเครื่องที่ 4 บิตได้
เลือก Flash ถ้าต้องใช้อินพุตภาพหรือการให้เหตุผล เลือก DeepSeek V4 Flash ถ้าต้องการอัตราส่วน 1:2 ที่ราบกว่า หรือเอาต์พุต 384K
รีวิวจากการใช้งานจริงส่วนใหญ่เขียนไว้ใต้ชื่อรุ่นพรีวิว ดังนั้นให้ค้นหา Ox Alpha บน Reddit แทน
Start here
ลองส่งงานที่ยากที่สุดของคุณให้ GLM 5.3 Flash ฟรีบนเบราว์เซอร์ แล้วค่อยนำโมเดล ID ไปต่อเข้ากับไปป์ไลน์ของคุณ