GLM 5.3 Flash

GLM 5 제품군에서 Z.ai가 내놓은 효율 등급 모델입니다. 총 320B·활성 18B의 Mixture-of-Experts로 텍스트·이미지·영상 입력, 100만 토큰 컨텍스트, MIT 오픈 가중치를 갖췄습니다.

GLM 5로 만들기

GLM 5.3 Flash란?

GLM 5.3 Flash는 2026년 8월 26일에 공개됐습니다. 그전 6일 동안은 OpenRouter에서 스텔스 모델 Ox Alpha로 돌아가고 있었습니다.

01

총 320B, 활성 18B

토큰당 288개 전문가 중 8개만 작동합니다. 메모리는 320B급, 연산은 18B급입니다.

02

태생부터 멀티모달

시각 능력은 30T 토큰 사전학습 코퍼스에서 나온 것이지 나중에 붙인 인코더가 아닙니다.

03

Flash는 빠르다가 아니라 싸다

Artificial Analysis 측정으로 초당 출력 50.2토큰, 동급 중앙값 67 t/s보다 낮습니다.

GLM 5.3 Flash 사양, 크기, 오픈소스 현황

아키텍처와 가중치, 라이선스는 Hugging Face 모델 카드와 zai-org/GLM-5 저장소 기준입니다.

모델 카드

아키텍처

총 파라미터
320B

MoE, 45개 레이어, 288개 중 8개 전문가.

활성 파라미터
18B

18B 밀집 모델 수준의 연산량.

컨텍스트 윈도
1,048,576 토큰

Io Net은 262,144, Cloudflare는 1,310,720까지.

최대 출력
131,072 토큰

최대 1,179,648까지 표기하는 곳도 있습니다.

모달리티
텍스트, 이미지, 영상

입력은 멀티모달, 출력은 텍스트.

가중치와 라이선스

크기와 라이선스

가중치 라이선스
MIT

상업적 이용과 재배포 가능, 기준선 없음.

Hugging Face
zai-org/GLM-5.3-Flash

-BF16 변형과 ModelScope 미러도 있습니다.

GitHub
zai-org/GLM-5

전용 저장소 없음. GLM-5는 Apache-2.0.

체크포인트 용량
약 328GB (FP8)

워크스테이션이 아니라 멀티노드 작업입니다.

서빙 스택
SGLang, vLLM

TokenSpeed, KTransformers, 커뮤니티 GGUF도 지원.

모델 카드와 OpenRouter endpoints API, 2026년 8월 기준.

가격 / 04

GLM 5.3 Flash 가격: 정가와 출시 할인

Z.ai 정가는 100만 토큰당 입력 $0.15, 출력 $0.50입니다. 여기저기 인용되는 $0.075 / $0.25는 한시적인 50% 출시 할인가입니다.

01

정가

$0.15

입력 100만 토큰당

GLM 5.3 Flash 비용은 할인가가 아니라 이 기준으로 추산하세요.

02

정가

$0.50

출력 100만 토큰당

1:3.3의 가파른 비율입니다. 출력부터 제한하세요.

03

정가

$0.03

캐시 입력 100만 토큰당

새 입력의 5분의 1로, 긴 컨텍스트를 감당 가능하게 만드는 요소입니다.

04

독립 측정

$0.10

혼합 단가

Artificial Analysis 기준, 캐시·입력·출력 7:2:1 비율 가정.

동일한 가중치인데 가격은 2배까지 벌어집니다. Z.AI, Novita, GMICloud는 할인하고 나머지는 정가입니다.

벤치마크 / 05

GLM 5.3 Flash 벤치마크: 공급사 발표치와 독립 측정치

Z.ai는 자체 표를 공개하고 비교 대상도 직접 고릅니다. GLM 5.2 대비 격차와 Artificial Analysis 수치는 검증을 견딥니다.

01

Z.ai 발표

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra는 87.4점이며, 어려운 과제일수록 격차가 벌어집니다.

02

Z.ai 발표

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

같은 계열, 같은 방식인데 가격은 10분의 1입니다. AutomationBench는 48.8 대 26.2.

03

Z.ai 발표

OfficeQA Pro

5.3 Flash62.4

문서·시각 추론에서 Opus 4.8을 앞선다고 발표했습니다.

04

Artificial Analysis

57

Intelligence Index

독립 측정치로, 유사한 오픈 가중치 모델의 중앙값은 약 27입니다.

GLM 5.3 Flash의 가장 믿을 만한 벤치마크는 결국 여러분의 백로그입니다.

기능 / 06

GLM 5.3 Flash로 할 수 있는 일

에이전트 하네스를 염두에 둔 설계입니다. 추론 강도 제어, 도구 호출, 구조화 출력, 100만 토큰 규모의 스트리밍을 지원합니다.

01

강도를 조절하는 추론

기본으로 켜져 있으며, 강도 수준을 조정할 수 있습니다.

02

함수 호출

도구와 도구 선택을 지원합니다. 각 동작의 검증은 여전히 앱의 몫입니다.

03

구조화 출력

응답 형식을 제약하면 파싱 가능한 JSON이 돌아옵니다.

04

스트리밍 응답

첫 토큰까지 1.47초로 중앙값보다 빠르지만, 처리량은 그렇지 않습니다.

05

이미지·영상 입력

스크린샷, 다이어그램, 화면 녹화를 프롬프트와 함께 붙여 넣으세요.

06

100만 토큰 컨텍스트

캐시 입력 $0.03 요율 덕분에 뒤 이어지는 턴이 저렴합니다.

비교 / 07

GLM 5.3 Flash와 DeepSeek V4 Flash

둘 다 MIT 가중치를 공개한 최전선 제품군의 저가 등급입니다. 모달리티, 추론, 하드웨어에서 갈립니다.

Z.ai

GLM 5.3 Flash

아키텍처
320B / 활성 18B

하이브리드 KDA와 NoPE 희소 MLA 어텐션.

입력
텍스트, 이미지, 영상

태생부터 멀티모달.

컨텍스트 / 출력
1M / 131K

출력 상한은 공급자마다 다릅니다.

정가
$0.15 / $0.50

출시 할인 적용 전 기준.

자체 호스팅
약 328GB FP8

MIT지만 멀티노드 작업입니다.

DeepSeek

DeepSeek V4 Flash

아키텍처
284B / 활성 약 13B

기본값은 추론 없음.

입력
텍스트만

스크린샷은 먼저 글로 옮겨야 합니다.

컨텍스트 / 출력
1M / 384K

응답에 쓸 수 있는 여유가 훨씬 큽니다.

정가
$0.14 / $0.28

1차 공급이며 1:2로 더 완만한 비율.

자체 호스팅
MIT 가중치

규모가 작아 서빙 비용도 낮습니다.

둘 다 glm5.app 모델 목록에 있어 같은 프롬프트를 양쪽에 돌려볼 수 있습니다.

출시 타임라인 / 08

GLM 5.3 Flash 출시 타임라인: Ox Alpha에서 오픈 가중치까지

익명 스텔스 모델로 6일을 보낸 뒤, 오픈 가중치와 함께 정식 출시됐습니다.

01

8월 20일 — Ox Alpha 등장

`stealth/ox-alpha`가 공급자 표기 없이 OpenRouter에 올라왔고, 토큰 과금은 무료였습니다.

02

8월 20~26일 — 에이전트 도구가 몰리다

사용량 상위 5곳이 모두 에이전트형 코딩 도구였고, OpenCode는 무료로 제공했습니다.

03

8월 26일 — GLM 5.3 Flash 출시

Z.ai가 Ox Alpha와 같은 계보임을 확인했고, 모델 카드·MIT 가중치·가격이 함께 공개됐습니다.

04

프리뷰는 중국산 칩에서 구동

SGLang을 변형한 자체 엔진으로 약 3배 성능이 보고됐습니다. 공급사는 비공개입니다.

05

가중치는 Hugging Face에 공개

`zai-org/GLM-5.3-Flash`와 BF16 변형, ModelScope 미러가 있습니다. GitHub 저장소는 없습니다.

06

소식이 먼저 뜨는 곳

가격은 OpenRouter, 양자화는 Hugging Face가 가장 빠릅니다. 실사용 후기는 Reddit에서 여전히 Ox Alpha로 검색됩니다.

이런 분께 / 09

GLM 5.3 Flash는 누가 쓰나요?

굳이 최상위 모델의 깊이가 필요 없던 작업에 최상위 요금을 내온 팀들, 그리고 이 모델이 맞지 않는 경우까지.

01

대량으로 돌리는 에이전트 코딩

GLM 5.3의 10분의 1 토큰 단가로 도구를 호출할 수 있어 긴 에이전트 루프가 감당 가능해집니다.

02

저장소 규모의 작업

100만 토큰 윈도에 코드베이스를 통째로 올려두면, 파일을 넘나드는 질문에 검색이 필요 없습니다.

03

화면을 보여주는 디버깅

깨진 레이아웃, 재현 녹화, 다이어그램으로 그린 스키마.

04

Z.ai를 경쟁사와 비교하는 팀

glm5.app 채팅에서 DeepSeek V4 Flash, Qwen과 나란히 비교해 보세요.

05

클러스터를 갖춘 자체 호스팅 사용자

MIT 가중치와 vLLM 지원은 사실이지만, FP8 328GB는 한 대로는 불가능합니다.

06

지연이 중요한 UI에는 부적합

초당 출력 약 50토큰으로, 같은 가격대 대부분보다 느립니다.

GLM 5.3 Flash 사용법 / 10

GLM 5.3 Flash 사용법

방법은 세 가지입니다. 브라우저 무료 채팅, glm5.app API, 또는 내 하드웨어에서 MIT 가중치를 직접 구동하기.

01
01

GLM 5.3 Flash와 무료로 채팅하기

채팅에서 GLM 5.3 Flash를 고르고 스크린샷을 첨부하세요. 신규 계정에는 무료 크레딧이 제공됩니다.

02
02

glm5.app API 호출하기

`https://glm5.app/api/v1`로 OpenAI 호환 요청을 보내고 모델 ID는 `glm-5.3-flash`를 지정하세요.

03
03

또는 가중치를 직접 운영하기

`zai-org/GLM-5.3-Flash`를 내려받아 SGLang이나 vLLM으로 서빙하세요. FP8 기준 약 328GB입니다.

Integration specimen

GLM 5.3 Flash API로 시작하기

OpenAI 호환 Chat Completions 엔드포인트입니다. `https://glm5.app/api/v1`에서 모델 ID `glm-5.3-flash`를 사용하세요.

API 문서 열기
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

GLM 5.3 Flash 자주 묻는 질문

Ox Alpha, 가격, 벤치마크, 파라미터, Hugging Face, vLLM, DGX Spark, DeepSeek V4 Flash에 대해.

GLM 5.3 Flash는 Ox Alpha와 같은 모델인가요?

맞습니다. 2026년 8월 20일부터 6일간 `stealth/ox-alpha`로 운영됐습니다. 저장된 Ox Alpha 대화는 자동으로 연결이 바뀝니다.


GLM 5.3 Flash는 GLM 5.3과 같은 모델인가요?

아닙니다. 등급이 다르고 가격 차이는 약 10배입니다. Flash는 320B-A18B 멀티모달 모델이고, GLM 5.3은 텍스트 플래그십입니다.


GLM 5.3 Flash 가격은 얼마인가요?

Z.ai 정가는 100만 토큰당 입력 $0.15, 캐시 $0.03, 출력 $0.50입니다. 인용되는 $0.075 / $0.25는 한시적인 50% 출시 할인가입니다.


GLM 5.3 Flash는 무료인가요?

Ox Alpha 프리뷰 기간에는 무료였지만 지금은 사용량 과금입니다. glm5.app 채팅에서는 여전히 무료로 써볼 수 있습니다.


GLM 5.3 Flash의 파라미터 수와 크기는 얼마인가요?

총 320B, 토큰당 활성 18B이며 45개 레이어가 288개 중 8개 전문가로 라우팅합니다. FP8 체크포인트는 약 328GB입니다.


GLM 5.3 Flash는 Hugging Face와 GitHub에 있나요?

가중치는 Hugging Face의 `zai-org/GLM-5.3-Flash`에 MIT 라이선스로 공개돼 있습니다. 전용 GitHub 저장소는 없고 레시피는 `zai-org/GLM-5`에 있습니다.


vLLM이나 DGX Spark에서 GLM 5.3 Flash를 돌릴 수 있나요?

vLLM, SGLang, TokenSpeed, KTransformers를 지원합니다. 328GB는 DGX Spark 한 대에 들어가지 않으며, 커뮤니티는 4비트로 두 대를 묶는 사례를 보고합니다.


GLM 5.3 Flash와 DeepSeek V4 Flash 중 무엇을 쓸까요?

시각 입력이나 숙고가 필요하면 Flash, 1:2의 완만한 비율이나 384K 출력이 필요하면 DeepSeek V4 Flash입니다.


Reddit에서는 GLM 5.3 Flash를 어떻게 평가하나요?

실사용 후기 대부분이 프리뷰 이름으로 쓰였으니, Reddit에서는 Ox Alpha로 검색하세요.


Start here

오늘 GLM 5.3 Flash로 시작하세요

가장 어려운 작업을 브라우저에서 무료로 GLM 5.3 Flash에 돌려보고, 그다음 모델 ID를 파이프라인에 연결하세요.