정가
$0.15
입력 100만 토큰당
GLM 5.3 Flash 비용은 할인가가 아니라 이 기준으로 추산하세요.
GLM 5 제품군에서 Z.ai가 내놓은 효율 등급 모델입니다. 총 320B·활성 18B의 Mixture-of-Experts로 텍스트·이미지·영상 입력, 100만 토큰 컨텍스트, MIT 오픈 가중치를 갖췄습니다.
GLM 5.3 Flash는 2026년 8월 26일에 공개됐습니다. 그전 6일 동안은 OpenRouter에서 스텔스 모델 Ox Alpha로 돌아가고 있었습니다.
토큰당 288개 전문가 중 8개만 작동합니다. 메모리는 320B급, 연산은 18B급입니다.
시각 능력은 30T 토큰 사전학습 코퍼스에서 나온 것이지 나중에 붙인 인코더가 아닙니다.
Artificial Analysis 측정으로 초당 출력 50.2토큰, 동급 중앙값 67 t/s보다 낮습니다.
아키텍처와 가중치, 라이선스는 Hugging Face 모델 카드와 zai-org/GLM-5 저장소 기준입니다.
모델 카드
MoE, 45개 레이어, 288개 중 8개 전문가.
18B 밀집 모델 수준의 연산량.
Io Net은 262,144, Cloudflare는 1,310,720까지.
최대 1,179,648까지 표기하는 곳도 있습니다.
입력은 멀티모달, 출력은 텍스트.
가중치와 라이선스
상업적 이용과 재배포 가능, 기준선 없음.
-BF16 변형과 ModelScope 미러도 있습니다.
전용 저장소 없음. GLM-5는 Apache-2.0.
워크스테이션이 아니라 멀티노드 작업입니다.
TokenSpeed, KTransformers, 커뮤니티 GGUF도 지원.
모델 카드와 OpenRouter endpoints API, 2026년 8월 기준.
가격 / 04
Z.ai 정가는 100만 토큰당 입력 $0.15, 출력 $0.50입니다. 여기저기 인용되는 $0.075 / $0.25는 한시적인 50% 출시 할인가입니다.
정가
$0.15
GLM 5.3 Flash 비용은 할인가가 아니라 이 기준으로 추산하세요.
정가
$0.50
1:3.3의 가파른 비율입니다. 출력부터 제한하세요.
정가
$0.03
새 입력의 5분의 1로, 긴 컨텍스트를 감당 가능하게 만드는 요소입니다.
독립 측정
$0.10
Artificial Analysis 기준, 캐시·입력·출력 7:2:1 비율 가정.
벤치마크 / 05
Z.ai는 자체 표를 공개하고 비교 대상도 직접 고릅니다. GLM 5.2 대비 격차와 Artificial Analysis 수치는 검증을 견딥니다.
Z.ai 발표
GPT-5.6 Terra는 87.4점이며, 어려운 과제일수록 격차가 벌어집니다.
Z.ai 발표
같은 계열, 같은 방식인데 가격은 10분의 1입니다. AutomationBench는 48.8 대 26.2.
Z.ai 발표
문서·시각 추론에서 Opus 4.8을 앞선다고 발표했습니다.
Artificial Analysis
57
독립 측정치로, 유사한 오픈 가중치 모델의 중앙값은 약 27입니다.
기능 / 06
에이전트 하네스를 염두에 둔 설계입니다. 추론 강도 제어, 도구 호출, 구조화 출력, 100만 토큰 규모의 스트리밍을 지원합니다.
기본으로 켜져 있으며, 강도 수준을 조정할 수 있습니다.
도구와 도구 선택을 지원합니다. 각 동작의 검증은 여전히 앱의 몫입니다.
응답 형식을 제약하면 파싱 가능한 JSON이 돌아옵니다.
첫 토큰까지 1.47초로 중앙값보다 빠르지만, 처리량은 그렇지 않습니다.
스크린샷, 다이어그램, 화면 녹화를 프롬프트와 함께 붙여 넣으세요.
캐시 입력 $0.03 요율 덕분에 뒤 이어지는 턴이 저렴합니다.
비교 / 07
둘 다 MIT 가중치를 공개한 최전선 제품군의 저가 등급입니다. 모달리티, 추론, 하드웨어에서 갈립니다.
Z.ai
하이브리드 KDA와 NoPE 희소 MLA 어텐션.
태생부터 멀티모달.
출력 상한은 공급자마다 다릅니다.
출시 할인 적용 전 기준.
MIT지만 멀티노드 작업입니다.
DeepSeek
기본값은 추론 없음.
스크린샷은 먼저 글로 옮겨야 합니다.
응답에 쓸 수 있는 여유가 훨씬 큽니다.
1차 공급이며 1:2로 더 완만한 비율.
규모가 작아 서빙 비용도 낮습니다.
둘 다 glm5.app 모델 목록에 있어 같은 프롬프트를 양쪽에 돌려볼 수 있습니다.
출시 타임라인 / 08
익명 스텔스 모델로 6일을 보낸 뒤, 오픈 가중치와 함께 정식 출시됐습니다.
`stealth/ox-alpha`가 공급자 표기 없이 OpenRouter에 올라왔고, 토큰 과금은 무료였습니다.
사용량 상위 5곳이 모두 에이전트형 코딩 도구였고, OpenCode는 무료로 제공했습니다.
Z.ai가 Ox Alpha와 같은 계보임을 확인했고, 모델 카드·MIT 가중치·가격이 함께 공개됐습니다.
SGLang을 변형한 자체 엔진으로 약 3배 성능이 보고됐습니다. 공급사는 비공개입니다.
`zai-org/GLM-5.3-Flash`와 BF16 변형, ModelScope 미러가 있습니다. GitHub 저장소는 없습니다.
가격은 OpenRouter, 양자화는 Hugging Face가 가장 빠릅니다. 실사용 후기는 Reddit에서 여전히 Ox Alpha로 검색됩니다.
이런 분께 / 09
굳이 최상위 모델의 깊이가 필요 없던 작업에 최상위 요금을 내온 팀들, 그리고 이 모델이 맞지 않는 경우까지.
GLM 5.3의 10분의 1 토큰 단가로 도구를 호출할 수 있어 긴 에이전트 루프가 감당 가능해집니다.
100만 토큰 윈도에 코드베이스를 통째로 올려두면, 파일을 넘나드는 질문에 검색이 필요 없습니다.
깨진 레이아웃, 재현 녹화, 다이어그램으로 그린 스키마.
glm5.app 채팅에서 DeepSeek V4 Flash, Qwen과 나란히 비교해 보세요.
MIT 가중치와 vLLM 지원은 사실이지만, FP8 328GB는 한 대로는 불가능합니다.
초당 출력 약 50토큰으로, 같은 가격대 대부분보다 느립니다.
방법은 세 가지입니다. 브라우저 무료 채팅, glm5.app API, 또는 내 하드웨어에서 MIT 가중치를 직접 구동하기.
채팅에서 GLM 5.3 Flash를 고르고 스크린샷을 첨부하세요. 신규 계정에는 무료 크레딧이 제공됩니다.
`https://glm5.app/api/v1`로 OpenAI 호환 요청을 보내고 모델 ID는 `glm-5.3-flash`를 지정하세요.
`zai-org/GLM-5.3-Flash`를 내려받아 SGLang이나 vLLM으로 서빙하세요. FP8 기준 약 328GB입니다.
Integration specimen
OpenAI 호환 Chat Completions 엔드포인트입니다. `https://glm5.app/api/v1`에서 모델 ID `glm-5.3-flash`를 사용하세요.
API 문서 열기curl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, 가격, 벤치마크, 파라미터, Hugging Face, vLLM, DGX Spark, DeepSeek V4 Flash에 대해.
맞습니다. 2026년 8월 20일부터 6일간 `stealth/ox-alpha`로 운영됐습니다. 저장된 Ox Alpha 대화는 자동으로 연결이 바뀝니다.
아닙니다. 등급이 다르고 가격 차이는 약 10배입니다. Flash는 320B-A18B 멀티모달 모델이고, GLM 5.3은 텍스트 플래그십입니다.
Z.ai 정가는 100만 토큰당 입력 $0.15, 캐시 $0.03, 출력 $0.50입니다. 인용되는 $0.075 / $0.25는 한시적인 50% 출시 할인가입니다.
Ox Alpha 프리뷰 기간에는 무료였지만 지금은 사용량 과금입니다. glm5.app 채팅에서는 여전히 무료로 써볼 수 있습니다.
총 320B, 토큰당 활성 18B이며 45개 레이어가 288개 중 8개 전문가로 라우팅합니다. FP8 체크포인트는 약 328GB입니다.
가중치는 Hugging Face의 `zai-org/GLM-5.3-Flash`에 MIT 라이선스로 공개돼 있습니다. 전용 GitHub 저장소는 없고 레시피는 `zai-org/GLM-5`에 있습니다.
vLLM, SGLang, TokenSpeed, KTransformers를 지원합니다. 328GB는 DGX Spark 한 대에 들어가지 않으며, 커뮤니티는 4비트로 두 대를 묶는 사례를 보고합니다.
시각 입력이나 숙고가 필요하면 Flash, 1:2의 완만한 비율이나 384K 출력이 필요하면 DeepSeek V4 Flash입니다.
실사용 후기 대부분이 프리뷰 이름으로 쓰였으니, Reddit에서는 Ox Alpha로 검색하세요.
Start here
가장 어려운 작업을 브라우저에서 무료로 GLM 5.3 Flash에 돌려보고, 그다음 모델 ID를 파이프라인에 연결하세요.