GLM 5.3 Flash

Экономичный уровень Z.ai в семействе GLM 5: Mixture-of-Experts на 320B с 18B активных параметров, ввод текста, изображений и видео, контекст 1M и открытые веса под MIT.

Создавайте с GLM 5

Что такое GLM 5.3 Flash?

GLM 5.3 Flash вышла 26 августа 2026 года — после шести дней на OpenRouter под видом скрытой модели Ox Alpha.

01

320B всего, 18B активных

На каждый токен срабатывают лишь 8 из 288 экспертов: память как у модели на 320B, вычисления — как у 18B.

02

Мультимодальность с рождения

Зрение выросло из корпуса предобучения на 30T токенов, а не из энкодера, добавленного позже.

03

Flash — это дёшево, а не быстро

Artificial Analysis фиксирует 50,2 выходных токена в секунду — ниже медианы класса в 67 t/s.

GLM 5.3 Flash: характеристики, размер и статус открытого кода

Архитектура, веса и лицензии — по карточке модели на Hugging Face и репозиторию zai-org/GLM-5.

Карточка модели

Архитектура

Всего параметров
320B

MoE, 45 слоёв, 8 экспертов из 288.

Активных параметров
18B

Вычисления как у плотной модели на 18B.

Окно контекста
1 048 576 токенов

Io Net ограничивает 262 144, Cloudflare — 1 310 720.

Максимальный вывод
131 072 токена

Другие указывают до 1 179 648.

Модальности
Текст, изображения, видео

Вход мультимодальный, выход текстовый.

Веса и лицензия

Размер и лицензия

Лицензия весов
MIT

Коммерческое использование и распространение без ограничений.

Hugging Face
zai-org/GLM-5.3-Flash

Есть вариант -BF16 и зеркало на ModelScope.

GitHub
zai-org/GLM-5

Отдельного репозитория нет; GLM-5 под Apache-2.0.

Размер чекпоинта
~328 ГБ (FP8)

Задача для кластера, а не для рабочей станции.

Стеки инференса
SGLang, vLLM

А также TokenSpeed, KTransformers и GGUF от сообщества.

Карточка модели и API endpoints OpenRouter, август 2026 года.

Цены / 04

Цены GLM 5.3 Flash: прайс-лист против стартовой скидки

Z.ai указывает $0,15 за ввод и $0,50 за вывод на 1M токенов. Цифры $0,075 / $0,25, которые цитируют повсюду, — временная стартовая скидка 50%.

01

Прайс-лист

$0.15

За 1M входных токенов

Считайте расходы на GLM 5.3 Flash по этой ставке, а не по акционной.

02

Прайс-лист

$0.50

За 1M выходных токенов

Крутое соотношение 1:3,3 — сначала ограничьте объём вывода.

03

Прайс-лист

$0.03

За 1M кешированных входных токенов

Пятая часть от свежего ввода — именно это делает длинный контекст посильным.

04

Независимая оценка

$0.10

Смешанная цена

Artificial Analysis, при соотношении кеш/ввод/вывод 7:2:1.

Двукратный разброс при одинаковых весах: Z.AI, Novita и GMICloud дают скидку, остальные берут по прайсу.

Бенчмарки / 05

Бенчмарки GLM 5.3 Flash: данные вендора и независимые

Z.ai публикует собственную таблицу и сама выбирает, с чем сравнивать. Отрыв от GLM 5.2 и цифры Artificial Analysis выдерживают проверку.

01

По данным Z.ai

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

У GPT-5.6 Terra 87,4; на сложных задачах разрыв растёт.

02

По данным Z.ai

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

То же семейство и метод, но в десять раз дешевле. AutomationBench: 48,8 против 26,2.

03

По данным Z.ai

OfficeQA Pro

5.3 Flash62.4

Рассуждения по документам и изображениям — по заявлению вендора, выше Opus 4.8.

04

Artificial Analysis

57

Intelligence Index

Независимая оценка против медианы около 27 у сопоставимых моделей с открытыми весами.

Самый надёжный бенчмарк GLM 5.3 Flash — ваш собственный бэклог.

Возможности / 06

Что умеет GLM 5.3 Flash

Модель сделана под агентные обвязки: управление рассуждением, инструменты, структурированный вывод и стриминг в окне на миллион токенов.

01

Рассуждение с настройкой усилий

Включено по умолчанию, уровень усилий регулируется.

02

Вызов функций

Инструменты и выбор инструмента; проверять каждое действие по-прежнему должно ваше приложение.

03

Структурированный вывод

Ограничение формата ответа возвращает JSON, готовый к разбору.

04

Потоковые ответы

1,47 с до первого токена лучше медианы, а вот пропускная способность — нет.

05

Ввод изображений и видео

Вставьте скриншот, схему или запись экрана прямо вместе с промптом.

06

Контекст на миллион токенов

Ставка $0,03 за кешированный ввод удерживает стоимость последующих ходов внизу.

Сравнение / 07

GLM 5.3 Flash против DeepSeek V4 Flash

Обе — недорогой уровень передового семейства с весами под MIT. Расходятся они в модальностях, рассуждении и требованиях к железу.

Z.ai

GLM 5.3 Flash

Архитектура
320B / 18B активных

Гибридный KDA плюс разрежённое MLA-внимание NoPE.

Ввод
Текст, изображения, видео

Мультимодальность с рождения.

Контекст / вывод
1M / 131K

Потолок вывода зависит от провайдера.

Прайс-лист
$0.15 / $0.50

До стартовой скидки.

Самостоятельный хостинг
~328 ГБ FP8

MIT, но нужен кластер.

DeepSeek

DeepSeek V4 Flash

Архитектура
284B / ~13B активных

По умолчанию без рассуждения.

Ввод
Только текст

Скриншоты нужно сначала расшифровать.

Контекст / вывод
1M / 384K

Гораздо больший бюджет на ответ.

Прайс-лист
$0.14 / $0.28

От первоисточника, с более пологим соотношением 1:2.

Самостоятельный хостинг
Веса под MIT

Модель меньше, обслуживать дешевле.

Обе есть в списке моделей glm5.app, поэтому один и тот же промпт можно прогнать через каждую.

Хроника релиза / 08

Хроника GLM 5.3 Flash: от Ox Alpha до открытых весов

Шесть дней в роли анонимной скрытой модели, затем полноценный релиз с открытыми весами.

01

20 августа — появляется Ox Alpha

`stealth/ox-alpha` возникает на OpenRouter без указания провайдера и бесплатно по токенам.

02

20-26 августа — сбегаются агентные инструменты

Пять крупнейших потребителей — агентные инструменты для кода; OpenCode отдаёт модель бесплатно.

03

26 августа — выходит GLM 5.3 Flash

Z.ai подтверждает происхождение от Ox Alpha; карточка модели, веса под MIT и цены выходят разом.

04

Превью работало на китайских чипах

Собственный движок на базе SGLang, заявленное ускорение — около 3x. Поставщик не раскрыт.

05

Веса выложены на Hugging Face

`zai-org/GLM-5.3-Flash`, плюс вариант BF16 и зеркало на ModelScope. Репозитория на GitHub нет.

06

Где новости появляются первыми

Цены — на OpenRouter, квантизации — на Hugging Face. За полевыми отчётами идите на Reddit, там всё ещё Ox Alpha.

Кому подходит / 09

Кто пользуется GLM 5.3 Flash?

Командам, которые платят по флагманскому тарифу за работу, никогда не требовавшую такой глубины, — и там, где это неудачный выбор.

01

Агентное программирование в больших объёмах

Вызовы инструментов по цене вдесятеро ниже токена GLM 5.3 делают длинные агентные циклы посильными.

02

Работа масштаба репозитория

Окно на миллион токенов держит кодовую базу целиком, поэтому вопросы по нескольким файлам обходятся без поиска.

03

Визуальная отладка

Разъехавшаяся вёрстка, записи воспроизведения бага, схемы на диаграммах.

04

Командам, сравнивающим Z.ai с конкурентами

Сравните с DeepSeek V4 Flash и Qwen прямо в чате glm5.app.

05

Тем, кто разворачивает у себя на кластере

Веса под MIT и поддержка vLLM реальны, но 328 ГБ в FP8 исключают одну машину.

06

Не для интерфейсов, критичных к задержке

Примерно 50 выходных токенов в секунду — медленнее большинства моделей той же цены.

Как пользоваться GLM 5.3 Flash / 10

Как пользоваться GLM 5.3 Flash

Три пути: бесплатный чат в браузере, API glm5.app или веса под MIT на своём железе.

01
01

Бесплатный чат с GLM 5.3 Flash

Выберите GLM 5.3 Flash в чате и прикрепите скриншоты. Новым аккаунтам начисляются бесплатные кредиты.

02
02

Вызовите API glm5.app

Отправляйте OpenAI-совместимые запросы на `https://glm5.app/api/v1` с ID модели `glm-5.3-flash`.

03
03

Или разверните веса сами

Скачайте `zai-org/GLM-5.3-Flash` и поднимите его на SGLang или vLLM — около 328 ГБ в FP8.

Integration specimen

Начните с API GLM 5.3 Flash

OpenAI-совместимая точка Chat Completions. Используйте ID модели `glm-5.3-flash` по адресу `https://glm5.app/api/v1`.

Открыть документацию API
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

GLM 5.3 Flash: частые вопросы

Ox Alpha, цены, бенчмарки, параметры, Hugging Face, vLLM, DGX Spark и DeepSeek V4 Flash.

GLM 5.3 Flash — это та же модель, что Ox Alpha?

Да — она работала как `stealth/ox-alpha` шесть дней начиная с 20 августа 2026 года. Сохранённые чаты Ox Alpha переносятся автоматически.


GLM 5.3 Flash — это то же самое, что GLM 5.3?

Нет, это разные уровни с разницей в цене примерно в 10 раз. Flash — мультимодальная модель 320B-A18B, а GLM 5.3 — текстовый флагман.


Сколько стоит GLM 5.3 Flash?

Z.ai указывает $0,15 за 1M входных токенов, $0,03 за кешированные и $0,50 за выходные. Цитируемые $0,075 / $0,25 — временная стартовая скидка 50%.


GLM 5.3 Flash бесплатна?

Превью Ox Alpha было бесплатным, сейчас модель тарифицируется по использованию. Попробовать бесплатно всё ещё можно в чате glm5.app.


Сколько параметров у GLM 5.3 Flash и сколько она весит?

320B всего, 18B активных на токен, 45 слоёв маршрутизируют 8 экспертов из 288. Чекпоинт в FP8 занимает около 328 ГБ.


Есть ли GLM 5.3 Flash на Hugging Face и GitHub?

Веса лежат на Hugging Face в `zai-org/GLM-5.3-Flash` под лицензией MIT. Отдельного репозитория на GitHub нет — рецепты в `zai-org/GLM-5`.


Можно ли запустить GLM 5.3 Flash на vLLM или DGX Spark?

vLLM, SGLang, TokenSpeed и KTransformers поддерживаются. 328 ГБ не поместятся в один DGX Spark; сообщество сообщает о связке двух на 4 битах.


GLM 5.3 Flash или DeepSeek V4 Flash — что выбрать?

Flash — если нужен визуальный ввод или рассуждение; DeepSeek V4 Flash — если важны пологое соотношение 1:2 или вывод в 384K.


Что о GLM 5.3 Flash пишут на Reddit?

Большая часть практических отзывов опубликована под именем превью, так что ищите на Reddit Ox Alpha.


Start here

Начните работать с GLM 5.3 Flash сегодня

Прогоните самую сложную задачу через GLM 5.3 Flash бесплатно в браузере, а затем подключите ID модели к своему пайплайну.