Прайс-лист
$0.15
За 1M входных токенов
Считайте расходы на GLM 5.3 Flash по этой ставке, а не по акционной.
Экономичный уровень Z.ai в семействе GLM 5: Mixture-of-Experts на 320B с 18B активных параметров, ввод текста, изображений и видео, контекст 1M и открытые веса под MIT.
GLM 5.3 Flash вышла 26 августа 2026 года — после шести дней на OpenRouter под видом скрытой модели Ox Alpha.
На каждый токен срабатывают лишь 8 из 288 экспертов: память как у модели на 320B, вычисления — как у 18B.
Зрение выросло из корпуса предобучения на 30T токенов, а не из энкодера, добавленного позже.
Artificial Analysis фиксирует 50,2 выходных токена в секунду — ниже медианы класса в 67 t/s.
Архитектура, веса и лицензии — по карточке модели на Hugging Face и репозиторию zai-org/GLM-5.
Карточка модели
MoE, 45 слоёв, 8 экспертов из 288.
Вычисления как у плотной модели на 18B.
Io Net ограничивает 262 144, Cloudflare — 1 310 720.
Другие указывают до 1 179 648.
Вход мультимодальный, выход текстовый.
Веса и лицензия
Коммерческое использование и распространение без ограничений.
Есть вариант -BF16 и зеркало на ModelScope.
Отдельного репозитория нет; GLM-5 под Apache-2.0.
Задача для кластера, а не для рабочей станции.
А также TokenSpeed, KTransformers и GGUF от сообщества.
Карточка модели и API endpoints OpenRouter, август 2026 года.
Цены / 04
Z.ai указывает $0,15 за ввод и $0,50 за вывод на 1M токенов. Цифры $0,075 / $0,25, которые цитируют повсюду, — временная стартовая скидка 50%.
Прайс-лист
$0.15
Считайте расходы на GLM 5.3 Flash по этой ставке, а не по акционной.
Прайс-лист
$0.50
Крутое соотношение 1:3,3 — сначала ограничьте объём вывода.
Прайс-лист
$0.03
Пятая часть от свежего ввода — именно это делает длинный контекст посильным.
Независимая оценка
$0.10
Artificial Analysis, при соотношении кеш/ввод/вывод 7:2:1.
Бенчмарки / 05
Z.ai публикует собственную таблицу и сама выбирает, с чем сравнивать. Отрыв от GLM 5.2 и цифры Artificial Analysis выдерживают проверку.
По данным Z.ai
У GPT-5.6 Terra 87,4; на сложных задачах разрыв растёт.
По данным Z.ai
То же семейство и метод, но в десять раз дешевле. AutomationBench: 48,8 против 26,2.
По данным Z.ai
Рассуждения по документам и изображениям — по заявлению вендора, выше Opus 4.8.
Artificial Analysis
57
Независимая оценка против медианы около 27 у сопоставимых моделей с открытыми весами.
Возможности / 06
Модель сделана под агентные обвязки: управление рассуждением, инструменты, структурированный вывод и стриминг в окне на миллион токенов.
Включено по умолчанию, уровень усилий регулируется.
Инструменты и выбор инструмента; проверять каждое действие по-прежнему должно ваше приложение.
Ограничение формата ответа возвращает JSON, готовый к разбору.
1,47 с до первого токена лучше медианы, а вот пропускная способность — нет.
Вставьте скриншот, схему или запись экрана прямо вместе с промптом.
Ставка $0,03 за кешированный ввод удерживает стоимость последующих ходов внизу.
Сравнение / 07
Обе — недорогой уровень передового семейства с весами под MIT. Расходятся они в модальностях, рассуждении и требованиях к железу.
Z.ai
Гибридный KDA плюс разрежённое MLA-внимание NoPE.
Мультимодальность с рождения.
Потолок вывода зависит от провайдера.
До стартовой скидки.
MIT, но нужен кластер.
DeepSeek
По умолчанию без рассуждения.
Скриншоты нужно сначала расшифровать.
Гораздо больший бюджет на ответ.
От первоисточника, с более пологим соотношением 1:2.
Модель меньше, обслуживать дешевле.
Обе есть в списке моделей glm5.app, поэтому один и тот же промпт можно прогнать через каждую.
Хроника релиза / 08
Шесть дней в роли анонимной скрытой модели, затем полноценный релиз с открытыми весами.
`stealth/ox-alpha` возникает на OpenRouter без указания провайдера и бесплатно по токенам.
Пять крупнейших потребителей — агентные инструменты для кода; OpenCode отдаёт модель бесплатно.
Z.ai подтверждает происхождение от Ox Alpha; карточка модели, веса под MIT и цены выходят разом.
Собственный движок на базе SGLang, заявленное ускорение — около 3x. Поставщик не раскрыт.
`zai-org/GLM-5.3-Flash`, плюс вариант BF16 и зеркало на ModelScope. Репозитория на GitHub нет.
Цены — на OpenRouter, квантизации — на Hugging Face. За полевыми отчётами идите на Reddit, там всё ещё Ox Alpha.
Кому подходит / 09
Командам, которые платят по флагманскому тарифу за работу, никогда не требовавшую такой глубины, — и там, где это неудачный выбор.
Вызовы инструментов по цене вдесятеро ниже токена GLM 5.3 делают длинные агентные циклы посильными.
Окно на миллион токенов держит кодовую базу целиком, поэтому вопросы по нескольким файлам обходятся без поиска.
Разъехавшаяся вёрстка, записи воспроизведения бага, схемы на диаграммах.
Сравните с DeepSeek V4 Flash и Qwen прямо в чате glm5.app.
Веса под MIT и поддержка vLLM реальны, но 328 ГБ в FP8 исключают одну машину.
Примерно 50 выходных токенов в секунду — медленнее большинства моделей той же цены.
Три пути: бесплатный чат в браузере, API glm5.app или веса под MIT на своём железе.
Выберите GLM 5.3 Flash в чате и прикрепите скриншоты. Новым аккаунтам начисляются бесплатные кредиты.
Отправляйте OpenAI-совместимые запросы на `https://glm5.app/api/v1` с ID модели `glm-5.3-flash`.
Скачайте `zai-org/GLM-5.3-Flash` и поднимите его на SGLang или vLLM — около 328 ГБ в FP8.
Integration specimen
OpenAI-совместимая точка Chat Completions. Используйте ID модели `glm-5.3-flash` по адресу `https://glm5.app/api/v1`.
Открыть документацию APIcurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha, цены, бенчмарки, параметры, Hugging Face, vLLM, DGX Spark и DeepSeek V4 Flash.
Да — она работала как `stealth/ox-alpha` шесть дней начиная с 20 августа 2026 года. Сохранённые чаты Ox Alpha переносятся автоматически.
Нет, это разные уровни с разницей в цене примерно в 10 раз. Flash — мультимодальная модель 320B-A18B, а GLM 5.3 — текстовый флагман.
Z.ai указывает $0,15 за 1M входных токенов, $0,03 за кешированные и $0,50 за выходные. Цитируемые $0,075 / $0,25 — временная стартовая скидка 50%.
Превью Ox Alpha было бесплатным, сейчас модель тарифицируется по использованию. Попробовать бесплатно всё ещё можно в чате glm5.app.
320B всего, 18B активных на токен, 45 слоёв маршрутизируют 8 экспертов из 288. Чекпоинт в FP8 занимает около 328 ГБ.
Веса лежат на Hugging Face в `zai-org/GLM-5.3-Flash` под лицензией MIT. Отдельного репозитория на GitHub нет — рецепты в `zai-org/GLM-5`.
vLLM, SGLang, TokenSpeed и KTransformers поддерживаются. 328 ГБ не поместятся в один DGX Spark; сообщество сообщает о связке двух на 4 битах.
Flash — если нужен визуальный ввод или рассуждение; DeepSeek V4 Flash — если важны пологое соотношение 1:2 или вывод в 384K.
Большая часть практических отзывов опубликована под именем превью, так что ищите на Reddit Ox Alpha.
Start here
Прогоните самую сложную задачу через GLM 5.3 Flash бесплатно в браузере, а затем подключите ID модели к своему пайплайну.