Бенчмарки Ox Alpha: как читать оценки сообщества
Aug 22, 2026

Бенчмарки Ox Alpha: как читать оценки сообщества

Бенчмарки Ox Alpha: официальных оценок нет. Результаты DeepSWE и Kingbench от сообщества не проверены — разбираем, как их читать и тестировать модель самому.

Коротко: у Ox Alpha нет официальных результатов бенчмарков. На странице модели stealth/ox-alpha в OpenRouter не указаны бенчмарки интеллекта, программирования или агентной работы, а независимый трекер Artificial Analysis эту модель не отслеживает (проверено 22 августа 2026 года). Цифры, которые ходят по сети, — около 80 % на подмножестве DeepSWE из 10 задач и 87,5 % на «Kingbench» — получены сообществом, основаны на крошечных выборках и не проверены независимо. Если вы оцениваете Ox Alpha, эта статья объясняет, что эти цифры значат на самом деле и на какие сигналы стоит смотреть вместо них.

Если вы искали бенчмарки Ox Alpha, вы наверняка упёрлись в ту же стену: 20 августа 2026 года появилась новая модель, о ней говорят в X и в анонсе OpenCode, но как только вы ищете твёрдые цифры, официальные страницы молчат, а посты сообщества расходятся в методологии. У stealth-модели, чей провайдер остаётся анонимным на время превью, это молчание легко принять за слабость или замазать скриншотами лидербордов. Это руководство опирается на карточку модели в OpenRouter, публичные данные API и публичные анонсы, по состоянию на 22 августа 2026 года. Формальных бенчмарков мы сами не проводили; цель — дать рамку для чтения чужих утверждений плюс те официальные данные, которые действительно существуют.

Официальное табло пусто — и это намеренно

Ox Alpha вышла на OpenRouter 20 августа 2026 года. Официальная карточка подробна там, где это важно для интеграции: контекстное окно на 1 048 576 токенов (1M), до 131 072 токенов вывода, ввод текста/изображений/видео с текстовым выводом, цена превью 0 $ за миллион токенов с обеих сторон, обязательный reasoning с максимальным усилием по умолчанию, а также поддержка инструментов, tool choice и структурированного вывода. Позиционирование заявлено прямо: «модель рассуждений, созданная для программирования, продолжительной агентной работы и продакшн-нагрузок», подходящая для «долгосрочной разработки ПО, сложных рассуждений и сценариев, сочетающих текст с визуальным контекстом».

Чего в карточке нет — так это результатов бенчмарков. Ни индекса интеллекта, ни позиции в лидерборде по программированию, ни агентной оценки в разделе Performance. Artificial Analysis — независимый трекер, который большинство проверяет первым, — эту модель не отслеживает (проверено 22 августа 2026 года). А данные, которые обычно нужны, чтобы поместить оценку в контекст — личность провайдера, архитектура, число параметров и цены после превью, — в этот период не раскрываются.

Стоит сказать это прямо: отсутствие официальных оценок — это факт о карточке модели, а не свидетельство о её возможностях. Stealth-модели часто пропускают бенчмарки, отчасти чтобы не быть зафиксированными до полноценного релиза. Правильный вопрос не «почему нет оценок?», а «какому сигналу я могу доверять вместо них?» — на это и отвечает остальная часть статьи.

Что сообщает сообщество

По сети ходят две цифры:

1. Около 80 % на подмножестве DeepSWE из 10 задач. Тест сообщества показывает у Ox Alpha примерно 80 % на подмножестве DeepSWE из 10 задач (данные сообщества, независимо не проверены). То же сравнение на малой выборке даёт Fable 65 %, а GPT-5.6 Sol — 52 %. Обратите внимание на методологию: это подмножество бенчмарка — десять задач, а не полный набор, — так что разрыв между 80 % и 65 % буквально равен нескольким задачам в ту или иную сторону.

2. 87,5 % на Kingbench. Статья сообщества сообщает о 87,5 % у Ox Alpha на Kingbench — второе место после GLM-5.3 с 91,25 % (данные сообщества, независимо не проверены). Kingbench не является стандартным бенчмарком: у него нет опубликованной проверяемой методологии, и ни одна независимая лаборатория его не проводит. Считайте эту цифру в лучшем случае ориентиром.

Есть также спекуляция, основанная на сравнении отпечатков, токенизатора и видеокодировщика, что Ox Alpha может быть скрытой мультимодальной версией модели серии GLM (не подтверждено, чистая догадка). Мы эту догадку не поддерживаем, и она не должна влиять на ваше решение, — но она объясняет, почему в части тредов модель считают «предположительно хорошей в коде», а не «доказанно хорошей в коде».

Как читать бенчмарки сообщества: практическая рамка

Большинство материалов просто повторяют цифры. Вот что обычно упускают — четыре вопроса, прежде чем оценка сообщества заслужит ваше доверие.

Вопрос 1: какого размера выборка? Результат из 10 задач сдвигается примерно на 10 пунктов за задачу. Один удачный или неудачный прогон переворачивает весь заголовок. Правило: любую оценку на выборке меньше 50 задач считайте сигналом, а не выводом. Она говорит, что модель стоит протестировать; она не говорит, какое место модель занимает.

Вопрос 2: что бенчмарк вообще измеряет? DeepSWE — бенчмарк долгосрочной разработки ПО: модель должна проработать реальный репозиторий за много ходов, чтобы закрыть задачу. Это похоже на агентную работу в продакшене. Методология Kingbench неясна (нестандартная), так что нельзя даже сказать, что именно он измеряет. Оценка за одноходовый вопрос-ответ почти ничего не скажет об агентной модели для кода, и наоборот. Сопоставьте нагрузку бенчмарка со своей, прежде чем взвешивать цифру.

Вопрос 3: кто проводил тест и была ли независимая проверка? Тесты сообщества — не рецензирование. Если у проводившего тест есть интерес в результате — вендор, партнёр, хайп-аккаунт — делайте скидку. Проверка теста — это воспроизводимость: видите ли вы точный набор задач, харнесс и конфигурацию модели? Если нет, цифра — это утверждение, а не измерение.

Вопрос 4: сравнения действительно сопоставимы? Использовалось ли одно и то же подмножество задач для каждой модели? Та же температура, тот же тулинг, то же число попыток? Сравнение с 80 % на DeepSWE выглядит внутренне непротиворечивым, но остаётся самостоятельно выбранным подмножеством, прогнанным одной стороной. Если хотя бы одна модель в таблице шла в других условиях, вся таблица недействительна.

Итог одной строкой: оценки сообщества полезны ровно для одного — составить шорт-лист. Для ранжирования Ox Alpha против других моделей они не годятся, а для stealth-модели, которую никто не смог проверить, они особенно слабы.

Сигналы получше: что говорит реальное использование

Вот та часть официальных данных, которую пропускает большинство постов в погоне за бенчмарками. Раздел Apps/Activity в OpenRouter показывает реальный продакшн-трафик, и примерно за два дня после запуска Ox Alpha израсходовала около 657 миллиардов промпт-токенов и 7,95 миллиарда токенов вывода. Пять приложений с наибольшим трафиком — все агентные инструменты для кода: Hermes Agent (120 млрд токенов), Claude Code (108 млрд), Oh-My-Pi (93,5 млрд), DeepSeek Harness с мультимодальным мостом (84,8 млрд) и ZCode (51,5 млрд).

Почему это лучше непроверенного скриншота с 10 задачами? Потому что это агрегировано по тысячам пользователей, непрерывно гоняющих реальные долгие нагрузки. Агентные инструменты — самый жёсткий стресс-тест: они держат контекст много ходов, вызывают инструменты, восстанавливаются после ошибок и продолжают работу. Если команды пропускают 657 миллиардов промпт-токенов через модель за два дня, это свидетельство полезности под реалистичной нагрузкой — не доказательство места в лидерборде, но куда более сильный сигнал, чем заявление на 10 задачах.

По эксплуатации официальный мониторинг (P50 примерно за три дня) сообщает пропускную способность 24 токена в секунду, задержку 5,81 секунды, аптайм 99,99 % и доступность 99,14 %. Адопция в экосистеме подтверждает тренд: Ox Alpha («Ox Alpha Free») есть в OpenCode Go с ограниченным бесплатным окном на ближайшую неделю, почти безлимитным использованием, которое не списывается с лимита Go, нулевым хранением данных и тем же контекстом 1M. Это публичное обязательство вендора инструментов, а не слух.

Если ваша работа — долгосрочное программирование и агентные задачи, то есть ровно тот профиль, который показывают данные использования, вы можете попробовать Ox Alpha бесплатно на glm5.app прямо сейчас.

Как самому провести бенчмарк Ox Alpha

Учитывая состояние публичных данных, самый надёжный бенчмарк для вашего сценария — тот, который вы проведёте сами. Конкретно:

  1. Возьмите 3–5 задач из своей реальной работы. Рефакторинг в знакомом репозитории, многошаговая отладка, длинный агентный прогон с вызовами инструментов или задача, где к инструкциям добавлен скриншот либо документ, — модель принимает изображения и видео на вход.
  2. Прогоните один и тот же промпт через Ox Alpha и вашу текущую модель. Те же инструкции, те же инструменты, та же температура. Между прогонами ничего в настройках не меняйте.
  3. Оценивайте выполнение и качество, а не впечатление. Задача завершена? Был ли вывод верным с первого раза? Сколько потребовалось ручного сопровождения?
  4. Нагрузите длинный горизонт. С контекстным окном на 1M токенов и reasoning на максимуме по умолчанию Ox Alpha рассчитана на продолжительную работу. Одноходовый вопрос не покажет её возможностей; агентный прогон на 20 ходов — покажет.
  5. Настраивайте честно. API поддерживает reasoning effort (max/high/low), инструменты и tool choice, структурированный вывод, temperature и top_p/top_k — так что сравнивать можно в идентичных, воспроизводимых условиях.

Несколько оговорок для калибровки ожиданий: провайдер анонимен на время превью, бесплатное ценовое окно в OpenRouter и бесплатная неделя OpenCode могут измениться, и ничто в этой статье не заменяет официальные страницы. Вы тестируете модель такой, какая она сегодня, — это честный способ оценивать stealth-релиз.

Если не хотите ради старта настраивать API-ключ, пообщайтесь с Ox Alpha в браузере на glm5.app — это бесплатная веб-точка входа — и выполните первую задачу за ближайшие пять минут.

FAQ

Есть ли у Ox Alpha официальные бенчмарки? Нет. Карточка в OpenRouter содержит характеристики, цены и мониторинг производительности, но не содержит оценок бенчмарков по интеллекту, программированию или агентной работе. Artificial Analysis модель не отслеживает (проверено 22 августа 2026 года).

Какие результаты у Ox Alpha на DeepSWE и Kingbench? По тестам сообщества: около 80 % на подмножестве DeepSWE из 10 задач (при Fable 65 % и GPT-5.6 Sol 52 % в том же прогоне на малой выборке) и 87,5 % на Kingbench, позади GLM-5.3 с 91,25 %. Оба результата получены сообществом и независимо не проверены; Kingbench не является стандартным бенчмарком.

Можно ли доверять оценкам сообщества? Как сигналам — да, как выводам — нет. Они получены на крошечных выборках без независимой проверки. Прогоните их через рамку из четырёх вопросов выше — размер выборки, что измеряется, кто проводил, сопоставимость методологии, — прежде чем взвешивать любую цифру.

Быстрая ли Ox Alpha? Мониторинг OpenRouter (P50, около трёх дней) сообщает о пропускной способности 24 токена в секунду и задержке 5,81 секунды при аптайме 99,99 % и доступности 99,14 %. Учтите: reasoning обязателен и по умолчанию стоит на максимальном усилии, так что на сложных задачах закладывайте время на размышление.

Как самому провести бенчмарк Ox Alpha? Прогоните собственные реальные задачи в прямом сравнении с текущей моделью — те же промпты, те же инструменты, те же настройки. Быстрее всего начать с бесплатного веб-чата на glm5.app; API через OpenRouter (бесплатный на время превью) позволяет тестировать программно с инструментами и структурированным выводом.

Sources

Последнее обновление: 22 августа 2026 года

Начните использовать GLM 5 сегодня

Попробуйте GLM 5 бесплатно — рассуждение, кодирование, агенты и генерация изображений на одной платформе.

Бенчмарки Ox Alpha: как читать оценки сообщества - GLM 5