20 августа 2026 года в каталоге OpenRouter появилась бесплатная модель stealth/ox-alpha. Разработчик не назывался, а описание обещало длинные агентные сессии, работу с кодом и контекст до 1 048 576 токенов. Модель принимала не только текст, но также изображения и видео.

Через шесть дней интрига разрешилась: за Ox Alpha стояла китайская компания Z.ai, ранее известная как Zhipu AI. Анонимным превью оказалась GLM-5.3-Flash — модель с 320 млрд параметров, из которых при обработке токена активируются 18 млрд. Её веса опубликованы на Hugging Face под лицензией MIT.

История действительно примечательная, но не потому, что неизвестная система якобы «разгромила GPT-4o» или установила мировой рекорд на арене. Таких данных первоисточники не содержат. Главный сюжет — в другом: Z.ai на неделю вывела недорогую модель с открытыми весами в реальную агентную среду без собственного бренда, собрала обратную связь и только затем раскрыла её происхождение.

Где на самом деле появилась Ox Alpha

Дебют модели иногда ошибочно связывают с LMSYS Chatbot Arena, слепыми дуэлями и рейтингом Elo — это неверная реконструкция событий.

OpenRouter указывает точную дату выпуска — 20 августа 2026 года — и сохраняет архивную страницу stealth/ox-alpha. Z.ai в своей документации называет две площадки анонимного теста: OpenCode и OpenRouter. Утверждений о первом месте в LMSYS/LMArena, рейтинге 1394 или специальных победах над Claude 3.5 Sonnet и GPT-4o в этих источниках нет.

Сравнение с моделями 2024 года к тому же мало говорит о расстановке сил в 2026-м. Поэтому формулировка «новый SOTA в генерации кода» не выдерживает проверки. Сама Z.ai описывает результат осторожнее: GLM-5.3-Flash приближается к Claude Opus 4.8 в задачах программирования и агентной работы, но не объявляется безусловным лидером рынка.

Корректная хронология выглядит так:

TEXT

20 августа 2026 OpenRouter публикует бесплатную stealth/ox-alpha ↓ анонимное тестирование на OpenRouter и OpenCode ↓ 26 августа 2026 Z.ai раскрывает название GLM-5.3-Flash ↓ веса и model card появляются на Hugging Face под MIT

Что подтвердили OpenRouter и Z.ai

После раскрытия OpenRouter прямо связал старый идентификатор stealth/ox-alpha с z-ai/glm-5.3-flash. На архивной странице зафиксированы основные параметры превью:

  • контекст — 1 048 576 токенов;
  • входные данные — текст, изображения и видео;
  • выход — текст;
  • назначение — программирование, длительная агентная работа и производственные сценарии;
  • разработчик и оператор — Z.ai.

Есть и важная оговорка о данных. OpenRouter сообщает, что провайдер сохранял промпты и ответы, но не использовал их для обучения. Z.ai формулирует цель превью как сбор пользовательской обратной связи. Это не даёт оснований утверждать, что компания провела RLHF или дообучила веса на коде пользователей OpenRouter.

Анонимность могла уменьшить предубеждение к бренду, но Z.ai не публиковала методику контролируемого эксперимента с brand bias. Поэтому правильнее говорить о стелс-превью продукта, а не о доказанном «слепом тесте» качества.

GLM-5.3 и GLM-5.3-Flash — разные модели

Название легко вводит в заблуждение. GLM-5.3-Flash — не облегчённый режим флагманской GLM-5.3 и не просто её более дешёвый API-тариф. По данным model card, Flash начинается с отдельно обученной базовой модели и использует переработанную архитектуру.

Различается и лицензирование. На Hugging Face для GLM-5.3-Flash указана MIT License, тогда как у GLM-5.3 — отдельная лицензия glm-5.3. Поэтому переносить условия MIT с Flash на всё семейство нельзя.

Точнее всего называть GLM-5.3-Flash моделью с открытыми весами и либеральной лицензией. Это не означает открытость обучающего датасета, полного производственного пайплайна или инфраструктуры, на которой модель создавалась.

Архитектура: 320B всего, 18B активных

GLM-5.3-Flash построена как Mixture of Experts. В конфигурации модели указаны:

  • 320 млрд параметров всего и 18 млрд активных;
  • 45 слоёв;
  • 288 маршрутизируемых экспертов и один общий эксперт;
  • восемь выбираемых экспертов на токен;
  • максимальный контекст 1 048 576 токенов;
  • 34 слоя линейного внимания и 11 слоёв разреженного внимания.

Z.ai называет это первой в серии GLM-5 нативно мультимодальной моделью. Визуальные данные встроены в агентный цикл: система может анализировать интерфейс или результат рендеринга, сопоставлять его с задачей и корректировать код.

Гибрид линейного и разреженного внимания нужен для снижения цены длинного контекста. Локальные зависимости обрабатываются через state-моделирование, а релевантный глобальный контекст извлекается разреженным механизмом с индексатором. Дополнительный компонент IndexPool объединяет ключи индексатора, уменьшая нагрузку на память.

По расчётам Z.ai, относительно GLM-5.3 вычисления внимания на токен, голову и слой сокращаются примерно в 3 раза, а средний размер KV-кэша на слой в формате BF16 — в 4,4 раза. Это нормированные оценки производителя для отдельных компонентов архитектуры, а не показатели общей вычислительной нагрузки и памяти всей модели или результаты независимого теста оборудования.

В некоторых источниках архитектура описывается иначе: 128 экспертов, специализации «Python», «Raft» и «ACID», GQA 8:1, YaRN, точность 99,8% на Needle in a Haystack и TTFT менее 380 мс. Подтверждения этим деталям в официальной документации нет.

Что говорят бенчмарки — и чего они не доказывают

Z.ai приводит собственные результаты на шести тестах программирования и агентной работы. Среди опубликованных значений:

Бенчмарк

GLM-5.3-Flash

GLM-5.2

DeepSWE v1.1

63,4

46,2

AutomationBench v1.0.6

48,8

26,2

Z.ai Code Bench v1.0, max effort

29,0

На внутреннем Z.ai Code Bench компания сравнивает результат Flash с 29,5 у Claude Opus 4.8. Это поддерживает формулировку «приближается к Opus 4.8», но не титул абсолютного SOTA.

К подобным таблицам нужны три оговорки.

Во-первых, результаты публикует разработчик модели. Во-вторых, агентные тесты чувствительны не только к весам, но и к harness, лимитам времени, числу попыток, инструментам и reasoning effort. В-третьих, баллы разных версий одного бенчмарка нельзя смешивать в общей таблице.

Именно так возникают вводящие в заблуждение сравнения: рядом ставят неподтверждённые значения SWE-bench Verified, LiveCodeBench, HumanEval+ и неидентифицированного Multi-file Refactoring Benchmark. Такая таблица создаёт видимость точности, но не имеет проверяемого происхождения.

Цена API и реальная стоимость локального запуска

На 5 сентября 2026 года прайс Z.ai указывает для GLM-5.3-Flash:

  • базовая цена ввода — $0,15 за 1 млн токенов;
  • базовая цена вывода — $0,50 за 1 млн токенов;
  • до 9 сентября действует скидка 50%: $0,075 и $0,25 соответственно.

Это действительно заметно дешевле флагманских API, однако цена токена не равна стоимости решённой задачи. Длинный агентный цикл может многократно перечитывать контекст, вызывать инструменты и исправлять собственные ошибки. Для сравнения моделей полезнее считать стоимость успешно выполненного задания при одинаковом harness.

MIT-лицензия разрешает локальное развёртывание, но не делает его дешёвым для обычной рабочей станции. Грубая оценка одних только 320 млрд весов составляет около 640 ГБ в BF16 или 160 ГБ при 4-битном представлении — без KV-кэша и служебных накладных расходов. Поэтому заявление о полноценном запуске на «нескольких RTX 4090/5090» требует конкретной квантизации, оборудования, скорости и длины контекста. Официальный model card перечисляет SGLang, vLLM, Transformers, KTransformers и Unsloth, но не обещает удобный миллионный контекст на паре потребительских GPU.

Зачем Z.ai понадобилось анонимное превью

Компания сообщает, что Ox Alpha стала самой популярной моделью недели, а весь трафик обслуживался на кластере китайских AI-ускорителей. Этот эпизод одновременно проверял модель и инфраструктуру на реальной нагрузке.

Однако из него нельзя автоматически выводить, что:

  • стелс-запуск стал новым обязательным стандартом индустрии;
  • пользовательские промпты пошли на обучение модели;
  • банки и телеком массово отказались от закрытых API;
  • монополия американских лабораторий завершилась.

Подтверждённый вывод скромнее и интереснее. Открытая модель может быстро получить широкую реальную нагрузку через агрегатор, а происхождение перестаёт быть главным фактором первого знакомства. После раскрытия решающими становятся уже проверяемые свойства: лицензия, цена, качество на конкретном рабочем процессе, политика данных и стоимость инфраструктуры.

Что остаётся неизвестным

Публичные материалы не отвечают на несколько вопросов:

  1. Как выглядело распределение задач во время бесплатного превью и сколько пользователей проверяли именно программирование.
  2. Как GLM-5.3-Flash сравнивается с актуальными конкурентами при одном независимом harness и одинаковом бюджете вычислений.
  3. Как меняется качество на длинных агентных сессиях при приближении к пределу контекста.
  4. Какие данные, кроме промптов и ответов, входили в собранную Z.ai «обратную связь».
  5. Какова практическая скорость self-hosted-инференса на разных квантизациях и ускорителях.

Пока этих данных нет, честная оценка должна оставаться предварительной.

Вывод

Ox Alpha не была тайным победителем LMSYS и не доказала новый мировой SOTA. Это было шестидневное анонимное превью GLM-5.3-Flash на OpenRouter и OpenCode.

У модели есть более убедительные основания для внимания: MIT-лицензия, нативная мультимодальность, контекст до миллиона токенов, 18 млрд активных параметров при 320 млрд общих и агрессивная цена API. По данным Z.ai, она заметно превосходит GLM-5.2 и приближается к Claude Opus 4.8 в ряде агентных задач.

Главный урок запуска — не «новый король кода», а изменение способа вывода моделей на рынок. Бесплатное анонимное превью способно быстро проверить спрос и инфраструктуру. Но после раскрытия бренда маркетинговую интригу всё равно должны заменить воспроизводимые тесты, понятная политика данных и расчёт полной стоимости эксплуатации.

Первоисточники