Введение: границы рекордов и контекст анонсов

В августе 2026 года Alibaba представила обновление семейства Qwen3.8. В медиа эти релизы нередко обобщали тезисом о «крупнейшей открытой модели на 2.4 триллиона параметров». Однако фактологический аудит требует точности: статус рекордсмена не принадлежит Alibaba. Еще 27 июля 2026 года Moonshot AI выпустила Kimi K3 масштабом 2.8 триллиона параметров (2.8T), зафиксировав рекорд для открытых весов.

Для экосистемы Qwen релиз Qwen3.8-2.4T-A95B стал рубежным событием по иной причине. Ранее наиболее производительный флагманский класс Max развивался исключительно как закрытый облачный сервис. Выпуск Qwen3.8-2.4T-A95B стал первым прецедентом открытия весов модели Max-класса в линейке Qwen, предоставив сообществу доступ к архитектуре разреженной смеси экспертов (Sparse MoE) такого масштаба.

Главная сложность восприятия августовских анонсов Alibaba в том, что компания выпустила три разных артефакта с различающимися характеристиками, модальностями и лицензиями. Смешение спецификаций API, открытых весов и плотной модели привело к путанице в оценке их возможностей и требований к инфраструктуре. Ниже приведено строгое разграничение каждого компонента.

1. Три артефакта экосистемы Qwen3.8: четкое разграничение

Под общим брендом Qwen3.8 в августе 2026 года вышли три самостоятельных решения:

1. Облачный API qwen3.8-max

Флагманский интерфейс стал общедоступным (GA) 3 августа 2026 года в сервисах Alibaba Cloud Model Studio и QwenCloud:

  • Мультимодальность: принимает текст, изображения и видео, а выводит текст.
  • Управляемый режим рассуждений: в API qwen3.8-max блок рассуждений (thinking) можно отключать в параметрах запроса, если приложению требуется минимальная задержка без генерации промежуточных шагов.
  • Контекстное окно: поддерживает передачу до 1 миллиона токенов в рамках одного запроса.
  • Встроенные инструменты (tools): включает нативную поддержку вызова внешних функций, выполнения кода и сетевого поиска.
  • Контрольный снимок: 2 сентября 2026 года в облачной инфраструктуре появился снимок qwen3.8-max-0902 с доработками логики рассуждений и кодогенерации.

2. Открытые веса Qwen3.8-2.4T-A95B

Публикация весов состоялась 12 августа 2026 года на Hugging Face. Это первый открытый представитель класса Qwen-Max, однако его параметры существенно отличаются от облачного сервиса:

  • Строго текстовый формат (text-only): в открытом чекпоинте отсутствуют зрительные модули; модель работает только с текстом.
  • Фиксированный режим рассуждений (thinking-only): открытые веса жестко ориентированы на обязательное построение цепочки рассуждений. Отключить блок размышлений штатным флагом вызова здесь невозможно.
  • Контекстное окно: нативный контекст составляет 262 144 токена (262k) с задокументированным расширением до 1 010 000 токенов (1.01M) при специализированной настройке RoPE.
  • Правовой статус: распространяется под кастомной лицензией Qwen3.8-Max License. Это модель с открытыми весами (open weights), но не свободный open source.

3. Плотная модель Qwen3.8-27B

14 августа 2026 года состоялся выход модели Qwen3.8-27B. В индустрии возник миф, будто это дистиллят старшего флагмана Max.

В официальной документации Qwen3.8-27B представлена как самостоятельная модель на плотной (dense) архитектуре, а не как дистиллят Max. На каждом токене задействуется вся модель. Она нативно мультимодальна и распространяется под пермиссивной лицензией Apache 2.0.

2. Архитектура Qwen3.8-2.4T-A95B по данным model card и config.json

Характеристики открытой модели зафиксированы в ее model card и файле config.json на Hugging Face:

  • Общий объем параметров: 2.4 триллиона (2.4T total).
  • Число активных параметров на токен: 95 миллиардов (95B active, или A95B).
  • Количество слоев трансформера: 92 последовательных слоя.
  • Размерность скрытого состояния (hidden_size): 8192.
  • Пул маршрутизируемых экспертов: 512 routed experts.
  • Схема активации на токен: ровно 10 маршрутизируемых экспертов плюс 1 постоянный разделяемый эксперт (10 routed + 1 shared).
  • Промежуточная размерность экспертов (intermediate_size): 2048.
  • Гибридное внимание: 69 слоев линейной памяти Gated DeltaNet и 23 слоя полного внимания Gated Attention, что задает соотношение 3:1.
  • Балансировка роутера: параметр вспомогательной функции потерь router_aux_loss_coef равен 0.001.

В официальных спецификациях Alibaba отсутствуют формула DeltaNet, заявления о снижении TTFT на 68% или сжатии KV-кэша в 4 раза. Нет там и жёстко заданной специализации экспертов по программированию, физике или другим предметным областям.

Почему 95B active не означает стоимость обычной 95B модели

В сообществе встречается ошибочный тезис: раз на каждый токен активируется 95 миллиардов параметров, сложность инференса равна стоимости стандартной плотной модели на 95B параметров. С инженерной точки зрения это не так.

Число активных параметров показывает, какая часть разреженной модели задействуется для обработки токена, но не является точной мерой FLOPs или стоимости инференса. Для работы модели в памяти кластера всё равно необходимо хранить весь массив из 2,4 триллиона параметров, а фактические затраты зависят также от внимания, роутера, пакетной нагрузки и реализации движка.

Распределение 512 экспертов по серверам порождает критическое узкое место — сетевую операцию All-to-All. В ходе генерации промежуточные векторные представления непрерывно передаются между GPU через интерконнект. Накладные расходы на сетевую задержку, дисбаланс очередей к экспертам и синхронизацию буферов делают обслуживание 2.4T-модели несопоставимо более затратным, чем эксплуатацию монолитной 95B модели.

3. Бенчмарки: данные вендора и независимый контекст

Анализ возможностей флагмана требует строгого разделения собственных отчетов разработчика и независимого тестирования.

Результаты тестирования вендора (Vendor Results Qwen)

В официальных материалах релиза команда Qwen приводит следующие подтвержденные показатели флагмана Qwen3.8-Max:

  • SWE-bench Pro: 67.7
  • Terminal-Bench 2.1: 86.6
  • PaperBench: 93.0
  • OSWorld-Verified: 86.1
  • GPQA Diamond: 92.6

Разработчики отмечают: различия в тестовых обвязках (harness), промптах и настройках декодирования не позволяют объявить универсального лидера по всем дисциплинам. В той же сравнительной таблице вендора присутствуют модели, опережающие флагман Alibaba в отдельных задачах: система Fable 5 зафиксировала 80.0 на SWE-bench Pro, а GPT-5.6 Sol достигла 88.8 на Terminal-Bench 2.1.

Сторонние замеры: Artificial Analysis и Arena

В бенчмарках Artificial Analysis используется Intelligence Index. По состоянию на 6 сентября 2026 года на актуальной шкале Intelligence Index v4.2:

  • облачный API qwen3.8-max набирает 47 пунктов;
  • открытый чекпоинт Qwen3.8-2.4T-A95B также набирает 47 пунктов.

Исторический результат API на предыдущей методике Intelligence Index v4.1 составлял 56 пунктов — Artificial Analysis опубликовала его 6 августа 2026 года. Версии v4.1 и v4.2 различаются набором тестов и калибровкой, поэтому результаты 56 и 47 напрямую несопоставимы.

В краудсорсинговой Arena модель qwen3.8-max на момент запуска заняла 5-е место в текстовой категории, 2-е — в Vision и 4-е — во Frontend Code. По данным платформы от 2 сентября 2026 года, снимок qwen3.8-max-0902 вышел на 1-е место в категории WebDev с рейтингом 1691. Эти позиции отражают состояние конкретных таблиц на указанные даты и могут меняться.

4. Экономика облачного API: цены, география и кэширование

Тарифная сетка Alibaba Cloud на доступ к API qwen3.8-max дифференцирована по регионам:

  • QwenCloud и Alibaba Cloud Model Studio (Сингапур, scope International): $2.00 за 1 миллион входных токенов и $6.00 за 1 миллион выходных токенов.
  • Alibaba Cloud Model Studio (Пекин; Global-регионы Frankfurt, Virginia, Tokyo и Hong Kong): $1.65 за 1M входных токенов и $4.951 за 1M выходных токенов.

Фактическая стоимость запросов зависит от региона размещения серверов, валютной конвертации и применения контекстного кэширования (Prompt Cache), снижающего затраты при повторной передаче длинных статических префиксов. При этом некорректно сравнивать эти тарифы с устаревшими моделями прошлых поколений (OpenAI o1, GPT-4o или Claude 3.5 Sonnet) и декларировать разрыв в «15–50 раз».

5. Лицензионные условия Qwen3.8-Max License: модель открытых весов

Правовой режим открытой модели Qwen3.8-2.4T-A95B определяется соглашением Qwen3.8-Max License. Это модель с открытыми весами (open weights), но не свободное ПО (open source), поскольку лицензия содержит прямые коммерческие ограничения:

  1. Порог упоминания бренда: если аудитория коммерческого сервиса на базе модели превышает 100 миллионов активных пользователей в месяц (100M MAU) либо его месячная выручка превышает $20 миллионов, лицензиат обязан указывать наименование оригинальной модели Qwen3.8-Max в интерфейсе и документации.
  2. Ограничение для сервисов MaaS и ИИ-ассистентов: для компаний, предоставляющих доступ к модели по схеме Model-as-a-Service или разрабатывающих корпоративных помощников (AI Work Assistant), действует финансовый порог: при доходе свыше $50 миллионов за последние 12 месяцев использование весов требует оформления отдельной лицензии у Alibaba Cloud.

6. Локальное развертывание (Self-hosting) и аппаратные требования

Эксплуатация модели масштаба 2.4T в локальном контуре выдвигает жесткие требования к аппаратуре и распределенной среде инференса.

Арифметика физического объема весов

  • Формат BF16 (16 бит): чистый объем весов составляет около 4.8 ТБ.
  • Квантованный формат FP8 (8 бит): размер файлов весов уменьшается примерно до 2.4 ТБ.

В публикациях встречается ошибочный расчет, будто для запуска модели в FP8 достаточно 16 ускорителей NVIDIA H200 (каждый по 141 ГБ VRAM, суммарно ~2256 ГБ). В действительности 16 карт H200 категорически недостаточно: этот расчет не учитывает память под системные процессы, буферы NCCL, активации и буфер KV-кэша.

Официальное руководство vLLM (vLLM recipe) оценивает минимальные требования кластера не менее чем в 48 ускорителей NVIDIA H200 для точности BF16 либо не менее 32 ускорителей NVIDIA H200 для режима FP8.

Фактическая скорость инференса зависит от сетевой топологии, пакетной нагрузки и длины контекста, поэтому приводить фиксированные цифры скорости генерации без конкретного стенда необоснованно. Развертывание в средах vLLM и SGLang рекомендуется выполнять строго по официальным руководствам разработчиков.

В качестве примера кластерной платформы NVIDIA опубликовала замеры на стойке GB300 NVL72: это вендорное измерение (vendor measurement) и пример масштабирования, а не отраслевой эталон.

Аппаратный профиль компактной Qwen3.8-27B

Для локальных экспериментов интерес представляет плотная модель Qwen3.8-27B. Арифметически в 4-битном квантовании одни только веса занимают около 13–14 ГБ памяти. Реальное потребление выше из-за служебных буферов движка, KV-кэша, длины контекста и мультимодального энкодера, поэтому из этой арифметики нельзя вывести универсальный минимальный объём VRAM.

Выводы редакции: баланс между открытостью и облачным контролем

Релиз семейства Qwen3.8 подтвердил высокий инженерный уровень Alibaba Cloud, предложившей разработчикам одновременно мощный облачный интерфейс и открытые веса рекордного для экосистемы объема.

Анализируя итоги августовских анонсов, редакция формулирует следующие выводы:

  1. Расширение выбора при закрытом облачном ядре: выпуск весов 2.4T-A95B существенно обогатил выбор для исследовательских лабораторий и корпораций с мощными кластерами. Вместе с тем наиболее функциональный флагманский сервис qwen3.8-max с нативной мультимодальностью, встроенными инструментами и управляемым режимом рассуждений остается закрытым проприетарным облачным сервисом.
  2. Правовая специфика open weights: открытая модель распространяется под кастомной лицензией с коммерческими барьерами. Она относится к формату открытых весов, но не является открытым программным обеспечением.
  3. Реальный масштаб рекордов: абсолютный рекорд по общему числу параметров среди открытых моделей ранее зафиксировала Kimi K3 (2.8T) от Moonshot AI. Модель Qwen3.8-2.4T-A95B корректно называть первым открытым релизом класса Max внутри семейства Qwen, что стало важным прецедентом для мировой индустрии.

Источники

  1. Официальный блог команды Qwen: https://qwen.ai/blog?id=qwen3.8
  2. Пресс-релиз Alibaba Cloud о запуске Qwen3.8-Max: https://www.alibabacloud.com/en/press-room/alibaba-unveils-qwen3-8-max?_p_lc=1
  3. Документация Alibaba Cloud Model Studio по Qwen3.8-Max: https://www.alibabacloud.com/help/en/model-studio/qwen3-8-max
  4. Тарифная сетка моделей в Alibaba Cloud Model Studio: https://www.alibabacloud.com/help/en/model-studio/model-pricing
  5. Страница модели Qwen3.8-Max на платформе QwenCloud: https://www.qwencloud.com/models/qwen3.8-max
  6. Репозиторий проекта Qwen3.8 на GitHub: https://github.com/QwenLM/Qwen3.8
  7. Репозиторий весов Qwen3.8-2.4T-A95B на Hugging Face: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
  8. Конфигурационный файл архитектуры Qwen3.8-2.4T-A95B: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B/raw/main/config.json
  9. Лицензионное соглашение Qwen3.8-Max License: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B/blob/main/LICENSE
  10. Репозиторий плотной мультимодальной модели Qwen3.8-27B: https://huggingface.co/Qwen/Qwen3.8-27B
  11. Официальное руководство по развертыванию модели в vLLM: https://recipes.vllm.ai/Qwen/Qwen3.8-2.4T-A95B
  12. Руководство по интеграции и инференсу в SGLang: https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8
  13. Инженерный отчет NVIDIA по инференсу на платформе GB300 NVL72: https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/
  14. Публикация о релизе открытой модели Kimi K3 2.8T: https://www.kimi.com/blog/kimi-k3
  15. Независимый аудит и аналитика Artificial Analysis: https://artificialanalysis.ai/models/qwen3-8-2-4t-a95b