Заметный скачок по длительности
20 мая 2026 года TechCrunch (автор Ivan Mehta) сообщил о запуске семейства моделей Stable Audio 3.0 от Stability AI — компании, известной по Stable Diffusion. По заявлению Stability, топовая модель генерирует профессиональную музыку длительностью более шести минут. Это заметный скачок относительно Stable Audio 2.0 2024 года, где предел был существенно ниже — около 47 секунд у открытой версии.

Четыре модели с разными задачами
В семейство входят четыре модели. Small SFX (459 млн параметров) и Small (459 млн) рассчитаны на генерацию звука и музыки прямо на устройстве, длительностью до двух минут. Medium (1,4 млрд) и Large (2,7 млрд) создают полноценные композиции длиной 6 минут 20 секунд с сохранением музыкальной структуры и мелодической линии — более чем вдвое дольше, чем мог Stable Audio 2.0. Small SFX, Small и Medium выходят с открытыми весами — их можно скачивать и дорабатывать. Large доступна только через API и платный self-hosting; компаниям с выручкой свыше $1 млн нужна корпоративная лицензия.
Лицензированные данные и наём из индустрии
Stability заявляет, что новое семейство моделей построено полностью на лицензированных данных. В 2025 году компания заключила соглашения с Warner Music Group и Universal Music Group на разработку моделей и инструментов создания музыки. Параллельно Stability готовит набор продуктов для профессиональных музыкантов — детали функций пока не раскрыты; Ethan Kaplan, бывший директор по цифровым технологиям Universal Audio и Fender, присоединяется, чтобы возглавить это направление.
Контекст рынка и стратегия
По независимому освещению релиза, компания использует пользовательскую лицензию Stability AI Community License, по которой пользователи владеют результатами генерации и могут их распространять и монетизировать в рамках условий лицензии. Google, ElevenLabs и другие компании ускоряют развитие музыкальных инструментов, а судебные баталии вокруг Suno и Udio показывают, что лицензирование данных и партнёрства с лейблами критичны для долгосрочного выживания на этом рынке — наём музыкальных руководителей стал общим трендом отрасли. Stable Audio 3.0 сочетает генерацию длинных треков, открытые веса среднего уровня и лицензированное обучение — ставка на открытую экосистему вместе с корпоративным уровнем Large. Для музыкантов ключевые проверяемые факты релиза: 4 модели, максимальная длительность 6 минут 20 секунд, открытые веса у 3 из 4 моделей, порог корпоративной лицензии — выручка от $1 млн.
Скорость инференса и инструменты редактирования
На Nvidia H200 генерация у моделей Small и Small SFX занимает 0,44 секунды, у Medium — 1,31 секунды. Для сравнения: предыдущее поколение, Stable Audio Open Small, ограничивалось максимум 11 секундами звука, а Stable Audio Open — 47 секундами; новое поколение выросло на порядок по длительности при заметно более быстрой генерации.
Инструменты редактирования Stable Audio 3.0 включают не только точечный inpainting отдельных сегментов, но и multi-section modification — правку сразу нескольких частей трека, и causal continuation — продолжение уже существующего аудио с сохранением его характера. Для кастомной доработки моделей Stability публикует отдельную документацию по LoRA-дообучению.
Модель | Параметров | Макс. длительность | Доступность |
|---|---|---|---|
Small SFX | 459 млн | до 2 минут | открытые веса |
Small | 459 млн | до 2 минут | открытые веса |
Medium | 1,4 млрд | 6 мин 20 сек | открытые веса |
Large | 2,7 млрд | 6 мин 20 сек | только API и корпоративный self-hosting |
Официальные источники
Факты проверены 29 июля 2026 г.














