Единая модель для трёх модальностей

23 июля 2026 года Black Forest Labs — разработчик семейства FLUX, известного благодаря генерации и редактированию изображений по тексту — опубликовала официальный пост о FLUX 3, новой мультимодальной базовой модели. Модель совместно обучается на изображениях, видео и звуке в единой архитектуре: цель — представление самого «мира» — как объекты держатся, как двигаются, как звучат события, — а не отдельных модальностей по отдельности. В основе подхода компании — метод Self-Flow для согласования мультимодальной генерации и понимания; вычислительные мощности и данные масштабировали так, чтобы обучать FLUX 3 одновременно на видео, изображениях и звуке. Модель умеет смешивать модальности и генерировать изображения и видео со звуком совместно — как из текстовых промптов, так и с опорой на референсы (изображения, видео).

Иллюстрация к материалу «FLUX 3 от Black Forest Labs»: цифровое творчество

Возможности по изображениям и видео

По изображениям FLUX 3 синтезирует и редактирует картинки в широком диапазоне стилей, соотношений сторон и разрешений. По предварительным оценкам на этапе промежуточного обучения, заметно выросла работа со сложными промптами и генерация текста на изображении — заявлена высокая точность текста на нескольких языках. Ранний доступ к FLUX 3 Image компания обещала «в ближайшие недели» — на момент публикации поста видео уже было в раннем доступе. По видео: ролики со звуком до 20 секунд за одну генерацию — текст-в-видео, изображение-в-видео с анимацией или визуальными референсами, видео-в-видео с переносом центральных элементов (например, персонажа), генеративное продолжение видео со звуком, генерация видео по ключевым кадрам, многоязычные диалоги, широкий диапазон стилей и соотношений сторон, агентная склейка клипов в многокадровые истории, устойчивая типографика и анимированный дизайн.

Предварительное сравнение с конкурентами

В предварительном тестировании предпочтений на 10-секундных клипах 720p с текстовым промптом и звуком компания сообщает: FLUX 3 предпочитали в сравнении с Grok Imagine Video в 69% случаев, с Kling v3 Pro — в 60%, с Happy Horse v1 — в 59%, с Happy Horse 1.1 — в 57%, с Seedance 2.0 и Gemini Omni Flash от Google — по 52%, с Runway Gen-4.5 — в 77%, с Luma Ray 3.2 — в 93%. По независимому освещению эти результаты помечены самой компанией как предварительная оценка раннего кандидата модели, то есть не обязательно совпадают с финальной выпущенной версией. Независимые обозреватели отмечают нюансы: превосходство над Luma и Runway выглядит «мягким» аргументом для корпоративного шортлиста, а 52% против Seedance 2.0 — почти монета, при том что международная версия Seedance 2.0 на момент сравнения была заморожена; против Omni Flash от Google уже действует общедоступный тариф около $0,10 за секунду видео 720p в API Gemini.

Направление Action и план запуска

Отдельное направление — Action: нативное предсказание действий и дообучение видео-модели вместе с партнёрами по робототехнике, включая FLUX-mimic для точной манипуляции объектами — испытания уже идут, в том числе у Audi. План запуска: FLUX 3 Video (API и приватные веса), Action (для партнёров, начиная с направления mimic), FLUX 3 Image (API и приватные веса), а также открытая мультимодальная базовая модель FLUX 3 Dev для создания контента и предсказания действий. На момент публикации цена, SLA для продакшна, полная методология оценки, размеры выборок и бенчмарки по изображениям ещё не объявлены — корпоративный покупатель пока не может самостоятельно посчитать полную стоимость владения.

Официальные источники

Факты проверены 26 июля 2026 г.