Первая модель Ideogram с открытыми весами
3 июня 2026 года Ideogram опубликовала технический блог о модели 4.0 — базовой text-to-image модели с открытыми весами на 9,3 миллиарда параметров. Это первый релиз компании с открытыми весами, специально заточенный под дизайн-задачи: типографику, управление раскладкой и структурированный промптинг. Архитектура: замороженный текстовый энкодер на основе языковой модели, обучаемый однопоточный Diffusion Transformer, sampler на основе flow-matching и замороженный VAE. Diffusion Transformer — единственный обучаемый компонент; в качестве текстового энкодера используется Qwen3-VL-8B-Instruct в текстовом режиме. Диапазон разрешения — от 256 до 2048 пикселей с гибким соотношением сторон.

Управление раскладкой через структурированный JSON
Ключевая особенность 4.0 — обучение исключительно на структурированных JSON-описаниях с блоком стиля, опциональными координатами объектов и цветовыми палитрами; при генерации система проверяет промпт на соответствие схеме. Поддерживается до 16 hex-цветов на изображение (по 5 на элемент), координаты объектов задаются в диапазоне от 0 до 1000, а типизированные текстовые элементы позволяют размещать многострочный текст разными шрифтами прямо на изображении — это превращает генерацию в управляемый инструмент вёрстки, куда ближе к дизайн-API, чем к «лотерее промптов».
Результаты на бенчмарках
По собственным данным Ideogram: контроль раскладки — 0,69 по метрике mIoU на бенчмарке 7Bench; распознавание текста на изображении — 0,97 по английскому OCR-бенчмарку X-Omni, что объясняет репутацию Ideogram как специалиста по тексту на изображениях; пространственное мышление — 0,76 по SpatialGenEval; соответствие промпту — 0,89 по Prism-bench. В независимом слепом исследовании ContraLabs Typography Evaluation профессиональные дизайнеры предпочли результат Ideogram 4.0 в 47,9% случаев — модель обошла Flux.2 несмотря на меньший размер в 9,3 миллиарда параметров. На независимом рейтинге DesignArena модель заняла первое место среди всех моделей с открытыми весами и девятое место в общем зачёте text-to-image арены, уступив только закрытым моделям OpenAI и Google.
Лицензия и практическое применение
Код инференса распространяется по лицензии Apache 2.0, но сами веса модели — по отдельному некоммерческому соглашению Ideogram: скачать, дообучить и запускать модель можно свободно для исследований и некоммерческого использования, а для коммерческого развёртывания нужна отдельная платная лицензия — через хостинговый API компании или отдельный договор. Релиз напрямую конкурирует с закрытыми моделями вроде GPT Image и моделей Google именно в нише дизайна, при этом сохраняя возможность самостоятельного развёртывания для некоммерческих и исследовательских задач — редкое сочетание для модели такого уровня качества.
Технические детали и доступность
Диффузионный трансформер Ideogram 4.0 состоит из 34 слоёв; текстовый энкодер Qwen3-VL-8B-Instruct не просто передаёт финальное представление — модель использует скрытые состояния сразу с 13 промежуточных слоёв энкодера, объединённые вместе. При безусловном проходе (classifier-free guidance) система не подменяет текстовые токены заглушками, а полностью отбрасывает их — асимметричный подход, отличающий Ideogram 4.0 от типичной схемы guidance.
Модель распространяется в квантованных версиях nf4 и fp8 на Hugging Face и GitHub, с поддержкой ComfyUI с первого дня релиза, а также доступна через fal.ai и собственную хостинговую платформу Ideogram. При 9,3 миллиарда параметров модель заметно компактнее конкурентов вроде HunyuanImage 3.0 (80 миллиардов параметров), что не помешало ей возглавить рейтинг открытых моделей. Компания, основанная бывшими исследователями Google Brain и базирующаяся в Торонто, использует трёхуровневую систему модерации: фильтрацию данных на этапе предобучения, процедуры на этапе дообучения и модерацию на этапе генерации через сервис Hive.
Официальные источники
Факты проверены 27 июля 2026 г.













