От нечитаемых меню к готовому результату

21 апреля 2026 года TechCrunch (автор Amanda Silberling) разобрал запуск ChatGPT Images 2.0 — новой модели генерации изображений OpenAI. Главный практический вывод: модель заметно лучше справляется с текстом на картинках, чем предыдущие генераторы вроде DALL-E 3. Два года назад AI-меню мексиканского ресторана легко выдавало орфографические ошибки в названиях блюд. В тесте TechCrunch Images 2.0 собрала меню, которое можно сразу использовать в заведении — для сравнения издание показывает старый результат генератора 2024 года с типичными артефактами в написании.

Иллюстрация к материалу «ChatGPT Images 2.0»: генерация изображений на экране

Почему текст на изображениях был проблемой

Исторически диффузионные модели плохо «писали» на изображениях: текст занимает крошечную часть пикселей, а генератор учится на паттернах, покрывающих гораздо больше площади. Из-за этого исследователи стали смотреть в сторону авторегрессионных моделей, устроенных ближе к языковым. OpenAI не раскрыла, какой именно тип архитектуры лежит в основе Images 2.0.

Что нового в возможностях

Компания заявила о способностях к «рассуждению»: поиск в вебе, генерация нескольких изображений из одного промпта, самопроверка результата. Это позволяет собирать маркетинговые материалы в разных форматах и многопанельные комиксы буквально за несколько минут. Также усилен рендеринг нелатинского текста — японского, корейского, хинди, бенгальского. Порог знаний модели — декабрь 2025 года, это может сказаться на промптах про самые свежие события. По официальному пресс-релизу OpenAI, модель отличает «беспрецедентная точность и достоверность»: следование инструкциям, сохранение деталей, точная передача мелких элементов — небольшого текста, иконографии, элементов интерфейса, плотных композиций и тонких стилистических ограничений — вплоть до разрешения 2K.

Доступ и место на рынке

Доступ открылся для всех пользователей ChatGPT и Codex со вторника после анонса; платным подписчикам доступны более продвинутые результаты. В API модель называется gpt-image-2, цена зависит от качества и разрешения. Независимое освещение подтверждает масштаб скачка: в течение 12 часов после запуска ChatGPT Images 2.0 заняла первое место по всем категориям рейтинга Image Arena с отрывом свыше 240 очков — крупнейший разрыв, зафиксированный в этом рейтинге. Для рынка генерации изображений апрель 2026 года стал моментом, когда OpenAI публично закрыла проблему «AI не умеет писать на картинках» и окончательно перевела пользователей с эпохи DALL-E на линейку ChatGPT Images и gpt-image.

По обзору VentureBeat, Images 2.0 умеет генерировать до восьми разных изображений из одного промпта с сохранением непрерывности персонажей и объектов между кадрами. Это открывает сценарии вроде цельных манга-историй, детских книг с одними и теми же героями на разных страницах или серии социальных графиков с общим визуальным стилем.

Официальные источники

Факты проверены 26 июля 2026 г.