Большой практический тест нейросетей для генерации изображений: фото, русский текст, инфографика, реклама, референсы и редактирование. Сравниваю самые популярные ИИ в 2026 году.

Нейросети для генерации изображений давно научились делать красивую картинку по описанию, поэтому очередной промпт в духе «девушка в кафе, cinematic light» уже мало что показывает. Гораздо интереснее реальные рабочие задачи: написать русский текст без ошибок, собрать инфографику, сохранить лицо по референсу, аккуратно изменить исходное фото или сделать рекламный кадр, который не придётся заново собирать в Photoshop.

За два дня я прогнал модели через большой набор одинаковых и сопоставимых сценариев. В итоге накопилось около 150 изображений и промежуточных правок. Показывать весь массив здесь было бы тяжело и для статьи, и для читателя, поэтому подробно разбираю 25 наиболее показательных тестов GPT Image 2.5, а остальные модели сравниваю на одинаковых контрольных заданиях, где различия особенно хорошо видны.

Красивые изображения получились почти у всех. Но как только в задаче появились точный текст, референсы, локальные правки и жёсткое следование промпту, разница между моделями стала намного заметнее.

Какие нейросети участвовали и что получилось

Нейросеть

Коротко по моим тестам

Лучше всего подходит для

GPT Image 2.5

Самый ровный результат: фото, текст, инфографика, референсы и правки

Универсальных задач, редактирования, текста и рекламы

Nano Banana 2

Очень стабильный универсал

Быстрой генерации качественных изображений

Grok Image 2.0

Сильный фотореализм и хороший рекламный тест

Реалистичных людей и коммерческих визуалов

Seedream 5.0

Красиво и детально, но бывают ошибки в тексте

Атмосферных и визуально насыщенных сцен

FLUX 2

Хорошая генерация фото, слабее с типографикой

Фотореалистичных сцен и предметки

Midjourney

Эффектно, но хуже с точным ТЗ

Арта, стилизации и выразительных концептов

Сразу оговорюсь: это не лабораторный benchmark и не попытка вывести рейтинг с точностью до сотых. Я смотрел на то, насколько результат пригоден в реальной работе: выполнен ли промпт, нет ли ошибок в тексте, не поплыли ли руки, сохранился ли человек по референсу и не решила ли нейросеть заодно изменить половину кадра.

Как проходил тест

Для GPT Image 2.5 я собрал 25 разных сценариев, от фотореалистичных людей до последовательных правок одного интерьера. Один отдельный тест на добавление объекта позже объединил с многошаговым редактированием — смысла дважды проверять один навык не было.

В сравнении с другими ИИ оставил два задания:

  • сложное фотореалистичное фото человека;

  • рекламный кадр продукта с русским текстом.

Первое хорошо показывает качество самой генерации. Второе сразу проверяет продукт, материалы, композицию, кириллицу, типографику и следование техническому заданию.

Генерация изображений по тексту: от портрета до сложной сцены

Тест 1. Фотореалистичный портрет

Первым был довольно сложный editorial-кадр: девушка с прозрачным зонтом в оранжерее на крыше небоскрёба, дождь, стекло, растения и вечерний город.

GPT Image 2.5 собрал сцену почти без слабых мест. Хорошо получились кожа, волосы, мокрые поверхности, капли на зонте и баланс между холодным городом за окном и тёплым светом внутри. Картинка довольно постановочная, но в данном случае это работает — выглядит скорее как кадр из кампании модного журнала, чем как типичная «AI-девушка».

Тест 2. Два человека и взаимодействие

Задача была сложнее: мужчина и женщина в вагоне-ресторане ночного поезда, карта на столе, фотоаппарат, чай в подстаканниках, одна героиня показывает пальцем на маршрут.

Здесь я в первую очередь смотрел не на красоту, а на логику взаимодействия. Руки выглядят нормально, оба персонажа смотрят туда, куда нужно, предметы не материализовались в странных местах. Сам вагон тоже получился цельным.

Для генерации двух людей в одной сцене результат очень уверенный.

Тест 3. Мастерская с большим количеством объектов

Дальше я специально перегрузил промпт: скетчбук, колба, компас, катушка медной проволоки, лампа, механические часы, ноутбук, книги по ботанике, кактус, засушенные травы.

Обычно именно на таких запросах начинают исчезать или мутировать второстепенные предметы. Здесь модель удержала почти весь набор и при этом не превратила стол в хаотичную свалку.

Особенно понравилось, что пространство воспринимается как настоящая рабочая мастерская, а не как витрина из случайных красивых объектов.

Тест 4. Архитектура и сложное пространство

Последний тест в этой группе — читальный зал, встроенный в скалу над холодным северным морем.

Здесь уже проверял скорее пространственное мышление. GPT Image 2.5 хорошо совместил бетон, каменную стену, огромные окна, мебель и пейзаж. Получилось убедительное пространство, а не просто «библиотека плюс море».

Человек у окна немного теряется на фоне масштаба — но композиционно это даже подходит сцене.

Русский текст, постеры и инфографика

Вот здесь стало интереснее. Фотореалистичные портреты сейчас умеют делать почти все крупные модели, а вот нормальный русский текст всё ещё хорошо разделяет генераторы.

Тест 5. Постер на русском

Я попросил сделать афишу фестиваля науки с точными строками:

ФЕСТИВАЛЬ НАУКИ
12 ОКТЯБРЯ
МОСКВА
ЛЕКЦИИ • ВЫСТАВКИ • ИНТЕРАКТИВ
ВХОД СВОБОДНЫЙ

Основной текст GPT Image 2.5 написал правильно. Причём модель не просто расставила буквы, а собрала нормальный макет: иерархия, крупный заголовок, дата, свободное пространство, стеклянная колба с городом.

Для меня это один из показательных моментов всего теста: текст уже можно воспринимать как элемент дизайна, а не как лотерею.

Тест 6. Обложка статьи

Следующая задача была ближе к моей реальной работе — обложка для материала о нейросетях для генерации изображений.

На столе модель разложила разные типы визуалов: портрет, инфографику, художественный кадр, товар и пример редактирования. Заголовок и подзаголовок читаются, композиция не рассыпалась.

Получился вполне рабочий hero image, который я бы мог использовать почти без ручной верстки.

Тест 7. Инфографика

Задание: показать шесть элементов хорошего промпта:

  1. объект;

  2. действие;

  3. среда;

  4. свет;

  5. стиль;

  6. ограничения.

Здесь модель особенно приятно удивила. Получилась настоящая инфографика, а не просто шесть карточек вокруг картинки. Иконки соответствуют смыслу, порядок понятен, подписи читаются, внизу есть пример готового промпта.

Тест 8. Схема процесса

Похожая задача, но уже не список, а последовательность:

Идея → Промпт → Референсы → Генерация → Правки → Финальный результат.

GPT Image 2.5 правильно понял логику процесса и визуально связал этапы. Это важный момент: модель умеет не только оформлять информацию, но и изображать последовательность действий.

Как я сейчас пишу промпты для генерации изображений

После этих тестов формула у меня довольно простая:

объект → действие → среда → композиция → свет → стиль → ограничения

Например, вместо:

Нарисуй девушку в мастерской.

лучше написать:

Молодая керамистка стоит у длинного рабочего стола и двумя руками рассматривает только что обожжённую чашу. Небольшая мастерская, деревянные полки, печь на заднем плане, холодный утренний свет из большого окна и несколько тёплых локальных источников. Фотореалистичная editorial-фотография, естественная кожа, правильные руки, реалистичные материалы. Не добавлять текст и лишние предметы.

Чем важнее конкретная деталь, тем лучше назвать её явно. Особенно это касается текста, количества объектов и того, что нельзя менять при редактировании. Стоит заметить, что у GPT Image 2.5 все отлично с фантазией, не бойтесь ей предоставлять возможность додумать изображение, если это позволяет ваша задача.

Рекламные изображения и фото товара

Тест 9. Студийная предметка

Я придумал условный премиальный чай NORDLEAF и попросил сделать рекламную съёмку в тёмной эстетике.

Получилась очень сильная предметка: матовая зелёная банка, золотые детали, керамика, чайные листья, пар, камень. Упаковка выглядит физически убедительно, а не как пластиковый 3D-объект.

Особенно хорошо сработал свет. Банка остаётся главным объектом, но фон и реквизит делают сцену живой.

Тест 10. Тот же товар в lifestyle-сцене

Дальше тот же продукт перенёс на светлую кухню.

И вот здесь важнее красоты было сохранить идентичность товара. Банка осталась той же формы, цвета и стилистики, но окружающий мир полностью поменялся.

Для ecommerce и рекламы это куда полезнее, чем ещё один красивый packshot: один продукт можно довольно быстро переносить между разными рекламными сценами.

Работа с референсами

Тест 11. Один человек в новой сцене

Загрузил портрет и попросил перенести человека в вечерний книжный магазин.

Лицо сохранилось очень хорошо. Возраст, волосы, основные черты — всё узнаваемо. Новая одежда и интерьер не выглядят приклеенными поверх исходника.

Но здесь же поймал одну из немногих явных ошибок: на фоновой табличке модель написала:

«Борошие книги делают людей ярче»

Хороший пример ограничения: крупный текст, который я задаю явно, модель воспроизводит отлично, а мелкие надписи, которые она придумывает сама, всё ещё стоит проверять.

Тест 12. Один персонаж в трёх сценах

Кафе, городской переход и офис — одна и та же девушка.

Для character consistency результат сильный. Меняются позы, освещение и масштаб персонажа, но лицо остаётся узнаваемым. В средней сцене героиня показана почти в полный рост, и даже там identity не развалился.

Если придираться, укладка и мелкие пропорции немного гуляют, но это скорее естественная вариативность, чем три разных человека.

Тест 13. Перенос визуального стиля

Вместо буквального копирования изображения попросил перенести его художественную логику на новую сцену с лодочной станцией.

Получилось атмосферно: дерево, вода, туман, рассветный свет и девушка на пирсе хорошо собираются в один кадр. Это уже не «фильтр по референсу», а довольно содержательная интерпретация.

Тест 14. Несколько референсов одновременно

Здесь загрузил четыре исходника: человека, куртку, интерьер и кружку.

Именно этот тест хорошо показывает, насколько далеко ушла генерация по референсам. Модель собрала все элементы в одну сцену без ощущения фотоколлажа. Лицо сохранилось, одежда правильно легла по фигуре, кружка получила нормальный масштаб и перспективу.

Multi-reference у GPT Image 2.5 в моих тестах оказался одной из сильнейших функций.

Редактирование фото нейросетью

Тест 15. Удаление объекта

Из сцены на озере я удалил лодки.

GPT Image 2.5 не просто затёр область, а восстановил воду, камыши и причал. Остальная сцена практически не изменилась: девушка, пирс, здание, свет и линия горизонта остались на месте.

Именно такое редактирование мне и нужно от нейросети: поменять одно, не перегенерировать всё остальное.

Тест 16. Замена одежды

Исходный человек сидит у кафе в худи и джинсах. Я попросил заменить образ на пальто, водолазку, тёмные брюки и ботинки.

Лицо, поза и фон почти не изменились, а новая одежда нормально подстроилась под положение тела. Это уже довольно близко к виртуальной примерке, а не к полной перегенерации фотографии.

Тест 17. Объединение двух фотографий

Человек из одного фото и локация из другого.

Здесь главное — свет и перспектива. В финальном изображении человек не выглядит вырезанным: вечерний свет ложится на волосы и лицо, кресло и стол находятся в правильном масштабе.

Задача «перенести человека на другое фото» выполнена очень чисто.

Тест 18. Эскиз в готовое изображение

Простой интерьерный sketch превратил в реалистичный чайный бар.

Модель сохранила исходную композицию: длинную стойку, ряд высоких стульев, подвесные лампы, узкое пространство и полки. При этом добавила нормальные материалы, свет и атмосферу.

Мне особенно понравилось, что ИИ не решил ради красоты перестроить весь проект.

Шесть последовательных правок одного изображения

Этот тест GPT Image 2.5 оказался, пожалуй, самым полезным.

Стартовал с обычного домашнего кабинета и по очереди просил:

  1. изменить дневной свет на вечерний;

  2. добавить чашку и записную книжку;

  3. поставить высокое растение;

  4. сделать интерьер более редакционным;

  5. изменить постеры;

  6. удалить настольную лампу.

Первые пять шагов прошли удивительно стабильно. Геометрия комнаты, стол, кресло, окно, ноутбук и полки оставались почти на своих местах. Особенно удачно получилась смена освещения: это не просто оранжевый фильтр, а действительно новый свет со своими тенями и отражениями.

Проблема появилась на последнем шаге. Я попросил только удалить лампу, а GPT Image 2.5 заодно поменял внешний вид постеров на стене.

Это хороший показатель текущей границы: многошаговое редактирование стало заметно стабильнее, но после длинной цепочки мелкие независимые детали всё ещё могут начать дрейфовать.

Попробуйте GPT Image 2.5 на своих задачах

Что показал большой тест GPT Image 2.5

После всех этих генераций сильнее всего я бы выделил четыре вещи:

  • очень ровный фотореализм;

  • хороший русский текст и layout;

  • сильную работу с несколькими референсами;

  • действительно полезное локальное редактирование.

При этом идеальной модель не стала. Мелкий самостоятельно придуманный текст всё ещё может ломаться, а после длинной серии правок появляются незапрошенные изменения.

Но в целом именно здесь у меня произошла небольшая смена фаворита. До этого я чаще всего использовал Nano Banana 2 и считал его своим универсальным вариантом. После этого теста GPT Image 2.5 выглядит заметно сильнее именно там, где картинка должна не просто быть красивой, а точно выполнять задачу.

Как другие нейросети справились с теми же заданиями

После двадцати сценариев на GPT Image повторять их ещё пять раз мне уже не хотелось — да и читателю вряд ли нужны ещё сто почти одинаковых изображений.

Поэтому я оставил два контрольных теста.

Тест A. Фотореалистичная керамистка

Одинаковая задача для всех моделей: молодая женщина в мастерской держит необычную керамическую чашу, естественный утренний свет, много фактур, руки должны быть хорошо видны.

GPT Image 2.5

Очень сильный результат. Много мелких деталей мастерской, естественная кожа, хорошие руки и правильный свет. При генерации фото в GPT Image 2.5 особенно чувствуется глубина сцены: передний план, человек и фон хорошо разделены.

Grok Image 2.0

Grok Image 2.0 пожалуй, главный сюрприз всего сравнения. Очень реалистично, сдержанно и без характерного пластикового блеска.

Окружение чуть более стерильное, чем у GPT Image, но сам человек выглядит очень убедительно. После этого теста Grok я точно буду использовать чаще.

Nano Banana 2

У Nano Banana 2 ожидаемо тоже сильный результат: много деталей, хороший свет, нормальная анатомия.

Возможно, после десятков генераций у меня уже просто замылился глаз, но я начал узнавать характерный Nano Banana look ещё до того, как смотрел подпись: очень чисто, мягко и чуть рекламно. Это не минус, просто у модели есть заметный визуальный почерк.

FLUX 2

Технически всё хорошо: руки нормальные, материалы читаются, свет естественный.

Но сцена чуть более плоская. Flux 2 по сравнению с GPT Image и Grok меньше ощущения глубины и живой editorial-фотографии.

Seedream 5.0

Seedream 5.0 Pro - красиво и качественно, но именно здесь чуть сильнее чувствуется «нейросетевость». Лицо, свет и поза слишком аккуратные, сцена выглядит немного вылизанной, но кинематографично.

Не явная ошибка, скорее ощущение.

Midjourney

А здесь поймал небольшой флешбек из времён старых генераторов.

Картинка у Midjourney эффектная, свет красивый, но лицо слегка уходит в зловещую долину, а пальцы правой руки заставили приблизить изображение. И не зря: кисть действительно выглядит неестественно.

Несколько лет назад именно такие руки были почти визитной карточкой генеративной графики. Не ожидал снова увидеть это здесь.

Сравнение фотореализма

Модель

Мои впечатления

GPT Image 2.5

Очень естественно, много деталей, хорошая глубина

Grok Image 2.0

Отличный реализм, почти без AI-look

Nano Banana 2

Очень качественно, чуть узнаваемый фирменный стиль

FLUX 2

Хорошо, но немного плоско

Seedream 5.0

Красиво, но слегка выдаёт генерацию

Midjourney

Эффектно, но лицо и пальцы подвели

Тест B. Премиальная реклама VERDANT

Второй тест оказался намного жёстче.

Нужно было сделать бутылку botanical tonic, стекло, конденсат, бергамот, розмарин, ягоды можжевельника, атмосферный фон и точный русский рекламный текст:

VERDANT
BOTANICAL TONIC
МОЖЖЕВЕЛЬНИК • БЕРГАМОТ • РОЗМАРИН
БЕЗ АЛКОГОЛЯ
330 МЛ

И отдельно:

СЛОЖНЫЙ ВКУС
ПРОСТОЙ СОСТАВ

GPT Image 2.5

Практически готовая реклама. Стекло, конденсат, фон, свободное место под текст — всё очень аккуратно. Надписи тоже без заметных ошибок.

Из всех вариантов этот выглядит наиболее близко к финальному коммерческому макету.

Nano Banana 2

Тоже отлично. Текст читается, бутылка выглядит убедительно, ингредиенты разложены нормально.

Просто визуально кадр чуть менее атмосферный, чем у GPT Image 2.5. Скорее качественная product shot-реклама, чем большой premium key visual.

Grok Image 2.0

Очень достойно — и снова неожиданно.

Текст получился хорошо, композиция чистая, бутылка выглядит дорого. Если искать мелкий недостаток, ягоды больше похожи на чернику, чем на можжевельник, а половинка бергамота визуально довольно близка к лайму.

Но это уже придирки к реквизиту, а не к самому макету.

FLUX 2

По фотографии всё нормально: хороший тёмный фон, стекло, капли, мокрый камень.

А вот текстовая часть просела. В слове «можжевельник» потерялась буква, часть копирайта изменилась, а структура слогана выполнилась не полностью.

Как картинка — хорошо. Как готовая реклама по ТЗ — уже хуже.

Seedream 5.0

Жаль, потому что визуально получилось очень неплохо.

Но в крупном слогане модель написала «ПРОСТОЙ СОСТАД» вместо «состав», а заодно проигнорировала запрошенный формат и сделала вертикальный кадр.

Раньше Seedream у меня с форматом так не чудил, поэтому этот результат был неожиданным.

Midjourney

Здесь начинается веселье.

Часть промпта модель просто проигнорировала. Кириллица исчезла, английский текст тоже оказался неправильным, а часть символов напоминает какую-то авторскую систему письма.

Я долго смотрел на эти надписи и пришёл к выводу, что Midjourney решил не выбирать между русским и английским и изобрёл руны.

При этом сама бутылка и свет вполне красивые. Но красивый mockup и рекламный макет по техническому заданию — всё-таки разные вещи.

Сравнение рекламного теста

Модель

Текст

Следование ТЗ

Итог

GPT Image 2.5

Без заметных ошибок

Очень точное

Практически готовый макет

Nano Banana 2

Хорошо

Точное

Отлично, чуть менее атмосферно

Grok Image 2.0

Хорошо

Точное

Сильный результат, мелкие вопросы к реквизиту

FLUX 2

Есть ошибка

Частичное

Фото хорошее, текст требует правки

Seedream 5.0

Ошибка «СОСТАД»

Нарушил формат

Визуально хорошо, но не готово к использованию

Midjourney

Серьёзные ошибки

Значительная часть ТЗ потеряна

Красиво, но для точного макета слабо

Какую нейросеть для генерации изображений я бы выбрал сейчас

После такого количества тестов главный вывод для меня изменился.

Раньше я чаще тянулся к Nano Banana 2 как к универсальному инструменту. Сейчас эту роль у меня, скорее всего, займёт GPT Image 2.5. Не потому, что он всегда делает самую эффектную картинку, а потому что реже ломается, когда задача становится сложнее обычного text-to-image.

Особенно это заметно в:

  • русском тексте;

  • инфографике;

  • работе с референсами;

  • сохранении лица;

  • локальных правках;

  • последовательном редактировании.

Grok Image 2.0 для меня стал главным открытием теста. Фотореализм очень достойный, рекламный кадр тоже получился сильным. Буду работать с ним плотнее.

Nano Banana 2 хуже от этого не стал — это всё ещё очень хороший генератор картинок, просто конкуренция сейчас заметно жестче.

А Midjourney, похоже, всё больше остаётся инструментом для тех случаев, когда важнее визуальный эффект, чем буквальное выполнение сложного технического задания.

На что смотреть при выборе генератора изображений

По этим тестам я бы вообще перестал оценивать нейросеть по одному красивому портрету.

Если нужен ИИ для генерации изображений в работе, лучше проверить четыре вещи:

  • насколько точно он выполняет промпт;

  • умеет ли нормально писать нужный вам текст;

  • сохраняет ли исходное изображение при image-to-image редактировании;

  • насколько стабильно работает с несколькими референсами и последовательными правками.

Красивую картинку сегодня можно получить почти везде. Настоящая разница начинается тогда, когда нейросеть должна сделать именно то, что вы попросили, а не просто что-то похожее и эстетичное.

Реклама. ООО "Диджитал Гениус". ИНН 7813681158

Комментарии (1)


  1. Tomasina
    23.09.2026 07:02

    Под каждым изображением не хватает текстового промпта, которым они были получены.

    И да, промпты были на русском или английском?