Нейросети

Что такое генеративный ИИ: Midjourney, DALL·E, Stable Diffusion

Вы пишете «кот-астронавт в акварельном стиле» — и через полминуты получаете картинку, которой никогда не существовало. Как машина рисует то, чего не видела? Разбираемся с нуля: что вообще значит «генеративный», как диффузионные модели лепят изображение из чистого шума, при чём тут GAN и чем на самом деле отличаются Midjourney, DALL·E и Stable Diffusion.

Рука робота тянется к светящейся сети узлов на синем фоне — образ генеративного искусственного интеллекта
Генеративный ИИ не копирует картинки — он создаёт новые, опираясь на выученные закономерности. Фото: Pexels

Что значит «генеративный»

Генеративный ИИ — это искусственный интеллект, который создаёт новое содержимое: текст, изображения, музыку, голос, видео, код. Ключевое слово — «создаёт». В этом его отличие от привычного ИИ, который обычно анализирует: отделяет спам от письма, узнаёт лицо на фото, ставит диагноз по снимку. Один распознаёт готовое, другой сочиняет то, чего раньше не было.

ChatGPT — генеративный (он генерирует текст). Midjourney и DALL·E — тоже генеративные, только на выходе картинки. Если механика текстовых моделей вам уже знакома по разбору, как работает ChatGPT, то здесь мы сфокусируемся на самом впечатляющем — генерации изображений. А если хочется совсем с азов, начните со статьи что такое нейросеть простыми словами.

Коротко

Генеративная модель не хранит библиотеку картинок, из которой «достаёт» подходящую. Во время обучения она выучила закономерности — как выглядят коты, акварель, космос — и на их основе рисует новое изображение с нуля под ваш запрос.

Диффузия: как из шума рождается картинка

Сердце большинства современных генераторов картинок — диффузионные модели (Stable Diffusion, DALL·E 3 и другие). Идея у них красивая и на удивление понятная, если зайти с правильной стороны.

Представьте старый телевизор без сигнала — экран в «снеге», случайных точках. Это и есть шум. Диффузионную модель обучают так: берут настоящую фотографию и постепенно, шаг за шагом, засыпают её шумом, пока от картинки не останется чистый «снег». А задача модели — научиться проделывать обратный путь: по зашумлённой картинке угадывать, как выглядела чуть более чистая версия.

Натренировавшись на миллионах примеров убирать шум, модель обретает суперспособность. Ей дают чистый случайный шум — и просят «очистить» его. Шаг за шагом она превращает хаос в осмысленное изображение, которого никогда не существовало. Это как скульптор, который видит в глыбе мрамора фигуру и отсекает лишнее, — только вместо мрамора здесь случайные точки, а вместо резца — обученная сеть.

1

Старт из шума

Модель начинает с холста, полностью заполненного случайными точками. Никакой картинки ещё нет — только хаос.

2

Шаг очистки

Сеть прикидывает, что «спрятано» в шуме, и убирает часть хаоса, делая изображение чуть чётче и осмысленнее.

3

Повтор десятки раз

Шаг очистки повторяется много раз. С каждым проходом из тумана всё яснее проступают формы, цвета и детали.

4

Готовое изображение

Через несколько десятков шагов шум полностью превращается в чёткую картинку по вашему описанию.

Текстовое условие: причём тут ваш запрос

Возникает вопрос: если модель просто убирает шум, откуда она знает, что рисовать именно кота-астронавта, а не пейзаж? Здесь в игру вступает текстовое условие (text conditioning). Ваш запрос — промпт — переводится в набор чисел, понятный модели, и работает как компас на каждом шаге очистки.

То есть модель не просто убирает шум «как получится» — она убирает его так, чтобы результат всё сильнее походил на «кота-астронавта в акварели». Промпт направляет каждый шаг, подталкивая картинку в сторону вашего описания. Именно поэтому формулировка запроса так сильно влияет на итог: чем точнее компас, тем ближе результат к задуманному. Как составлять хорошие промпты — подробно разобрано в гайде как писать промпты для нейросетей.

Роботизированная рука подаёт кружку кофе мужчине с книгой — образ ИИ как помощника-исполнителя задач
Промпт — это инструкция, которую ИИ старается выполнить как можно точнее. Фото: Pexels

GAN: дуэль двух нейросетей

До эпохи диффузии главным способом генерировать картинки были GAN — генеративно-состязательные сети (Generative Adversarial Networks). Механика у них азартная, как поединок фальшивомонетчика и эксперта.

Внутри GAN работают две нейросети, которые соревнуются. Первая — генератор — пытается создать правдоподобную картинку. Вторая — дискриминатор — эксперт, который должен отличить подделку генератора от настоящего фото. Генератор учится обманывать всё убедительнее, дискриминатор — всё зорче ловить фальшивку. Гонка вооружений продолжается, пока подделки генератора не станут неотличимы от реальности.

GAN сделали настоящую революцию (вспомните ранние сайты вроде «этого человека не существует»), но у них капризный характер: обучение нестабильно, результаты трудно контролировать. Диффузионные модели оказались стабильнее, предсказуемее и разнообразнее — поэтому сегодня именно они рисуют львиную долю ИИ-картинок, потеснив GAN.

Запомнить разницу

GAN — это дуэль «художник против критика», результат за один заход. Диффузия — это постепенная лепка картинки из шума за много шагов. Обе создают новое, но диффузия сейчас популярнее из-за стабильности и качества.

Midjourney, DALL·E, Stable Diffusion

Три самых известных генератора построены на диффузии, но у каждого свой характер и своя сильная сторона. Коротко о том, чем они отличаются на практике:

СервисХарактерСильная сторонаДоступ
MidjourneyХудожественный, стилизованныйЭффектная, «красивая» картинка почти без усилийЗакрытый, платный
DALL·E 3Точный, «послушный»Строго следует описанию, хорошо пишет текст на картинкеЗакрытый (в ChatGPT)
Stable DiffusionГибкий, настраиваемыйОткрытый код: запуск у себя, тонкая настройка, свои моделиОткрытый

Грубое правило: нужна красивая картинка «из коробки» и минимум возни — Midjourney. Нужно, чтобы модель точно поняла сложное описание, — DALL·E 3. Нужны полный контроль, приватность и бесплатный запуск на своём железе — Stable Diffusion. «Лучшего» среди них нет: есть подходящий под конкретную задачу.

Диффузия победила не потому, что «умнее» GAN, а потому, что ей проще управлять. В генеративном ИИ предсказуемость нередко ценнее гениальности.

Ограничения, авторство и этика

Генеративный ИИ впечатляет, но у него есть слабые места и острые вопросы, о которых честно стоит знать заранее:

  • Руки, текст и мелочи. Модели до сих пор путаются в количестве пальцев, зеркалят надписи и «додумывают» анатомию. Это следствие того, что они улавливают закономерности, а не считают пальцы.
  • Авторские права. Модели учились на миллионах изображений из интернета, и вопрос, кому принадлежит сгенерированная картинка и можно ли её продавать, юридически всё ещё спорный в разных странах.
  • Дипфейки и дезинформация. Та же технология создаёт убедительные фейковые фото и видео. Отличить ИИ-картинку помогают метаданные и водяные знаки — об этом отдельный разбор, как распознать ИИ-картинку.
  • Предвзятость. Модель отражает перекосы своих обучающих данных — и может воспроизводить стереотипы, даже если вы об этом не просили.

Отдельная практичная деталь: генераторы обычно отдают результат в PNG или JPG, иногда WebP. Для веба удобно, но для печати картинку нередко нужно увеличить или переконвертировать. Что почём в форматах ИИ-изображений — в статье в каком формате нейросети отдают картинки. А про умное дорисовывание и расширение кадра — что такое Generative Fill.

Готовы работать с ИИ-картинкой дальше?

Сгенерировали изображение в Midjourney или DALL·E — и нужно перевести его в PNG, JPG или другой формат для печати, сайта или соцсетей? FormatZ конвертирует файлы прямо в браузере, без установки и регистрации.

Открыть конвертеры

Теперь за словом «генеративный» для вас стоят конкретные механизмы: диффузия лепит картинку из шума, текстовое условие держит курс на ваш запрос, а GAN — азартный предшественник. Хотите увидеть, где генеративные модели вписаны в общую картину ИИ? Читайте разбор, чем отличаются ИИ, машинное обучение и нейросети.

Обычный ИИ чаще анализирует или классифицирует: отличает спам от письма, кота от собаки, выдаёт «да/нет». Генеративный ИИ создаёт новое содержимое — текст, картинку, музыку, голос, видео. Разница в задаче: один распознаёт, другой сочиняет. ChatGPT, Midjourney и DALL·E — все генеративные.
Большинство современных сервисов используют диффузионные модели. Модель начинает со случайного шума (как «снег» на старом телевизоре) и шаг за шагом убирает его, превращая в осмысленную картинку. Текстовое описание работает как компас: на каждом шаге оно направляет очистку так, чтобы результат соответствовал вашему запросу.
Это нейросеть, обученная убирать шум с картинок. Сначала её тренируют так: берут настоящее изображение и постепенно засыпают шумом, а модель учится проделывать обратное — восстанавливать. После обучения ей дают чистый шум, и она «восстанавливает» из него картинку, которой никогда не было. Так работают Stable Diffusion и DALL·E.
Все три — генераторы картинок на базе диффузии, но с разным характером. Midjourney даёт художественный, эффектный, стилизованный результат. DALL·E 3 силён в точном следовании описанию и работе с текстом на картинке. Stable Diffusion — открытая модель, её можно запускать у себя и тонко настраивать. Выбор зависит от задачи и того, нужна ли вам гибкость или красивая картинка «из коробки».
Чаще всего PNG или JPG, иногда WebP. Для веба это удобно, но для печати изображение нередко нужно перевести в другой формат или увеличить разрешение. Проще всего конвертировать файл в онлайн-конвертере: PNG сохранит прозрачность и качество, JPG даст меньший размер.