Что такое генеративный ИИ: Midjourney, DALL·E, Stable Diffusion
Вы пишете «кот-астронавт в акварельном стиле» — и через полминуты получаете картинку, которой никогда не существовало. Как машина рисует то, чего не видела? Разбираемся с нуля: что вообще значит «генеративный», как диффузионные модели лепят изображение из чистого шума, при чём тут GAN и чем на самом деле отличаются Midjourney, DALL·E и Stable Diffusion.
Что значит «генеративный»
Генеративный ИИ — это искусственный интеллект, который создаёт новое содержимое: текст, изображения, музыку, голос, видео, код. Ключевое слово — «создаёт». В этом его отличие от привычного ИИ, который обычно анализирует: отделяет спам от письма, узнаёт лицо на фото, ставит диагноз по снимку. Один распознаёт готовое, другой сочиняет то, чего раньше не было.
ChatGPT — генеративный (он генерирует текст). Midjourney и DALL·E — тоже генеративные, только на выходе картинки. Если механика текстовых моделей вам уже знакома по разбору, как работает ChatGPT, то здесь мы сфокусируемся на самом впечатляющем — генерации изображений. А если хочется совсем с азов, начните со статьи что такое нейросеть простыми словами.
Коротко
Генеративная модель не хранит библиотеку картинок, из которой «достаёт» подходящую. Во время обучения она выучила закономерности — как выглядят коты, акварель, космос — и на их основе рисует новое изображение с нуля под ваш запрос.
Диффузия: как из шума рождается картинка
Сердце большинства современных генераторов картинок — диффузионные модели (Stable Diffusion, DALL·E 3 и другие). Идея у них красивая и на удивление понятная, если зайти с правильной стороны.
Представьте старый телевизор без сигнала — экран в «снеге», случайных точках. Это и есть шум. Диффузионную модель обучают так: берут настоящую фотографию и постепенно, шаг за шагом, засыпают её шумом, пока от картинки не останется чистый «снег». А задача модели — научиться проделывать обратный путь: по зашумлённой картинке угадывать, как выглядела чуть более чистая версия.
Натренировавшись на миллионах примеров убирать шум, модель обретает суперспособность. Ей дают чистый случайный шум — и просят «очистить» его. Шаг за шагом она превращает хаос в осмысленное изображение, которого никогда не существовало. Это как скульптор, который видит в глыбе мрамора фигуру и отсекает лишнее, — только вместо мрамора здесь случайные точки, а вместо резца — обученная сеть.
Старт из шума
Модель начинает с холста, полностью заполненного случайными точками. Никакой картинки ещё нет — только хаос.
Шаг очистки
Сеть прикидывает, что «спрятано» в шуме, и убирает часть хаоса, делая изображение чуть чётче и осмысленнее.
Повтор десятки раз
Шаг очистки повторяется много раз. С каждым проходом из тумана всё яснее проступают формы, цвета и детали.
Готовое изображение
Через несколько десятков шагов шум полностью превращается в чёткую картинку по вашему описанию.
Текстовое условие: причём тут ваш запрос
Возникает вопрос: если модель просто убирает шум, откуда она знает, что рисовать именно кота-астронавта, а не пейзаж? Здесь в игру вступает текстовое условие (text conditioning). Ваш запрос — промпт — переводится в набор чисел, понятный модели, и работает как компас на каждом шаге очистки.
То есть модель не просто убирает шум «как получится» — она убирает его так, чтобы результат всё сильнее походил на «кота-астронавта в акварели». Промпт направляет каждый шаг, подталкивая картинку в сторону вашего описания. Именно поэтому формулировка запроса так сильно влияет на итог: чем точнее компас, тем ближе результат к задуманному. Как составлять хорошие промпты — подробно разобрано в гайде как писать промпты для нейросетей.
GAN: дуэль двух нейросетей
До эпохи диффузии главным способом генерировать картинки были GAN — генеративно-состязательные сети (Generative Adversarial Networks). Механика у них азартная, как поединок фальшивомонетчика и эксперта.
Внутри GAN работают две нейросети, которые соревнуются. Первая — генератор — пытается создать правдоподобную картинку. Вторая — дискриминатор — эксперт, который должен отличить подделку генератора от настоящего фото. Генератор учится обманывать всё убедительнее, дискриминатор — всё зорче ловить фальшивку. Гонка вооружений продолжается, пока подделки генератора не станут неотличимы от реальности.
GAN сделали настоящую революцию (вспомните ранние сайты вроде «этого человека не существует»), но у них капризный характер: обучение нестабильно, результаты трудно контролировать. Диффузионные модели оказались стабильнее, предсказуемее и разнообразнее — поэтому сегодня именно они рисуют львиную долю ИИ-картинок, потеснив GAN.
Запомнить разницу
GAN — это дуэль «художник против критика», результат за один заход. Диффузия — это постепенная лепка картинки из шума за много шагов. Обе создают новое, но диффузия сейчас популярнее из-за стабильности и качества.
Midjourney, DALL·E, Stable Diffusion
Три самых известных генератора построены на диффузии, но у каждого свой характер и своя сильная сторона. Коротко о том, чем они отличаются на практике:
| Сервис | Характер | Сильная сторона | Доступ |
|---|---|---|---|
| Midjourney | Художественный, стилизованный | Эффектная, «красивая» картинка почти без усилий | Закрытый, платный |
| DALL·E 3 | Точный, «послушный» | Строго следует описанию, хорошо пишет текст на картинке | Закрытый (в ChatGPT) |
| Stable Diffusion | Гибкий, настраиваемый | Открытый код: запуск у себя, тонкая настройка, свои модели | Открытый |
Грубое правило: нужна красивая картинка «из коробки» и минимум возни — Midjourney. Нужно, чтобы модель точно поняла сложное описание, — DALL·E 3. Нужны полный контроль, приватность и бесплатный запуск на своём железе — Stable Diffusion. «Лучшего» среди них нет: есть подходящий под конкретную задачу.
Ограничения, авторство и этика
Генеративный ИИ впечатляет, но у него есть слабые места и острые вопросы, о которых честно стоит знать заранее:
- Руки, текст и мелочи. Модели до сих пор путаются в количестве пальцев, зеркалят надписи и «додумывают» анатомию. Это следствие того, что они улавливают закономерности, а не считают пальцы.
- Авторские права. Модели учились на миллионах изображений из интернета, и вопрос, кому принадлежит сгенерированная картинка и можно ли её продавать, юридически всё ещё спорный в разных странах.
- Дипфейки и дезинформация. Та же технология создаёт убедительные фейковые фото и видео. Отличить ИИ-картинку помогают метаданные и водяные знаки — об этом отдельный разбор, как распознать ИИ-картинку.
- Предвзятость. Модель отражает перекосы своих обучающих данных — и может воспроизводить стереотипы, даже если вы об этом не просили.
Отдельная практичная деталь: генераторы обычно отдают результат в PNG или JPG, иногда WebP. Для веба удобно, но для печати картинку нередко нужно увеличить или переконвертировать. Что почём в форматах ИИ-изображений — в статье в каком формате нейросети отдают картинки. А про умное дорисовывание и расширение кадра — что такое Generative Fill.
Готовы работать с ИИ-картинкой дальше?
Сгенерировали изображение в Midjourney или DALL·E — и нужно перевести его в PNG, JPG или другой формат для печати, сайта или соцсетей? FormatZ конвертирует файлы прямо в браузере, без установки и регистрации.
Открыть конвертерыТеперь за словом «генеративный» для вас стоят конкретные механизмы: диффузия лепит картинку из шума, текстовое условие держит курс на ваш запрос, а GAN — азартный предшественник. Хотите увидеть, где генеративные модели вписаны в общую картину ИИ? Читайте разбор, чем отличаются ИИ, машинное обучение и нейросети.
Частые вопросы о генеративном ИИ
Читайте также
НейросетиКак работает ChatGPT и языковые модели: на пальцах
Тот же генеративный принцип, но на выходе текст, а не картинка.
НейросетиКак писать промпты для нейросетей: гайд для новичка
Хороший промпт — компас для диффузионной модели. Учимся его составлять.
ИИ-картинкиКак распознать ИИ-картинку: C2PA, SynthID и метаданные
Как отличить сгенерированное изображение от настоящего фото.