Размытое лицо, лишние пальцы и «пластиковая» кожа на сгенерированном фото — почти всегда следствие не сбоя нейросети, а слишком общего промта вроде «красивая девушка». Генеративные модели вроде Midjourney, Stable Diffusion или DALL-E не угадывают намерение: они буквально следуют словам запроса, и чем конкретнее описание, тем предсказуемее результат.
В этой статье разберём, из каких блоков состоит рабочий промт для ИИ-фото, какие параметры влияют на реализм, как адаптировать запрос под разные нейросети и какие ошибки чаще всего портят генерацию. Материал подойдёт как новичкам, так и тем, кто уже пробовал генерировать изображения, но получает нестабильное качество.
Что такое промт и почему он решает всё
Промт — это текстовое описание, по которому нейросеть строит изображение. Модель преобразует слова в набор признаков: объекты, стиль, освещение, композицию, цветовую палитру. Каждое слово в запросе «тянет» результат в свою сторону, поэтому случайные или противоречивые формулировки дают хаотичную картинку.
Важно понимать: нейросеть не «понимает» смысл как человек. Она опирается на статистические связи между словами и образами из обучающей выборки. Поэтому формулировка фотореалистичный портрет, снятый на 85mm объектив, мягкий дневной свет работает заметно лучше, чем абстрактное «сделай красиво».
Длина промта тоже имеет значение. Слишком короткий запрос оставляет модели слишком много свободы, а чрезмерно длинный — размывает вес каждого слова. Оптимально — от 15 до 60 слов с чёткой структурой, о которой поговорим ниже.
Структура идеального промта
Рабочий промт для фотореалистичного изображения удобно собирать из шести блоков. Не обязательно использовать все каждый раз, но порядок желательно сохранять — от главного к второстепенному.
- 🎯 Субъект — кто или что в кадре: «женщина 30 лет», «рыжий кот», «спортивный автомобиль».
- 👕 Детали объекта — внешность, одежда, эмоции, поза: «в льняной рубашке, лёгкая улыбка, смотрит в камеру».
- 🌆 Окружение — фон и обстановка: «в кафе у окна», «на фоне вечернего города».
- 💡 Освещение — «мягкий рассеянный свет», «золотой час», «неоновая подсветка».
- 📷 Камера и стиль — «портретный объектив 85mm, малая глубина резкости», «студийная съёмка».
- 🎨 Качество и атмосфера — «фотореализм, высокая детализация, естественные цвета».
Собранный по этой схеме промт может выглядеть так:
портрет молодой женщины с вьющимися тёмными волосами,
в сером свитере, лёгкая улыбка, сидит у окна в кафе,
мягкий дневной свет из окна, размытый фон,
снято на 85mm f/1.8, фотореализм, высокая детализация кожи
☑️ Проверка промта перед генерацией
Негативный промт: что исключить из кадра
Многие модели на базе Stable Diffusion поддерживают негативный промт — отдельное поле, где перечисляется то, чего на изображении быть не должно. Это один из самых эффективных инструментов борьбы с типичными артефактами генерации.
В негативный промт обычно выносят дефекты анатомии и качества: лишние пальцы, деформированные руки, размытие, низкое качество, водяные знаки, текст. Набор таких исключений зависит от конкретной модели и чекпоинта, поэтому имеет смысл смотреть рекомендации автора используемой модели.
⚠️ Внимание: в Midjourney классического поля негативного промта нет — вместо него используется параметр--no(например,--no text, blur). Не путайте синтаксис разных сервисов, иначе часть запроса будет проигнорирована.
Отличия промтов для разных нейросетей
Один и тот же запрос в разных сервисах даст разный результат: модели обучены на разных данных и по-разному интерпретируют синтаксис. Универсального промта «на все случаи» не существует, поэтому запрос стоит адаптировать.
| Сервис | Особенности промта | Язык |
|---|---|---|
| Midjourney | Короткие фразы, параметры через --ar, --no, --style | Английский |
| Stable Diffusion | Детальные описания, веса через скобки, негативный промт | Английский |
| DALL-E | Естественные предложения, хорошо понимает длинные описания сцены | Английский и русский |
| Kandinsky | Описательные запросы, поддержка русского языка | Русский, английский |
Обратите внимание на язык: большинство моделей обучались преимущественно на англоязычных описаниях, поэтому промт на английском почти всегда даёт более точный результат, чем тот же текст на русском. Исключение — модели, изначально рассчитанные на русский язык. Если английский не является вашим рабочим языком, можно составить запрос на русском и перевести его, сохранив структуру.
Также учитывайте, что версии одной модели различаются: поведение Midjourney менялось от версии к версии, и параметры, работавшие раньше, могут интерпретироваться иначе. Актуальный синтаксис проверяйте в официальной документации сервиса.
Почему модель «не слушается» часть промта
У большинства моделей слова в начале запроса имеют больший вес, чем в конце. Если важная деталь теряется, перенесите её ближе к началу. В Stable Diffusion дополнительно можно усилить слово синтаксисом весов, например (красное платье:1.3), но поддержка зависит от интерфейса.
Типичные ошибки при написании промтов
Ниже — ошибки, которые чаще всего встречаются у начинающих. Если ваши генерации стабильно не совпадают с задумкой, проверьте запрос по этому списку.
- 🚫 Слишком общие слова: «красивый», «крутой», «качественный» без конкретики почти не влияют на результат.
- 🔀 Противоречия в одном запросе: «зимний вечер, яркое полуденное солнце» — модель попытается совместить несовместимое.
- 📚 Перегрузка стилями: одновременное «акварель, масло, фотореализм, аниме» размывает итоговую картинку.
- 🔤 Ожидание корректного текста: надписи и логотипы нейросети исторически воспроизводят плохо, хотя новые версии моделей справляются лучше.
- 🧍 Сложные позы и взаимодействия: «человек жонглирует пятью мячами верхом на лошади» резко повышает шанс артефактов.
Отдельная ошибка — копирование чужих промтов без понимания их структуры. Запрос, идеально работающий в конкретной версии конкретной модели с определённым сидом, в вашей конфигурации может дать совсем другой результат. Разбирайте чужие промты на блоки и адаптируйте под свою задачу.
⚠️ Внимание: генерация изображений реальных людей, а также использование чужих фотографий как референса может нарушать правила сервиса и законодательство о правах на изображение. Ознакомьтесь с условиями использования выбранной платформы перед коммерческим применением результатов.
Итеративный подход: как улучшать результат
Редко кто получает идеальное изображение с первой попытки. Профессиональный подход — итеративный: вы генерируете, анализируете, что не так, и точечно правите промт, а не переписываете его заново.
Меняйте за одну итерацию один-два элемента. Если лицо вышло неестественным — усильте блок про кожу и освещение. Если композиция скучная — добавьте указание ракурса: съёмка снизу, вид сверху, крупный план. Так вы будете понимать, какое изменение к чему привело.
Многие сервисы позволяют варьировать удачную генерацию: в Midjourney это кнопки вариаций, в интерфейсах Stable Diffusion — фиксация сида с изменением отдельных слов. Фиксация сида особенно полезна: композиция сохраняется, а вы дорабатываете только детали.
Часто задаваемые вопросы
Нужно ли писать промт на английском языке?
Для большинства моделей — да, английский даёт более точный результат, так как они обучались на англоязычных описаниях. Исключение — модели с заявленной поддержкой русского языка, например Kandinsky. Некоторые сервисы автоматически переводят запрос, но перевод может искажать нюансы.
Какой длины должен быть промт?
Универсальной нормы нет. Практически рабочий диапазон — примерно 15–60 слов: короче — модели слишком много свободы, длиннее — размывается вес отдельных слов. Важнее не длина, а структура: субъект, детали, окружение, свет, стиль.
Почему на фото получаются искажённые руки и лица?
Это известная слабость генеративных моделей: мелкие детали анатомии они воспроизводят хуже всего. Помогает негативный промт с исключением деформаций, уменьшение количества людей в кадре, крупные планы вместо полного роста, а также новые версии моделей, где проблема частично решена.
Можно ли использовать сгенерированные фото в коммерческих целях?
Зависит от условий конкретного сервиса и вашего тарифа: у разных платформ правила различаются. Перед коммерческим использованием изучите лицензионное соглашение выбранного сервиса, а также учитывайте ограничения на изображения реальных людей и охраняемых объектов.
Что делать, если нейросеть игнорирует часть запроса?
Перенесите важную деталь ближе к началу промта — слова в начале обычно имеют больший вес. Уберите из запроса лишние элементы, конкурирующие за внимание модели. В Stable Diffusion дополнительно можно повысить вес ключевого слова через синтаксис скобок, если ваш интерфейс это поддерживает.