Нейросеть выдала размытое лицо с шестью пальцами вместо ожидаемого портрета — чаще всего причина кроется не в модели, а в самом промте: отсутствуют параметры освещения, ракурса и качества, и генератор заполняет пробелы случайным образом. Промт для AI фото — это текстовая инструкция, по которой нейросеть вроде Midjourney, Stable Diffusion, DALL-E или Flux строит изображение, и от точности формулировок напрямую зависит результат.
В этом руководстве разберём структуру правильного запроса, ключевые слова для фотореалистичности, готовые шаблоны и типичные ошибки, из-за которых картинки получаются «пластиковыми» или искажёнными. Материал подойдёт как новичкам, так и тем, кто уже генерирует изображения, но хочет стабильно получать предсказуемый результат.
Что такое промт и как нейросеть его понимает
Промт (от англ. prompt — «подсказка») — это текстовое описание желаемого изображения. Нейросеть не «понимает» запрос как человек: она разбивает текст на токены и сопоставляет их с визуальными паттернами, на которых обучалась. Поэтому порядок слов, конкретность и даже знаки препинания влияют на итог.
Общее правило простое: чем раньше в промте стоит слово, тем больший вес оно обычно имеет. Начинать описание лучше с главного объекта, а детали фона и атмосферы указывать ближе к концу. Расплывчатые формулировки вроде «красивая девушка» дают случайный результат, потому что у модели нет единого эталона «красивости».
Стоит учитывать и язык: большинство моделей обучены преимущественно на англоязычных данных, поэтому промты на английском, как правило, работают точнее. Русскоязычные запросы многие сервисы автоматически переводят, но при переводе теряются нюансы.
Структура идеального промта
Универсальная формула запроса для фотореалистичного изображения состоит из шести блоков. Не обязательно использовать все, но чем больше заполнено, тем меньше простора для случайностей.
- 🎯 Объект — кто или что в кадре:
a young woman,an old wooden house - 🎬 Действие и поза — что происходит:
reading a book by the window - 🌍 Окружение — фон и локация:
in a cozy library, autumn park - 💡 Освещение — тип света:
golden hour sunlight,soft studio lighting - 📷 Камера и ракурс — имитация съёмки:
85mm lens, shallow depth of field, close-up - 🎨 Стиль и качество — финальный штрих:
photorealistic, highly detailed
Собираем блоки вместе и получаем рабочий промт:
a young woman reading a book by the window, cozy library interior, golden hour sunlight, 85mm lens, shallow depth of field, photorealistic, highly detailed
Вам не нужно зазубривать все ключевые слова — достаточно понимать логику блоков и подставлять свои значения. Со временем набор рабочих формулировок откладывается сам.
☑️ Проверка промта перед генерацией
Ключевые слова для фотореалистичности
Отдельная категория промтов — слова-модификаторы, которые «поднимают» качество картинки. Они работают не во всех моделях одинаково, но в Midjourney и Stable Diffusion хорошо себя зарекомендовали.
| Категория | Ключевые слова | Эффект |
|---|---|---|
| Качество | highly detailed, sharp focus, 8k | Детализация текстур и мелких элементов |
| Свет | golden hour, cinematic lighting, soft light | Реалистичная светотень, «киношный» вид |
| Камера | shot on Canon EOS R5, 35mm, bokeh | Имитация оптики, размытие фона |
| Плёнка | Kodak Portra 400, film grain | Аналоговая цветопередача и зернистость |
| Атмосфера | moody, dramatic, ethereal | Настроение и тональность кадра |
Не стоит сваливать все модификаторы в один запрос. Два-три осмысленных слова из разных категорий работают лучше, чем десяток случайных — лишние токены размывают вес главных элементов.
Промты под конкретную модель
Один и тот же запрос в разных нейросетях даёт разный результат, потому что модели обучены на разных данных и по-разному интерпретируют синтаксис.
Midjourney хорошо реагирует на художественные описания и поддерживает параметры после двойного дефиса, например --ar 16:9 для соотношения сторон или --style raw для менее «прилизанного» результата. Длинные литературные описания здесь работают отлично.
Stable Diffusion и интерфейсы на его базе (Automatic1111, ComfyUI) используют взвешивание через скобки: (masterpiece:1.2) усиливает элемент. Здесь же критически важен негативный промт — отдельное поле, где перечисляется то, чего на картинке быть не должно:
negative prompt: deformed hands, extra fingers, blurry, watermark, text, low quality
DALL-E (в том числе через ChatGPT) лучше понимает естественный язык и длинные связные описания, но хуже реагирует на технические «теги». Здесь запрос стоит писать как обычное предложение: «Сфотографируй кота в стиле портрета эпохи Возрождения при мягком дневном свете».
⚠️ Внимание: параметры командной строки вроде --ar или синтаксис весов через двоеточие — это функции конкретных платформ, а не универсальный стандарт. Перед использованием сверяйтесь с документацией вашего сервиса: синтаксис и набор параметров меняются между версиями.
Готовые примеры промтов
Ниже — проверенные шаблоны под популярные сценарии. Подставляйте свои объекты и детали.
Портрет:
portrait of a middle-aged man with a beard, thoughtful expression, window light, dark background, 85mm f/1.8, photorealistic, sharp focus
Предметная съёмка:
product photo of a ceramic coffee cup on a wooden table, morning light, steam rising, minimalist composition, studio quality
Пейзаж:
mountain lake at dawn, mist over water, reflection of peaks, dramatic sky, wide angle, landscape photography, highly detailed
Обратите внимание: во всех примерах есть указание на свет и тип съёмки. Именно освещение чаще всего отличает «живое» AI-фото от плоской компьютерной картинки — без него модель отрисовывает нейтральный рассеянный свет, который выглядит искусственно.
Как заставить нейросеть повторять один и тот же стиль
Используйте фиксированный seed (если платформа позволяет) — тогда при неизменном промте результат будет воспроизводимым. В Midjourney также помогают ссылки на референсные изображения и параметр стилизации. Полная идентичность между сессиями не гарантируется: модели обновляются, и поведение может меняться.
Типичные ошибки при составлении промтов
Первая и главная ошибка — перегрузка запроса. Когда в промте тридцать слов о деталях одежды, но ни слова о композиции, модель выдаёт хаотичный кадр. Приоритет всегда у первых токенов, поэтому главное — вперёд.
Вторая проблема — противоречия. Связки вроде minimalist, highly detailed, crowded scene ставят модель в тупик: она попытается выполнить всё сразу и получится визуальный шум. Проверяйте, не тянут ли слова запрос в разные стороны.
- 🚫 Слишком абстрактные слова без визуальной привязки: «гармония», «душевность»
- 🚫 Запрос текста на изображении — буквы нейросети рисуют плохо (хотя новые модели справляются лучше)
- 🚫 Игнорирование негативного промта там, где он поддерживается
- 🚫 Копирование чужих промтов без адаптации под свою модель и версию
⚠️ Внимание: генерация изображений реальных людей без их согласия, а также deepfake-контент могут нарушать законодательство и правила платформ. Многие сервисы блокируют запросы с именами известных личностей. Используйте AI-фото в рамках правил выбранной площадки.
Как улучшать результаты итеративно
Редко кто получает идеальную картинку с первого запроса — профессионалы работают итерациями. Сгенерировали четыре варианта, выбрали ближайший к задумке, добавили уточняющие слова, повторили. Такой цикл из трёх-пяти проходов обычно приводит к нужному результату быстрее, чем попытки написать «идеальный промт» с нуля.
Полезный приём — менять по одному элементу за раз. Если переписать половину запроса, вы не поймёте, какое изменение сработало. Добавили описание света — посмотрели эффект. Поменяли ракурс — сравнили. Это похоже на отладку кода: изолируем переменные.
Также многие платформы позволяют использовать сгенерированное изображение как референс или основу для вариаций. Это удобно, когда композиция удачна, но нужно подправить детали.
FAQ: частые вопросы о промтах для AI фото
На каком языке писать промты — русском или английском?
Большинство моделей обучены преимущественно на англоязычных описаниях, поэтому английский даёт более точный результат. Часть сервисов автоматически переводит русские запросы, но нюансы могут теряться. Если английский не ваш — используйте переводчик и проверяйте ключевые термины.
Почему один и тот же промт даёт разные картинки?
Генерация стартует со случайного шума, и каждый запуск — новый результат. Если платформа поддерживает параметр seed, зафиксируйте его значение, чтобы воспроизводить конкретный вариант. Без фиксации seed полная повторяемость невозможна.
Что такое негативный промт и нужен ли он всегда?
Негативный промт — список того, чего на изображении быть не должно: искажения, водяные знаки, лишние конечности. Он поддерживается не всеми платформами (в первую очередь это инструменты на базе Stable Diffusion). Если функция доступна — использовать её стоит почти всегда, это заметно снижает количество артефактов.
Как сделать, чтобы персонаж выглядел одинаково на нескольких фото?
Это одна из сложных задач генерации. Работающие подходы: фиксация seed, использование референсных изображений, детальное описание внешности в каждом промте, а в Stable Diffusion — обучение персональной модели (LoRA). Гарантии стопроцентного сходства ни один метод не даёт.
Можно ли использовать сгенерированные фото в коммерческих целях?
Зависит от условий конкретного сервиса и вашего тарифа: у разных платформ разные лицензии на сгенерированный контент. Перед коммерческим использованием изучите условия использования выбранной нейросети — обычно они опубликованы на официальном сайте сервиса.