Картинка в Stable Diffusion получается размытой, с лишними пальцами или вообще не похожей на задумку — в большинстве таких случаев проблема не в модели, а в том, как написан промпт. Нейросеть буквально понимает текст: она не догадывается, что вы имели в виду, а берёт только те слова, которые вы ввели, и веса, которые им присвоены.
Эта статья разбирает структуру промпта для Stable Diffusion: какие блоки должны присутствовать, как работают веса и негативные промпты, какие ключевые слова реально влияют на результат. Материал подходит для интерфейсов AUTOMATIC1111 и ComfyUI — синтаксис весов у них совпадает.
Что такое промпт и как его понимает нейросеть
Промпт — это текстовое описание изображения, которое модель преобразует в картинку. Stable Diffusion не «понимает» смысл предложения как человек: она разбивает текст на токены и сопоставляет их с визуальными понятиями, на которых обучалась. Поэтому длинное художественное описание часто работает хуже, чем короткий список точных тегов.
Важная особенность: слова в начале промпта имеют больший приоритет, чем слова в конце. Если главный объект — девушка в красном платье, то именно это описание должно стоять первым, а фон и атмосферу стоит добавлять после. Когда ключевой объект оказывается в конце запроса, модель может сделать его мелким или вообще проигнорировать.
Ещё одно следствие токенизации — модель лучше понимает английский язык. Обучающие данные для большинства чекпоинтов были подписаны на английском, поэтому промпт на русском либо не сработает, либо даст непредсказуемый результат. Переведите описание на английский — это самое простое улучшение качества.
Структура правильного промпта
Рабочий промпт обычно строится из нескольких логических блоков, идущих в определённом порядке. Это не жёсткое правило, но проверенная схема, которая стабильно даёт хорошие результаты.
- 🎯 Главный объект — кто или что на изображении:
1girl,a castle,portrait of an old man - 🎨 Действие и детали — что делает объект, одежда, эмоции, поза:
sitting on a bench, reading a book - 🌆 Окружение и фон — где происходит сцена:
in a autumn park, city lights in background - 💡 Освещение —
soft lighting,golden hour,cinematic lighting - 📷 Стиль и качество —
masterpiece, best quality, photorealisticилиoil painting, digital art
Пример собранного промпта:
1girl, long silver hair, blue eyes, wearing a white dress, sitting on a bench, reading a book, autumn park, falling leaves, golden hour, soft lighting, masterpiece, best quality, highly detailed
Веса и усиление ключевых слов
Иногда модель упорно игнорирует важную деталь — например, цвет глаз или конкретный аксессуар. Для этого в синтаксисе Stable Diffusion предусмотрены веса: они усиливают или ослабляют влияние слова на результат.
Основной синтаксис — круглые скобки и число: (blue eyes:1.3) означает, что «голубые глаза» получат вес 1.3 вместо стандартного 1.0. Простое оборачивание в скобки (word) без числа эквивалентно весу примерно 1.1, а двойные скобки ((word)) — около 1.21. Квадратные скобки [word], наоборот, ослабляют слово.
⚠️ Внимание: не поднимайте веса выше 1.5 без необходимости. Чрезмерное усиление одного слова «ломает» композицию — модель начинает рисовать этот элемент повсюду, а остальные части промпта теряются.
Ослабление тоже полезно: если элемент появляется, но слишком доминирует, задайте ему вес 0.7–0.9, например (hats:0.8). Так вы сохраните деталь, но уберёте её с переднего плана.
Негативный промпт: что исключить из картинки
Негативный промпт — это отдельное поле, куда вносятся слова, описывающие то, чего на изображении быть не должно. Без него модель часто выдаёт типичные артефакты: лишние конечности, деформированные руки, размытость, водяные знаки.
Базовый универсальный негативный промпт, с которого можно начинать:
worst quality, low quality, blurry, bad anatomy, bad hands, extra fingers, missing fingers, deformed, watermark, text, signature
Обратите внимание: негативный промпт не исправляет всё. Если руки деформированы из-за слишком низкого разрешения или неподходящего чекпоинта, слова bad hands в негативе помогут лишь частично. Негативный промпт корректирует вероятности, но не заменяет подходящую модель и адекватные настройки генерации.
Ключевые слова качества и стиля
Отдельная категория тегов — слова-модификаторы, которые задают уровень проработки и художественный стиль. Часть из них работает почти на любом чекпоинте, часть привязана к конкретным моделям и их обучающим данным.
| Категория | Примеры тегов | Эффект |
|---|---|---|
| Качество | masterpiece, best quality, highly detailed |
Общая детализация и чистота картинки |
| Фотореализм | photorealistic, raw photo, 8k, dslr |
Фотографический стиль, текстуры кожи |
| Освещение | cinematic lighting, volumetric light, rim light |
Драматичный или объёмный свет |
| Ракурс | close-up, wide shot, from below, dutch angle |
Положение «камеры» и кадрирование |
| Арт-стили | oil painting, watercolor, anime style, pixel art |
Живописная или стилизованная подача |
Не стоит сваливать в промпт все теги качества сразу. Три-четыре осмысленных модификатора работают лучше, чем двадцать слов-дублей — избыточные теги размывают влияние друг друга и «съедают» лимит токенов, который мог бы пойти на описание сцены.
Настройки генерации, влияющие на промпт
Даже идеально составленный запрос не даст результата, если параметры генерации ему противоречат. Три настройки напрямую связаны с тем, как модель следует промпту.
CFG Scale (Classifier Free Guidance) определяет, насколько строго модель придерживается текста. Низкие значения дают больше «творческой свободы» и отклонений от промпта, высокие — жёсткое следование, но при слишком высоких значениях появляются пересвеченные, «пережжённые» цвета и артефакты. Для большинства чекпоинтов рабочий диапазон — средние значения; точный оптимум зависит от конкретной модели, и его обычно указывают на странице чекпоинта.
Разрешение должно соответствовать тому, на чём обучалась модель. Генерация портрета в широком формате без коррекции часто даёт двойные объекты и искажённую анатомию. Если нужен большой размер, используйте Hires. fix или апскейл вместо прямого увеличения разрешения.
Seed фиксирует стартовый шум. Один и тот же seed с одним промптом даст воспроизводимый результат — это удобно, когда вы подбираете промпт итеративно: меняете одно слово, смотрите разницу, оставляете лучший вариант.
☑️ Проверка промпта перед генерацией
Типичные ошибки при написании промптов
Большинство проблем с генерацией сводится к нескольким повторяющимся ошибкам. Вот что стоит проверить в первую очередь.
- 🚫 Противоречия в запросе —
day, nightилиsmiling, cryingв одном промпте заставляют модель усреднять несовместимое - 🚫 Описание через отрицание — слово
noв позитивном промпте не работает как отрицание; «без шляпы» нужно переносить в негативный промпт какhat - 🚫 Промпт-простыня — сотня тегов, скопированных из чужого запроса, размывает влияние каждого слова
- 🚫 Игнорирование чекпоинта — аниме-модель не выдаст фотореализм, сколько бы тегов
photorealisticвы ни добавили
⚠️ Внимание: не путайте позитивный и негативный промпты. Частая ошибка новичков — писать в позитивное поле «no blur, no distortion». Модель видит токеныblurиdistortionи, наоборот, повышает их вероятность. Всё нежелательное — только в негативное поле.
Как работают BREAK и AND
Ключевое слово BREAK разбивает длинный промпт на отдельные сегменты по 75 токенов — это помогает, когда описание очень длинное и модель начинает смешивать части. Оператор AND (в AUTOMATIC1111) позволяет объединять несколько независимых подпромптов с разными весами, например: a cat :1.2 AND a dog :0.8. Используйте эти инструменты только когда обычный промпт уже не справляется.
Где брать готовые промпты и как учиться на них
Самый быстрый способ научиться — разбирать чужие работы. На Civitai почти каждое опубликованное изображение содержит полные метаданные генерации: промпт, негативный промпт, seed, CFG, название модели. В AUTOMATIC1111 эти данные можно импортировать через вкладку PNG Info — просто перетащите картинку, и все параметры подставятся автоматически.
Метод обучения простой: берите чужой промпт, генерируйте его как есть, затем убирайте по одному блоку и смотрите, что изменилось. Через десяток таких экспериментов вы начнёте предсказывать, какое слово за что отвечает, и сможете собирать собственные запросы осознанно, а не методом тыка.
Часто задаваемые вопросы
На каком языке писать промпты для Stable Diffusion?
На английском. Подавляющее большинство моделей обучались на англоязычных подписях к изображениям, поэтому русский текст модель либо игнорирует, либо интерпретирует непредсказуемо. Если английский вызывает трудности — переведите описание через любой переводчик, для промптов этого достаточно.
Что означают скобки в промпте?
Круглые скобки усиливают слово: (word) — примерно в 1.1 раза, (word:1.4) — с указанным весом. Квадратные скобки [word] ослабляют влияние слова. Это синтаксис интерфейсов вроде AUTOMATIC1111 и ComfyUI, а не самой нейросети.
Почему модель игнорирует часть промпта?
Три вероятные причины: слово стоит слишком далеко от начала запроса, промпт перегружен и влияние тегов размыто, либо понятие плохо представлено в обучающих данных чекпоинта. Решения: переместите слово в начало, усильте его весом до 1.2–1.4 или сократите общий промпт.
Обязателен ли негативный промпт?
Формально нет — генерация работает и без него. Но на практике базовый негативный промпт с тегами вроде worst quality, bad anatomy, bad hands заметно снижает количество брака, особенно на универсальных чекпоинтах. Некоторые модели, обученные со встроенной коррекцией качества, могут давать хороший результат и без негатива — проверяйте рекомендации к конкретному чекпоинту.
Как сделать одинаковые лица на разных картинках?
Одним промптом стабильно повторить лицо сложно — текстовое описание задаёт лишь общие черты. Для консистентного персонажа обычно используют LoRA-модели, обученные на конкретном лице, либо фиксацию seed в сочетании с одинаковым детальным описанием. Промпт в этом случае — вспомогательный инструмент, а не основной.