Как повысить качество изображений в Stable Diffusion

Размытые лица, лишние пальцы и «пластиковая» кожа при генерации в Stable Diffusion чаще всего возникают из-за низкого количества шагов сэмплирования, слишком высокого значения CFG Scale или генерации в разрешении, на которое модель не была обучена. Все три причины устраняются настройками в интерфейсе Automatic1111 или ComfyUI без переустановки программы.

Качество результата в нейросети зависит не от одного «волшебного» параметра, а от связки: выбранная модель, промпт, сэмплер, число шагов, масштаб подсказки и итоговое разрешение. Ниже разберём каждый фактор отдельно и покажем, как диагностировать, что именно портит вашу картинку.

От чего зависит качество генерации

Stable Diffusion создаёт изображение итеративно: начинает с шума и постепенно «проявляет» картинку, ориентируясь на текстовый промпт. Если на любом из этапов заданы неподходящие условия, дефекты накапливаются — и на выходе получается размытие, артефакты или искажённая анатомия.

  • 🎨 Чекпоинт (модель) — базовое «умение» нейросети. Слабая или несоответствующая задаче модель не спасёт никакими настройками.
  • ⚙️ Sampler и Steps — алгоритм сэмплирования и число итераций очистки шума.
  • 🎯 CFG Scale — сила следования промпту. Слишком высокое значение даёт перенасыщенные, «выжженные» цвета.
  • 📐 Разрешение — генерация далеко от «родного» размера модели приводит к дублированию объектов и деформациям.
  • 📝 Промпт и негативный промпт — чем точнее описание, тем предсказуемее результат.

Выбор модели и её «родного» разрешения

Каждый чекпоинт обучен на изображениях определённого размера. Модели семейства SD 1.5 традиционно ориентированы на 512×512 пикселей, а SDXL — на 1024×1024. Если генерировать картинку заметно больше «родного» разрешения напрямую, нейросеть начинает повторять объекты: появляются двойные головы, лишние конечности, клонированные фигуры.

Проверить это просто: сгенерируйте тестовый кадр в базовом разрешении вашей модели и сравните с результатом в увеличенном. Если на маленьком размере анатомия корректна, а на большом «поплыла» — проблема именно в разрешении, а не в промпте.

Для получения больших изображений используйте двухэтапный подход: генерация в родном разрешении, затем увеличение через Hires. fix или внешний апскейлер. Так детализация добавляется на втором проходе, а не выдумывается с нуля.

⚠️ Внимание: не ставьте разрешение выше 768×768 для моделей SD 1.5 без включённого Hires. fix — это самая частая причина «двоения» персонажей и сломанной анатомии.

Настройка Sampler, Steps и CFG Scale

Sampler определяет, как именно нейросеть убирает шум. Популярные варианты вроде DPM++ 2M Karras или Euler a дают хороший баланс скорости и детализации, но точный выбор — дело вкуса и конкретной модели. Авторы чекпоинтов часто указывают рекомендованные сэмплеры на странице модели — сверьтесь с этой информацией.

Количество шагов (Steps) влияет на проработку деталей, но не линейно. Слишком мало шагов — картинка недоработана, размыта. Слишком много — время растёт, а прирост качества почти незаметен. Разумный рабочий диапазон для большинства сэмплеров — примерно 20–40 шагов; дальше экспериментируйте на конкретной модели.

CFG Scale отвечает за то, насколько строго нейросеть следует промпту. Низкие значения дают свободную, но «расслабленную» картинку, высокие — резкие, перенасыщенные цвета и артефакты контраста. Универсальной цифры нет: начните со средних значений (около 7) и двигайтесь в обе стороны, наблюдая за результатом.

📊 Что чаще всего портит ваши генерации в Stable Diffusion?
Размытие и недостаток деталей
Искажённая анатомия и лишние конечности
Перенасыщенные цвета и артефакты
Несоответствие промпту

Пошаговая диагностика проблем с качеством

Действуйте методично, меняя по одному параметру за раз — иначе не поймёте, что именно помогло. Зафиксируйте Seed (значение -1 замените на конкретное число), чтобы сравнение было честным.

☑️ Чек-лист диагностики качества

Выполнено: 0 / 6

Если после всех шагов картинка всё равно неудовлетворительна, вероятная причина — сам чекпоинт. Попробуйте другую модель под вашу задачу: чекпоинты специализируются на фотореализме, аниме-стиле, иллюстрации, и универсальных среди них мало.

Роль промпта и негативного промпта

Нейросеть буквально следует тексту: расплывчатый промпт даёт случайный результат. Описывайте сцену конкретно — объект, освещение, ракурс, стиль. Слова в начале промпта имеют больший вес, поэтому главное ставьте первым.

Негативный промпт указывает, чего на картинке быть не должно. Типичный набор для борьбы с дефектами анатомии и качества:

worst quality, low quality, blurry, deformed, bad anatomy, extra limbs, mutated hands, poorly drawn face

Не перегружайте негативный промпт сотней слов — избыточный список иногда ухудшает результат, отнимая «внимание» модели у основного запроса. Начните с короткого набора и дополняйте под конкретные дефекты, которые видите в своих генерациях.

Что такое VAE и зачем его менять

VAE (вариационный автоэнкодер) отвечает за преобразование картинки из внутреннего представления модели в финальные пиксели. Неподходящий или отсутствующий VAE — частая причина блёклых, «вымытых» цветов. Многие чекпоинты имеют встроенный VAE, но иногда авторы рекомендуют отдельный файл. Если цвета выглядят серыми и безжизненными при корректных остальных настройках — проверьте, какой VAE подключён в настройках интерфейса.

Апскейлинг и постобработка

Когда базовая генерация удалась, но разрешения не хватает, на помощь приходит апскейлинг. Встроенная функция Hires. fix увеличивает картинку и одновременно добавляет детали вторым проходом диффузии — параметр Denoising strength при этом лучше держать умеренным, иначе изображение изменится до неузнаваемости.

Альтернатива — апскейл без повторной диффузии на вкладке Extras с использованием отдельных моделей вроде ESRGAN-семейства. Такой способ быстрее и не меняет содержимое картинки, но и не добавляет новых деталей — только увеличивает существующие.

МетодЧто делаетКогда применять
Hires. fixУвеличение + догенерация деталейСразу при генерации крупных картинок
Extras / ESRGANУвеличение без изменения содержимогоКогда результат уже устраивает
img2img с низким denoiseЛёгкая доработка деталейТочечное улучшение удачного кадра
ControlNet / InpaintИсправление отдельных областейЛокальные дефекты: руки, лицо
⚠️ Внимание: при использовании Hires. fix высокое значение Denoising strength (близкое к 1) фактически перерисовывает картинку заново. Если хотите сохранить композицию, держите параметр в умеренных пределах и проверяйте результат на одном и том же Seed.

Типичные дефекты и их причины

Умение «читать» дефекты экономит часы экспериментов. Вот частые симптомы и их вероятные источники:

  • 🌀 Размытие, «мыльность» — мало шагов, неподходящий сэмплер или слишком низкий CFG.
  • 🔥 Пересвеченные, кислотные цвета — завышенный CFG Scale.
  • 👥 Двойные лица, лишние конечности — разрешение выше родного для модели.
  • 🌫️ Блёклые серые тона — отсутствующий или неподходящий VAE.
  • 🧩 Посторонние объекты — перегруженный или противоречивый промпт.
⚠️ Внимание: не пытайтесь исправить анатомию одним лишь наращиванием Steps. Деформации почти всегда связаны с разрешением, моделью или промптом — лишние шаги только потратят время.

FAQ: частые вопросы о качестве Stable Diffusion

Почему лицо на генерации искажено, хотя остальное выглядит хорошо?

Лица занимают мало пикселей при генерации в стандартном разрешении, поэтому модель прорабатывает их хуже. Помогает функция восстановления лиц (например, встроенные опции face restoration в Automatic1111), генерация в большем разрешении с Hires. fix или локальная доработка через Inpaint.

Сколько шагов Steps ставить для максимального качества?

Универсального числа нет — оно зависит от сэмплера и модели. Для большинства связок рабочий диапазон составляет примерно 20–40 шагов; дальнейшее увеличение даёт минимальный прирост. Сравните результат на одном Seed при 20, 30 и 40 шагах — разница покажет оптимум для вашей конфигурации.

Влияет ли видеокарта на качество картинки?

Нет, GPU влияет только на скорость генерации и максимально доступное разрешение (из-за объёма видеопамяти). При одинаковых Seed, модели и параметрах результат будет идентичен на разных видеокартах.

Что важнее для качества — промпт или настройки?

Они решают разные задачи. Настройки (Steps, CFG, разрешение) определяют техническое качество — резкость, цвета, отсутствие артефактов. Промпт определяет содержание и композицию. Сначала добейтесь чистой картинки настройками, затем полируйте содержание текстом запроса.

Улучшат ли результат LoRA и текстовые инверсии?

LoRA добавляют модели новые стили, персонажей или концепции и могут заметно поднять качество в своей нише — при условии, что они совместимы с вашей базовой моделью (например, LoRA для SD 1.5 не работает с SDXL). Используйте их как дополнение к хорошему чекпоинту, а не как замену настройкам.