Как использовать Stable Diffusion: полное руководство для начинающих

Запуск Stable Diffusion упирается в одно первичное требование — видеокарту с достаточным объёмом видеопамяти: для комфортной работы с моделями семейства SD 1.5 желательно 6–8 ГБ VRAM, а для SDXL — от 8 ГБ и выше. Если видеокарта слабее, генерация либо не стартует, либо завершается ошибкой нехватки памяти CUDA out of memory. Поэтому первое действие перед установкой — проверить модель своего GPU через Диспетчер задач → Производительность → Графический процессор.

Stable Diffusion — это нейросеть с открытым кодом, которая генерирует изображения по текстовому описанию. В отличие от облачных сервисов, она работает локально на вашем компьютере: без подписки, без лимитов на количество картинок и без цензуры со стороны платформы. Расплачиваться придётся требованиями к железу и временем на первоначальную настройку.

Способы запуска: локально или в облаке

Существует три основных пути. Первый — локальная установка через веб-интерфейс AUTOMATIC1111, самый популярный вариант для Windows. Второй — ComfyUI, узловой интерфейс, который сложнее в освоении, но гибче и экономнее расходует видеопамять. Третий — облачные сервисы вроде Google Colab или аренды GPU, если своей видеокарты нет вовсе.

Для первого знакомства разумнее всего выбрать AUTOMATIC1111: у него понятный веб-интерфейс, огромная база инструкций и расширений. ComfyUI имеет смысл осваивать позже, когда появится понимание внутреннего устройства генерации.

  • 🖥️ AUTOMATIC1111 — классический веб-интерфейс, лучший выбор для новичка
  • 🧩 ComfyUI — узловая система для продвинутых рабочих процессов
  • ☁️ Google Colab / облачный GPU — вариант без мощной видеокарты
  • 📦 Fooocus — упрощённый интерфейс «в одну кнопку» для быстрых результатов
📊 Какой способ запуска Stable Diffusion вам ближе?
Локально через AUTOMATIC1111
ComfyUI для гибких сценариев
Облако — нет подходящей видеокарты
Пока только выбираю

Установка AUTOMATIC1111 на Windows

Перед установкой убедитесь, что в системе есть Python 3.10 (именно ветка 3.10, другие версии часто вызывают конфликты зависимостей) и Git. Затем клонируйте репозиторий в папку без русских букв и пробелов в пути — это одна из самых частых причин сбоев при первом запуске.

git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git

cd stable-diffusion-webui

webui-user.bat

Первый запуск webui-user.bat займёт заметное время: скрипт сам скачает зависимости и создаст виртуальное окружение. Когда в консоли появится строка вида Running on local URL: http://127.0.0.1:7860, откройте этот адрес в браузере — перед вами интерфейс генерации.

☑️ Готовность системы к установке

Выполнено: 0 / 5
⚠️ Внимание: скачивайте модели только в формате .safetensors, а не .ckpt или .pt от неизвестных источников — старые форматы могут содержать исполняемый код. Проверяйте файлы антивирусом и используйте проверенные каталоги моделей.

Модели: где брать и куда класть

Сама по себе программа — только оболочка. Картинки рисует чекпоинт (модель) — файл весом от 2 до 7 ГБ. Популярный источник моделей — каталог Civitai, где публикуются тысячи вариантов: реалистичные, аниме, живописные, специализированные под портреты или архитектуру.

Скачанный файл помещается в папку stable-diffusion-webui/models/Stable-diffusion. После этого модель появится в выпадающем списке в левом верхнем углу интерфейса — иногда требуется нажать кнопку обновления рядом со списком.

Тип файлаНазначениеПапка установки
Checkpoint (.safetensors)Базовая модель генерацииmodels/Stable-diffusion
LoRAНебольшие дополнения: стили, персонажиmodels/Lora
VAEКоррекция цветов и детализацииmodels/VAE
EmbeddingТекстовые закладки для промптовembeddings

Первая генерация: промпт и базовые параметры

Перейдите на вкладку txt2img. В верхнее поле вводится промпт — описание желаемого изображения на английском языке, в нижнее — негативный промпт, то есть то, чего на картинке быть не должно. Нейросеть понимает английский заметно лучше русского, поэтому даже простые фразы стоит писать на английском.

Пример стартовой связки: промпт «portrait of a girl, cinematic lighting, detailed face, 85mm photo», негатив — «blurry, low quality, deformed hands, watermark». Порядок слов имеет значение: чем раньше слово в промпте, тем больший вес оно получает.

  • 🎨 Sampling steps — число шагов генерации; для большинства моделей достаточно 20–30
  • 📐 Width/Height — разрешение; для SD 1.5 держитесь около 512×512, для SDXL — около 1024×1024
  • 🎛️ CFG Scale — насколько строго следовать промпту; типичный диапазон 5–9
  • 🎲 Seed — зерно генерации; значение -1 даёт случайный результат каждый раз

Улучшение результата: Hires. fix, LoRA и ControlNet

Генерация в высоком разрешении напрямую часто даёт артефакты вроде двойных лиц. Функция Hires. fix решает это в два прохода: сначала создаётся картинка базового размера, затем она увеличивается с дорисовкой деталей. Включите чекбокс Hires. fix, выберите апскейлер (для фото подойдут варианты семейства 4x-UltraSharp, для иллюстраций — R-ESRGAN 4x+ Anime6B) и задайте коэффициент увеличения.

LoRA — компактные файлы-дополнения, которые добавляют модели новый стиль, персонажа или приём. Подключаются прямо в тексте промпта конструкцией <lora:имя_файла:0.8>, где число — сила влияния. ControlNet (ставится как расширение) позволяет задать позу, композицию или контур по референсу — это главный инструмент управляемой генерации, а не «лотереи».

Что такое inpainting и зачем он нужен

Inpainting (вкладка img2img) позволяет перерисовать только выделенную часть изображения — например, исправить кисть руки или заменить фон, не трогая остальное. Выделяете область кистью, пишете промпт для этой зоны и запускаете генерацию. Параметр Denoising strength определяет, насколько сильно изменится выделенная область.

Типичные ошибки и их решение

Самая частая проблема — CUDA out of memory. Она означает, что видеопамяти не хватило под текущие настройки. Решается снижением разрешения, отключением Hires. fix или добавлением параметров запуска --medvram или --lowvram в файл webui-user.bat в строку COMMANDLINE_ARGS.

Вторая группа проблем — чёрные картинки вместо результата. Частая причина — включённый фильтр NSFW или некорректный VAE. Проверьте настройки VAE в разделе Settings → Stable Diffusion и попробуйте сменить сэмплер. Третья типичная ситуация — «пластиковая» кожа и мыльная картинка: обычно это следствие слишком высокого CFG или промпта, перегруженного словами вроде masterpiece, best quality без конкретики.

⚠️ Внимание: не добавляйте в COMMANDLINE_ARGS флаги --xformers или --medvram «на всякий случай» — каждый из них меняет скорость и стабильность работы. Включайте параметр только если столкнулись с конкретной проблемой, которую он решает.
⚠️ Внимание: генерация изображений реальных людей без их согласия, а также создание дипфейков может нарушать законодательство вашей страны. Используйте нейросеть в рамках правил платформ, где планируете публиковать результат.

FAQ: частые вопросы

Работает ли Stable Diffusion на видеокартах AMD?

Да, но с оговорками. На Windows поддержка AMD исторически сложнее: используются сборки с DirectML или форки вроде Stable Diffusion WebUI с поддержкой ZLUDA, а на Linux — ROCm. Скорость и стабильность зависят от конкретной карты и драйверов, поэтому сверяйтесь с инструкциями под вашу модель GPU.

Можно ли генерировать без мощной видеокарты?

Можно через облачные сервисы: Google Colab, аренда GPU или готовые платформы. Локально на слабом железе возможна генерация на CPU, но она занимает минуты на одну картинку и подходит разве что для ознакомления.

Почему руки на изображениях получаются деформированными?

Кисти рук — слабое место диффузионных моделей из-за сложной анатомии и малой доли в обучающих данных. Помогают: явное описание положения рук в промпте, негативные промпты, специализированные LoRA и исправление через inpainting.

Чем SD 1.5 отличается от SDXL?

SDXL — более новое семейство с родным разрешением около 1024×1024, лучшим пониманием промптов и детализацией, но оно требовательнее к видеопамяти. SD 1.5 легче, быстрее и имеет огромную базу обученных моделей и LoRA.

Нужен ли интернет после установки?

Нет. После того как программа и модели скачаны, генерация полностью локальна. Интернет понадобится только для загрузки новых моделей, расширений и обновлений.