Нейросеть Stable Diffusion: полное руководство по запуску и генерации изображений

Stable Diffusion запускается локально на видеокарте с объёмом видеопамяти от 4–6 ГБ, и именно нехватка VRAM чаще всего становится причиной ошибок CUDA out of memory при первом старте. Если генерация падает с этой ошибкой, первым делом проверьте разрешение изображения в настройках — снижение с 1024×1024 до 512×512 обычно решает проблему на слабых картах.

В отличие от облачных сервисов вроде Midjourney, Stable Diffusion работает полностью на вашем компьютере: без подписки, лимитов на количество генераций и цензуры контента. Модель с открытым кодом разработана компанией Stability AI, а вокруг неё выросла огромная экосистема интерфейсов, дополнительных моделей и плагинов. В этой статье разберём, что нужно для запуска, какой интерфейс выбрать и как получать качественные результаты.

Что такое Stable Diffusion и как она работает

Stable Diffusion — это диффузионная нейросеть, которая создаёт изображения из текстового описания (промпта). Принцип работы: модель начинает со случайного шума и постепенно «очищает» его, приближая картинку к описанию. Процесс управляется количеством шагов (steps) и методом семплирования (sampler).

Существует несколько поколений модели: SD 1.5, SD 2.1, SDXL и более новые версии. Они различаются разрешением, качеством проработки деталей и требованиями к железу. Для большинства пользователей оптимальны SD 1.5 (лёгкая, огромная база обученных моделей) или SDXL (заметно качественнее, но требовательнее к видеопамяти).

Ключевое преимущество — открытость. На базе модели сообщество обучило тысячи специализированных версий: для аниме-стилистики, фотореализма, архитектурных рендеров. Их можно скачивать с площадок вроде Civitai и подключать к своей установке.

Системные требования и подготовка ПК

Главный компонент для работы нейросети — видеокарта. Лучше всего поддерживаются карты NVIDIA с технологией CUDA. На AMD запуск возможен, но сложнее: потребуются специальные сборки интерфейса с поддержкой DirectML или ROCm, а производительность обычно ниже.

КомпонентМинимумКомфортная работа
ВидеокартаNVIDIA с 4 ГБ VRAM8–12 ГБ VRAM и больше
Оперативная память8 ГБ16–32 ГБ
Место на диске20 ГБ50+ ГБ (SSD предпочтительнее)
ОСWindows 10/11, LinuxWindows 10/11 64-bit

Перед установкой убедитесь, что на компьютере установлены Python версии 3.10.x и Git — они нужны для большинства интерфейсов. Также обновите драйверы видеокарты до актуальной версии: устаревший драйвер — частая причина сбоев при инициализации CUDA.

Выбор интерфейса: AUTOMATIC1111, ComfyUI и другие

Сама модель — это лишь файл весов. Для работы нужен интерфейс, и вариантов несколько:

  • 🖥️ AUTOMATIC1111 WebUI — самый популярный интерфейс с вкладками txt2img, img2img, inpainting и огромным выбором расширений. Оптимален для новичков.
  • 🧩 ComfyUI — нодовый интерфейс, где процесс генерации собирается из блоков. Сложнее в освоении, но гибче и экономичнее по памяти.
  • 🎨 Fooocus — максимально упрощённый интерфейс в духе Midjourney: минимум настроек, хорошие результаты «из коробки».
  • ⚙️ SD.Next — форк AUTOMATIC1111 с улучшенной оптимизацией и поддержкой новых моделей.

Для первого знакомства разумнее всего поставить AUTOMATIC1111: по нему больше всего инструкций и готовых решений типичных ошибок. ComfyUI имеет смысл осваивать позже, когда понадобятся сложные цепочки обработки.

📊 Каким интерфейсом Stable Diffusion вы пользуетесь?
AUTOMATIC1111 WebUI
ComfyUI
Fooocus
Только планирую установить

Установка AUTOMATIC1111 на Windows

Установка сводится к клонированию репозитория и запуску скрипта, который сам подтянет зависимости. Порядок действий:

Сначала установите Python 3.10 (при установке обязательно отметьте галочку Add Python to PATH) и Git. Затем откройте командную строку в папке, куда хотите поставить программу, и выполните:

git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git

После клонирования запустите файл webui-user.bat двойным кликом. Первый запуск займёт продолжительное время — скачиваются библиотеки PyTorch и зависимости. Когда в консоли появится строка с адресом вида http://127.0.0.1:7860, откройте его в браузере — интерфейс готов к работе.

☑️ Проверка перед первым запуском

Выполнено: 0 / 5

Чтобы генерация началась, нужна хотя бы одна модель. Скачанный файл .safetensors или .ckpt помещается в папку models/Stable-diffusion внутри каталога программы, после чего модель появляется в выпадающем списке в левом верхнем углу интерфейса.

⚠️ Внимание: скачивайте модели только в формате .safetensors. Файлы .ckpt основаны на pickle и теоретически могут содержать вредоносный код. Проверяйте источники и не запускайте модели с сомнительных сайтов.

Промпты: как получать хорошие результаты

Промпт — это текстовое описание желаемого изображения на английском языке. Чем конкретнее описание, тем предсказуемее результат. Указывайте объект, стиль, освещение, ракурс и качество: например, portrait of a woman, soft studio lighting, 85mm lens, photorealistic.

Не менее важен негативный промпт — поле, где перечисляется то, чего на картинке быть не должно. Типичный набор: blurry, low quality, deformed hands, extra fingers, watermark. Хорошо составленный негативный промпт заметно снижает количество брака, особенно с руками и лицами.

Основные параметры генерации:

  • 🎲 Seed — число, определяющее стартовый шум. Одинаковые seed и настройки дают идентичный результат, что удобно для воспроизведения удачных генераций.
  • 🔢 Steps — количество шагов семплирования. Обычно достаточно 20–30; больше не значит лучше.
  • 🎚️ CFG Scale — насколько строго модель следует промпту. Значения в районе 7 — стандартная отправная точка.
  • 📐 Разрешение — для SD 1.5 оптимально 512×512, для SDXL — около 1024×1024. Сильное отклонение от «родного» разрешения даёт артефакты.
Что такое LoRA и зачем они нужны

LoRA — это небольшие файлы-дополнения (обычно 10–500 МБ), которые «докручивают» базовую модель: добавляют конкретный стиль, персонажа или концепцию. Их можно комбинировать с любой базовой моделью и включать прямо в промпте через специальный синтаксис.

Типичные ошибки и их решение

Ошибка CUDA out of memory означает, что видеокарте не хватило памяти. Проверьте разрешение и размер батча, а если не помогло — добавьте в файл webui-user.bat параметры запуска --medvram или --lowvram. Это замедлит генерацию, но позволит работать на слабых картах.

Если интерфейс не запускается и консоль выдаёт ошибки про версии пакетов, возможная причина — конфликт установленного Python. Убедитесь, что в системе стоит именно версия 3.10.x, а не 3.11 или 3.12: с ними часть зависимостей несовместима. Проверить версию можно командой python --version.

Чёрные картинки вместо результата часто возникают из-за конфликта с определёнными настройками точности вычислений. Попробуйте добавить флаг --no-half или --precision full в параметры запуска — это известная проблема на некоторых картах старых серий.

⚠️ Внимание: при генерации изображений людей помните о правовых ограничениях. Создание фотореалистичных изображений реальных лиц без их согласия и распространение таких материалов может нарушать законодательство вашей страны.

Обучение собственных моделей

Когда готовых моделей перестаёт хватать, можно обучить свою. Самый доступный способ — LoRA-обучение: для стиля или персонажа обычно достаточно 15–30 качественных изображений. Обучение выполняется локально через Kohya GUI или встроенные инструменты, но требует заметно больше видеопамяти, чем обычная генерация.

Качество обучающего набора важнее количества. Размытые, однотипные или низкоразрешённые картинки дадут слабую модель, которая будет «ломать» генерации. Подписывайте изображения тегами (это называется captioning) — так модель точнее поймёт, чему именно её учат.

Часто задаваемые вопросы

Можно ли запустить Stable Diffusion без мощной видеокарты?

Да, но с оговорками. Существует режим работы на процессоре, однако генерация одного изображения займёт от нескольких минут до десятков минут. Альтернатива — облачные сервисы вроде Google Colab или аренда GPU, где модель работает на удалённом сервере.

Чем SD 1.5 отличается от SDXL?

SDXL обучена на большем разрешении и даёт более детализированные и связные изображения, особенно в фотореализме. Обратная сторона — выше требования к видеопамяти и меньшее количество дополнительных моделей по сравнению с огромной экосистемой SD 1.5.

Бесплатна ли Stable Diffusion?

Сама модель и популярные интерфейсы распространяются бесплатно с открытым исходным кодом. Расходы — только электричество и ваше железо. Отдельные сторонние модели на площадках могут распространяться на платной основе по решению их авторов.

Почему на генерациях искажённые руки и лица?

Это известная слабость диффузионных моделей. Помогают развёрнутый негативный промпт, расширение ADetailer для автоматической коррекции лиц и рук, а также технология ControlNet, позволяющая задавать позу по референсу.

Можно ли использовать сгенерированные изображения в коммерческих целях?

Лицензия Stable Diffusion в целом разрешает коммерческое использование, но у отдельных пользовательских моделей с Civitai могут быть собственные условия. Перед коммерческим применением проверяйте лицензию конкретной модели, которую используете.