Stable Diffusion: полная инструкция для начинающих

Ошибка CUDA out of memory при первом запуске Stable Diffusion почти всегда означает, что видеокарте не хватает памяти для выбранного разрешения — снизьте размер изображения до 512×512 и добавьте параметр --medvram в файл запуска. Эта инструкция проведёт вас от установки до уверенной генерации: разберём требования к железу, настройку веб-интерфейса Automatic1111, принципы составления промптов и типичные проблемы новичков.

Stable Diffusion — это нейросеть для генерации изображений по текстовому описанию, которую можно запустить локально на собственном компьютере. В отличие от облачных сервисов, локальный запуск не требует подписки, не ограничивает количество генераций и даёт полный контроль над моделями и настройками. Платой за это служат требования к видеокарте и необходимость разобраться в параметрах.

Системные требования и подготовка

Главное требование — видеокарта с поддержкой CUDA. Лучше всего подходят карты NVIDIA с объёмом видеопамяти от 6 ГБ, хотя с оптимизациями возможна работа и на 4 ГБ. Карты AMD поддерживаются через альтернативные сборки, но настройка сложнее, а стабильность ниже.

Кроме видеокарты понадобится:

  • 💾 Свободное место на диске — от 20 ГБ: сама программа, зависимости и хотя бы одна модель весом 2-7 ГБ
  • 🐍 Python 3.10.x — именно эта ветка версий, с другими версиями возможны конфликты зависимостей
  • 📦 Git — для загрузки и обновления репозитория веб-интерфейса
  • 🧠 Оперативная память — желательно от 16 ГБ для комфортной работы
⚠️ Внимание: при установке Python обязательно отметьте галочку «Add Python to PATH» в первом окне установщика. Без этого скрипт запуска не найдёт интерпретатор, и вы получите ошибку ещё до начала загрузки компонентов.

Установка Automatic1111 WebUI

Самый популярный интерфейс для Stable Diffusion — Automatic1111 WebUI. Он бесплатен, активно обновляется и поддерживает расширения. Установка на Windows сводится к нескольким шагам.

Сначала клонируйте репозиторий в удобную папку, например на диск D. Откройте командную строку в нужной директории и выполните:

git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git

Затем скачайте файл модели (чекпоинт) в формате .safetensors — например, с площадки Civitai или Hugging Face — и поместите его в папку models/Stable-diffusion внутри каталога программы. После этого запустите файл webui-user.bat: при первом старте автоматически загрузятся все зависимости, это может занять заметное время.

☑️ Проверка перед первым запуском

Выполнено: 0 / 5

Когда в консоли появится строка с локальным адресом, откройте в браузере http://127.0.0.1:7860 — перед вами интерфейс генерации.

Первая генерация: интерфейс и базовые настройки

Вкладка txt2img — основная рабочая область. В верхнее поле вводится промпт (описание желаемого изображения), в поле ниже — негативный промпт, то есть то, чего на картинке быть не должно. Кнопка Generate запускает процесс.

Разберём ключевые параметры, которые вы увидите под полями ввода:

ПараметрЧто делаетС чего начать
Sampling methodАлгоритм сэмплирования (метод «сборки» изображения из шума)Euler a или DPM++ 2M Karras
Sampling stepsКоличество шагов обработки20-30
CFG ScaleСила следования промпту7
Width / HeightРазрешение результата512×512 для моделей SD 1.5
SeedЗерно генерации, определяет вариант картинки-1 (случайное)

Для первого теста введите простой промпт вроде a cat sitting on a windowsill, soft light и нажмите Generate. Если изображение появилось — установка прошла успешно, можно переходить к тонкой настройке.

📊 На каком железе вы запускаете Stable Diffusion?
NVIDIA с 8+ ГБ видеопамяти
NVIDIA с 4-6 ГБ
Видеокарта AMD
Только процессор / облако

Как писать промпты: практические правила

Промпт пишется на английском языке — модели обучены преимущественно на нём. Структура имеет значение: слова в начале описания влияют на результат сильнее, чем в конце. Поэтому сначала указывайте главный объект, затем детали, стиль и качество.

Рабочая формула для начинающих: субъект + действие/поза + окружение + освещение + стиль + качество. Например: portrait of an elderly fisherman, weathered face, seaside background, golden hour lighting, photorealistic, highly detailed.

  • 🎯 Конкретика важнее объёма — «red vintage car» сработает лучше, чем просто «car»
  • ⚖️ Веса через скобки — запись (word:1.3) усиливает элемент, а (word:0.7) ослабляет
  • 🚫 Негативный промпт — добавьте blurry, low quality, deformed hands, watermark для отсечения типичных дефектов
  • 🎨 Стилевые якоря — слова вроде oil painting, anime style, cinematic кардинально меняют результат
Что такое VAE и зачем его подключать

VAE (вариационный автоэнкодер) отвечает за финальное декодирование изображения. Некоторые модели без внешнего VAE выдают блёклые, сероватые цвета. Файл VAE скачивается отдельно и кладётся в папку models/VAE, после чего выбирается в настройках интерфейса (Settings → Stable Diffusion → SD VAE). Многие современные чекпоинты уже содержат встроенный VAE — тогда ничего дополнительно делать не нужно.

Решение типичных проблем и ошибок

Самая частая жалоба — упомянутая ошибка нехватки видеопамяти. Откройте файл webui-user.bat в текстовом редакторе и измените строку параметров:

set COMMANDLINE_ARGS=--medvram --xformers

Флаг --medvram снижает потребление памяти ценой скорости, а --xformers оптимизирует вычисления на картах NVIDIA. Если памяти критически мало, используйте --lowvram, но генерация замедлится в разы.

⚠️ Внимание: не добавляйте в параметры запуска флаги, назначения которых вы не понимаете, скопированные из чужих конфигураций. Некоторые аргументы несовместимы между собой или предназначены для конкретных версий PyTorch — это может привести к падениям, которые сложно диагностировать.

Другие распространённые ситуации: чёрный квадрат вместо картинки (обычно связано с генерацией на полупрецизионной точности — помогает флаг --no-half или --precision full), зависание на загрузке зависимостей (проверьте интернет-соединение и антивирус) и ошибки git при обновлении (удалите конфликтующие изменённые файлы или переустановите расширение).

Расширение возможностей: модели, LoRA и ControlNet

Базовая модель — только начало. Экосистема Stable Diffusion позволяет точно настраивать стиль и результат. LoRA — небольшие файлы-дополнения (обычно десятки-сотни мегабайт), которые добавляют модели новые стили, персонажей или объекты. Их кладут в папку models/Lora, а активируют прямо в промпте конструкцией вида <lora:название:0.8>.

ControlNet — расширение, которое позволяет задавать композицию по референсу: позу человека, контуры, глубину сцены. Устанавливается через вкладку Extensions веб-интерфейса и требует отдельных управляющих моделей. Это один из самых мощных инструментов, но и один из самых требовательных к видеопамяти.

⚠️ Внимание: скачивайте модели только в формате .safetensors, а не .ckpt. Формат ckpt основан на pickle и теоретически может содержать исполняемый код — safetensors лишён этого риска и является стандартом безопасности в сообществе.

FAQ: частые вопросы

Можно ли запустить Stable Diffusion без видеокарты NVIDIA?

Да, но с оговорками. Возможен запуск на процессоре с флагом --use-cpu all, однако генерация одного изображения займёт очень много времени. Для карт AMD существуют сборки на базе DirectML и ROCm, но их настройка сложнее. Альтернатива — облачные сервисы вроде Google Colab, где WebUI запускается на удалённом GPU.

Почему лицо на генерации выглядит искажённым?

При малых разрешениях лицо занимает слишком мало пикселей, и модель не успевает его проработать. Включите опцию Restore faces (использует отдельную модель восстановления лиц) или применяйте Hires. fix. Также помогает уточнение в промпте: detailed face, symmetrical face.

Как повторить понравившееся изображение?

Зафиксируйте значение Seed: скопируйте число из информации о генерации и вставьте в поле Seed вместо -1. При том же промпте, модели и настройках вы получите идентичный результат, а меняя отдельные слова — сможете точечно варьировать картинку.

Какая разница между моделями SD 1.5, SDXL и другими версиями?

Версии отличаются архитектурой, обучающими данными и родным разрешением. SD 1.5 работает с картинками 512×512 и требует меньше ресурсов. SDXL обучена на разрешении 1024×1024, даёт более качественную детализацию, но требовательнее к видеопамяти. Для каждой версии существуют свои LoRA и дополнения — они несовместимы между поколениями.

Легально ли использовать Stable Diffusion и сгенерированные картинки?

Сама модель распространяется с открытой лицензией, но условия использования конкретных чекпоинтов могут отличаться — проверяйте лицензию на странице модели. Правовой статус сгенерированных изображений зависит от юрисдикции и сценария использования; для коммерческих проектов стоит изучить условия конкретной модели и актуальное законодательство вашей страны.