Ошибка CUDA out of memory при первом запуске Stable Diffusion почти всегда означает, что видеокарте не хватает памяти для выбранного разрешения — снизьте размер изображения до 512×512 и добавьте параметр --medvram в файл запуска. Эта инструкция проведёт вас от установки до уверенной генерации: разберём требования к железу, настройку веб-интерфейса Automatic1111, принципы составления промптов и типичные проблемы новичков.
Stable Diffusion — это нейросеть для генерации изображений по текстовому описанию, которую можно запустить локально на собственном компьютере. В отличие от облачных сервисов, локальный запуск не требует подписки, не ограничивает количество генераций и даёт полный контроль над моделями и настройками. Платой за это служат требования к видеокарте и необходимость разобраться в параметрах.
Системные требования и подготовка
Главное требование — видеокарта с поддержкой CUDA. Лучше всего подходят карты NVIDIA с объёмом видеопамяти от 6 ГБ, хотя с оптимизациями возможна работа и на 4 ГБ. Карты AMD поддерживаются через альтернативные сборки, но настройка сложнее, а стабильность ниже.
Кроме видеокарты понадобится:
- 💾 Свободное место на диске — от 20 ГБ: сама программа, зависимости и хотя бы одна модель весом 2-7 ГБ
- 🐍 Python 3.10.x — именно эта ветка версий, с другими версиями возможны конфликты зависимостей
- 📦 Git — для загрузки и обновления репозитория веб-интерфейса
- 🧠 Оперативная память — желательно от 16 ГБ для комфортной работы
⚠️ Внимание: при установке Python обязательно отметьте галочку «Add Python to PATH» в первом окне установщика. Без этого скрипт запуска не найдёт интерпретатор, и вы получите ошибку ещё до начала загрузки компонентов.
Установка Automatic1111 WebUI
Самый популярный интерфейс для Stable Diffusion — Automatic1111 WebUI. Он бесплатен, активно обновляется и поддерживает расширения. Установка на Windows сводится к нескольким шагам.
Сначала клонируйте репозиторий в удобную папку, например на диск D. Откройте командную строку в нужной директории и выполните:
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
Затем скачайте файл модели (чекпоинт) в формате .safetensors — например, с площадки Civitai или Hugging Face — и поместите его в папку models/Stable-diffusion внутри каталога программы. После этого запустите файл webui-user.bat: при первом старте автоматически загрузятся все зависимости, это может занять заметное время.
☑️ Проверка перед первым запуском
Когда в консоли появится строка с локальным адресом, откройте в браузере http://127.0.0.1:7860 — перед вами интерфейс генерации.
Первая генерация: интерфейс и базовые настройки
Вкладка txt2img — основная рабочая область. В верхнее поле вводится промпт (описание желаемого изображения), в поле ниже — негативный промпт, то есть то, чего на картинке быть не должно. Кнопка Generate запускает процесс.
Разберём ключевые параметры, которые вы увидите под полями ввода:
| Параметр | Что делает | С чего начать |
|---|---|---|
| Sampling method | Алгоритм сэмплирования (метод «сборки» изображения из шума) | Euler a или DPM++ 2M Karras |
| Sampling steps | Количество шагов обработки | 20-30 |
| CFG Scale | Сила следования промпту | 7 |
| Width / Height | Разрешение результата | 512×512 для моделей SD 1.5 |
| Seed | Зерно генерации, определяет вариант картинки | -1 (случайное) |
Для первого теста введите простой промпт вроде a cat sitting on a windowsill, soft light и нажмите Generate. Если изображение появилось — установка прошла успешно, можно переходить к тонкой настройке.
Как писать промпты: практические правила
Промпт пишется на английском языке — модели обучены преимущественно на нём. Структура имеет значение: слова в начале описания влияют на результат сильнее, чем в конце. Поэтому сначала указывайте главный объект, затем детали, стиль и качество.
Рабочая формула для начинающих: субъект + действие/поза + окружение + освещение + стиль + качество. Например: portrait of an elderly fisherman, weathered face, seaside background, golden hour lighting, photorealistic, highly detailed.
- 🎯 Конкретика важнее объёма — «red vintage car» сработает лучше, чем просто «car»
- ⚖️ Веса через скобки — запись
(word:1.3)усиливает элемент, а(word:0.7)ослабляет - 🚫 Негативный промпт — добавьте
blurry, low quality, deformed hands, watermarkдля отсечения типичных дефектов - 🎨 Стилевые якоря — слова вроде oil painting, anime style, cinematic кардинально меняют результат
Что такое VAE и зачем его подключать
VAE (вариационный автоэнкодер) отвечает за финальное декодирование изображения. Некоторые модели без внешнего VAE выдают блёклые, сероватые цвета. Файл VAE скачивается отдельно и кладётся в папку models/VAE, после чего выбирается в настройках интерфейса (Settings → Stable Diffusion → SD VAE). Многие современные чекпоинты уже содержат встроенный VAE — тогда ничего дополнительно делать не нужно.
Решение типичных проблем и ошибок
Самая частая жалоба — упомянутая ошибка нехватки видеопамяти. Откройте файл webui-user.bat в текстовом редакторе и измените строку параметров:
set COMMANDLINE_ARGS=--medvram --xformers
Флаг --medvram снижает потребление памяти ценой скорости, а --xformers оптимизирует вычисления на картах NVIDIA. Если памяти критически мало, используйте --lowvram, но генерация замедлится в разы.
⚠️ Внимание: не добавляйте в параметры запуска флаги, назначения которых вы не понимаете, скопированные из чужих конфигураций. Некоторые аргументы несовместимы между собой или предназначены для конкретных версий PyTorch — это может привести к падениям, которые сложно диагностировать.
Другие распространённые ситуации: чёрный квадрат вместо картинки (обычно связано с генерацией на полупрецизионной точности — помогает флаг --no-half или --precision full), зависание на загрузке зависимостей (проверьте интернет-соединение и антивирус) и ошибки git при обновлении (удалите конфликтующие изменённые файлы или переустановите расширение).
Расширение возможностей: модели, LoRA и ControlNet
Базовая модель — только начало. Экосистема Stable Diffusion позволяет точно настраивать стиль и результат. LoRA — небольшие файлы-дополнения (обычно десятки-сотни мегабайт), которые добавляют модели новые стили, персонажей или объекты. Их кладут в папку models/Lora, а активируют прямо в промпте конструкцией вида <lora:название:0.8>.
ControlNet — расширение, которое позволяет задавать композицию по референсу: позу человека, контуры, глубину сцены. Устанавливается через вкладку Extensions веб-интерфейса и требует отдельных управляющих моделей. Это один из самых мощных инструментов, но и один из самых требовательных к видеопамяти.
⚠️ Внимание: скачивайте модели только в формате.safetensors, а не.ckpt. Формат ckpt основан на pickle и теоретически может содержать исполняемый код — safetensors лишён этого риска и является стандартом безопасности в сообществе.
FAQ: частые вопросы
Можно ли запустить Stable Diffusion без видеокарты NVIDIA?
Да, но с оговорками. Возможен запуск на процессоре с флагом --use-cpu all, однако генерация одного изображения займёт очень много времени. Для карт AMD существуют сборки на базе DirectML и ROCm, но их настройка сложнее. Альтернатива — облачные сервисы вроде Google Colab, где WebUI запускается на удалённом GPU.
Почему лицо на генерации выглядит искажённым?
При малых разрешениях лицо занимает слишком мало пикселей, и модель не успевает его проработать. Включите опцию Restore faces (использует отдельную модель восстановления лиц) или применяйте Hires. fix. Также помогает уточнение в промпте: detailed face, symmetrical face.
Как повторить понравившееся изображение?
Зафиксируйте значение Seed: скопируйте число из информации о генерации и вставьте в поле Seed вместо -1. При том же промпте, модели и настройках вы получите идентичный результат, а меняя отдельные слова — сможете точечно варьировать картинку.
Какая разница между моделями SD 1.5, SDXL и другими версиями?
Версии отличаются архитектурой, обучающими данными и родным разрешением. SD 1.5 работает с картинками 512×512 и требует меньше ресурсов. SDXL обучена на разрешении 1024×1024, даёт более качественную детализацию, но требовательнее к видеопамяти. Для каждой версии существуют свои LoRA и дополнения — они несовместимы между поколениями.
Легально ли использовать Stable Diffusion и сгенерированные картинки?
Сама модель распространяется с открытой лицензией, но условия использования конкретных чекпоинтов могут отличаться — проверяйте лицензию на странице модели. Правовой статус сгенерированных изображений зависит от юрисдикции и сценария использования; для коммерческих проектов стоит изучить условия конкретной модели и актуальное законодательство вашей страны.