Запуск Stable Diffusion упирается в одно первичное требование — видеокарту с достаточным объёмом видеопамяти: для комфортной работы с моделями семейства SD 1.5 желательно 6–8 ГБ VRAM, а для SDXL — от 8 ГБ и выше. Если видеокарта слабее, генерация либо не стартует, либо завершается ошибкой нехватки памяти CUDA out of memory. Поэтому первое действие перед установкой — проверить модель своего GPU через Диспетчер задач → Производительность → Графический процессор.
Stable Diffusion — это нейросеть с открытым кодом, которая генерирует изображения по текстовому описанию. В отличие от облачных сервисов, она работает локально на вашем компьютере: без подписки, без лимитов на количество картинок и без цензуры со стороны платформы. Расплачиваться придётся требованиями к железу и временем на первоначальную настройку.
Способы запуска: локально или в облаке
Существует три основных пути. Первый — локальная установка через веб-интерфейс AUTOMATIC1111, самый популярный вариант для Windows. Второй — ComfyUI, узловой интерфейс, который сложнее в освоении, но гибче и экономнее расходует видеопамять. Третий — облачные сервисы вроде Google Colab или аренды GPU, если своей видеокарты нет вовсе.
Для первого знакомства разумнее всего выбрать AUTOMATIC1111: у него понятный веб-интерфейс, огромная база инструкций и расширений. ComfyUI имеет смысл осваивать позже, когда появится понимание внутреннего устройства генерации.
- 🖥️ AUTOMATIC1111 — классический веб-интерфейс, лучший выбор для новичка
- 🧩 ComfyUI — узловая система для продвинутых рабочих процессов
- ☁️ Google Colab / облачный GPU — вариант без мощной видеокарты
- 📦 Fooocus — упрощённый интерфейс «в одну кнопку» для быстрых результатов
Установка AUTOMATIC1111 на Windows
Перед установкой убедитесь, что в системе есть Python 3.10 (именно ветка 3.10, другие версии часто вызывают конфликты зависимостей) и Git. Затем клонируйте репозиторий в папку без русских букв и пробелов в пути — это одна из самых частых причин сбоев при первом запуске.
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
cd stable-diffusion-webui
webui-user.bat
Первый запуск webui-user.bat займёт заметное время: скрипт сам скачает зависимости и создаст виртуальное окружение. Когда в консоли появится строка вида Running on local URL: http://127.0.0.1:7860, откройте этот адрес в браузере — перед вами интерфейс генерации.
☑️ Готовность системы к установке
⚠️ Внимание: скачивайте модели только в формате.safetensors, а не.ckptили.ptот неизвестных источников — старые форматы могут содержать исполняемый код. Проверяйте файлы антивирусом и используйте проверенные каталоги моделей.
Модели: где брать и куда класть
Сама по себе программа — только оболочка. Картинки рисует чекпоинт (модель) — файл весом от 2 до 7 ГБ. Популярный источник моделей — каталог Civitai, где публикуются тысячи вариантов: реалистичные, аниме, живописные, специализированные под портреты или архитектуру.
Скачанный файл помещается в папку stable-diffusion-webui/models/Stable-diffusion. После этого модель появится в выпадающем списке в левом верхнем углу интерфейса — иногда требуется нажать кнопку обновления рядом со списком.
| Тип файла | Назначение | Папка установки |
|---|---|---|
| Checkpoint (.safetensors) | Базовая модель генерации | models/Stable-diffusion |
| LoRA | Небольшие дополнения: стили, персонажи | models/Lora |
| VAE | Коррекция цветов и детализации | models/VAE |
| Embedding | Текстовые закладки для промптов | embeddings |
Первая генерация: промпт и базовые параметры
Перейдите на вкладку txt2img. В верхнее поле вводится промпт — описание желаемого изображения на английском языке, в нижнее — негативный промпт, то есть то, чего на картинке быть не должно. Нейросеть понимает английский заметно лучше русского, поэтому даже простые фразы стоит писать на английском.
Пример стартовой связки: промпт «portrait of a girl, cinematic lighting, detailed face, 85mm photo», негатив — «blurry, low quality, deformed hands, watermark». Порядок слов имеет значение: чем раньше слово в промпте, тем больший вес оно получает.
- 🎨 Sampling steps — число шагов генерации; для большинства моделей достаточно 20–30
- 📐 Width/Height — разрешение; для SD 1.5 держитесь около 512×512, для SDXL — около 1024×1024
- 🎛️ CFG Scale — насколько строго следовать промпту; типичный диапазон 5–9
- 🎲 Seed — зерно генерации; значение -1 даёт случайный результат каждый раз
Улучшение результата: Hires. fix, LoRA и ControlNet
Генерация в высоком разрешении напрямую часто даёт артефакты вроде двойных лиц. Функция Hires. fix решает это в два прохода: сначала создаётся картинка базового размера, затем она увеличивается с дорисовкой деталей. Включите чекбокс Hires. fix, выберите апскейлер (для фото подойдут варианты семейства 4x-UltraSharp, для иллюстраций — R-ESRGAN 4x+ Anime6B) и задайте коэффициент увеличения.
LoRA — компактные файлы-дополнения, которые добавляют модели новый стиль, персонажа или приём. Подключаются прямо в тексте промпта конструкцией <lora:имя_файла:0.8>, где число — сила влияния. ControlNet (ставится как расширение) позволяет задать позу, композицию или контур по референсу — это главный инструмент управляемой генерации, а не «лотереи».
Что такое inpainting и зачем он нужен
Inpainting (вкладка img2img) позволяет перерисовать только выделенную часть изображения — например, исправить кисть руки или заменить фон, не трогая остальное. Выделяете область кистью, пишете промпт для этой зоны и запускаете генерацию. Параметр Denoising strength определяет, насколько сильно изменится выделенная область.
Типичные ошибки и их решение
Самая частая проблема — CUDA out of memory. Она означает, что видеопамяти не хватило под текущие настройки. Решается снижением разрешения, отключением Hires. fix или добавлением параметров запуска --medvram или --lowvram в файл webui-user.bat в строку COMMANDLINE_ARGS.
Вторая группа проблем — чёрные картинки вместо результата. Частая причина — включённый фильтр NSFW или некорректный VAE. Проверьте настройки VAE в разделе Settings → Stable Diffusion и попробуйте сменить сэмплер. Третья типичная ситуация — «пластиковая» кожа и мыльная картинка: обычно это следствие слишком высокого CFG или промпта, перегруженного словами вроде masterpiece, best quality без конкретики.
⚠️ Внимание: не добавляйте вCOMMANDLINE_ARGSфлаги--xformersили--medvram«на всякий случай» — каждый из них меняет скорость и стабильность работы. Включайте параметр только если столкнулись с конкретной проблемой, которую он решает.
⚠️ Внимание: генерация изображений реальных людей без их согласия, а также создание дипфейков может нарушать законодательство вашей страны. Используйте нейросеть в рамках правил платформ, где планируете публиковать результат.
FAQ: частые вопросы
Работает ли Stable Diffusion на видеокартах AMD?
Да, но с оговорками. На Windows поддержка AMD исторически сложнее: используются сборки с DirectML или форки вроде Stable Diffusion WebUI с поддержкой ZLUDA, а на Linux — ROCm. Скорость и стабильность зависят от конкретной карты и драйверов, поэтому сверяйтесь с инструкциями под вашу модель GPU.
Можно ли генерировать без мощной видеокарты?
Можно через облачные сервисы: Google Colab, аренда GPU или готовые платформы. Локально на слабом железе возможна генерация на CPU, но она занимает минуты на одну картинку и подходит разве что для ознакомления.
Почему руки на изображениях получаются деформированными?
Кисти рук — слабое место диффузионных моделей из-за сложной анатомии и малой доли в обучающих данных. Помогают: явное описание положения рук в промпте, негативные промпты, специализированные LoRA и исправление через inpainting.
Чем SD 1.5 отличается от SDXL?
SDXL — более новое семейство с родным разрешением около 1024×1024, лучшим пониманием промптов и детализацией, но оно требовательнее к видеопамяти. SD 1.5 легче, быстрее и имеет огромную базу обученных моделей и LoRA.
Нужен ли интернет после установки?
Нет. После того как программа и модели скачаны, генерация полностью локальна. Интернет понадобится только для загрузки новых моделей, расширений и обновлений.