Stable Diffusion от Stability AI — это нейросеть для генерации изображений по текстовому описанию, которую можно запустить локально на обычном домашнем ПК с видеокартой NVIDIA, не отправляя запросы в облако и не оплачивая подписку. В отличие от онлайн-сервисов вроде Midjourney, модель распространяется с открытыми весами, поэтому её можно скачать, доработать под свои задачи и использовать без ограничений по количеству генераций.
В этом руководстве разберём, какие версии Stable Diffusion существуют, какое железо потребуется, как установить модель через популярные интерфейсы и какие ошибки чаще всего возникают у новичков при первом запуске.
Что такое Stable Diffusion и кто её разработал
Stable Diffusion — генеративная модель, созданная компанией Stability AI в сотрудничестве с исследователями из CompVis и Runway. Первая публичная версия вышла в 2022 году, и именно открытость весов модели сделала её стандартом де-факто для локальной генерации изображений.
Модель работает по принципу диффузии: она постепенно «расчищает» случайный шум, превращая его в изображение, соответствующее текстовому запросу — промпту. Чем точнее сформулирован промпт и чем корректнее выставлены параметры генерации, тем предсказуемее результат.
За время существования проекта вышло несколько поколений модели, и выбор конкретной версии влияет на качество картинки, скорость работы и требования к видеокарте.
Версии Stable Diffusion: какую выбрать
Линейка моделей Stability AI включает несколько поколений, заметно различающихся по возможностям. Вот основные из них:
- 🖼️ SD 1.5 — классическая версия с огромной базой дообученных моделей (чекпоинтов) и LoRA-адаптеров; работает даже на слабых видеокартах.
- 🎨 SD 2.x — улучшенное понимание текста, но меньшая популярность в сообществе из-за изменений в обучающих данных.
- ⚡ SDXL 1.0 — значительно более детализированные изображения с нативным разрешением около 1024×1024, требует больше видеопамяти.
- 🚀 SD 3 / SD 3.5 — новое поколение с улучшенной архитектурой и лучшим следованием сложным промптам.
Для начинающих разумный выбор — SD 1.5 или SDXL: у первой минимальные требования и тысячи готовых чекпоинтов на сайтах вроде Civitai, у второй — заметно более высокое качество «из коробки». Точные системные требования зависят от конкретной версии и интерфейса, поэтому перед установкой сверьтесь с документацией выбранной модели.
| Версия | Разрешение | Требования к VRAM | Для кого |
|---|---|---|---|
| SD 1.5 | 512×512 | Низкие (от ~4 ГБ) | Новички, слабые ПК |
| SDXL 1.0 | 1024×1024 | Средние (от ~6–8 ГБ) | Качественные арты |
| SD 3.5 | До 1024×1024 и выше | Средние и выше | Сложные сцены, текст |
| LoRA/чекпоинты | Зависит от базы | Как у базовой модели | Стилизация, персонажи |
Системные требования и подготовка ПК
Главный компонент для локального запуска — видеокарта. Оптимальный вариант — GPU NVIDIA с поддержкой CUDA: чем больше видеопамяти (VRAM), тем крупнее изображения можно генерировать и тем быстрее идёт процесс. На картах AMD и встроенной графике запуск тоже возможен через альтернативные сборки, но настройка сложнее и скорость ниже.
Помимо GPU понадобятся:
- 💾 Свободное место на диске — одна модель весит от 2 до 7 ГБ, а с набором чекпоинтов и LoRA коллекция быстро разрастается до десятков гигабайт; желателен SSD.
- 🧠 Оперативная память — комфортный минимум составляет 16 ГБ, при меньшем объёме возможны подтормаживания.
- 🐍 Python и Git — большинство интерфейсов устанавливаются через них; актуальные версии указаны в документации конкретного веб-интерфейса.
- 🪟 64-битная Windows 10/11 или Linux — на macOS запуск возможен, но с ограничениями.
⚠️ Внимание: скачивайте веса моделей только с официальных репозиториев Stability AI на Hugging Face или с проверенных площадок вроде Civitai. Файлы чекпоинтов из неизвестных источников могут содержать вредоносный код — формат pickle, использовавшийся в ранних моделях, допускает выполнение произвольного кода при загрузке. Предпочитайте формат Safetensors, он лишён этой уязвимости.
Установка через AUTOMATIC1111 WebUI
Самый популярный интерфейс для работы со Stable Diffusion — AUTOMATIC1111 WebUI. Он бесплатен, активно развивается сообществом и поддерживает расширения. Общий порядок установки на Windows выглядит так:
☑️ Установка AUTOMATIC1111 WebUI
Клонирование репозитория выполняется одной командой в терминале из папки, куда вы хотите поставить программу:
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
Первый запуск занимает заметное время: скрипт сам скачивает PyTorch и остальные зависимости. Не закрывайте окно консоли, пока не появится строка с локальным адресом http://127.0.0.1:7860 — именно по нему открывается веб-интерфейс в браузере.
Если у видеокарты мало видеопамяти, добавьте в файл webui-user.bat аргументы запуска, например --medvram или --lowvram, а также --xformers для ускорения генерации. Подробный список флагов есть в вики проекта на GitHub.
Альтернативные интерфейсы: ComfyUI и Fooocus
AUTOMATIC1111 — не единственный вариант. В зависимости от задач стоит присмотреться к альтернативам:
ComfyUI — нодовый интерфейс, где процесс генерации собирается из блоков, как конструктор. Он сложнее для входа, но даёт полный контроль над пайплайном и экономнее расходует видеопамять. Именно на нём энтузиасты строят сложные схемы с ControlNet, апскейлом и пакетной обработкой.
Fooocus — противоположный подход: минимум настроек, всё работает «из коробки». Программа сама подбирает параметры и подходит тем, кто хочет просто вводить промпт и получать качественную картинку без погружения в технические детали.
Что такое LoRA и зачем она нужна
LoRA — небольшие файлы-дополнения (обычно 10–500 МБ), которые «подключаются» к базовой модели и меняют стиль генерации: добавляют конкретного персонажа, художественную манеру или тип одежды. Они не заменяют чекпоинт, а работают поверх него. В WebUI LoRA подключается прямо в тексте промпта через конструкцию вида
Основы написания промптов
Качество результата в Stable Diffusion наполовину зависит от промпта. Модель понимает английский язык, поэтому запросы лучше писать на нём, даже если вы работаете в русскоязычном интерфейсе.
Структура удачного промпта обычно включает: объект съёмки, описание деталей, стиль, освещение и параметры качества. Например: portrait of a girl, freckles, soft sunlight, film photography, highly detailed. Слова в начале фразы имеют больший вес, чем в конце.
Не менее важен негативный промпт — поле, где перечисляется то, чего на картинке быть не должно: blurry, low quality, deformed hands, extra fingers. Многие чекпоинты с Civitai содержат в описании рекомендованные позитивные и негативные промпты — используйте их как отправную точку.
Ключевые параметры генерации в интерфейсе: Sampling steps (число шагов, обычно достаточно 20–30), CFG Scale (насколько строго модель следует промпту, типичный диапазон — 5–9) и Seed (зерно генерации; зафиксировав его, вы сможете воспроизвести понравившийся результат).
Типичные ошибки и их решение
При первом запуске пользователи чаще всего сталкиваются с несколькими характерными проблемами. Разберём их по порядку.
Ошибка CUDA out of memory означает, что видеокарте не хватило памяти. Решения: уменьшите разрешение изображения, включите флаг --medvram или --lowvram, сократите размер батча до единицы. Если ошибка возникает при загрузке SDXL на карте с малым объёмом VRAM, возможно, стоит вернуться на SD 1.5.
Чёрное изображение вместо результата — возможная причина в конфликте вычислений в половинной точности (fp16) на старых видеокартах. Попробуйте добавить аргументы --precision full --no-half, хотя это замедлит генерацию. Также чёрный квадрат иногда выдаёт срабатывание встроенного фильтра NSFW — проверьте консоль на наличие соответствующих сообщений.
WebUI не запускается после обновления. Часто помогает удаление папки venv в каталоге программы — при следующем старте зависимости переустановятся заново. Перед обновлением через git pull сохраните свои настройки и список установленных расширений.
⚠️ Внимание: не редактируйте системные файлы Python и не ставьте «оптимизирующие» сборки WebUI с сомнительных сайтов. Модифицированные установщики нередко содержат майнеры — используйте только официальные репозитории на GitHub и проверяйте цифровые подписи релизов, если они предоставлены.
Лицензия и правовые моменты
Модели Stability AI распространяются на условиях открытых лицензий, но их формулировки различаются между версиями. Ранние модели (SD 1.x, SDXL) выходили под лицензией CreativeML Open RAIL, которая разрешает коммерческое использование, но запрещает генерацию противоправного и вредоносного контента. У новых версий условия могут отличаться — перед коммерческим применением ознакомьтесь с текстом лицензии конкретной модели на странице её репозитория.
Отдельный нюанс — пользовательские чекпоинты с Civitai и подобных площадок. Их авторы могут выставлять собственные ограничения: запрет на коммерческое использование, на продажу сгенерированных изображений или на слияние модели с другими. Эти условия указаны на странице каждой модели, и их стоит проверять до использования в рабочих проектах.
Часто задаваемые вопросы
Можно ли запустить Stable Diffusion без видеокарты NVIDIA?
Да, но с оговорками. Существуют сборки для карт AMD (через DirectML или ROCm) и режим генерации на CPU, однако на процессоре одна картинка может генерироваться десятки минут. Практичный вариант без мощного GPU — облачные сервисы вроде Google Colab или аренда GPU.
Сколько места нужно на диске для Stable Diffusion?
Сам интерфейс с зависимостями занимает порядка 10–15 ГБ, каждая модель — от 2 до 7 ГБ. С учётом коллекции чекпоинтов, LoRA и сгенерированных изображений разумно зарезервировать не менее 50–100 ГБ свободного места, желательно на SSD.
Чем Stable Diffusion отличается от Midjourney и DALL-E?
Главное отличие — открытость: Stable Diffusion запускается локально, бесплатна в использовании и допускает дообучение под собственные задачи. Midjourney и DALL-E — закрытые облачные сервисы с подпиской, где вы не контролируете модель, но получаете стабильно высокое качество без настройки.
Безопасно ли скачивать чекпоинты со сторонних сайтов?
Только в формате Safetensors и с известных площадок вроде Hugging Face и Civitai. Файлы в старом формате .ckpt потенциально могут исполнять код при загрузке, поэтому источники с сомнительной репутацией лучше обходить стороной.
Можно ли использовать сгенерированные изображения в коммерческих целях?
Для базовых моделей Stability AI под лицензией Open RAIL коммерческое использование, как правило, разрешено, но условия зависят от версии модели и от лицензии конкретного чекпоинта или LoRA. Всегда проверяйте лицензионный текст на странице загрузки и при необходимости консультируйтесь с юристом.