Stable Video Diffusion: как установить и запустить локально

Установка Stable Video Diffusion упирается не в сложность самой модели, а в подготовку окружения: без видеокарты NVIDIA с достаточным объёмом VRAM и корректно настроенного Python-окружения генерация видео просто не запустится. Модель от Stability AI распространяется как набор весов (файлы .safetensors), которые загружаются в интерфейс-оболочку — чаще всего ComfyUI, реже Automatic1111 с расширениями.

Ниже разберём полный цикл: проверка железа, установка ComfyUI, скачивание чекпоинтов SVD, настройка рабочего процесса и типовые ошибки, с которыми сталкиваются при первом запуске. Инструкция ориентирована на Windows, но логика шагов аналогична и для Linux.

Системные требования: что проверить до установки

Первое, что нужно сделать, — убедиться, что ваша видеокарта потянет Stable Video Diffusion. Модель требовательна к видеопамяти: для комфортной работы желательно 8–12 ГБ VRAM и более. На картах с 6 ГБ генерация возможна с ухищрениями (уменьшение разрешения, режимы экономии памяти), но стабильность не гарантируется.

  • 🎮 Видеокарта NVIDIA с поддержкой CUDA — откройте диспетчер задач, вкладка «Производительность», и посмотрите объём выделенной памяти GPU.
  • 💾 Свободное место на диске — веса моделей занимают порядка 10 ГБ и более, плюс сам ComfyUI и зависимости Python.
  • 🐍 Python версии 3.10–3.11, если ставите ComfyUI вручную, а не портативную сборку.
  • 🔧 Свежие драйверы NVIDIA — устаревший драйвер частая причина ошибок CUDA при запуске.

Если GPU от AMD или встроенная графика — локальный запуск SVD на Windows будет проблематичным. В этом случае разумнее рассмотреть облачные сервисы аренды GPU, где окружение уже подготовлено.

⚠️ Внимание: не скачивайте «установщики Stable Video Diffusion» со сторонних сайтов. Официальных exe-инсталляторов модели не существует — веса публикуются на Hugging Face, а интерфейс ComfyUI распространяется через репозиторий GitHub. Файлы с других ресурсов могут содержать вредоносный код.

Способ 1: установка портативной сборки ComfyUI

Самый простой путь для Windows — портативная версия ComfyUI, которая не требует ручной установки Python и зависимостей. Архив скачивается со страницы релизов официального репозитория ComfyUI на GitHub (файл вида ComfyUI_windows_portable_nvidia.7z).

После скачивания распакуйте архив через 7-Zip в папку без кириллицы и пробелов в пути — например, D:\ComfyUI. Внутри найдёте два скрипта запуска: run_nvidia_gpu.bat для работы на видеокарте и run_cpu.bat для режима CPU (очень медленный, годится только для проверки интерфейса).

Запустите run_nvidia_gpu.bat — откроется консоль, а интерфейс станет доступен в браузере по адресу http://127.0.0.1:8188. Если консоль сразу закрывается с ошибкой, запустите bat-файл из командной строки, чтобы прочитать текст ошибки.

☑️ Проверка перед первым запуском

Выполнено: 0 / 4

Способ 2: ручная установка через Python и Git

Этот вариант даёт больше контроля и удобен, если планируете регулярно обновлять ComfyUI. Понадобятся установленные Git и Python 3.10–3.11 (при установке Python отметьте галочку добавления в PATH).

Клонируйте репозиторий и установите зависимости:

git clone https://github.com/comfyanonymous/ComfyUI.git

cd ComfyUI

python -m venv venv

venv\Scripts\activate

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

pip install -r requirements.txt

Ключевой момент — установка PyTorch именно с поддержкой CUDA, а не CPU-сборки. Индекс cu121 в команде указывает версию CUDA; актуальную команду для вашей конфигурации стоит брать с официального сайта PyTorch, так как версии со временем меняются. После установки запуск выполняется командой python main.py.

Скачивание весов Stable Video Diffusion

Сам по себе ComfyUI — пустая оболочка. Для генерации видео нужны файлы модели SVD, которые публикуются на Hugging Face в репозитории stabilityai. Существуют две основные версии: SVD (генерация до 14 кадров) и SVD-XT (до 25 кадров). Файлы имеют расширение .safetensors и заметный размер — закладывайте время на загрузку.

Скачанный чекпоинт помещается в папку ComfyUI\models\checkpoints. Для некоторых рабочих процессов дополнительно требуются файлы VAE — их кладут в ComfyUI\models\vae. После добавления файлов перезапустите ComfyUI или нажмите кнопку обновления в интерфейсе, чтобы модели появились в списках узлов.

⚠️ Внимание: доступ к файлам на Hugging Face может требовать регистрации и принятия лицензионного соглашения на странице модели. Если скачивание не начинается — проверьте, авторизованы ли вы на сайте и подтверждены ли условия использования.
📊 Какая у вас видеокарта для запуска SVD?
NVIDIA с 12+ ГБ VRAM
NVIDIA с 8 ГБ VRAM
NVIDIA с 6 ГБ и меньше
AMD или встроенная графика

Настройка рабочего процесса и первая генерация

SVD работает по принципу image-to-video: вы загружаете исходное изображение, а модель «оживляет» его, генерируя короткий ролик. В ComfyUI это реализуется цепочкой узлов: загрузка картинки → Image Only Checkpoint LoaderSVD Image-to-Video Conditioning → сэмплер → декодирование кадров → сохранение видео.

Проще всего не собирать схему с нуля: на странице ComfyUI и в сообществе доступны готовые workflow-файлы в формате JSON. Перетащите такой файл прямо в окно браузера с открытым ComfyUI — вся цепочка узлов загрузится автоматически. Останется выбрать скачанную модель SVD в соответствующем узле и загрузить исходное изображение.

Ключевые параметры, влияющие на результат: количество кадров (video_frames), частота кадров fps и motion bucket id — последний отвечает за интенсивность движения в ролике. Начинайте со стандартных значений из готового workflow и меняйте по одному параметру за раз, чтобы понимать, что именно влияет на результат.

Типовые ошибки при установке и запуске

Чаще всего первый запуск сопровождается одной из предсказуемых проблем. Ниже — симптомы и направления решения.

Ошибка / симптомВероятная причинаЧто делать
CUDA out of memoryНе хватает VRAMСнизить разрешение и число кадров, закрыть другие программы, использующие GPU
torch.cuda.is_available() = FalseУстановлен CPU-вариант PyTorchПереустановить PyTorch с CUDA-индексом
Консоль закрывается сразуОшибка в скрипте запускаЗапустить bat из cmd и прочитать текст ошибки
Модель не видна в спискеФайл не в той папкеПроверить путь models\checkpoints и обновить интерфейс
Чёрный или битый результатНесовместимость VAE или параметровИспользовать готовый проверенный workflow

Отдельно стоит сказать про флаг --lowvram: если видеокарта на грани по памяти, запуск ComfyUI с этим параметром (python main.py --lowvram) снижает потребление VRAM ценой скорости. Это компромисс, но он позволяет работать на более слабом железе.

Генерация занимает очень много времени — это нормально?

Да. Даже на производительных картах создание короткого ролика из 14–25 кадров занимает от нескольких минут. На слабом железе или в режиме lowvram ожидание может растягиваться значительно дольше. Ускорить процесс можно уменьшением числа кадров, снижением разрешения и уменьшением количества шагов сэмплера, но каждое из этих действий влияет на качество.

Альтернативы локальной установке

Если железо не позволяет запустить SVD локально, есть обходные пути. Первый — облачные платформы с арендой GPU, где ComfyUI разворачивается на удалённой машине, а вы работаете через браузер. Второй — официальные и сторонние веб-сервисы на базе моделей Stability AI, где генерация выполняется на серверах компании.

Облачный вариант лишает приватности и требует оплаты за время работы GPU, но избавляет от всех описанных выше этапов настройки. Для разовых экспериментов это часто рациональнее, чем апгрейд видеокарты.

Часто задаваемые вопросы

Можно ли установить Stable Video Diffusion без видеокарты NVIDIA?

Технически ComfyUI запускается в CPU-режиме, но генерация видео на процессоре займёт неоправданно много времени. Практический минимум — NVIDIA с CUDA. Владельцам AMD стоит рассмотреть облачные решения или сборки с поддержкой ROCm на Linux, что требует дополнительной настройки.

Чем SVD отличается от SVD-XT?

SVD-XT — расширенная версия модели, генерирующая больше кадров за одну генерацию (до 25 против 14 у базовой). Это даёт более длинные и плавные ролики, но требует больше видеопамяти и времени на обработку.

Можно ли генерировать видео по текстовому описанию?

Напрямую — нет: SVD работает по схеме image-to-video. Обходной путь — сначала сгенерировать изображение по тексту в Stable Diffusion (в том же ComfyUI), а затем подать его на вход SVD.

Куда сохраняются готовые видео?

Результаты генерации по умолчанию попадают в папку ComfyUI\output. Формат выходного файла зависит от узла сохранения в вашем workflow — это может быть набор кадров, анимированный WebP или видеофайл.

Нужно ли обновлять ComfyUI после установки?

Да, проект активно развивается. В портативной сборке есть скрипты обновления в папке update, при ручной установке достаточно выполнить git pull в каталоге проекта. Обновляйте и зависимости при появлении ошибок совместимости.