Stable Video Diffusion: установка и настройка на локальном компьютере

Установка Stable Video Diffusion чаще всего упирается не в саму модель, а в окружение: несовместимая версия Python, отсутствующий CUDA-Toolkit или недостаток видеопамяти приводят к ошибкам ещё до первой генерации. Модель от Stability AI распространяется в виде весов, которые запускаются через интерфейсы вроде ComfyUI или Stable Diffusion WebUI, поэтому корректная подготовка системы — половина успеха.

В этом руководстве разберём установку SVD на Windows через ComfyUI как наиболее стабильный и поддерживаемый способ, а также рассмотрим системные требования, загрузку весов и типичные проблемы. Инструкция построена так, чтобы каждый шаг можно было проверить до перехода к следующему.

Системные требования и подготовка

Перед установкой важно честно оценить железо. Stable Video Diffusion генерирует видео покадрово, и нагрузка на видеокарту заметно выше, чем при генерации статичных изображений в обычной Stable Diffusion. Критичный параметр — объём VRAM: с малым объёмом видеопамяти генерация либо не запустится, либо завершится ошибкой нехватки памяти.

  • 🎮 Видеокарта NVIDIA с поддержкой CUDA — для комфортной работы желательно от 8–12 ГБ VRAM; на меньшем объёме придётся снижать разрешение и количество кадров.
  • 🧠 Оперативная память — рекомендуется от 16 ГБ, при 8 ГБ возможны подвисания при загрузке модели.
  • 💾 Свободное место на диске — веса моделей SVD занимают несколько гигабайт, плюс место под Python-окружение и кэш.
  • 🐍 Python версии, совместимой с ComfyUI (обычно 3.10–3.12; точную версию проверяйте в репозитории проекта).
  • 🔧 Свежие драйверы NVIDIA — устаревший драйвер частая причина ошибок CUDA при запуске.
⚠️ Внимание: видеокарты AMD и встроенная графика поддерживаются ограниченно или через обходные пути (DirectML, ROCm на Linux). На Windows самый предсказуемый вариант — GPU NVIDIA. Не пытайтесь запускать SVD на CPU: генерация займёт неприемлемо много времени.

Установка ComfyUI — базовый интерфейс для SVD

Самый простой путь — использовать ComfyUI, который изначально проектировался с поддержкой видеомоделей. Есть два варианта установки: готовая портативная сборка и ручная установка из репозитория. Для большинства пользователей Windows подходит первый.

Скачайте портативную сборку ComfyUI с официального репозитория проекта на GitHub (раздел Releases). Архив распакуйте в папку без кириллицы и пробелов в пути, например C:\ComfyUI. Для запуска используются готовые скрипты: run_nvidia_gpu.bat — для карт NVIDIA. При первом запуске подтянутся зависимости, это может занять время.

Если предпочитаете ручную установку, последовательность выглядит так:

git clone https://github.com/comfyanonymous/ComfyUI.git

cd ComfyUI

python -m venv venv

venv\Scripts\activate

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

pip install -r requirements.txt

Обратите внимание: версия CUDA в команде установки PyTorch должна соответствовать вашему драйверу. Актуальный индекс и команды всегда сверяйте с официальной документацией PyTorch и ComfyUI — они периодически меняются.

☑️ Проверка перед первым запуском SVD

Выполнено: 0 / 5

Загрузка весов Stable Video Diffusion

Сами веса модели распространяются через Hugging Face в репозитории stabilityai. Доступны две основные версии: SVD (14 кадров) и SVD-XT (25 кадров). Файлы имеют формат .safetensors — это безопасный формат, предпочитайте его вариантам .ckpt из неофициальных источников.

Скачанный файл нужно поместить в папку ComfyUI\models\checkpoints. После перезапуска интерфейса модель станет доступна для загрузки в рабочем процессе. Если модель не появилась в списке — проверьте, что файл полностью докачался: оборванная загрузка даёт повреждённый файл, который вызовет ошибку при загрузке.

Настройка рабочего процесса и первая генерация

SVD работает по принципу image-to-video: вы подаёте статичное изображение, а модель «оживляет» его, генерируя последовательность кадров. В ComfyUI для этого нужен специальный workflow — готовые примеры рабочих процессов для SVD публикуются в документации ComfyUI и сообществом.

Базовая цепочка узлов выглядит так: загрузка чекпоинта SVD → загрузка исходного изображения → кодирование изображения → сэмплер с параметрами генерации → декодирование кадров → сохранение видео или набора кадров. Ключевые параметры, которые влияют на результат и нагрузку:

  • 🎞️ Количество кадров — больше кадров = длиннее видео, но выше расход VRAM.
  • 📐 Разрешение — стандартное для SVD около 1024×576; снижение разрешения помогает при нехватке памяти.
  • 🎚️ Motion bucket — параметр интенсивности движения в сцене.
  • ⚙️ Шаги сэмплирования — больше шагов обычно даёт чище результат, но дольше генерацию.
📊 На каком железе вы планируете запускать Stable Video Diffusion?
NVIDIA с 8 ГБ VRAM
NVIDIA с 12+ ГБ VRAM
Видеокарта AMD
Только CPU / слабое железо

Типичные ошибки и их решения

Большинство проблем при установке и запуске SVD сводятся к нескольким повторяющимся сценариям. Разберём их с точки зрения диагностики: сначала смотрим на текст ошибки в консоли, затем проверяем вероятную причину.

Ошибка / симптомВероятная причинаЧто проверить
CUDA out of memoryНе хватает видеопамятиСнизить разрешение и число кадров, закрыть другие программы, использующие GPU
ModuleNotFoundErrorНе установлены зависимостиПовторно выполнить pip install -r requirements.txt в активированном venv
Модель не видна в спискеФайл не в той папке или повреждёнПроверить путь models\checkpoints и целостность файла
Чёрные кадры на выходеКонфликт типов данных / устаревший xformersОбновить ComfyUI и зависимости до актуальных версий
Очень медленная генерацияМодель работает на CPUПроверить, что PyTorch установлен с поддержкой CUDA, а не CPU-сборка
⚠️ Внимание: если при установке PyTorch вы случайно поставили CPU-версию (без указания CUDA-индекса), генерация будет идти на процессоре — на CPU одно видео может рендериться часами. Проверить поддержку CUDA можно командой python -c "import torch; print(torch.cuda.is_available())" — ответ True означает, что GPU задействован.
Что делать, если VRAM всё равно не хватает

Попробуйте запуск ComfyUI с флагом экономии памяти, например --lowvram (доступные флаги перечислены в документации ComfyUI). Дополнительно уменьшите разрешение исходного изображения и количество генерируемых кадров. На картах с 6–8 ГБ VRAM реалистично работать с укороченными настройками, хотя и медленнее.

Альтернативные способы запуска SVD

ComfyUI — не единственный вариант. Модель можно запустить через Stable Diffusion WebUI с соответствующим расширением, а также напрямую из Python-скриптов с использованием библиотеки diffusers от Hugging Face. Последний способ удобен для интеграции в собственные проекты, но требует навыков программирования.

Для тех, кто не хочет возиться с локальной установкой, существуют облачные сервисы и API, где SVD доступна по подписке или поминутной оплате. Это разумный вариант, если видеокарта слабая: вы платите только за фактическую генерацию и не нагружаете свой компьютер. Однако локальный запуск даёт полный контроль над параметрами и не требует интернета после установки.

Обновление и обслуживание установки

Экосистема вокруг SVD развивается быстро: выходят новые версии ComfyUI, обновляются узлы и зависимости. Регулярное обновление интерфейса через git pull (для ручной установки) или скачивание свежей портативной сборки помогает избежать конфликтов совместимости с новыми workflow.

После обновления ComfyUI иногда требуется обновить и зависимости: pip install -r requirements.txt --upgrade. Если после апдейта что-то сломалось, портативная сборка позволяет просто хранить резервную копию рабочей папки и откатиться. Веса моделей при обновлениях не трогаются — они лежат отдельно в models.

Часто задаваемые вопросы

Можно ли установить Stable Video Diffusion без видеокарты NVIDIA?

Технически возможны варианты через DirectML для AMD или запуск на CPU, но производительность будет низкой, а настройка — сложнее. Для практической работы рекомендуется GPU NVIDIA с поддержкой CUDA. Альтернатива — облачные сервисы с готовой SVD.

Чем SVD отличается от SVD-XT и какую версию ставить?

SVD генерирует последовательности из 14 кадров, SVD-XT — из 25 кадров, что даёт более длинное видео. Для начала имеет смысл поставить SVD-XT: при нехватке VRAM количество кадров можно уменьшить в параметрах workflow.

Безопасно ли скачивать веса модели со сторонних сайтов?

Рискованно. Файлы формата .ckpt могут содержать произвольный код. Скачивайте веса только из официального репозитория stabilityai на Hugging Face и предпочитайте формат .safetensors, который не исполняет код при загрузке.

Почему ComfyUI запускается, но генерация падает с ошибкой памяти?

Интерфейс работает на минимальных ресурсах, а пиковое потребление VRAM происходит именно при сэмплировании. Снизьте разрешение, число кадров, закройте браузер и другие GPU-программы, либо используйте флаги экономии памяти при запуске.

Нужен ли интернет после установки Stable Video Diffusion?

Нет. После того как ComfyUI, зависимости и веса модели скачаны, генерация работает полностью локально и офлайн. Интернет понадобится только для обновлений и загрузки новых моделей.