Установка Stable Video Diffusion чаще всего упирается не в саму модель, а в окружение: несовместимая версия Python, отсутствующий CUDA-Toolkit или недостаток видеопамяти приводят к ошибкам ещё до первой генерации. Модель от Stability AI распространяется в виде весов, которые запускаются через интерфейсы вроде ComfyUI или Stable Diffusion WebUI, поэтому корректная подготовка системы — половина успеха.
В этом руководстве разберём установку SVD на Windows через ComfyUI как наиболее стабильный и поддерживаемый способ, а также рассмотрим системные требования, загрузку весов и типичные проблемы. Инструкция построена так, чтобы каждый шаг можно было проверить до перехода к следующему.
Системные требования и подготовка
Перед установкой важно честно оценить железо. Stable Video Diffusion генерирует видео покадрово, и нагрузка на видеокарту заметно выше, чем при генерации статичных изображений в обычной Stable Diffusion. Критичный параметр — объём VRAM: с малым объёмом видеопамяти генерация либо не запустится, либо завершится ошибкой нехватки памяти.
- 🎮 Видеокарта NVIDIA с поддержкой CUDA — для комфортной работы желательно от 8–12 ГБ VRAM; на меньшем объёме придётся снижать разрешение и количество кадров.
- 🧠 Оперативная память — рекомендуется от 16 ГБ, при 8 ГБ возможны подвисания при загрузке модели.
- 💾 Свободное место на диске — веса моделей SVD занимают несколько гигабайт, плюс место под Python-окружение и кэш.
- 🐍 Python версии, совместимой с ComfyUI (обычно 3.10–3.12; точную версию проверяйте в репозитории проекта).
- 🔧 Свежие драйверы NVIDIA — устаревший драйвер частая причина ошибок CUDA при запуске.
⚠️ Внимание: видеокарты AMD и встроенная графика поддерживаются ограниченно или через обходные пути (DirectML, ROCm на Linux). На Windows самый предсказуемый вариант — GPU NVIDIA. Не пытайтесь запускать SVD на CPU: генерация займёт неприемлемо много времени.
Установка ComfyUI — базовый интерфейс для SVD
Самый простой путь — использовать ComfyUI, который изначально проектировался с поддержкой видеомоделей. Есть два варианта установки: готовая портативная сборка и ручная установка из репозитория. Для большинства пользователей Windows подходит первый.
Скачайте портативную сборку ComfyUI с официального репозитория проекта на GitHub (раздел Releases). Архив распакуйте в папку без кириллицы и пробелов в пути, например C:\ComfyUI. Для запуска используются готовые скрипты: run_nvidia_gpu.bat — для карт NVIDIA. При первом запуске подтянутся зависимости, это может занять время.
Если предпочитаете ручную установку, последовательность выглядит так:
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python -m venv venv
venv\Scripts\activate
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
pip install -r requirements.txt
Обратите внимание: версия CUDA в команде установки PyTorch должна соответствовать вашему драйверу. Актуальный индекс и команды всегда сверяйте с официальной документацией PyTorch и ComfyUI — они периодически меняются.
☑️ Проверка перед первым запуском SVD
Загрузка весов Stable Video Diffusion
Сами веса модели распространяются через Hugging Face в репозитории stabilityai. Доступны две основные версии: SVD (14 кадров) и SVD-XT (25 кадров). Файлы имеют формат .safetensors — это безопасный формат, предпочитайте его вариантам .ckpt из неофициальных источников.
Скачанный файл нужно поместить в папку ComfyUI\models\checkpoints. После перезапуска интерфейса модель станет доступна для загрузки в рабочем процессе. Если модель не появилась в списке — проверьте, что файл полностью докачался: оборванная загрузка даёт повреждённый файл, который вызовет ошибку при загрузке.
Настройка рабочего процесса и первая генерация
SVD работает по принципу image-to-video: вы подаёте статичное изображение, а модель «оживляет» его, генерируя последовательность кадров. В ComfyUI для этого нужен специальный workflow — готовые примеры рабочих процессов для SVD публикуются в документации ComfyUI и сообществом.
Базовая цепочка узлов выглядит так: загрузка чекпоинта SVD → загрузка исходного изображения → кодирование изображения → сэмплер с параметрами генерации → декодирование кадров → сохранение видео или набора кадров. Ключевые параметры, которые влияют на результат и нагрузку:
- 🎞️ Количество кадров — больше кадров = длиннее видео, но выше расход VRAM.
- 📐 Разрешение — стандартное для SVD около 1024×576; снижение разрешения помогает при нехватке памяти.
- 🎚️ Motion bucket — параметр интенсивности движения в сцене.
- ⚙️ Шаги сэмплирования — больше шагов обычно даёт чище результат, но дольше генерацию.
Типичные ошибки и их решения
Большинство проблем при установке и запуске SVD сводятся к нескольким повторяющимся сценариям. Разберём их с точки зрения диагностики: сначала смотрим на текст ошибки в консоли, затем проверяем вероятную причину.
| Ошибка / симптом | Вероятная причина | Что проверить |
|---|---|---|
| CUDA out of memory | Не хватает видеопамяти | Снизить разрешение и число кадров, закрыть другие программы, использующие GPU |
| ModuleNotFoundError | Не установлены зависимости | Повторно выполнить pip install -r requirements.txt в активированном venv |
| Модель не видна в списке | Файл не в той папке или повреждён | Проверить путь models\checkpoints и целостность файла |
| Чёрные кадры на выходе | Конфликт типов данных / устаревший xformers | Обновить ComfyUI и зависимости до актуальных версий |
| Очень медленная генерация | Модель работает на CPU | Проверить, что PyTorch установлен с поддержкой CUDA, а не CPU-сборка |
⚠️ Внимание: если при установке PyTorch вы случайно поставили CPU-версию (без указания CUDA-индекса), генерация будет идти на процессоре — на CPU одно видео может рендериться часами. Проверить поддержку CUDA можно командойpython -c "import torch; print(torch.cuda.is_available())"— ответTrueозначает, что GPU задействован.
Что делать, если VRAM всё равно не хватает
Попробуйте запуск ComfyUI с флагом экономии памяти, например --lowvram (доступные флаги перечислены в документации ComfyUI). Дополнительно уменьшите разрешение исходного изображения и количество генерируемых кадров. На картах с 6–8 ГБ VRAM реалистично работать с укороченными настройками, хотя и медленнее.
Альтернативные способы запуска SVD
ComfyUI — не единственный вариант. Модель можно запустить через Stable Diffusion WebUI с соответствующим расширением, а также напрямую из Python-скриптов с использованием библиотеки diffusers от Hugging Face. Последний способ удобен для интеграции в собственные проекты, но требует навыков программирования.
Для тех, кто не хочет возиться с локальной установкой, существуют облачные сервисы и API, где SVD доступна по подписке или поминутной оплате. Это разумный вариант, если видеокарта слабая: вы платите только за фактическую генерацию и не нагружаете свой компьютер. Однако локальный запуск даёт полный контроль над параметрами и не требует интернета после установки.
Обновление и обслуживание установки
Экосистема вокруг SVD развивается быстро: выходят новые версии ComfyUI, обновляются узлы и зависимости. Регулярное обновление интерфейса через git pull (для ручной установки) или скачивание свежей портативной сборки помогает избежать конфликтов совместимости с новыми workflow.
После обновления ComfyUI иногда требуется обновить и зависимости: pip install -r requirements.txt --upgrade. Если после апдейта что-то сломалось, портативная сборка позволяет просто хранить резервную копию рабочей папки и откатиться. Веса моделей при обновлениях не трогаются — они лежат отдельно в models.
Часто задаваемые вопросы
Можно ли установить Stable Video Diffusion без видеокарты NVIDIA?
Технически возможны варианты через DirectML для AMD или запуск на CPU, но производительность будет низкой, а настройка — сложнее. Для практической работы рекомендуется GPU NVIDIA с поддержкой CUDA. Альтернатива — облачные сервисы с готовой SVD.
Чем SVD отличается от SVD-XT и какую версию ставить?
SVD генерирует последовательности из 14 кадров, SVD-XT — из 25 кадров, что даёт более длинное видео. Для начала имеет смысл поставить SVD-XT: при нехватке VRAM количество кадров можно уменьшить в параметрах workflow.
Безопасно ли скачивать веса модели со сторонних сайтов?
Рискованно. Файлы формата .ckpt могут содержать произвольный код. Скачивайте веса только из официального репозитория stabilityai на Hugging Face и предпочитайте формат .safetensors, который не исполняет код при загрузке.
Почему ComfyUI запускается, но генерация падает с ошибкой памяти?
Интерфейс работает на минимальных ресурсах, а пиковое потребление VRAM происходит именно при сэмплировании. Снизьте разрешение, число кадров, закройте браузер и другие GPU-программы, либо используйте флаги экономии памяти при запуске.
Нужен ли интернет после установки Stable Video Diffusion?
Нет. После того как ComfyUI, зависимости и веса модели скачаны, генерация работает полностью локально и офлайн. Интернет понадобится только для обновлений и загрузки новых моделей.