Локальный запуск DeepSeek чаще всего упирается в один и тот же симптом: модель скачана, но при генерации ответа система уходит в своп, а скорость падает до одного токена в несколько секунд. Причина почти всегда одна — выбранный вариант модели не помещается в доступную видеопамять или оперативную память. Поэтому развёртывание стоит начинать не с установки, а с трезвой оценки своего железа и выбора подходящей квантованной версии.
DeepSeek распространяется в виде открытых весов, которые можно запустить на обычном домашнем ПК без подключения к облаку. Это даёт приватность данных, отсутствие лимитов на запросы и независимость от доступности внешних сервисов. Взамен вы берёте на себя расходы на железо и время на первичную настройку.
В статье разберём два рабочих способа — через Ollama и через LM Studio, требования к конфигурации, типичные ошибки и способы ускорить работу модели.
Какие версии DeepSeek можно запустить локально
Полноразмерные модели семейства DeepSeek-V3 и DeepSeek-R1 содержат сотни миллиардов параметров и на потребительском железе не запускаются — им нужны серверные конфигурации с профессиональными ускорителями. Для домашнего использования предназначены дистиллированные версии — компактные модели, обученные на выводах большой сети.
Наиболее популярны дистилляты DeepSeek-R1-Distill на базе архитектур Qwen и Llama. Они выпускаются в нескольких размерах, и именно размер определяет, запустится ли модель на вашей машине.
- 🖥️ 1.5B–7B — работают даже на ноутбуке с 8–16 ГБ ОЗУ, подходят для простых задач и экспериментов.
- 💻 8B–14B — оптимальный баланс качества и требований, желательно 16–32 ГБ ОЗУ или видеокарта с 8–12 ГБ VRAM.
- 🚀 32B — заметно лучше рассуждает, но требует 24 ГБ видеопамяти или 32+ ГБ ОЗУ с терпимой скоростью.
- 🧠 70B — уже энтузиастский уровень: топовые видеокарты или 64+ ГБ оперативной памяти.
Дополнительно учитывайте квантование — сжатие весов модели. Форматы вроде Q4 снижают потребление памяти почти вдвое по сравнению с исходной точностью при умеренной потере качества. Для домашнего запуска это стандартный выбор.
Требования к железу: честная проверка перед установкой
Прежде чем что-то скачивать, проверьте три параметра: объём оперативной памяти, наличие и объём видеопамяти, свободное место на диске. Именно они определяют, какая модель запустится и насколько быстро.
| Модель | Минимум ОЗУ (CPU) | Рекомендуемая VRAM | Место на диске |
|---|---|---|---|
| R1-Distill 1.5B | 8 ГБ | не обязательна | ~2 ГБ |
| R1-Distill 7B | 16 ГБ | 6–8 ГБ | ~5 ГБ |
| R1-Distill 14B | 32 ГБ | 10–12 ГБ | ~9 ГБ |
| R1-Distill 32B | 64 ГБ | 20–24 ГБ | ~20 ГБ |
Объёмы указаны ориентировочно для квантованных сборок: точный размер зависит от конкретного файла и уровня сжатия. Смотрите фактический размер файла модели в репозитории перед загрузкой.
Если видеокарты нет или она слабая — модель всё равно запустится на процессоре, но генерация будет медленной. На CPU комфортно работать разве что с самыми маленькими дистиллятами. Диск желательно SSD: загрузка весов с HDD ощутимо растягивает старт каждой сессии.
⚠️ Внимание: если свободной памяти впритык, система начнёт использовать файл подкачки, и скорость ответов упадёт на порядок. Оставляйте запас минимум 3–4 ГБ ОЗУ поверх потребностей модели — иначе вместо нейросети вы получите слайд-шоу.
Способ 1: развёртывание через Ollama
Ollama — самый простой путь для тех, кто не боится командной строки. Утилита сама скачивает веса, подбирает квантование и управляет памятью. Установщики доступны для Windows, macOS и Linux с официального сайта проекта.
После установки откройте терминал (в Windows — PowerShell или командную строку) и выполните одну команду:
ollama run deepseek-r1:7b
При первом запуске Ollama скачает модель — это займёт время в зависимости от скорости соединения. После загрузки откроется интерактивный чат прямо в терминале. Чтобы выйти, введите /bye. Для другого размера модели подставьте соответствующий тег, например deepseek-r1:14b.
☑️ Проверка после установки Ollama
Для постоянной работы удобно запускать Ollama как фоновый сервис и обращаться к нему через API на локальном порту — так модель можно подключить к сторонним интерфейсам и собственным скриптам. Подробности по настройке API есть в официальной документации проекта.
Способ 2: LM Studio для тех, кто предпочитает интерфейс
LM Studio — десктопное приложение с графическим интерфейсом, которое берёт на себя поиск, загрузку и запуск моделей. Подходит, если командная строка отпугивает или хочется визуально управлять параметрами генерации.
Порядок действий простой. Скачайте приложение с официального сайта, установите и откройте вкладку поиска моделей. В строке поиска введите DeepSeek R1 Distill и выберите вариант под ваше железо — в списке видны размер файла и требования к памяти. После загрузки перейдите во вкладку чата, выберите модель и начинайте диалог.
- 🎛️ GPU Offload — ползунок, определяющий, сколько слоёв модели уйдёт на видеокарту; двигайте его, если модель не влезает целиком в VRAM.
- 📏 Context Length — длина контекста влияет на расход памяти; для слабых машин её стоит уменьшить.
- 🌡️ Temperature — для рассуждающих моделей вроде R1 умеренные значения обычно работают лучше экстремальных.
Типичные проблемы и их решение
Чаще всего пользователи сталкиваются с тремя сценариями. Первый — ошибка нехватки памяти при загрузке модели. Решение: возьмите меньший размер модели или более агрессивное квантование, закройте тяжёлые приложения, в Ollama проверьте список загруженных моделей командой ollama ps и выгрузите лишние.
Второй сценарий — модель работает, но мучительно медленно. Проверьте, используется ли видеокарта: если вся нагрузка легла на CPU, убедитесь, что установлены актуальные драйверы и что приложение видит ваш GPU. Частичная выгрузка слоёв на видеокарту часто ускоряет генерацию в разы.
Третий случай — модель «залипает» в длинных рассуждениях, что характерно для reasoning-моделей вроде R1. Это особенность архитектуры: она сначала генерирует цепочку мыслей, потом ответ. Уменьшите длину контекста или попробуйте недистиллированные инструктивные модели, если рассуждения не нужны.
⚠️ Внимание: скачивайте веса только из официальных репозиториев — Hugging Face-аккаунта DeepSeek или каталогов Ollama и LM Studio. Сторонние раздачи «оптимизированных» версий могут содержать модифицированные файлы, и проверить их безопасность невозможно.
Что такое дистилляция простыми словами
Большая модель (учитель) генерирует развёрнутые ответы с рассуждениями, а маленькая модель (ученик) обучается воспроизводить это поведение. В результате компактная сеть перенимает часть способностей гиганта, оставаясь достаточно лёгкой для домашнего ПК. Качество ниже оригинала, но для повседневных задач разница часто некритична.
Как ускорить работу локальной модели
Если базовая настройка завершена, а скорость не радует, есть несколько безопасных рычагов. Начните с квантования: переход с Q8 на Q4 почти незаметен в простых задачах, но заметно снижает требования к памяти и ускоряет отклик.
Далее — контекст. Длинная история диалога заставляет модель перечитывать весь текст при каждом новом сообщении, поэтому старые ветки разговоров лучше закрывать и начинать чистые сессии. В LM Studio и Ollama можно ограничить максимальную длину контекста вручную.
Наконец, следите за фоновой нагрузкой. Браузер с десятками вкладок, виртуальные машины и игры отбирают ту самую память, которой не хватает модели. Перед длинной рабочей сессией с нейросетью имеет смысл выгрузить лишнее.
Часто задаваемые вопросы
Можно ли запустить DeepSeek без видеокарты?
Да, модели работают на CPU через Ollama или LM Studio. Но комфортная скорость на процессоре достижима только с самыми маленькими дистиллятами — 1.5B и частично 7B. Более крупные варианты будут отвечать очень медленно.
Нужен ли интернет после установки?
Нет. Интернет требуется только для скачивания весов модели и самого приложения. После этого генерация происходит полностью локально, данные никуда не отправляются.
Чем локальная версия отличается от облачного DeepSeek?
Локально запускаются дистиллированные модели меньшего размера — они слабее полноценной облачной версии в сложных рассуждениях. Зато вы получаете приватность, отсутствие лимитов и работу офлайн.
Сколько места нужно на диске для нескольких моделей?
Каждая квантованная модель занимает примерно от 2 до 20 ГБ в зависимости от размера. Если планируете держать несколько вариантов, зарезервируйте 30–50 ГБ на SSD.
Можно ли использовать локальный DeepSeek в своих программах?
Да. Ollama поднимает локальный API, а LM Studio предлагает сервер, совместимый с API OpenAI. Это позволяет подключать модель к скриптам, редакторам кода и другим приложениям без изменения логики интеграции.