Запуск DeepSeek локально начинается с выбора размера модели: версия DeepSeek-R1 с 7–8 млрд параметров работает на обычной видеокарте с 8 ГБ видеопамяти, а полноценная модель на 671 млрд параметров требует серверного оборудования и на домашнем ПК попросту не поместится. Именно несоответствие модели возможностям железа — самая частая причина ошибок при локальном запуске.
Локальный запуск даёт три вещи: приватность (запросы не уходят на внешние серверы), работу без интернета и отсутствие ограничений API. Взамен вы получаете более слабую версию модели — дистиллированные варианты DeepSeek-R1-Distill уступают облачному оригиналу в сложных рассуждениях, но для повседневных задач их обычно достаточно.
Какие версии DeepSeek можно запустить локально
Полная модель DeepSeek-R1 содержит сотни миллиардов параметров и предназначена для кластеров с несколькими серверными GPU. Для домашнего использования команда DeepSeek выпустила дистиллированные модели — компактные версии, обученные на ответах большой модели. Они построены на архитектурах Qwen и Llama и выпускаются в нескольких размерах.
Чем больше параметров, тем качественнее ответы и тем выше требования к памяти. Ориентировочная логика выбора такова:
- 🟢 1.5B — запускается даже на ноутбуке без дискретной видеокарты, подходит для простых задач и тестирования
- 🔵 7B–8B — оптимальный баланс для ПК с видеокартой на 8 ГБ
- 🟣 14B — нужна видеокарта с 12–16 ГБ видеопамяти или большой объём ОЗУ
- 🟠 32B — требует 24 ГБ видеопамяти или мощной рабочей станции
- 🔴 70B — вариант для энтузиастов с топовым железом или несколькими GPU
Точные требования зависят от квантования — сжатия весов модели. Формат Q4 уменьшает потребление памяти почти вдвое по сравнению с исходным при умеренной потере качества, поэтому именно квантованные версии используют чаще всего.
Требования к железу
Ключевой ресурс для локальной нейросети — память. Модель должна целиком поместиться либо в видеопамять (VRAM), либо в оперативную память (RAM). Работа с видеокарты быстрее в разы, поэтому наличие GPU с достаточным объёмом VRAM — главный фактор комфорта.
| Модель | Минимум VRAM (Q4) | Запуск на CPU |
|---|---|---|
| DeepSeek-R1-Distill 1.5B | ~2 ГБ | Комфортно, 8 ГБ RAM |
| DeepSeek-R1-Distill 7B/8B | ~6 ГБ | Возможно, 16 ГБ RAM |
| DeepSeek-R1-Distill 14B | ~10 ГБ | Медленно, 32 ГБ RAM |
| DeepSeek-R1-Distill 32B | ~20 ГБ | Очень медленно |
Процессор и накопитель тоже имеют значение. Файлы моделей занимают от пары до десятков гигабайт, поэтому нужен SSD с запасом свободного места. При работе только на CPU скорость генерации заметно падает: ответ формируется медленно, особенно на моделях от 14B.
⚠️ Внимание: если видеопамяти не хватает, часть модели выгружается в обычную ОЗУ, и скорость генерации падает в несколько раз. Проверяйте объём VRAM своей видеокарты до скачивания крупной модели.
Способ 1: запуск через Ollama
Ollama — самый простой инструмент для локального запуска моделей на Windows, macOS и Linux. Программа работает через командную строку и сама скачивает нужные файлы модели.
Порядок действий выглядит так. Сначала скачайте установщик с официального сайта Ollama и установите программу стандартным способом. Затем откройте терминал (в Windows — PowerShell или командную строку) и выполните команду загрузки модели:
ollama run deepseek-r1:7b
При первом запуске начнётся скачивание весов — это займёт время в зависимости от скорости интернета. После загрузки откроется интерактивный чат прямо в терминале: пишите вопрос и получайте ответ. Чтобы выйти из диалога, введите /bye.
☑️ Проверка перед запуском Ollama
Для других размеров модели меняется тег в команде, например ollama run deepseek-r1:14b или ollama run deepseek-r1:32b. Список уже скачанных моделей показывает команда ollama list, а удалить ненужную можно через ollama rm.
Способ 2: LM Studio с графическим интерфейсом
Если командная строка неудобна, используйте LM Studio — приложение с привычным окном чата. Программа бесплатна для персонального использования и доступна для Windows и macOS.
После установки откройте вкладку поиска моделей, введите в строке deepseek r1 и выберите подходящий вариант из списка — рядом с каждым указан размер файла и требования к памяти. Нажмите загрузку, дождитесь окончания скачивания и перейдите во вкладку чата. Модель загрузится в память, и можно начинать диалог.
Полезная настройка в LM Studio — GPU Offload: ползунок определяет, какая часть слоёв модели обрабатывается на видеокарте. Если VRAM не хватает для полной выгрузки, уменьшите значение — часть вычислений уйдёт на процессор, скорость снизится, но модель запустится.
Веб-интерфейс и интеграции
Для тех, кто хочет полноценный чат в браузере с историей диалогов, существует Open WebUI. Это веб-интерфейс, который подключается к запущенной Ollama и даёт интерфейс, похожий на ChatGPT: список чатов, настройки генерации, загрузка документов.
Установка обычно выполняется через Docker одной командой, но требует базового знакомства с контейнерами. Если Docker не настроен, проще остановиться на LM Studio — функционально для одиночного пользователя разница невелика.
Дополнительно локальную модель можно подключить к редактору кода. Ollama предоставляет локальный API на порту 11434, и многие инструменты для программистов умеют с ним работать — это позволяет использовать DeepSeek как помощника при написании кода без отправки исходников в облако.
Что такое API Ollama
Когда Ollama запущена, она поднимает локальный сервер на адресе http://localhost:11434. Любая программа может отправлять запросы к модели через этот адрес — так работают интеграции с редакторами кода, ботами и собственными скриптами.
Типичные проблемы и их решение
Самая частая жалоба — медленная генерация. Причина почти всегда одна: модель не поместилась в видеопамять и работает на CPU. Проверьте загрузку GPU во время генерации через диспетчер задач. Если видеокарта простаивает, выберите модель меньшего размера или более агрессивное квантование.
Вторая типичная ситуация — ошибка при загрузке модели или обрыв скачивания. Убедитесь, что на диске достаточно места: файлы весов крупных моделей занимают десятки гигабайт. При нестабильном интернете скачивание может прерываться — обычно помогает повторный запуск той же команды, загрузка продолжится с места обрыва.
⚠️ Внимание: скачивайте модели только через официальные инструменты (Ollama, LM Studio) или с официальной страницы DeepSeek на Hugging Face. Сторонние сайты с «готовыми сборками» могут распространять модифицированные файлы.
Если модель отвечает бессвязно или «галлюцинирует», это не поломка, а ограничение маленькой версии. Дистиллированные модели на 1.5B–7B заметно слабее облачного DeepSeek в сложных рассуждениях и многошаговых задачах. Для требовательных сценариев берите версию от 14B, если позволяет железо.
Ограничения локального запуска
Честно обозначим границы метода. Локальный DeepSeek — это не та модель, которая отвечает вам в облачном чате. Дистиллированные версии сохранили стиль рассуждений оригинала, но уступают ему в глубине анализа, знании редких фактов и работе с длинным контекстом.
Также локальная модель не имеет доступа к интернету и актуальным данным — её знания ограничены датой обучения. Для задач, где нужна свежая информация, потребуется либо облачная версия, либо подключение поиска через дополнительные инструменты.
Частые вопросы
Можно ли запустить DeepSeek локально без видеокарты?
Да, модели до 7–8B параметров работают на обычном процессоре с 16 ГБ оперативной памяти, но генерация будет медленной. Для комфортной работы лучше иметь видеокарту с 8 ГБ VRAM и более.
Какая версия DeepSeek-R1 лучше для домашнего ПК?
Для типичного компьютера с видеокартой на 8 ГБ оптимален вариант 7B/8B в квантовании Q4. Если памяти больше — попробуйте 14B, качество ответов заметно вырастет.
Отправляются ли мои запросы куда-то при локальном запуске?
Нет. При работе через Ollama или LM Studio все вычисления происходят на вашем компьютере. Интернет нужен только для первоначального скачивания файлов модели.
Почему локальная модель отвечает хуже, чем чат на сайте DeepSeek?
На сайте работает полная модель с сотнями миллиардов параметров, а локально запускаются компактные дистиллированные версии. Разница в качестве сложных рассуждений — ожидаемое следствие разницы в размере.
Сколько места на диске нужно для локального DeepSeek?
Зависит от размера модели: версия 7B в квантовании Q4 занимает порядка 4–5 ГБ, модель 32B — около 20 ГБ. Закладывайте запас на несколько моделей и временные файлы.