Как запустить DeepSeek на ПК: полная инструкция по локальной установке

Локальный запуск DeepSeek на ПК сводится к установке одного из двух инструментов — Ollama или LM Studio — и загрузке весов модели с открытого репозитория, после чего нейросеть работает полностью офлайн, без отправки данных на внешние серверы. Весь процесс занимает от 15 минут до часа в зависимости от скорости интернета, поскольку основное время уходит на скачивание файла модели размером в несколько гигабайт.

Ниже разберём, какое железо потребуется, чем отличаются способы запуска, какую версию модели выбрать под вашу видеокарту и что делать, если генерация работает медленно или программа выдаёт ошибку. Инструкция ориентирована на Windows, но принципы применимы и к другим системам.

Что нужно знать перед установкой

DeepSeek — это семейство языковых моделей с открытыми весами, что и позволяет запускать их локально. Полные версии вроде DeepSeek-R1 с сотнями миллиардов параметров на обычном домашнем ПК не поместятся — для них нужна серверная инфраструктура. Поэтому на пользовательских машинах запускают дистиллированные (уменьшенные) версии, которые разработчики выпускают специально для локального использования.

Ключевой параметр при выборе — объём видеопамяти (VRAM) вашей видеокарты. Чем больше параметров у модели, тем больше памяти требуется для её загрузки. Если VRAM не хватает, часть вычислений уходит в оперативную память и на процессор, из-за чего скорость ответов заметно падает.

Дополнительно модели распространяются в квантованном виде — со сжатием весов. Формат Q4 считается разумным компромиссом между качеством ответов и требованиями к памяти, а более агрессивное сжатие может заметно ухудшать результат.

Системные требования

Точные требования зависят от конкретной версии модели, поэтому перед скачиванием сверяйтесь с описанием на странице модели в репозитории. Ориентировочная картина по популярным дистиллированным вариантам выглядит так:

Размер моделиМинимум VRAMОЗУ (если без GPU)Кому подходит
1.5B2–4 ГБ8 ГБСлабые ноутбуки, тест
7B–8B6–8 ГБ16 ГБОсновной вариант для большинства ПК
14B10–12 ГБ32 ГБИгровые видеокарты среднего уровня
32B20–24 ГБ64 ГБТоповые видеокарты

Значения в таблице — ориентировочные оценки для квантованных версий, а не официальные нормы. Реальное потребление памяти зависит от формата сжатия и длины контекста, поэтому всегда оставляйте запас.

  • 💾 Свободное место на диске — минимум вдвое больше размера файла модели
  • 🧠 Желательно SSD: загрузка модели с HDD ощутимо медленнее
  • 🎮 Видеокарта NVIDIA ускоряет работу сильнее всего, AMD и встроенная графика тоже поддерживаются, но с оговорками
  • 🌐 Интернет нужен только для скачивания — дальше всё работает офлайн

Способ 1: запуск через Ollama

Ollama — самый популярный инструмент для локального запуска языковых моделей через командную строку. Скачайте установщик с официального сайта проекта, установите как обычную программу и перезагрузите терминал.

Проверьте установку командой ollama --version. Если версия отображается — можно загружать модель. Для старта подойдёт базовый вариант:

ollama run deepseek-r1:7b

При первом запуске начнётся скачивание весов — это несколько гигабайт, время зависит от скорости соединения. После загрузки откроется диалоговый режим прямо в терминале: пишите вопрос, модель отвечает. Для выхода используйте /bye.

☑️ Запуск DeepSeek через Ollama

Выполнено: 0 / 5

Если хотите более компактную или, наоборот, более мощную версию, укажите её тег в команде, например deepseek-r1:1.5b или deepseek-r1:14b. Актуальный список доступных тегов смотрите на странице модели в библиотеке Ollama — набор версий со временем меняется.

📊 Каким способом вы планируете запускать DeepSeek?
Ollama через командную строку
LM Studio с графическим интерфейсом
Ещё не определился
Только облачная версия

Способ 2: запуск через LM Studio

Если командная строка неудобна, используйте LM Studio — программу с графическим интерфейсом, где модель выбирается и запускается мышкой. Установите приложение с официального сайта, откройте встроенный поиск моделей и введите deepseek.

В результатах появятся варианты в формате GGUF — это как раз квантованные файлы для локального запуска. Программа обычно подсвечивает, какие модели потянет ваше железо, ориентируйтесь на эту подсказку. Выберите файл с квантованием Q4, нажмите загрузку и дождитесь окончания скачивания.

После загрузки перейдите на вкладку чата, выберите скачанную модель в верхнем списке и начните диалог. LM Studio также умеет поднимать локальный сервер, совместимый с API OpenAI, — это полезно, если вы хотите подключить модель к сторонним программам.

Как выбрать версию модели под своё железо

Главный вопрос при выборе — баланс между качеством ответов и скоростью. Маленькие модели вроде 1.5B отвечают мгновенно даже на процессоре, но заметно уступают в рассуждениях. Версии 7B–8B — оптимальная точка входа для большинства пользователей: адекватные ответы при умеренных требованиях.

Модели 14B и крупнее имеет смысл брать только при наличии видеокарты с достаточным объёмом VRAM. Попытка запустить слишком большую модель на слабом железе не приведёт к ошибке — она просто будет генерировать по одному слову в несколько секунд, что делает работу бессмысленной.

  • 🚀 Начните с 7B — при нехватке скорости переходите на 1.5B, при избытке ресурсов — на 14B
  • 📦 Предпочитайте квантование Q4, избегайте слишком сильного сжатия
  • 🔍 Проверяйте описание конкретного файла на странице модели — там указаны требования
  • ⚖️ Длинный контекст (большие документы) требует дополнительной памяти сверх базовой

Типичные проблемы и их решение

Самая частая жалоба — медленная генерация. Проверьте, действительно ли задействуется видеокарта: в LM Studio это видно в настройках загрузки модели, а в Ollama можно оценить по загрузке GPU в диспетчере задач во время ответа. Если видеокарта простаивает, модель работает на процессоре — отсюда и низкая скорость.

⚠️ Внимание: если при загрузке модели система зависает или программа закрывается без ошибки, вероятная причина — нехватка оперативной памяти. Закройте браузер и тяжёлые приложения, а если не помогло — возьмите модель меньшего размера.

Ошибка скачивания в Ollama обычно решается повторным запуском той же команды — загрузка продолжится с места обрыва. Если LM Studio не видит вашу видеокарту, обновите драйверы GPU и проверьте, что в настройках выбран правильный режим ускорения.

⚠️ Внимание: скачивайте модели только из официальной библиотеки Ollama, встроенного поиска LM Studio или репозитория Hugging Face от проверенных авторов. Файлы весов с посторонних сайтов могут содержать вредоносный код.

Ещё один нюанс: дистиллированные модели DeepSeek-R1 выводят «рассуждения» перед ответом — это нормальное поведение, а не сбой. Блок размышлений можно игнорировать или сворачивать, если интерфейс это позволяет.

Чем локальный запуск отличается от веб-версии

Локальная модель не отправляет ваши запросы на внешние серверы и работает без интернета, но уступает облачной версии в качестве ответов, поскольку полная модель слишком велика для домашнего ПК. Облачный DeepSeek использует полную версию модели, поэтому для сложных задач он сильнее. Локальный вариант выбирают ради приватности, автономности и отсутствия ограничений по числу запросов.

Приватность и ограничения локального запуска

Главное преимущество локального запуска — приватность: ваши запросы и документы не покидают компьютер. Это важно при работе с конфиденциальными текстами, кодом внутренних проектов или личными данными. После скачивания модели интернет для работы нейросети вообще не нужен.

Обратная сторона — ограниченное качество. Дистиллированные версии заметно слабее полной облачной модели, особенно в сложных рассуждениях, математике и работе с длинными документами. Нет и доступа к актуальной информации из интернета: модель знает только то, что было в обучающих данных.

Поэтому разумная стратегия — комбинировать: рутинные и чувствительные задачи обрабатывать локально, а требующие максимального качества — через официальный веб-интерфейс или API.

Часто задаваемые вопросы

Можно ли запустить DeepSeek без видеокарты?

Да, модель может работать на процессоре, но скорость генерации будет низкой, особенно у версий крупнее 7B. Для комфортной работы на CPU выбирайте самые компактные варианты вроде 1.5B и убедитесь, что у вас достаточно оперативной памяти.

Сколько места занимает модель на диске?

Зависит от размера и квантования: компактные версии занимают около 1–2 ГБ, модели 7B–8B в формате Q4 — порядка 4–5 ГБ, а крупные варианты — десятки гигабайт. Точный размер указан на странице конкретной модели.

Работает ли локальный DeepSeek без интернета?

Да, после первоначального скачивания весов модель полностью автономна. Интернет потребуется снова только для загрузки других версий или обновления программы.

Что лучше для новичка — Ollama или LM Studio?

LM Studio проще для старта благодаря графическому интерфейсу и подсказкам по совместимости с железом. Ollama удобнее для автоматизации и интеграции с другими инструментами, но требует работы с командной строкой.

Почему модель пишет длинные рассуждения перед ответом?

Это особенность reasoning-моделей серии DeepSeek-R1: они сначала «размышляют» вслух, а затем дают итоговый ответ. Это нормальное поведение, повышающее качество ответов на сложные вопросы, а не ошибка.