Как запустить DeepSeek локально на компьютере

Запуск DeepSeek локально начинается с выбора подходящей версии модели: полноразмерная DeepSeek-R1 с 671 миллиардом параметров требует серверного оборудования, а для обычного ПК предназначены компактные дистиллированные варианты DeepSeek-R1-Distill на базе Qwen и Llama размером от 1,5 до 70 миллиардов параметров. Если попытаться загрузить слишком тяжёлую модель на слабую машину, вы получите либо ошибку нехватки памяти, либо генерацию текста со скоростью одно слово в несколько секунд.

В этой инструкции разберём рабочие способы локального запуска DeepSeek через Ollama и LM Studio, поможем подобрать модель под ваше железо и покажем, как решить типичные проблемы: от медленной генерации до сбоев при загрузке весов. Все шаги проверяемы и не требуют специальных знаний в программировании.

Что нужно для локального запуска DeepSeek

Главный ограничивающий фактор — объём оперативной памяти или видеопамяти (VRAM). Модель загружается целиком, поэтому чем больше параметров, тем больше памяти потребуется. Квантованные версии (например, Q4) ужимают веса почти вдвое по сравнению с исходными, что позволяет запускать крупные модели на бытовом железе с небольшой потерей качества ответов.

Ориентировочные требования выглядят так: для модели на 1,5 млрд параметров хватит 8 ГБ ОЗУ даже без дискретной видеокарты. Вариант на 7–8 млрд комфортно работает при 16 ГБ ОЗУ или видеокарте с 8 ГБ VRAM. Модели на 14 млрд и выше желательно запускать с 32 ГБ оперативной памяти или GPU с 12+ ГБ видеопамяти. Точные цифры зависят от уровня квантования, поэтому перед скачиванием сверяйтесь с описанием конкретной сборки модели.

  • 🖥️ Процессор: любой современный многоядерный CPU, частота влияет на скорость генерации
  • 💾 ОЗУ: минимум 8 ГБ для младших моделей, 16–32 ГБ для средних
  • 🎮 Видеокарта: не обязательна, но GPU с поддержкой CUDA заметно ускоряет работу
  • 💿 Диск: от 2 до 40+ ГБ свободного места в зависимости от размера модели, желательно SSD
⚠️ Внимание: не путайте дистиллированные модели DeepSeek-R1-Distill с оригинальной R1. Дистилляты — это компактные модели, обученные на ответах большой R1; их качество ниже, но именно они предназначены для домашних ПК.

Способ 1: запуск через Ollama

Ollama — самый простой инструмент для локального запуска языковых моделей из командной строки. Скачайте установщик с официального сайта ollama.com, установите программу и убедитесь, что она запущена: в трее Windows появится значок, а служба будет работать в фоне.

Далее откройте терминал (PowerShell или командную строку) и выполните команду загрузки и запуска модели. Для старта подойдёт компактный вариант — например:

ollama run deepseek-r1:7b

При первом запуске Ollama скачает веса модели — это несколько гигабайт, поэтому потребуется время и стабильное интернет-соединение. После загрузки откроется интерактивный чат прямо в терминале: вводите вопрос и получайте ответ. Чтобы выйти из диалога, используйте команду /bye.

☑️ Запуск DeepSeek через Ollama

Выполнено: 0 / 5

Доступные размеры можно посмотреть на странице модели в библиотеке Ollama — теги вида 1.5b, 7b, 14b указывают на число параметров. Если модель на 7B работает медленно, удалите её командой ollama rm deepseek-r1:7b и попробуйте вариант на 1,5 млрд.

Способ 2: запуск через LM Studio

Если командная строка неудобна, используйте LM Studio — приложение с графическим интерфейсом для Windows, macOS и Linux. После установки откройте вкладку поиска, введите DeepSeek R1 Distill и выберите подходящую сборку в формате GGUF. Программа сама подскажет совместимость модели с вашим железом, помечая варианты по степени пригодности.

После скачивания перейдите на вкладку чата, выберите загруженную модель в верхней панели и начните диалог. В настройках загрузки можно регулировать GPU offload — количество слоёв модели, переносимых на видеокарту. Чем больше слоёв на GPU, тем быстрее генерация, но тем больше нужно видеопамяти.

Дополнительный плюс LM Studio — встроенный локальный сервер, совместимый с API OpenAI. Его можно включить на отдельной вкладке, после чего обращаться к модели из своих скриптов и программ по адресу вида http://localhost:1234. Фактический порт указан в интерфейсе приложения.

📊 Какой способ запуска DeepSeek вам ближе?
Ollama (командная строка)
LM Studio (графический интерфейс)
Хочу поднять API-сервер
Пока только выбираю железо

Сравнение моделей DeepSeek для локального запуска

Выбор конкретной версии зависит от задач. Младшие модели справляются с простыми вопросами и переводом, средние — с рассуждениями, программированием и анализом текстов. Ниже — ориентировочное сравнение популярных дистиллированных версий; точные требования могут отличаться в зависимости от квантования и сборки.

МодельПараметрыРекомендуемая памятьКому подходит
DeepSeek-R1-Distill-Qwen-1.5B1,5 млрд8 ГБ ОЗУСлабые ПК, тестирование
DeepSeek-R1-Distill-Qwen-7B7 млрд16 ГБ ОЗУУниверсальные задачи
DeepSeek-R1-Distill-Llama-8B8 млрд16 ГБ ОЗУАльтернатива 7B на базе Llama
DeepSeek-R1-Distill-Qwen-14B14 млрд32 ГБ ОЗУБолее глубокие рассуждения
DeepSeek-R1-Distill-Qwen-32B32 млрдGPU с 24 ГБ VRAMПродвинутые пользователи

Обратите внимание: дистиллированные модели R1 генерируют цепочку рассуждений в тегах <think> перед финальным ответом — это нормальное поведение, а не сбой. Из-за этого ответы могут казаться длинными и медленными, особенно на слабом железе.

Типичные ошибки и их решение

Наиболее частая проблема — нехватка памяти при загрузке модели. В Ollama это проявляется как аварийное завершение или зависание, в LM Studio — как сообщение о невозможности выделить память. Решение одно: закройте тяжёлые приложения (браузер с десятками вкладок, игры) или перейдите на модель меньшего размера либо более агрессивное квантование.

Вторая типичная жалоба — очень медленная генерация. Проверьте, используется ли видеокарта: в LM Studio это видно в индикаторе загрузки GPU, в Ollama — через диспетчер задач в разделе производительности GPU. Если модель целиком работает на процессоре, скорость будет в разы ниже. Возможная причина — устаревшие драйверы видеокарты или недостаток VRAM, из-за чего слои не помещаются на GPU.

⚠️ Внимание: скачивайте модели только из официальных источников — библиотеки Ollama, встроенного поиска LM Studio или проверенных репозиториев Hugging Face. Сторонние сайты с «готовыми сборками» могут содержать вредоносный код.
  • 🐌 Медленные ответы: уменьшите контекст, включите GPU offload или возьмите модель поменьше
  • 💥 Ошибка загрузки: проверьте свободное место на диске и целостность скачанного файла
  • 🔁 Бессвязные ответы: возможно, файл весов повреждён — удалите модель и скачайте заново
  • 🔥 Перегрев ноутбука: ограничьте число потоков CPU в настройках и не запускайте генерацию от батареи

Использование локального DeepSeek через API

Локально запущенная модель может работать не только в чате, но и как backend для приложений. Ollama автоматически поднимает API на порту 11434 — к нему можно обращаться HTTP-запросами из Python, Node.js или любых программ, поддерживающих локальные LLM.

curl http://localhost:11434/api/generate -d "{\"model\": \"deepseek-r1:7b\", \"prompt\": \"Привет!\"}"

Такой подход позволяет подключить DeepSeek к редакторам кода, системам автоматизации и собственным скриптам без отправки данных на внешние серверы. Все запросы и документы остаются на вашей машине — это главное преимущество локального развёртывания перед облачным чатом.

Зачем вообще запускать DeepSeek локально

Основные причины — приватность данных, работа без интернета, отсутствие лимитов и платных подписок, а также возможность интеграции модели в собственные программы. Минус — качество компактных моделей ниже, чем у полной облачной версии.

FAQ: частые вопросы о локальном запуске DeepSeek

Можно ли запустить DeepSeek без видеокарты?

Да, модели до 7–8 млрд параметров работают на обычном процессоре, если хватает оперативной памяти. Скорость генерации будет ниже, чем на GPU, но для неспешной работы этого достаточно.

Сколько места занимает модель на диске?

Зависит от размера и квантования: младшие версии занимают около 1–2 ГБ, модель 7B в формате Q4 — порядка 4–5 ГБ, крупные варианты — десятки гигабайт. Точный объём указан на странице модели перед скачиванием.

Почему DeepSeek-R1 пишет длинные рассуждения перед ответом?

Это особенность reasoning-моделей: они сначала генерируют внутреннюю цепочку рассуждений (в тегах think), а затем итоговый ответ. Отключить это полностью нельзя, но можно ограничить длину генерации в настройках.

Чем локальный DeepSeek отличается от версии на сайте?

На сайте работает полная модель R1 с сотнями миллиардов параметров, а локально доступны только компактные дистиллированные версии. Они слабее в сложных задачах, зато работают офлайн и не передают данные третьим лицам.

Можно ли запустить DeepSeek на Mac?

Да, Ollama и LM Studio поддерживают macOS. На компьютерах с чипами Apple Silicon локальные модели работают особенно эффективно благодаря унифицированной памяти.