Запуск DeepSeek локально начинается с выбора подходящей версии модели: полноразмерная DeepSeek-R1 с 671 миллиардом параметров требует серверного оборудования, а для обычного ПК предназначены компактные дистиллированные варианты DeepSeek-R1-Distill на базе Qwen и Llama размером от 1,5 до 70 миллиардов параметров. Если попытаться загрузить слишком тяжёлую модель на слабую машину, вы получите либо ошибку нехватки памяти, либо генерацию текста со скоростью одно слово в несколько секунд.
В этой инструкции разберём рабочие способы локального запуска DeepSeek через Ollama и LM Studio, поможем подобрать модель под ваше железо и покажем, как решить типичные проблемы: от медленной генерации до сбоев при загрузке весов. Все шаги проверяемы и не требуют специальных знаний в программировании.
Что нужно для локального запуска DeepSeek
Главный ограничивающий фактор — объём оперативной памяти или видеопамяти (VRAM). Модель загружается целиком, поэтому чем больше параметров, тем больше памяти потребуется. Квантованные версии (например, Q4) ужимают веса почти вдвое по сравнению с исходными, что позволяет запускать крупные модели на бытовом железе с небольшой потерей качества ответов.
Ориентировочные требования выглядят так: для модели на 1,5 млрд параметров хватит 8 ГБ ОЗУ даже без дискретной видеокарты. Вариант на 7–8 млрд комфортно работает при 16 ГБ ОЗУ или видеокарте с 8 ГБ VRAM. Модели на 14 млрд и выше желательно запускать с 32 ГБ оперативной памяти или GPU с 12+ ГБ видеопамяти. Точные цифры зависят от уровня квантования, поэтому перед скачиванием сверяйтесь с описанием конкретной сборки модели.
- 🖥️ Процессор: любой современный многоядерный CPU, частота влияет на скорость генерации
- 💾 ОЗУ: минимум 8 ГБ для младших моделей, 16–32 ГБ для средних
- 🎮 Видеокарта: не обязательна, но GPU с поддержкой CUDA заметно ускоряет работу
- 💿 Диск: от 2 до 40+ ГБ свободного места в зависимости от размера модели, желательно SSD
⚠️ Внимание: не путайте дистиллированные модели DeepSeek-R1-Distill с оригинальной R1. Дистилляты — это компактные модели, обученные на ответах большой R1; их качество ниже, но именно они предназначены для домашних ПК.
Способ 1: запуск через Ollama
Ollama — самый простой инструмент для локального запуска языковых моделей из командной строки. Скачайте установщик с официального сайта ollama.com, установите программу и убедитесь, что она запущена: в трее Windows появится значок, а служба будет работать в фоне.
Далее откройте терминал (PowerShell или командную строку) и выполните команду загрузки и запуска модели. Для старта подойдёт компактный вариант — например:
ollama run deepseek-r1:7b
При первом запуске Ollama скачает веса модели — это несколько гигабайт, поэтому потребуется время и стабильное интернет-соединение. После загрузки откроется интерактивный чат прямо в терминале: вводите вопрос и получайте ответ. Чтобы выйти из диалога, используйте команду /bye.
☑️ Запуск DeepSeek через Ollama
Доступные размеры можно посмотреть на странице модели в библиотеке Ollama — теги вида 1.5b, 7b, 14b указывают на число параметров. Если модель на 7B работает медленно, удалите её командой ollama rm deepseek-r1:7b и попробуйте вариант на 1,5 млрд.
Способ 2: запуск через LM Studio
Если командная строка неудобна, используйте LM Studio — приложение с графическим интерфейсом для Windows, macOS и Linux. После установки откройте вкладку поиска, введите DeepSeek R1 Distill и выберите подходящую сборку в формате GGUF. Программа сама подскажет совместимость модели с вашим железом, помечая варианты по степени пригодности.
После скачивания перейдите на вкладку чата, выберите загруженную модель в верхней панели и начните диалог. В настройках загрузки можно регулировать GPU offload — количество слоёв модели, переносимых на видеокарту. Чем больше слоёв на GPU, тем быстрее генерация, но тем больше нужно видеопамяти.
Дополнительный плюс LM Studio — встроенный локальный сервер, совместимый с API OpenAI. Его можно включить на отдельной вкладке, после чего обращаться к модели из своих скриптов и программ по адресу вида http://localhost:1234. Фактический порт указан в интерфейсе приложения.
Сравнение моделей DeepSeek для локального запуска
Выбор конкретной версии зависит от задач. Младшие модели справляются с простыми вопросами и переводом, средние — с рассуждениями, программированием и анализом текстов. Ниже — ориентировочное сравнение популярных дистиллированных версий; точные требования могут отличаться в зависимости от квантования и сборки.
| Модель | Параметры | Рекомендуемая память | Кому подходит |
|---|---|---|---|
| DeepSeek-R1-Distill-Qwen-1.5B | 1,5 млрд | 8 ГБ ОЗУ | Слабые ПК, тестирование |
| DeepSeek-R1-Distill-Qwen-7B | 7 млрд | 16 ГБ ОЗУ | Универсальные задачи |
| DeepSeek-R1-Distill-Llama-8B | 8 млрд | 16 ГБ ОЗУ | Альтернатива 7B на базе Llama |
| DeepSeek-R1-Distill-Qwen-14B | 14 млрд | 32 ГБ ОЗУ | Более глубокие рассуждения |
| DeepSeek-R1-Distill-Qwen-32B | 32 млрд | GPU с 24 ГБ VRAM | Продвинутые пользователи |
Обратите внимание: дистиллированные модели R1 генерируют цепочку рассуждений в тегах <think> перед финальным ответом — это нормальное поведение, а не сбой. Из-за этого ответы могут казаться длинными и медленными, особенно на слабом железе.
Типичные ошибки и их решение
Наиболее частая проблема — нехватка памяти при загрузке модели. В Ollama это проявляется как аварийное завершение или зависание, в LM Studio — как сообщение о невозможности выделить память. Решение одно: закройте тяжёлые приложения (браузер с десятками вкладок, игры) или перейдите на модель меньшего размера либо более агрессивное квантование.
Вторая типичная жалоба — очень медленная генерация. Проверьте, используется ли видеокарта: в LM Studio это видно в индикаторе загрузки GPU, в Ollama — через диспетчер задач в разделе производительности GPU. Если модель целиком работает на процессоре, скорость будет в разы ниже. Возможная причина — устаревшие драйверы видеокарты или недостаток VRAM, из-за чего слои не помещаются на GPU.
⚠️ Внимание: скачивайте модели только из официальных источников — библиотеки Ollama, встроенного поиска LM Studio или проверенных репозиториев Hugging Face. Сторонние сайты с «готовыми сборками» могут содержать вредоносный код.
- 🐌 Медленные ответы: уменьшите контекст, включите GPU offload или возьмите модель поменьше
- 💥 Ошибка загрузки: проверьте свободное место на диске и целостность скачанного файла
- 🔁 Бессвязные ответы: возможно, файл весов повреждён — удалите модель и скачайте заново
- 🔥 Перегрев ноутбука: ограничьте число потоков CPU в настройках и не запускайте генерацию от батареи
Использование локального DeepSeek через API
Локально запущенная модель может работать не только в чате, но и как backend для приложений. Ollama автоматически поднимает API на порту 11434 — к нему можно обращаться HTTP-запросами из Python, Node.js или любых программ, поддерживающих локальные LLM.
curl http://localhost:11434/api/generate -d "{\"model\": \"deepseek-r1:7b\", \"prompt\": \"Привет!\"}"
Такой подход позволяет подключить DeepSeek к редакторам кода, системам автоматизации и собственным скриптам без отправки данных на внешние серверы. Все запросы и документы остаются на вашей машине — это главное преимущество локального развёртывания перед облачным чатом.
Зачем вообще запускать DeepSeek локально
Основные причины — приватность данных, работа без интернета, отсутствие лимитов и платных подписок, а также возможность интеграции модели в собственные программы. Минус — качество компактных моделей ниже, чем у полной облачной версии.
FAQ: частые вопросы о локальном запуске DeepSeek
Можно ли запустить DeepSeek без видеокарты?
Да, модели до 7–8 млрд параметров работают на обычном процессоре, если хватает оперативной памяти. Скорость генерации будет ниже, чем на GPU, но для неспешной работы этого достаточно.
Сколько места занимает модель на диске?
Зависит от размера и квантования: младшие версии занимают около 1–2 ГБ, модель 7B в формате Q4 — порядка 4–5 ГБ, крупные варианты — десятки гигабайт. Точный объём указан на странице модели перед скачиванием.
Почему DeepSeek-R1 пишет длинные рассуждения перед ответом?
Это особенность reasoning-моделей: они сначала генерируют внутреннюю цепочку рассуждений (в тегах think), а затем итоговый ответ. Отключить это полностью нельзя, но можно ограничить длину генерации в настройках.
Чем локальный DeepSeek отличается от версии на сайте?
На сайте работает полная модель R1 с сотнями миллиардов параметров, а локально доступны только компактные дистиллированные версии. Они слабее в сложных задачах, зато работают офлайн и не передают данные третьим лицам.
Можно ли запустить DeepSeek на Mac?
Да, Ollama и LM Studio поддерживают macOS. На компьютерах с чипами Apple Silicon локальные модели работают особенно эффективно благодаря унифицированной памяти.