Полная версия DeepSeek R1 с 671 миллиардом параметров физически не помещается в память обычного домашнего компьютера — для её запуска требуется серверное оборудование с сотнями гигабайт видеопамяти. Поэтому локально запускают не оригинальную модель, а её дистиллированные версии — компактные модели на базе архитектур Qwen и Llama, обученные на результатах рассуждений R1.
Именно такие версии — от 1.5B до 70B параметров — доступны через Ollama, LM Studio и другие локальные рантаймы. Ниже разберём, какую версию выбрать под ваше железо, как установить модель и что делать, если генерация работает медленно или не запускается вовсе.
Что такое DeepSeek R1 и почему его запускают локально
DeepSeek R1 — reasoning-модель от китайской компании DeepSeek, которая перед ответом строит цепочку рассуждений (chain-of-thought). Это делает её сильной в математике, программировании и логических задачах. Модель распространяется с открытыми весами, что позволяет запускать её без подключения к облаку.
Локальный запуск даёт несколько практических преимуществ:
- 🔒 Приватность — запросы не уходят на сторонние серверы, данные остаются на вашем устройстве.
- 💸 Бесплатное использование — нет лимитов API и платы за токены.
- 📴 Работа офлайн — модель отвечает без интернета после первоначальной загрузки весов.
- 🛠️ Гибкая настройка — можно менять системные промпты, температуру и интегрировать модель в свои скрипты.
Обратная сторона — требования к железу и то, что дистиллированные версии слабее полной модели. Для сложных задач разница с оригинальным R1 заметна.
Какая версия DeepSeek R1 подойдёт под ваше железо
Ключевой параметр при выборе — объём VRAM видеокарты или оперативной памяти при запуске на CPU. Модели обычно используют в квантованном виде (например, Q4), что заметно снижает потребление памяти при умеренной потере качества.
| Модель | Ориентировочный размер (Q4) | Минимум памяти | Для каких задач |
|---|---|---|---|
| DeepSeek-R1-Distill-Qwen-1.5B | ~1–2 ГБ | 4–8 ГБ RAM | Простые вопросы, тесты |
| DeepSeek-R1-Distill-Qwen-7B | ~4–5 ГБ | 8 ГБ VRAM / 16 ГБ RAM | Код, тексты, повседневные задачи |
| DeepSeek-R1-Distill-Llama-8B | ~5 ГБ | 8 ГБ VRAM / 16 ГБ RAM | Аналогично 7B, другая архитектура |
| DeepSeek-R1-Distill-Qwen-14B | ~9 ГБ | 12–16 ГБ VRAM | Более сложные рассуждения |
| DeepSeek-R1-Distill-Qwen-32B | ~20 ГБ | 24 ГБ VRAM | Максимальное качество из доступных локально |
Цифры — ориентировочные: реальное потребление зависит от выбранного уровня квантования, длины контекста и рантайма. Точный размер конкретного файла модели смотрите на странице загрузки в Ollama или Hugging Face.
⚠️ Внимание: если памяти не хватает, рантайм начнёт выгружать слои модели в обычную RAM или на диск. Модель формально запустится, но скорость генерации упадёт до единиц токенов в секунду — работать с ней станет невозможно. Лучше сразу взять модель меньшего размера.
Установка DeepSeek R1 через Ollama
Самый простой способ запуска — Ollama, доступный для Windows, macOS и Linux. После установки приложения с официального сайта вся работа идёт через терминал.
Загрузка и первый запуск модели выполняются одной командой:
ollama run deepseek-r1:7b
При первом запуске Ollama скачает веса модели — это может занять время в зависимости от скорости соединения. После загрузки откроется интерактивный чат прямо в терминале. Для другой версии замените тег, например deepseek-r1:14b или deepseek-r1:32b — список доступных тегов есть в библиотеке Ollama.
☑️ Проверка перед первым запуском
Чтобы использовать модель из сторонних программ, Ollama поднимает локальный API на порту 11434. К нему можно обращаться из скриптов на Python или подключать графические интерфейсы вроде Open WebUI.
Запуск через LM Studio — вариант с графическим интерфейсом
Если терминал неудобен, используйте LM Studio — приложение с графическим интерфейсом для Windows, macOS и Linux. В нём модели ищутся и скачиваются прямо из встроенного каталога, подключённого к Hugging Face.
Порядок действий простой: откройте поиск моделей, введите DeepSeek R1 Distill, выберите версию и уровень квантования (Q4_K_M — разумный баланс качества и размера), дождитесь загрузки и перейдите во вкладку чата. В настройках можно указать, сколько слоёв модели выгружать на GPU — параметр часто называется GPU Offload.
Что стоит настроить сразу:
- 🎛️ GPU Offload — выставьте максимум, если модель целиком помещается в VRAM.
- 📏 Context Length — длинный контекст сильно расходует память; для слабого железа держите умеренные значения.
- 🌡️ Temperature — для reasoning-задач разработчики DeepSeek рекомендуют значения в районе 0.6.
⚠️ Внимание: скачивайте модели только из официальных источников — репозитория deepseek-ai на Hugging Face или библиотеки Ollama. Сторонние раздачи весов могут содержать повреждённые или модифицированные файлы.
Типичные проблемы при локальном запуске и их решения
Самая частая жалоба — медленная генерация. Почти всегда причина в том, что модель работает на CPU, а не на видеокарте. Проверьте в настройках рантайма, задействован ли GPU, и уменьшите размер модели или контекста, если VRAM не хватает.
Вторая типичная ситуация — модель «зависает» на этапе рассуждений. Это особенность R1: перед ответом модель генерирует длинный блок размышлений, который в интерфейсах обычно отображается отдельно или в тегах <think>. На слабом железе этот этап может занимать минуты — это нормально, а не ошибка.
Модель отвечает бессвязно или обрывает текст
Проверьте три вещи: не исчерпан ли контекст (очистите диалог), не слишком ли агрессивное квантование выбрано (попробуйте Q5 или Q6 вместо Q2/Q3) и не перегревается ли видеокарта под нагрузкой. Также убедитесь, что системный промпт не конфликтует с форматом reasoning-модели.
Если Ollama не видит видеокарту, обновите драйверы GPU и саму Ollama до актуальной версии. Для карт NVIDIA требуется поддержка CUDA; на системах без дискретной графики модель будет работать на процессоре — медленно, но стабильно.
Насколько дистиллированные версии хуже оригинала
Честный ответ: заметно слабее на сложных задачах. Дистилляция переносит стиль рассуждений большой модели в маленькую, но не её полную мощность. Модели 1.5B–8B хорошо справляются с типовыми задачами по коду и текстам, но уступают полной R1 в многошаговой логике и сложной математике.
Если нужно качество оригинального R1, а своего сервера нет, разумный компромисс — официальный API DeepSeek или веб-чат, а локальную модель использовать для приватных и офлайн-сценариев. Полная DeepSeek R1 на 671B параметров не запускается на потребительском железе ни в каком квантовании — любые инструкции, обещающие обратное на обычном ПК, вводят в заблуждение.
Частые вопросы о локальном запуске DeepSeek R1
Можно ли запустить DeepSeek R1 без видеокарты?
Да, дистиллированные версии работают на CPU через Ollama или LM Studio, но скорость генерации будет низкой. Для комфортной работы на процессоре выбирайте модели 1.5B–7B и закрывайте ресурсоёмкие приложения.
Чем отличаются версии Distill-Qwen и Distill-Llama?
Это дистилляции на базе разных открытых архитектур — Qwen и Llama соответственно. Практическая разница для пользователя невелика; обычно выбирают по размеру и тому, какая версия стабильнее работает в вашем рантайме.
Сколько места на диске нужно для модели?
Зависит от версии и квантования: от пары гигабайт для 1.5B до десятков гигабайт для 32B. Точный размер файла указан на странице модели в библиотеке Ollama или на Hugging Face — сверьтесь перед загрузкой.
Работает ли локальная модель без интернета?
Да, после первоначальной загрузки весов интернет не нужен. Модель целиком хранится на вашем диске и обрабатывает запросы локально.
Что делать, если модель долго «думает» перед ответом?
Это штатное поведение reasoning-модели: она генерирует цепочку рассуждений перед финальным ответом. Сократить ожидание можно, уменьшив размер модели, перенеся вычисления на GPU или ограничив длину генерации в настройках.