Как настроить и запустить DeepSeek локально
В этой статье поставим DeepSeek локально с помощью LM Studio и Ollama, настроим SSL и узнаем, зачем нужен RAG.
Системные требования
Перед запуском DeepSeek нужно определить, сколько вычислительных ресурсов нам потребуется. Основные факторы — объем оперативной памяти (RAM) и объем видеопамяти (VRAM). Их значения зависят от модели, которую мы хотим использовать. Обычно для домашнего использования устанавливают дистиллированные версии R1 или квантованные модели, так как для них требуется меньше ресурсов.
| Модель | RAM | VRAM | Диск |
| R1 1.5B | 8–16 ГБ | 2–4 ГБ | ~3 ГБ |
| R1 7B/8B | 16–32 ГБ | 6–8 ГБ | ~5–10 ГБ |
| R1 14B | 32 ГБ | 10–12+ ГБ | ~10–15 ГБ |
| R1 32B | 64 ГБ | 20–24 ГБ | ~20–25 ГБ |
| R1 70B | 64–128 ГБ | ~40 ГБ+ | ~45–50+ ГБ |
Как выбрать версию модели
Семейство DeepSeek включает несколько типов моделей-дистиллятов под разные сценарии использования.
Например, DeepSeek-R1 подходит для задач, требующих пошаговых рассуждений (Chain of Thought): решения математических задач, программирования, анализа данных и логического вывода. Именно ее чаще всего запускают локально.
Дистиллированные модели представляют собой уменьшенные версии R1, перенесенные на архитектуры Qwen и Llama. Они значительно компактнее, быстрее работают и требуют меньше ресурсов, сохраняя при этом большую часть возможностей исходной модели.
При выборе модели можно ориентироваться на следующие рекомендации:
| Версия | Для чего подойдет |
| 1.5B | слабые ноутбуки и мини-ПК, ознакомление с моделью |
| 7B | оптимальный вариант для большинства пользователей |
| 14B | хороший баланс между качеством и требованиями к оборудованию |
| 32B | для рабочих станций с мощной видеокартой |
| 70B | серверное развертывание и максимальное качество ответов |
Для большинства задач программирования и работы с текстом модель 7B обеспечивает самое выгодное соотношение качества, скорости и требований к оборудованию.
Как запустить DeepSeek локально
Запуск языковой модели на собственном компьютере позволяет работать с ней без подключения к облачным сервисам, обеспечивает конфиденциальность данных и дает возможность гибко настраивать параметры. Существует много инструментов для запуска моделей семейства DeepSeek. Мы рассмотрим LM Studio на Windows Server и Ollama на Ubuntu.
Как установить Deepseek на ВМ с Windows Server
Запуск DeepSeek на виртуальной машине позволяет не нагружать локальный компьютер и использовать более мощные ресурсы для работы модели. Кроме того, виртуальную машину проще настраивать, обновлять и при необходимости увеличивать ее мощности.
Для установки будем использовать LM Studio. Программа предоставляет графический интерфейс, автоматически загружает модели из репозитория Hugging Face и позволяет запускать их буквально в несколько кликов.
Для установки выберем ВМ на ОС Windows Server 2019, оптимизированную под GPU. Перейдите в панель управления → Продукты → Облачные серверы → Создать. В поле «Источник» выберите Windows Server. Выберем конфигурацию с GPU A500 с 24 ГБ VRAM – этого будет достаточно для использования модели DeepSeek-R1-0528-Qwen3-8B Q4_K_M.

После создания сервера переходим к установке DeepSeek. Для этого выполним ряд действий, описанных ниже.
Для начала подключимся к серверу по RDP с помощью инструкции.
Далее переходим на официальный сайт и загружаем программу.

Открываем установочный файл и запускаем инсталляцию.


После установки откроется приветственное окно, нажимаем Get started.

Находим нужную модель в поисковой строке в левом верхнем углу.


Открываем каталог моделей и загружаем необходимую, например, DeepSeek-R1-0528-Qwen3-8B Q4_K_M.

Нажимаем Use in New Chat.

Теперь все готово! Можно начать использовать нашу локальную модель.

LM Studio оптимально подходит, когда требуется максимально быстро начать работу без изучения особенностей того, как все развернуть.
Как установить Deepseek на ВМ с Ubuntu
Для создания сервера перейдите в панель управления → Продукты → Облачные серверы → Создать. В поле «Источник» выберите Ubuntu 24.04 LTS 64-bit GPU Driver 580, а в поле GPU – A500 с 24 ГБ VRAM. Также можно воспользоваться подробной инструкцией по созданию ВМ.
Для установки DeepSeek будем использовать Ollama. Это консольная утилита для локального запуска LLM. Она поддерживает Windows, Linux и macOS, автоматически управляет загрузкой моделей и предоставляет простой HTTP API.
Установка очень простая: достаточно зайти на официальный сайт и выполнить указанную команду или загрузить установочный файл. Команда для установки на Linux:
curl -fsSL https://ollama.com/install.sh | sh

После установки запуск модели выполняется одной командой:
ollama run deepseek-r1:7b

При первом запуске Ollama автоматически скачает необходимые веса модели и сохранит их в локальном кэше. Все последующие запуски будут происходить без повторной загрузки.

Для проверки установленных моделей используем команду:
ollama list

Запускаем собственный сервер API с помощью команды:
ollama serve
После этого модель становится доступной по адресу http://localhost:11434.

К ней могут подключаться различные приложения, включая IDE, веб-интерфейсы и собственные программы через OpenAI-совместимый API.
LM Studio будет наиболее удобным выбором для первого знакомства с DeepSeek благодаря простому графическому интерфейсу. Если же требуется интеграция модели в собственные приложения или автоматизация работы, можно использовать Ollama.
Подключение к локальному DeepSeek по API
Большинство современных средств запуска локальных LLM предоставляют HTTP API, совместимый с API OpenAI. Благодаря этому к локальной модели можно подключать собственные приложения, IDE, Telegram-ботов, системы автоматизации и другие сервисы без изменения клиентского кода.
В качестве адреса сервера Ollama использует http://localhost:11434, а LM Studio — http://localhost:1234/v1.
Например, запрос к локальному серверу Ollama с помощью curl можно выполнить следующим образом:
curl http://localhost:11434/api/chat \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-r1:7b",
"messages": [
{
"role": "user",
"content": "Топ-3 причины выбрать Selectel"
}
],
"stream": false
}'
Запрос при использовании LM Studio:
curl http://localhost:1234/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "DeepSeek-R1-Distill-Qwen-7B",
"messages": [
{
"role": "user",
"content": "Топ-3 причины выбрать Selectel"
}
]
}'
Для Python можно использовать официальный клиент OpenAI, указав адрес локального OpenAI-совместимого сервера:
from openai import OpenAI
client = OpenAI(
api_key="local",
base_url="http://localhost:1234/v1"
)
response = client.chat.completions.create(
model="DeepSeek-R1-Distill-Qwen-7B",
messages=[
{
"role": "user",
"content": "Топ-3 причины выбрать Selectel"
}
]
)
print(response.choices[0].message.content)
Все это позволяет быстро интегрировать локальную модель в существующие приложения без переписывания программной логики.
Доступ к модели через Open WebUI
Хотя с локальной моделью можно взаимодействовать через консоль или API, гораздо удобнее использовать полноценный веб-интерфейс. Одним из наиболее популярных решений является Open WebUI — открытая платформа для работы с локальными и облачными языковыми моделями.
Если Open WebUI и Ollama работают на одном компьютере, интерфейс автоматически обнаруживает локальный сервер и отображает все загруженные модели без дополнительной настройки. Самый простой способ запуска Open WebUI — использовать Docker.
Создадим отдельную Docker-сеть ollama-net, чтобы контейнеры могли общаться между собой.
docker network create ollama-net
Запустим Ollama в отдельном контейнере.
docker run -d \
--name ollama \
--network ollama-net \
--gpus all \
-v ollama:/root/.ollama \
ollama/ollama
Запустим Open WebUI и подключим его к той же Docker-сети.
docker run -d \
--name open-webui \
--network ollama-net \
-p 3000:8080 \
-e OLLAMA_BASE_URL=http://ollama:11434 \
-v open-webui:/app/backend/data \
ghcr.io/open-webui/open-webui:main
Что тут происходит:
--network ollama-netподключает контейнер к общей Docker-сети;-p 3000:8080делает веб-интерфейс доступным по адресуhttp://localhost:3000;OLLAMA_BASE_URL=http://ollama:11434указывает Open WebUI на контейнер Ollama. Имяollamaразрешается внутри Docker-сети во внутренний IP-адрес соответствующего контейнера;-v open-webui:/app/backend/dataсохраняет данные Open WebUI между перезапусками контейнера;--name open-webuiзадает имя контейнера Open WebUI.
После этого веб-интерфейс становится доступен по адресу http://localhost:3000.
При первом открытии потребуется создать учетную запись администратора. Для этого нужно указать имя, почту и пароль.

После регистрации мы попадем на главную страницу.

Для подключения Ollama нужно указать адрес http://ollama:11434.

Видим, что наша модель появилась в WebUI.

Теперь все готово и мы можем использовать нашу модель.

В настройках WebUI также можно подключить любой сервер с OpenAI-совместимым API.
Настройка SSL
При использовании DeepSeek только на локальном компьютере шифрование трафика обычно не требуется. Но при публикации сервиса в интернете рекомендуется использовать HTTPS, чтобы защитить передаваемые данные.
Самый распространенный вариант — разместить перед сервером Ollama или LM Studio обратный прокси (reverse proxy), который будет выполнять TLS-терминацию. В качестве такого прокси обычно используется Nginx. Типичная схема выглядит так:
Браузер → HTTPS (SSL) → Nginx/Caddy → Ollama или LM Studio → DeepSeek
Для этого:
1. Установим Nginx:
sudo apt install nginx
2. Создадим конфиг:
sudo nano /etc/nginx/sites-available/ollama
server {
listen 80;
server_name your-domain.com;
location / {
proxy_pass http://127.0.0.1:11434;
proxy_set_header Host $host;
proxy_set_header X-Real-IP $remote_addr;
proxy_read_timeout 600s;
proxy_send_timeout 600s;
proxy_buffering off;
}
}
3. Активируем созданную конфигурацию:
sudo ln -s /etc/nginx/sites-available/ollama /etc/nginx/sites-enabled/
sudo nginx -t
sudo systemctl reload nginx
4. Установим Certbot, плагин для Nginx и выпустим сертификат:
sudo apt install certbot python3-certbot-nginx
sudo certbot --nginx -d your-domain.com
Для большей безопасности в конфигурацию nginx можно добавить ограничение доступа по IP. Для этого в блог location / пропишем необходимые адреса:
allow 1.2.3.4;
allow 5.6.7.8;
deny all;
После выполненных шагов Ollama будет доступна по адресу: https://your-domain.com.
Зачем запускают RAG на собственных серверах
RAG (Retrieval-Augmented Generation) — это подход, при котором AI перед ответом ищет информацию в ваших документах, базе знаний или файлах и использует их для формирования ответа.
Использование собственного сервера для RAG имеет несколько важных преимуществ:
- не отправляет документы сторонним облачным сервисам;
- помогает соблюдать требования информационной безопасности;
- позволяет индексировать документы любого объема;
- обеспечивает высокую скорость поиска по внутренним данным.
Попробуем загрузить документ с текстовым описанием проекта и задать по нему вопрос:

Текст документа для тестирования:
Название проекта: «Север»
Проект «Север» был создан 12 февраля 2026 года.
Руководитель проекта — Алексей Смирнов.
Главный разработчик — Елена Кузнецова.
Системный администратор — Михаил Орлов.
Сервер проекта находится в Амстердаме.
Для хранения данных используется база данных PostgreSQL.
Порт базы данных — 5437.
Приложение работает на сервере с 32 ГБ оперативной памяти и процессором AMD EPYC 7313.
Для обработки изображений используется видеокарта NVIDIA A5000 с 24 ГБ видеопамяти.
Максимальный размер загружаемого файла составляет 250 МБ.
Резервное копирование базы данных выполняется каждый день в 03:30 по UTC.
Резервные копии хранятся в течение 30 дней.
В проекте используется три уровня доступа:
- Администратор — полный доступ ко всем функциям.
- Оператор — доступ к рабочим данным без возможности изменения настроек системы.
- Наблюдатель — доступ только для чтения.
Основной цвет интерфейса проекта — тёмно-синий.
Следующее обновление проекта запланировано на 20 апреля 2026 года.
После обновления максимальный размер файла будет увеличен с 250 МБ до 500 МБ.
В ответ получаем информацию из предложенного нами документа:

RAG активно применяется для создания корпоративных помощников, технической поддержки, интеллектуального поиска по документации, обработки нормативных документов, анализа контрактов и построения внутренних баз знаний.
Преимущества DeepSeek среди локальных LLM
За последние годы появилось большое количество открытых языковых моделей, среди которых Llama, Qwen, Gemma, Mistral и другие. DeepSeek занял особое место благодаря удачному сочетанию качества генерации, эффективности и открытости.
У запуска DeepSeek есть несколько ключевых преимуществ:
- Глубокая логика рассуждений. Разработчики спроектировали модели серии DeepSeek-R1 специально для задач, требующих пошагового логического вывода и анализа.
- Эффективная работа в локальной среде. Благодаря дистиллированным версиям размером 1.5B, 7B, 14B и 32B, DeepSeek можно запускать не только на мощных серверных GPU, но и на обычных виртуальных машинах.
- Совместимость с популярными инструментами. DeepSeek поддерживают практически все современные программы для запуска локальных LLM.
- Конфиденциальность данных. Все запросы, документы и результаты обработки остаются внутри инфраструктуры организации. Это помогает компаниям защитить коммерческую тайну и персональные данные без передачи информации на внешние серверы.
Чем может помочь Selectel
В Selectel доступны серверы различных конфигураций для запуска локальных LLM — от CPU-нод до мощных GPU-инстансов с видеокартами.
Конфигурацию ВМ можно менять на лету, что дает гибкость в управлении ресурсами: запускать тяжелые модели на GPU, а легкие задачи — на CPU, и не переплачивать за простаивающие мощности.
Для тестирования и экспериментов подойдут прерываемые ВМ — они стоят заметно дешевле и позволяют обкатать решение до того, как переходить на постоянную инфраструктуру.
Заключение
DeepSeek — это база открытых языковых моделей, пригодных для локального использования. Благодаря поддержке популярных инструментов развертывания, совместимости с OpenAI API и широкому выбору моделей различного размера его можно использовать как на персональном компьютере, так и в корпоративной инфраструктуре.
Для индивидуальной работы удобнее всего использовать LM Studio или Ollama. Если добавить WebUI и RAG с собственной базой знаний, локальный DeepSeek превращается в полноценного интеллектуального помощника, способного работать со внутренней документацией без передачи данных внешним сервисам.