Как запустить DeepSeek локально: установка, настройки и системные требования, чтобы развернуть модель LLM на своем компьютере

Как настроить и запустить DeepSeek локально

В этой статье поставим DeepSeek локально с помощью LM Studio и Ollama, настроим SSL и узнаем, зачем нужен RAG.

Системные требования

Перед запуском DeepSeek нужно определить, сколько вычислительных ресурсов нам потребуется. Основные факторы — объем оперативной памяти (RAM) и объем видеопамяти (VRAM). Их значения зависят от модели, которую мы хотим использовать. Обычно для домашнего использования устанавливают дистиллированные версии R1 или квантованные модели, так как для них требуется меньше ресурсов.

МодельRAMVRAMДиск
R1 1.5B8–16 ГБ2–4 ГБ~3 ГБ
R1 7B/8B16–32 ГБ6–8 ГБ~5–10 ГБ
R1 14B32 ГБ10–12+ ГБ~10–15 ГБ
R1 32B64 ГБ20–24 ГБ~20–25 ГБ
R1 70B64–128 ГБ~40 ГБ+~45–50+ ГБ

Как выбрать версию модели

Семейство DeepSeek включает несколько типов моделей-дистиллятов под разные сценарии использования.

Например, DeepSeek-R1 подходит для задач, требующих пошаговых рассуждений (Chain of Thought): решения математических задач, программирования, анализа данных и логического вывода. Именно ее чаще всего запускают локально.

Дистиллированные модели представляют собой уменьшенные версии R1, перенесенные на архитектуры Qwen и Llama. Они значительно компактнее, быстрее работают и требуют меньше ресурсов, сохраняя при этом большую часть возможностей исходной модели.

При выборе модели можно ориентироваться на следующие рекомендации:

ВерсияДля чего подойдет
1.5Bслабые ноутбуки и мини-ПК, ознакомление с моделью
7Bоптимальный вариант для большинства пользователей
14Bхороший баланс между качеством и требованиями к оборудованию
32Bдля рабочих станций с мощной видеокартой
70Bсерверное развертывание и максимальное качество ответов

Для большинства задач программирования и работы с текстом модель 7B обеспечивает самое выгодное соотношение качества, скорости и требований к оборудованию.

Как запустить DeepSeek локально

Запуск языковой модели на собственном компьютере позволяет работать с ней без подключения к облачным сервисам, обеспечивает конфиденциальность данных и дает возможность гибко настраивать параметры. Существует много инструментов для запуска моделей семейства DeepSeek. Мы рассмотрим LM Studio на  Windows Server и Ollama на Ubuntu.

Как установить Deepseek на ВМ с Windows Server 

Запуск DeepSeek на виртуальной машине позволяет не нагружать локальный компьютер и использовать более мощные ресурсы для работы модели. Кроме того, виртуальную машину проще настраивать, обновлять и при необходимости увеличивать ее мощности.

Для установки будем использовать LM Studio. Программа предоставляет графический интерфейс, автоматически загружает модели из репозитория Hugging Face и позволяет запускать их буквально в несколько кликов.

Для установки выберем ВМ на ОС Windows Server 2019, оптимизированную под GPU. Перейдите в панель управленияПродуктыОблачные серверыСоздать. В поле «Источник» выберите Windows Server. Выберем конфигурацию с GPU A500 с 24 ГБ VRAM – этого будет достаточно для использования модели DeepSeek-R1-0528-Qwen3-8B Q4_K_M.

Скриншот из панели управления, страница конфигурирования облачного сервера.

После создания сервера переходим к установке DeepSeek. Для этого выполним ряд действий, описанных ниже.

Для начала подключимся к серверу по RDP с помощью инструкции.

Далее переходим на официальный сайт и загружаем программу.

Главная страница сайта LM Studio для локального запуска ИИ-моделей.

Открываем установочный файл и запускаем инсталляцию.

Окно установки программы LM Studio на компьютер Windows.
Окно завершения установки программы LM Studio.

После установки откроется приветственное окно, нажимаем Get started.

Приветственный экран программы LM Studio с кнопкой начала работы.

Находим нужную модель в поисковой строке в левом верхнем углу.

Интерфейс программы LM Studio с наведением на кнопку поиска моделей.
Страница поиска и скачивания модели DeepSeek R1 в LM Studio.

Открываем каталог моделей и загружаем необходимую, например, DeepSeek-R1-0528-Qwen3-8B Q4_K_M.

Выбор версии и загрузка квантованной модели в LM Studio.

Нажимаем Use in New Chat.

Загруженная модель ИИ и кнопка запуска нового чата.

Теперь все готово! Можно начать использовать нашу локальную модель.

Чат с ИИ-моделью в интерфейсе программы LM Studio.

LM Studio оптимально подходит, когда требуется максимально быстро начать работу без изучения особенностей того, как все развернуть.

Как установить Deepseek на ВМ с Ubuntu

Для создания сервера перейдите в панель управленияПродуктыОблачные серверыСоздать. В поле «Источник» выберите Ubuntu 24.04 LTS 64-bit GPU Driver 580, а в поле GPU – A500 с 24 ГБ VRAM. Также можно воспользоваться подробной инструкцией по созданию ВМ. 

Для установки DeepSeek будем использовать Ollama. Это консольная утилита для локального запуска LLM. Она поддерживает Windows, Linux и macOS, автоматически управляет загрузкой моделей и предоставляет простой HTTP API. 

Установка очень простая: достаточно зайти на официальный сайт и выполнить указанную команду или загрузить установочный файл. Команда для установки на Linux:


      curl -fsSL https://ollama.com/install.sh | sh
Процесс успешной установки программы Ollama через командную строку Linux.

После установки запуск модели выполняется одной командой:


      ollama run deepseek-r1:7b
Загрузка и запуск модели DeepSeek-R1 в Ollama через терминал.

При первом запуске Ollama автоматически скачает необходимые веса модели и сохранит их в локальном кэше. Все последующие запуски будут происходить без повторной загрузки.

Вывод ответа модели DeepSeek-R1 в терминале Ollama.

Для проверки установленных моделей используем команду:


      ollama list
Список загруженных моделей в Ollama через командную строку.

Запускаем собственный сервер API с помощью команды:


      ollama serve

После этого модель становится доступной по адресу http://localhost:11434.

Проверка версии Ollama через curl-запрос к API в терминале.

К ней могут подключаться различные приложения, включая IDE, веб-интерфейсы и собственные программы через OpenAI-совместимый API.

LM Studio будет наиболее удобным выбором для первого знакомства с DeepSeek благодаря простому графическому интерфейсу. Если же требуется интеграция модели в собственные приложения или автоматизация работы, можно использовать Ollama.

Подключение к локальному DeepSeek по API

Большинство современных средств запуска локальных LLM предоставляют HTTP API, совместимый с API OpenAI. Благодаря этому к локальной модели можно подключать собственные приложения, IDE, Telegram-ботов, системы автоматизации и другие сервисы без изменения клиентского кода.

В качестве адреса сервера Ollama использует http://localhost:11434, а LM Studio — http://localhost:1234/v1.

Например, запрос к локальному серверу Ollama с помощью curl можно выполнить следующим образом:


      curl http://localhost:11434/api/chat \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-r1:7b",
    "messages": [
      {
        "role": "user",
        "content": "Топ-3 причины выбрать Selectel"
      }
    ],
    "stream": false
  }'

Запрос при использовании LM Studio:


      curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "DeepSeek-R1-Distill-Qwen-7B",
    "messages": [
      {
        "role": "user",
        "content": "Топ-3 причины выбрать Selectel"
      }
    ]
  }'

Для Python можно использовать официальный клиент OpenAI, указав адрес локального OpenAI-совместимого сервера:


      from openai import OpenAI
client = OpenAI(
    api_key="local",
    base_url="http://localhost:1234/v1"
)
response = client.chat.completions.create(
    model="DeepSeek-R1-Distill-Qwen-7B",
    messages=[
        {
            "role": "user",
            "content": "Топ-3 причины выбрать Selectel"
        }
    ]
)
print(response.choices[0].message.content)

Все это позволяет быстро интегрировать локальную модель в существующие приложения без переписывания программной логики. 

Доступ к модели через Open WebUI

Хотя с локальной моделью можно взаимодействовать через консоль или API, гораздо удобнее использовать полноценный веб-интерфейс. Одним из наиболее популярных решений является Open WebUI — открытая платформа для работы с локальными и облачными языковыми моделями.

Если Open WebUI и Ollama работают на одном компьютере, интерфейс автоматически обнаруживает локальный сервер и отображает все загруженные модели без дополнительной настройки. Самый простой способ запуска Open WebUI — использовать Docker.

Создадим отдельную Docker-сеть ollama-net, чтобы контейнеры могли общаться между собой.


      docker network create ollama-net

Запустим Ollama в отдельном контейнере.


      docker run -d \
  --name ollama \
  --network ollama-net \
  --gpus all \
  -v ollama:/root/.ollama \
  ollama/ollama

Запустим Open WebUI и подключим его к той же Docker-сети.


      docker run -d \
  --name open-webui \
  --network ollama-net \
  -p 3000:8080 \
  -e OLLAMA_BASE_URL=http://ollama:11434 \
  -v open-webui:/app/backend/data \
  ghcr.io/open-webui/open-webui:main

Что тут происходит:

  • --network ollama-net подключает контейнер к общей Docker-сети;
  • -p 3000:8080 делает веб-интерфейс доступным по адресу http://localhost:3000;
  • OLLAMA_BASE_URL=http://ollama:11434 указывает Open WebUI на контейнер Ollama. Имя ollama разрешается внутри Docker-сети во внутренний IP-адрес соответствующего контейнера;
  • -v open-webui:/app/backend/data сохраняет данные Open WebUI между перезапусками контейнера;
  • --name open-webui задает имя контейнера Open WebUI.

После этого веб-интерфейс становится доступен по адресу http://localhost:3000.

При первом открытии потребуется создать учетную запись администратора. Для этого нужно указать имя, почту и пароль.

Экран начальной регистрации и создания аккаунта администратора в Open WebUI.

После регистрации мы попадем на главную страницу.

Главный рабочий интерфейс веб-приложения Open WebUI.

Для подключения Ollama нужно указать адрес http://ollama:11434.

Экран настроек подключений API в интерфейсе Open WebUI.

Видим, что наша модель появилась в WebUI.

Отображение модели в WebUI.

Теперь все готово и мы можем использовать нашу модель.

Диалог с ИИ-моделью DeepSeek-R1 в веб-интерфейсе Open WebUI.

В настройках WebUI также можно подключить любой сервер с OpenAI-совместимым API.

Настройка SSL

При использовании DeepSeek только на локальном компьютере шифрование трафика обычно не требуется. Но при публикации сервиса в интернете рекомендуется использовать HTTPS, чтобы защитить передаваемые данные.

Самый распространенный вариант — разместить перед сервером Ollama или LM Studio обратный прокси (reverse proxy), который будет выполнять TLS-терминацию. В качестве такого прокси обычно используется Nginx. Типичная схема выглядит так:

Браузер → HTTPS (SSL) → Nginx/Caddy → Ollama или LM Studio → DeepSeek

Для этого:

1. Установим Nginx:


      sudo apt install nginx

2. Создадим конфиг:


      sudo nano /etc/nginx/sites-available/ollama

server {
    listen 80;
    server_name your-domain.com;

    location / {
        proxy_pass http://127.0.0.1:11434;
        proxy_set_header Host $host;
        proxy_set_header X-Real-IP $remote_addr;
        proxy_read_timeout 600s;
        proxy_send_timeout 600s;
        proxy_buffering off;
    }
}

3. Активируем созданную конфигурацию:


      sudo ln -s /etc/nginx/sites-available/ollama /etc/nginx/sites-enabled/
sudo nginx -t
sudo systemctl reload nginx

4. Установим Certbot, плагин для Nginx и выпустим сертификат:


      sudo apt install certbot python3-certbot-nginx
sudo certbot --nginx -d your-domain.com

Для большей безопасности в конфигурацию nginx можно добавить ограничение доступа по IP. Для этого в блог location / пропишем необходимые адреса:


      allow 1.2.3.4;
allow 5.6.7.8;
deny all;

После выполненных шагов Ollama будет доступна по адресу: https://your-domain.com.

Зачем запускают RAG на собственных серверах

RAG (Retrieval-Augmented Generation) — это подход, при котором AI перед ответом ищет информацию в ваших документах, базе знаний или файлах и использует их для формирования ответа.

Использование собственного сервера для RAG имеет несколько важных преимуществ:

  • не отправляет документы сторонним облачным сервисам;
  • помогает соблюдать требования информационной безопасности;
  • позволяет индексировать документы любого объема;
  • обеспечивает высокую скорость поиска по внутренним данным.

Попробуем загрузить документ с текстовым описанием проекта и задать по нему вопрос:

Скриншот начала диалога с моделью: загружен документ, задан вопрос.

Текст документа для тестирования:

Название проекта: «Север»

Проект «Север» был создан 12 февраля 2026 года.

Руководитель проекта — Алексей Смирнов.
Главный разработчик — Елена Кузнецова.
Системный администратор — Михаил Орлов.

Сервер проекта находится в Амстердаме.

Для хранения данных используется база данных PostgreSQL.
Порт базы данных — 5437.

Приложение работает на сервере с 32 ГБ оперативной памяти и процессором AMD EPYC 7313.

Для обработки изображений используется видеокарта NVIDIA A5000 с 24 ГБ видеопамяти.

Максимальный размер загружаемого файла составляет 250 МБ.

Резервное копирование базы данных выполняется каждый день в 03:30 по UTC.

Резервные копии хранятся в течение 30 дней.

В проекте используется три уровня доступа:

  1. Администратор — полный доступ ко всем функциям.
  2. Оператор — доступ к рабочим данным без возможности изменения настроек системы.
  3. Наблюдатель — доступ только для чтения.

Основной цвет интерфейса проекта — тёмно-синий.

Следующее обновление проекта запланировано на 20 апреля 2026 года.

После обновления максимальный размер файла будет увеличен с 250 МБ до 500 МБ.

В ответ получаем информацию из предложенного нами документа:

Ответ модели в диалоге.

RAG активно применяется для создания корпоративных помощников, технической поддержки, интеллектуального поиска по документации, обработки нормативных документов, анализа контрактов и построения внутренних баз знаний.

Преимущества DeepSeek среди локальных LLM

За последние годы появилось большое количество открытых языковых моделей, среди которых Llama, Qwen, Gemma, Mistral и другие. DeepSeek занял особое место благодаря удачному сочетанию качества генерации, эффективности и открытости.

У запуска DeepSeek есть несколько ключевых преимуществ:

  • Глубокая логика рассуждений. Разработчики спроектировали модели серии DeepSeek-R1 специально для задач, требующих пошагового логического вывода и анализа.
  • Эффективная работа в локальной среде. Благодаря дистиллированным версиям размером 1.5B, 7B, 14B и 32B, DeepSeek можно запускать не только на мощных серверных GPU, но и на обычных виртуальных машинах.
  • Совместимость с популярными инструментами. DeepSeek поддерживают практически все современные программы для запуска локальных LLM.
  • Конфиденциальность данных. Все запросы, документы и результаты обработки остаются внутри инфраструктуры организации. Это помогает компаниям защитить коммерческую тайну и персональные данные без передачи информации на внешние серверы.

Чем может помочь Selectel

В Selectel доступны серверы различных конфигураций для запуска локальных LLM — от CPU-нод до мощных GPU-инстансов с видеокартами. 

Конфигурацию ВМ можно менять на лету, что дает гибкость в управлении ресурсами: запускать тяжелые модели на GPU, а легкие задачи — на CPU, и не переплачивать за простаивающие мощности.

Для тестирования и экспериментов подойдут прерываемые ВМ — они стоят заметно дешевле и позволяют обкатать решение до того, как переходить на постоянную инфраструктуру.

Заключение

DeepSeek — это база открытых языковых моделей, пригодных для локального использования. Благодаря поддержке популярных инструментов развертывания, совместимости с OpenAI API и широкому выбору моделей различного размера его можно использовать как на персональном компьютере, так и в корпоративной инфраструктуре.

Для индивидуальной работы удобнее всего использовать LM Studio или Ollama. Если добавить WebUI и RAG с собственной базой знаний, локальный DeepSeek превращается в полноценного интеллектуального помощника, способного работать со внутренней документацией без передачи данных внешним сервисам.