Локальные LLM на Mac mini: тестируем инференс и OpenClaw

Локальный инференс LLM на Mac mini с OpenClaw

Александр Ершов
Александр Ершов Системный администратор
22 июля 2026

Проверяем, может ли Mac mini заменить мощный ПК с несколькими видеокартами для запуска локальных LLM. Тестируем ИИ-агентов на унифицированной памяти.

Изображение записи

Введение

Локальный домашний инференс обычно ассоциируется с полноразмерным ПК с несколькими видеокартами (иногда объединенными SLI/NVLink) и мощным блоком питания. При этом основными ограничениями такого решения зачастую являются объем оперативной и видеопамяти, а также их пропускная способность.

На волне популярности LLM-моделей для локального инференса востребованными оказались Mac mini™. Тому есть несколько причин. За счет унифицированной памяти для загрузки модели доступен весь объем за исключением занятого системой. Пропускная способность этой памяти на порядок больше таковой в сравнении с DDR5. Также набор инструментов для локального инференса развился до состояния, пригодного для быстрого разворачивания.

С такими вводными Mac mini™ с памятью 24 или 48 ГБ — интересная альтернатива инференсу на десктопе. Совмещая локальную LLM-модель среднего размера и OpenClaw, пользователи организуют различные сценарии, используя персонального ИИ-агента. В этой статье попробуем запустить несколько моделей локально и проверим, оправдан ли хайп вокруг Mac mini™.

Насколько прожорлив OpenClaw

OpenClaw не является моделью. Это ИИ-агент или ИИ-ассистент, как его иногда позиционируют, работающий поверх LLM. Также у него есть интеграции с популярными сервисами: Discord, Google Chat, iMessage®, Matrix и другими. В документации OpenClaw называют self-hosted шлюзом для связи приложений и мессенджеров с возможностью подключения ИИ-агентов для программирования.

Минимальные системные требования и правда малы: одно ядро процессора,  512 МБ ОЗУ, 1 ГБ диска и сеть 1 Мбит/c. Такая инсталляция заявлена как персональный бот на бюджетном облачном сервере / Raspberry Pi® для тестов или разработки. 

Production- и heavy-сценарии более требовательны к ресурсам: 2/4+ ядра процессора, 8/16 ГБ ОЗУ, 20/50+ ГБ диска и сеть 10/25+ Мбит/с. В такой инсталляции связка OpenClaw + LLM может работать в рамках команды или компании, обеспечивать работу мультиагентных воркфлоу и пайплайнов автоматизации. Все перечисленные системные требования не учитывают локальное размещение модели.

Наш тестовый Mac mini™ оснащен процессором M4 Pro, 48 ГБ ОЗУ и 2 ТБ диска. «На бумаге» железо позволяет развернуть OpenClaw в самом требовательном к ресурсам сценарии. Из-за архитектуры Mac mini™ с унифицированной памятью (UMA) пул доступной оперативной памяти един для процессора и графики. Это накладывает ограничения на выбор модели: чем больше модель, тем меньше памяти останется для OpenClaw и системы.

Установка OpenClaw и настройка локального инференса

Для тестов нужно локально развернуть LLM-модель с OpenAI-совместимым API. Одно из готовых решений — LM Studio. Оно позволяет скачивать и локально запускать модели, а также обеспечивает эндпоинты с OpenAI-совместимым API. 

Кроме LM Studio существуют другие решения со схожим функционалом: llama.cpp, Ollama (на базе llama.cpp), vLLM и другие. LM Studio выигрывает для задачи «скачать модель и получить API» за счет GUI, встроенного каталога моделей и минимальной настройки. Аналоги «из коробки» требуют больше действий для такого же результата.

Установка LM Studio поддерживается в двух форматах: GUI и headless. Для тестовых целей подойдет GUI-вариант, который позволяет быстро настраивать параметры загрузки моделей и генерации и скачивать модели. Headless подойдет для развертывания на удаленной машине, например, на выделенном сервере, для использования разными клиентами. Сам процесс установки прост — скачать DMG-файл и установить.
Далее для локального запуска нужно загрузить модели и настроить доступ к ней по API.

Загрузить модель можно в меню Model Search. По умолчанию модели отсортированы в порядке Best Match, начиная с самых больших и подходящих для устройства. Для тестового Mac mini™ LM Studio оценивает доступный для модели объем памяти в 40 ГБ.

Скриншот окна десктопного приложения (LM Studio) на macOS. В левой панели отображается список ИИ-моделей, среди которых Nemotron 3 Nano Omni, Qwen3.6 и Gemma 4. В центре открыто выпадающее меню сортировки «Sort by» с выбранным пунктом «Best Match» и активным чекбоксом «Only include Staff Picks that can fit on this device» с ограничением емкости в 40.00 GB. В правой части окна открыта карточка модели nvidia/nemotron-3-nano-omni с кнопкой для скачивания файла размером 26.10 GB в формате GGUF.
Предложение моделей в LM Studio на момент написания статьи.

После скачивания весов модели и загрузки в память можно пингануть модель и получить ответ.

Скриншот окна приложения LM Studio на macOS, демонстрирующий открытый чат под названием «Ping-Pong Exchange». Справа вверху виден пузырек сообщения пользователя с текстом «Ping». Ниже отображается ответ локальной языковой модели qwen/qwen3.6-35b-a3b: скрытый блок «Thought for 6.91 seconds» и текст «Pong! I'm here and ready to help. What can I do for you?». Под ответом выведена техническая статистика генерации (52.17 tok/sec, 388 tokens) и панель инструментов. В нижней части окна находится поле ввода сообщения с активными кнопками «Think» и «Vision».
Модель работает, на пинг отвечает.

Для запуска локального сервера нужно переключиться в меню Developer и переключить статус. Тут же видны логи.

Скриншот интерфейса LM Studio на macOS, открытого на вкладке «Developer». В верхней части центральной панели отображается статус сервера «Running» с адресом http://127.0.0.1:1234. В блоке «Loaded Models» показана загруженная модель qwen/qwen3.6-35b-a3b размером 22.07 GB. Ниже перечислены поддерживаемые эндпоинты (LM Studio API, OpenAI-compatible, Anthropic-compatible), а в самом низу открыта панель «Developer Logs» с отладочными логами. В правой боковой панели выведена подробная информация о модели Qwen3.6 35B A3B, включая формат GGUF и квантование Q4_K_M.
Информация о локальном сервере в LM Studio. Тут можно смотреть логи, информацию о модели и изменять параметры загрузки, например, размер контекста.

После загрузки модели LM Studio оценивает объем занятой памяти в 21 ГБ.

Скриншот окна настроек LM Studio, открытого на вкладке Hardware в разделе System. В верхней панели отображаются характеристики процессора Apple M4 Pro (архитектура ARM64, объединенная память RAM — 48.00 GB, VRAM — 37.44 GB). В блоке GPUs показан один обнаруженный графический процессор Apple M4 Pro с поддержкой Metal, переключатель которого находится в положении ON. В мониторе ресурсов (Resource Monitor) указано использование памяти RAM + VRAM на уровне 21.29 GB, а нагрузка на CPU составляет 0.00%. В самом низу, в разделе Guardrails, выбран строгий режим ограничения загрузки моделей (Strict).
Сводка по железу тестового Mac mini™, там же есть настройка гардрейлов в части перегрузки ресурсов системы.

После настройки локальной модели перейдем к установке OpenClaw.

Обратите внимание, что для лаконичности инструкции используются команды, которые скачивают неизвестный скрипт и выполняют его с правами суперпользователя. Это небезопасно, так как скрипт может быть изменен и содержать вредоносный контент.

Такой подход допустим для краткосрочных проектов на чистом сервере, однако в продуктовой среде рекомендуется устанавливать ПО вручную из доверенных источников.


      curl -fsSL https://openclaw.ai/install.sh

Скрипт ставит необходимые пакеты и запускает мастер настройки. Проходим его с минимальными настройками. После завершения откроем дашборд и отправим запрос на проверку состояния системы — Check system health.

Скриншот окна браузера с открытым локальным адресом 127.0.0.1. Отображается веб-интерфейс инструмента OpenClaw (версия v2026.5.27) в режиме чата. В центре экрана выведен подробный текстовый отчет от ИИ-ассистента с заголовком Here's the system health snapshot. В отчете приведены данные аппаратного обеспечения (Apple M4 Pro, 48 GB RAM, macOS 26.5), таблица системных ресурсов (Disk, Load avg, RAM, Swap) и статус OpenClaw Gateway (все пункты отмечены зелеными галочками). В левой боковой панели находится меню навигации с разделами Control (Overview, Activity, Instances) и Agent (Agents, Skills).
Агент ответил, информацию о себе рассказал.

«Самодиагностика» в порядке, можно переходить к тестам.

Тесты OpenClaw с бекэндом LM Studio

В каталоге LM Studio есть разные модели как по архитектуре, так и по размеру. Перед тестами были загружены несколько моделей из топа подходящих под железо и минимально проверена их работоспособность: модель загружается и дает скорость, пригодную для интерактивной работы (на глаз). Часть моделей не подошла из-за таймаута при генерации ответа на запрос через OpenClaw, часть не удалось загрузить. Загрузка одной из моделей привела к перезагрузке Mac mini™ по неустановленной причине. В результате осталось три модели: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b, google/gemma-4-31b.

Пинг

Протестируем скорость отклика агента. Попробуем пропинговать агента с разными моделями и сравним время их ответа. Для улучшения точности замеров предварительно закроем все тяжелые приложения в системе и будем поочередно загружать модели с контекстом 64k.

МодельКвантизацияФорматВремя, с
google/gemma-4-26b-a4b-qat4bitMLX4
qwen/qwen3.6-35b-a3bQ4_K_MGGUF3
google/gemma-4-31bQ4_K_MGGUF12

Сводка новостей

Попросим OpenCLaw рассказать новости о компании Selectel. Запрос: «Расскажи новости про Selectel за последний квартал». Далее приведены полученные ответы от каждой из тестируемых моделей.

qwen/qwen3.6-35b-a3b

Вот основные новости по Selectel за последний квартал (Q1 2026):

—

**1. Финансовые итоги Q1 2026 (опубликованы 15 мая)**

– **Выручка** выросла на **14% г/г** до **5 млрд руб.** (включая 4,3 млрд от облачных инфраструктурных сервисов, тоже +14%)

– **Скорректированная EBITDA** — **2,7 млрд руб.** (+5% г/г), рентабельность **54%**

– **Чистая прибыль** — **0,9 млрд руб.** (+4% г/г), рентабельность 18%

– **Клиентская база** достигла **36,6 тыс.** (прирост 8,1 тыс. за год)

– **Чистый долг / EBITDA LTM** — **1,8x** — комфортный уровень

Общий фон: двузначный рост на фоне устойчивого спроса на облачную инфраструктуру в России.

—

**2. Итоги 2025 года (аудированная отчётность по МСФО, опубликована 1 апреля)**

– Выручка за 2025 — **18,3 млрд руб.** (+39% г/г)

– Компания подвела итоги года и опубликовала аудированную отчётность

—

**3. Сделка: Catalytic People приобрела 25% Selectel (июнь 2026)**

– **Catalytic People** (совместное предприятие **Т-Технологий** и **Интеррос** Владимира Потанина) приобрела **25%** акций Selectel за **16 млрд руб.**

– Доли в Catalytic People: Т-Технологии — **50,01%**, Интеррос — **49,99%**

– Сделка осуществляется в рамках стратегии вложений в высокотехнологичный сектор, в том числе для развития отечественных AI-моделей

– Это уже вторая волна подобных новостей: ранее (конец 2025) сообщалось о подготовке сделки

—

**4. Перспективы**

– Аналитики (в т.ч. T-Bank Invest, Sector IT) отмечают, что снижение ключевой ставки ЦБ положительно скажется на долговой нагрузке компании

– Выручка облачных сервисов растёт быстрее рынка — драйвером является спрос на AI-инфраструктуру

– Selectel рассчитывает удержать темпы роста и в 2026 году

Ответ содержит ошибку в п. 3. Сделка была объявлена 29 декабря 2025 года, а не в июне 2026. Сам текст написан разнородно: в отсутствие аналитики остается компиляция заголовков. На генерацию ответа ушло примерно 60 секунд.

google/gemma-4-26b-a4b-qat

На основе финансовых отчетов за первый квартал 2026 года (который завершился в марте), можно выделить следующие ключевые новости и показатели Selectel:

### 💰 Финансовые показатели (за I квартал 2026)

* **Выручка:** Составила **5 млрд рублей**.

* **Динамика:** Компания продолжает расти двузначными темпами, демонстрируя уверенную динамику даже на фоне напряженной экономической ситуации.

### 🏗️ Инвестиции и развитие (CAPEX)

Selectel продолжает активно расширять свои мощности. За прошедший квартал объем капитальных вложений (CAPEX) составил **2,8 млрд рублей**, которые были распределены следующим образом:

* **1,7 млрд руб.** — на закупку серверного оборудования;

* **0,9 млрд руб.** — на развитие инфраструктуры дата-центров.

### 📈 Общий итог

Отчетность за первый квартал характеризуется как «спокойная и качественная». Основной фокус компании остается на расширении инфраструктуры и поддержании темпов роста за счет наращивания серверных мощностей.

В тексте нет ошибок. По форме это больше как аналитическая заметка, а по содержанию ближе к пересказу пресс-релиза. Генерация заняла также около 60 секунд.

google/gemma-4-31b

Главная новость за последний квартал — финансовые результаты Selectel по итогам первого квартала 2026 года:

* **Выручка:** составила **5 млрд рублей**.

* **Рост:** выручка увеличилась на **14%** по сравнению с аналогичным периодом прошлого года.

* **Отчетность:** данные основаны на управленческой отчетности, соответствующей принципам МСФО.

Остальные новости в этот период носили преимущественно информационный характер, подтверждающий стабильный рост компании как независимого провайдера ИТ-инфраструктуры.

Этот ответ получился краткий и точный, но малоинформативный. Кроме того, на его генерацию ушло гораздо больше времени — 300 секунд.

Время ответа моделей собрано в таблице ниже.

МодельВремя, с
google/gemma-4-26b-a4b-qat60
qwen/qwen3.6-35b-a3b60
google/gemma-4-31b300

Самый детальный ответ дала модель qwen3.6-35b-a3b за минимальное из всех моделей время. Модель gemma-4-31b генерировала ответ дольше всех, однако детализированность ответа меньше таковой у gemma-4-26b-a4b-qat.

Синтетические бенчмарки

Посмотрим, сколько «попугаев» в синтетических тестах покажет Mac mini™ M4 Pro. Воспользуемся Anubis — open-source приложением для тестирования производительности локальных LLM-моделей на процессорах линейки Apple Silicon.

Список моделей тот же — для сравнимости. В таблице указаны средние значения результатов 20 запусков.

МодельТокенов в секундуДжоулей на 1 токенTTFT, мсЗадержка генерации токена, мс
google/gemma-4-26b-a4b-qat590,3823717
qwen/qwen3.6-35b-a3b500,459620
google/gemma-4-31b102,731 21797
  • Самой быстрой моделью по генерации токенов оказалась gemma-4-26b-a4b-qat — она же, по версии Anubis, еще и самая энергоэффективная. При схожей с qwen3.6-35b-a3b задержке генерации показатель TTFT (Time to First Token, время до первого токена) у модели Gemma оказался выше. 
  • Во всех тестах загруженность CPU не превышала 10%, в то время как загрузка GPU стабильно находилась около 99%. Такая загрузка показывает, что вычисления ложатся на GPU-часть Apple Silicon. Это ожидаемо для LLM-инференса через ML-фреймворки.
  • gemma-4-31b — последняя по скорости и энергоэффективности. Плотная модель на 31B параметров без квантования ожидаемо проигрывает MoE-архитектурам: 10 токенов/с против 50–59, энергозатраты выше примерно в 6–7 раз.
  • Обе MoE-модели gemma-4-26b-a4b-qat и qwen3.6-35b-a3b лидируют по пропускной способности. У них меньше активных параметров и быстрее инференс.
  • Модель gemma-4-31b менее детальна, чем gemma-4-26b-a4b-qat. Плотная 31B-модель при 5-кратной разнице во времени генерации (300 с vs 60 с) выдала худший по детализации результат, чем квантованная 26B MoE.
  • Модель qwen3.6-35b-a3b дает самый детальный ответ при наименьшем числе активных параметров. Казалось бы, модель с меньшим числом активных параметров должна выдавать менее развернутые ответы, но, вероятно, пропорциональной потери качества не происходит за счет архитектуры и качества обучающей выборки.

Заключение

По результатам тестов локальный запуск LLM на Mac mini™ выглядит вполне юзабельным. LLM-модели среднего размера выдают ответы с небольшой задержкой, что в сочетании с OpenClaw позволяет сделать из Mac mini™ полноценного ИИ-ассистента без использования подписок провайдеров LLM.

А для моделей большего размера можно рассмотреть выделенные или облачные серверы с более производительными GPU, в том числе с GPU NVIDIA® H300.