Локальные LLM на Mac mini: тестируем инференс и OpenClaw

Локальный инференс LLM на Mac mini с OpenClaw

Александр Ершов
Александр Ершов Младший системный администратор
22 июля 2026

Проверяем, может ли Mac mini заменить мощный ПК с несколькими видеокартами для запуска локальных LLM. Тестируем ИИ-агентов на унифицированной памяти.

Изображение записи

Введение

Локальный домашний инференс обычно ассоциируется с полноразмерным ПК с несколькими видеокартами (иногда объединенными SLI/NVLink) и мощным блоком питания. При этом основными ограничениями такого решения зачастую являются объем оперативной и видеопамяти, а также их пропускная способность.

На волне популярности LLM-моделей для локального инференса востребованными оказались Mac mini. Тому есть несколько причин. За счет унифицированной памяти для загрузки модели доступен весь объем за исключением занятого системой. Пропускная способность этой памяти на порядок больше таковой в сравнении с DDR5. Также набор инструментов для локального инференса развился до состояния, пригодного для быстрого разворачивания.

С такими вводными Mac mini с памятью 24 или 48 ГБ — интересная альтернатива инференсу на десктопе. Совмещая локальную LLM-модель среднего размера и OpenClaw, пользователи организуют различные сценарии, используя персонального ИИ-агента. В этой статье попробуем запустить несколько моделей локально и проверим, оправдан ли хайп вокруг Mac mini.

Насколько прожорлив OpenClaw

OpenClaw не является моделью. Это ИИ-агент или ИИ-ассистент, как его иногда позиционируют, работающий поверх LLM. Также у него есть интеграции с популярными сервисами: Discord, Google Chat, iMessage®, Matrix и другими. В документации OpenClaw называют self-hosted шлюзом для связи приложений и мессенджеров с возможностью подключения ИИ-агентов для программирования.

Минимальные системные требования и правда малы: одно ядро процессора,  512 МБ ОЗУ, 1 ГБ диска и сеть 1 Мбит/c. Такая инсталляция заявлена как персональный бот на бюджетном облачном сервере / Raspberry Pi® для тестов или разработки. 

Production- и heavy-сценарии более требовательны к ресурсам: 2/4+ ядра процессора, 8/16 ГБ ОЗУ, 20/50+ ГБ диска и сеть 10/25+ Мбит/с. В такой инсталляции связка OpenClaw + LLM может работать в рамках команды или компании, обеспечивать работу мультиагентных воркфлоу и пайплайнов автоматизации. Все перечисленные системные требования не учитывают локальное размещение модели.

Наш тестовый Mac mini оснащен процессором M4 Pro, 48 ГБ ОЗУ и 2 ТБ диска. «На бумаге» железо позволяет развернуть OpenClaw в самом требовательном к ресурсам сценарии. Из-за архитектуры Mac mini с унифицированной памятью (UMA) пул доступной оперативной памяти един для процессора и графики. Это накладывает ограничения на выбор модели: чем больше модель, тем меньше памяти останется для OpenClaw и системы.

Установка OpenClaw и настройка локального инференса

Для тестов нужно локально развернуть LLM-модель с OpenAI-совместимым API. Одно из готовых решений — LM Studio. Оно позволяет скачивать и локально запускать модели, а также обеспечивает эндпоинты с OpenAI-совместимым API. 

Кроме LM Studio существуют другие решения со схожим функционалом: llama.cpp, Ollama (на базе llama.cpp), vLLM и другие. LM Studio выигрывает для задачи «скачать модель и получить API» за счет GUI, встроенного каталога моделей и минимальной настройки. Аналоги «из коробки» требуют больше действий для такого же результата.

Установка LM Studio поддерживается в двух форматах: GUI и headless. Для тестовых целей подойдет GUI-вариант, который позволяет быстро настраивать параметры загрузки моделей и генерации и скачивать модели. Headless подойдет для развертывания на удаленной машине, например, на выделенном сервере, для использования разными клиентами. Сам процесс установки прост — скачать DMG-файл и установить.
Далее для локального запуска нужно загрузить модели и настроить доступ к ней по API.

Загрузить модель можно в меню Model Search. По умолчанию модели отсортированы в порядке Best Match, начиная с самых больших и подходящих для устройства. Для тестового Mac mini LM Studio оценивает доступный для модели объем памяти в 40 ГБ.

Скриншот окна десктопного приложения (LM Studio) на macOS. В левой панели отображается список ИИ-моделей, среди которых Nemotron 3 Nano Omni, Qwen3.6 и Gemma 4. В центре открыто выпадающее меню сортировки «Sort by» с выбранным пунктом «Best Match» и активным чекбоксом «Only include Staff Picks that can fit on this device» с ограничением емкости в 40.00 GB. В правой части окна открыта карточка модели nvidia/nemotron-3-nano-omni с кнопкой для скачивания файла размером 26.10 GB в формате GGUF.
Предложение моделей в LM Studio на момент написания статьи.

После скачивания весов модели и загрузки в память можно пингануть модель и получить ответ.

Скриншот окна приложения LM Studio на macOS, демонстрирующий открытый чат под названием «Ping-Pong Exchange». Справа вверху виден пузырек сообщения пользователя с текстом «Ping». Ниже отображается ответ локальной языковой модели qwen/qwen3.6-35b-a3b: скрытый блок «Thought for 6.91 seconds» и текст «Pong! I'm here and ready to help. What can I do for you?». Под ответом выведена техническая статистика генерации (52.17 tok/sec, 388 tokens) и панель инструментов. В нижней части окна находится поле ввода сообщения с активными кнопками «Think» и «Vision».
Модель работает, на пинг отвечает.

Для запуска локального сервера нужно переключиться в меню Developer и переключить статус. Тут же видны логи.

Скриншот интерфейса LM Studio на macOS, открытого на вкладке «Developer». В верхней части центральной панели отображается статус сервера «Running» с адресом http://127.0.0.1:1234. В блоке «Loaded Models» показана загруженная модель qwen/qwen3.6-35b-a3b размером 22.07 GB. Ниже перечислены поддерживаемые эндпоинты (LM Studio API, OpenAI-compatible, Anthropic-compatible), а в самом низу открыта панель «Developer Logs» с отладочными логами. В правой боковой панели выведена подробная информация о модели Qwen3.6 35B A3B, включая формат GGUF и квантование Q4_K_M.
Информация о локальном сервере в LM Studio. Тут можно смотреть логи, информацию о модели и изменять параметры загрузки, например, размер контекста.

После загрузки модели LM Studio оценивает объем занятой памяти в 21 ГБ.

Скриншот окна настроек LM Studio, открытого на вкладке Hardware в разделе System. В верхней панели отображаются характеристики процессора Apple M4 Pro (архитектура ARM64, объединенная память RAM — 48.00 GB, VRAM — 37.44 GB). В блоке GPUs показан один обнаруженный графический процессор Apple M4 Pro с поддержкой Metal, переключатель которого находится в положении ON. В мониторе ресурсов (Resource Monitor) указано использование памяти RAM + VRAM на уровне 21.29 GB, а нагрузка на CPU составляет 0.00%. В самом низу, в разделе Guardrails, выбран строгий режим ограничения загрузки моделей (Strict).
Сводка по железу тестового Mac mini, там же есть настройка гардрейлов в части перегрузки ресурсов системы.

После настройки локальной модели перейдем к установке OpenClaw.

Обратите внимание, что для лаконичности инструкции используются команды, которые скачивают неизвестный скрипт и выполняют его с правами суперпользователя. Это небезопасно, так как скрипт может быть изменен и содержать вредоносный контент.

Такой подход допустим для краткосрочных проектов на чистом сервере, однако в продуктовой среде рекомендуется устанавливать ПО вручную из доверенных источников.


      curl -fsSL https://openclaw.ai/install.sh

Скрипт ставит необходимые пакеты и запускает мастер настройки. Проходим его с минимальными настройками. После завершения откроем дашборд и отправим запрос на проверку состояния системы — Check system health.

Скриншот окна браузера с открытым локальным адресом 127.0.0.1. Отображается веб-интерфейс инструмента OpenClaw (версия v2026.5.27) в режиме чата. В центре экрана выведен подробный текстовый отчет от ИИ-ассистента с заголовком Here's the system health snapshot. В отчете приведены данные аппаратного обеспечения (Apple M4 Pro, 48 GB RAM, macOS 26.5), таблица системных ресурсов (Disk, Load avg, RAM, Swap) и статус OpenClaw Gateway (все пункты отмечены зелеными галочками). В левой боковой панели находится меню навигации с разделами Control (Overview, Activity, Instances) и Agent (Agents, Skills).
Агент ответил, информацию о себе рассказал.

«Самодиагностика» в порядке, можно переходить к тестам.

Тесты OpenClaw с бекэндом LM Studio

В каталоге LM Studio есть разные модели как по архитектуре, так и по размеру. Перед тестами были загружены несколько моделей из топа подходящих под железо и минимально проверена их работоспособность: модель загружается и дает скорость, пригодную для интерактивной работы (на глаз). Часть моделей не подошла из-за таймаута при генерации ответа на запрос через OpenClaw, часть не удалось загрузить. Загрузка одной из моделей привела к перезагрузке Mac mini по неустановленной причине. В результате осталось три модели: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b, google/gemma-4-31b.

Пинг

Протестируем скорость отклика агента. Попробуем пропинговать агента с разными моделями и сравним время их ответа. Для улучшения точности замеров предварительно закроем все тяжелые приложения в системе и будем поочередно загружать модели с контекстом 64k.

МодельКвантизацияФорматВремя, с
google/gemma-4-26b-a4b-qat4bitMLX4
qwen/qwen3.6-35b-a3bQ4_K_MGGUF3
google/gemma-4-31bQ4_K_MGGUF12

Сводка новостей

Попросим OpenCLaw рассказать новости о компании Selectel. Запрос: «Расскажи новости про Selectel за последний квартал». Далее приведены полученные ответы от каждой из тестируемых моделей.

qwen/qwen3.6-35b-a3b

Вот основные новости по Selectel за последний квартал (Q1 2026):

**1. Финансовые итоги Q1 2026 (опубликованы 15 мая)**

– **Выручка** выросла на **14% г/г** до **5 млрд руб.** (включая 4,3 млрд от облачных инфраструктурных сервисов, тоже +14%)

– **Скорректированная EBITDA** — **2,7 млрд руб.** (+5% г/г), рентабельность **54%**

– **Чистая прибыль** — **0,9 млрд руб.** (+4% г/г), рентабельность 18%

– **Клиентская база** достигла **36,6 тыс.** (прирост 8,1 тыс. за год)

– **Чистый долг / EBITDA LTM** — **1,8x** — комфортный уровень

Общий фон: двузначный рост на фоне устойчивого спроса на облачную инфраструктуру в России.

**2. Итоги 2025 года (аудированная отчётность по МСФО, опубликована 1 апреля)**

– Выручка за 2025 — **18,3 млрд руб.** (+39% г/г)

– Компания подвела итоги года и опубликовала аудированную отчётность

**3. Сделка: Catalytic People приобрела 25% Selectel (июнь 2026)**

– **Catalytic People** (совместное предприятие **Т-Технологий** и **Интеррос** Владимира Потанина) приобрела **25%** акций Selectel за **16 млрд руб.**

– Доли в Catalytic People: Т-Технологии — **50,01%**, Интеррос — **49,99%**

– Сделка осуществляется в рамках стратегии вложений в высокотехнологичный сектор, в том числе для развития отечественных AI-моделей

– Это уже вторая волна подобных новостей: ранее (конец 2025) сообщалось о подготовке сделки

**4. Перспективы**

– Аналитики (в т.ч. T-Bank Invest, Sector IT) отмечают, что снижение ключевой ставки ЦБ положительно скажется на долговой нагрузке компании

– Выручка облачных сервисов растёт быстрее рынка — драйвером является спрос на AI-инфраструктуру

– Selectel рассчитывает удержать темпы роста и в 2026 году

Ответ содержит ошибку в п. 3. Сделка была объявлена 29 декабря 2025 года, а не в июне 2026. Сам текст написан разнородно: в отсутствие аналитики остается компиляция заголовков. На генерацию ответа ушло примерно 60 секунд.

google/gemma-4-26b-a4b-qat

На основе финансовых отчетов за первый квартал 2026 года (который завершился в марте), можно выделить следующие ключевые новости и показатели Selectel:

### 💰 Финансовые показатели (за I квартал 2026)

* **Выручка:** Составила **5 млрд рублей**.

* **Динамика:** Компания продолжает расти двузначными темпами, демонстрируя уверенную динамику даже на фоне напряженной экономической ситуации.

### 🏗️ Инвестиции и развитие (CAPEX)

Selectel продолжает активно расширять свои мощности. За прошедший квартал объем капитальных вложений (CAPEX) составил **2,8 млрд рублей**, которые были распределены следующим образом:

* **1,7 млрд руб.** — на закупку серверного оборудования;

* **0,9 млрд руб.** — на развитие инфраструктуры дата-центров.

### 📈 Общий итог

Отчетность за первый квартал характеризуется как «спокойная и качественная». Основной фокус компании остается на расширении инфраструктуры и поддержании темпов роста за счет наращивания серверных мощностей.

В тексте нет ошибок. По форме это больше как аналитическая заметка, а по содержанию ближе к пересказу пресс-релиза. Генерация заняла также около 60 секунд.

google/gemma-4-31b

Главная новость за последний квартал — финансовые результаты Selectel по итогам первого квартала 2026 года:

* **Выручка:** составила **5 млрд рублей**.

* **Рост:** выручка увеличилась на **14%** по сравнению с аналогичным периодом прошлого года.

* **Отчетность:** данные основаны на управленческой отчетности, соответствующей принципам МСФО.

Остальные новости в этот период носили преимущественно информационный характер, подтверждающий стабильный рост компании как независимого провайдера ИТ-инфраструктуры.

Этот ответ получился краткий и точный, но малоинформативный. Кроме того, на его генерацию ушло гораздо больше времени — 300 секунд.

Время ответа моделей собрано в таблице ниже.

МодельВремя, с
google/gemma-4-26b-a4b-qat60
qwen/qwen3.6-35b-a3b60
google/gemma-4-31b300

Самый детальный ответ дала модель qwen3.6-35b-a3b за минимальное из всех моделей время. Модель gemma-4-31b генерировала ответ дольше всех, однако детализированность ответа меньше таковой у gemma-4-26b-a4b-qat.

Синтетические бенчмарки

Посмотрим, сколько «попугаев» в синтетических тестах покажет Mac mini M4 Pro. Воспользуемся Anubis — open-source приложением для тестирования производительности локальных LLM-моделей на процессорах линейки Apple Silicon.

Список моделей тот же — для сравнимости. В таблице указаны средние значения результатов 20 запусков.

МодельТокенов в секундуДжоулей на 1 токенTTFT, мсЗадержка генерации токена, мс
google/gemma-4-26b-a4b-qat590,3823717
qwen/qwen3.6-35b-a3b500,459620
google/gemma-4-31b102,731 21797
  • Самой быстрой моделью по генерации токенов оказалась gemma-4-26b-a4b-qat — она же, по версии Anubis, еще и самая энергоэффективная. При схожей с qwen3.6-35b-a3b задержке генерации показатель TTFT (Time to First Token, время до первого токена) у модели Gemma оказался выше. 
  • Во всех тестах загруженность CPU не превышала 10%, в то время как загрузка GPU стабильно находилась около 99%. Такая загрузка показывает, что вычисления ложатся на GPU-часть Apple Silicon. Это ожидаемо для LLM-инференса через ML-фреймворки.
  • gemma-4-31b — последняя по скорости и энергоэффективности. Плотная модель на 31B параметров без квантования ожидаемо проигрывает MoE-архитектурам: 10 токенов/с против 50–59, энергозатраты выше примерно в 6–7 раз.
  • Обе MoE-модели gemma-4-26b-a4b-qat и qwen3.6-35b-a3b лидируют по пропускной способности. У них меньше активных параметров и быстрее инференс.
  • Модель gemma-4-31b менее детальна, чем gemma-4-26b-a4b-qat. Плотная 31B-модель при 5-кратной разнице во времени генерации (300 с vs 60 с) выдала худший по детализации результат, чем квантованная 26B MoE.
  • Модель qwen3.6-35b-a3b дает самый детальный ответ при наименьшем числе активных параметров. Казалось бы, модель с меньшим числом активных параметров должна выдавать менее развернутые ответы, но, вероятно, пропорциональной потери качества не происходит за счет архитектуры и качества обучающей выборки.

Заключение

По результатам тестов локальный запуск LLM на Mac mini выглядит вполне юзабельным. LLM-модели среднего размера выдают ответы с небольшой задержкой, что в сочетании с OpenClaw позволяет сделать из Mac mini полноценного ИИ-ассистента без использования подписок провайдеров LLM.

А для моделей большего размера можно рассмотреть выделенные или облачные серверы с более производительными GPU, в том числе с GPU NVIDIA® H300.