Сравнение GPU для инференса LLM

Вопрос: на какие карты перенести модель, чтобы снизить стоимость обработки запросов без потери скорости?

Линия поддержки
Линия поддержки Ответы на вопросы пользователей
27 августа 2026

Выбор GPU для инференса LLM: оптимизация расходов на инфраструктуру.

Изображение записи

Комментарий пользователя

Мы выводим LLM в продакшен. Сейчас инференс крутится на A100 (80 ГБ), но мы ищем решение с лучшим соотношением цена/производительность (price/performance). Что вы можете посоветовать из актуальных карт, чтобы снизить стоимость обработки запросов без просадки по скорости?

Дмитрий Самойлов MLOps-инженер

Ответ специалиста

Добрый день, Дмитрий!

NVIDIA® A100 — отличная карта, но для задач инференса часто можно подобрать более интересные варианты по стоимости вычислений.

Чтобы оптимально подобрать инфраструктуру, важно учитывать не только объем VRAM, но и вычислительную мощность (compute), а также поддержку современных форматов сжатия — FP8 и FP4.

Перед сменой железа рекомендуем зафиксировать базовые метрики на текущей инфраструктуре. Во-первых, стоит замерить пиковое потребление VRAM. Проверьте, сколько памяти занимают веса модели вместе с динамическим KV-кэшем при наплыве пользователей:


      nvidia-smi --query-gpu=memory.used,memory.total --format=csv -l 1
  • Сергей Ковалёв

    Сергей Ковалёв

    Менеджер выделенных серверов

Во-вторых, зафиксируйте эталонные метрики. Измерьте TTFT (Time to First Token) и общую скорость генерации на A100 с помощью скрипта benchmark_serving.py в vLLM.

Подбор карт под задачи

NVIDIA RTX™ PRO 6000 Blackwell (96 ГБ) — карта с хорошим price/performance под модели 70B+. Есть поддержка FP4: сжатые веса дают высокую скорость генерации на единицу стоимости. Это позволяет существенно снизить себестоимость одного запроса по сравнению с арендой A100.

Кастомные сборки RTX™ 4090 на 48 ГБ VRAM в Selectel: модифицированные серверные GPU с увеличенным объемом памяти. Это абсолютный лидер по показателю «производительность на рубль» для высоконагруженного инференса моделей 13B–34B и оптимизированных 70B. 

Для локальных и легких задач стоит рассмотреть NVIDIA® L4 (24 ГБ). Она подходит под компактные модели (до 7B–8B в квантованном формате FP8/INT8) или сценарии с небольшой параллельной нагрузкой. Однако помните, что вычислительная мощность (compute) у L4 ограничена, поэтому под большое число запросов лучше сразу выбирать кастомные RTX™ 4090 (48 ГБ) или RTX™ PRO 6000.

В нашем материале мы подробно описываем стратегии оптимизации ресурсов под задачи машинного обучения. А в Selectel вы можете арендовать конфигурации с картами RTX™ PRO 6000 Blackwell, RTX™ 4090 (48 ГБ) и L4 под задачи любой сложности.