Комментарий пользователя
Мы выводим LLM в продакшен. Сейчас инференс крутится на A100 (80 ГБ), но мы ищем решение с лучшим соотношением цена/производительность (price/performance). Что вы можете посоветовать из актуальных карт, чтобы снизить стоимость обработки запросов без просадки по скорости?
Ответ специалиста
Добрый день, Дмитрий!
NVIDIA® A100 — отличная карта, но для задач инференса часто можно подобрать более интересные варианты по стоимости вычислений.
Чтобы оптимально подобрать инфраструктуру, важно учитывать не только объем VRAM, но и вычислительную мощность (compute), а также поддержку современных форматов сжатия — FP8 и FP4.
Перед сменой железа рекомендуем зафиксировать базовые метрики на текущей инфраструктуре. Во-первых, стоит замерить пиковое потребление VRAM. Проверьте, сколько памяти занимают веса модели вместе с динамическим KV-кэшем при наплыве пользователей:
nvidia-smi --query-gpu=memory.used,memory.total --format=csv -l 1
Во-вторых, зафиксируйте эталонные метрики. Измерьте TTFT (Time to First Token) и общую скорость генерации на A100 с помощью скрипта benchmark_serving.py в vLLM.
Подбор карт под задачи
NVIDIA RTX™ PRO 6000 Blackwell (96 ГБ) — карта с хорошим price/performance под модели 70B+. Есть поддержка FP4: сжатые веса дают высокую скорость генерации на единицу стоимости. Это позволяет существенно снизить себестоимость одного запроса по сравнению с арендой A100.
Кастомные сборки RTX™ 4090 на 48 ГБ VRAM в Selectel: модифицированные серверные GPU с увеличенным объемом памяти. Это абсолютный лидер по показателю «производительность на рубль» для высоконагруженного инференса моделей 13B–34B и оптимизированных 70B.
Для локальных и легких задач стоит рассмотреть NVIDIA® L4 (24 ГБ). Она подходит под компактные модели (до 7B–8B в квантованном формате FP8/INT8) или сценарии с небольшой параллельной нагрузкой. Однако помните, что вычислительная мощность (compute) у L4 ограничена, поэтому под большое число запросов лучше сразу выбирать кастомные RTX™ 4090 (48 ГБ) или RTX™ PRO 6000.
В нашем материале мы подробно описываем стратегии оптимизации ресурсов под задачи машинного обучения. А в Selectel вы можете арендовать конфигурации с картами RTX™ PRO 6000 Blackwell, RTX™ 4090 (48 ГБ) и L4 под задачи любой сложности.