Разработчики представили инструмент для расчета необходимых мощностей оборудования при запуске локальных языковых моделей. Сервис позволяет оценить требования к видеопамяти (VRAM) и оперативной памяти в зависимости от параметров модели, метода квантования и контекстного окна. Это упрощает подбор конфигурации серверов или рабочих станций для развертывания ИИ-решений без обращения к облачным API.

При выборе модели для локального инференса ключевым ограничением становится объем видеопамяти, необходимой для загрузки весов. Калькулятор учитывает не только размер самой модели, но и дополнительные затраты ресурсов на KV-кэш, который растет пропорционально длине контекста. Использование различных уровней квантования (от 2-bit до 8-bit) позволяет значительно снизить порог входа, жертвуя при этом точностью ответов.

Инструмент ориентирован на инженеров и исследователей, которые занимаются локальным развертыванием моделей с открытыми весами. Он помогает заранее определить, достаточно ли имеющегося графического ускорителя для работы конкретной архитектуры, или требуется масштабирование системы с использованием нескольких GPU или специализированных решений для инференса.

Ключевые факты

  • Сервис поддерживает расчеты для популярных архитектур моделей, включая Llama, Mistral и их производные.
  • Учитываются параметры квантования, позволяющие оптимизировать потребление памяти при сохранении производительности.
  • Калькулятор включает оценку нагрузки на KV-кэш, что критично для задач с длинным контекстом.
  • Инструмент предоставляет рекомендации по минимальному объему VRAM для комфортной работы моделей разного размера (от 7B до 70B+ параметров).