Представлен актуальный справочник open-weight моделей, классифицированных по объему необходимой видеопамяти для запуска. Анализ охватывает широкий спектр архитектур — от компактных решений для локальных устройств до тяжелых весов, требующих серверных мощностей. Данные помогают разработчикам подбирать оптимальные модели под конкретные аппаратные ограничения, обеспечивая баланс между производительностью и доступными ресурсами при развертывании агентных систем.

Выбор подходящей модели сегодня критически зависит от доступного VRAM. С ростом сложности архитектур и внедрением новых методов квантования, требования к памяти становятся ключевым фактором при проектировании инфраструктуры для инференса. Материал систематизирует текущий ландшафт моделей, позволяя оценить, какие из них можно запустить на потребительском «железе», а какие требуют кластерных решений.

Помимо базовых требований, учитывается влияние различных уровней квантования на итоговый размер модели. Это позволяет точнее прогнозировать затраты на инфраструктуру и выбирать модели, которые вписываются в бюджет памяти без критической потери качества генерации. Подобная сегментация упрощает процесс интеграции LLM в локальные и облачные пайплайны.

Ключевые факты

  • Классификация охватывает модели с параметрами от 1B до более чем 100B, распределенные по категориям VRAM от 4GB до 80GB+.
  • Учтены требования для различных форматов квантования (4-bit, 8-bit, FP16), что позволяет масштабировать запуск моделей на разном оборудовании.
  • В список включены наиболее эффективные архитектуры, актуальные на июль 2026 года, с учетом их способности к выполнению сложных агентных задач.
  • Таблица предоставляет четкие рекомендации по выбору GPU для конкретных весов, минимизируя риск нехватки памяти при выполнении инференса.