Исследователи продемонстрировали возможность запуска мощной языковой модели с 35 миллиардами параметров и контекстным окном 128 тысяч токенов на потребительском оборудовании стоимостью менее 900 евро. Использование подержанных серверных компонентов позволило достичь высокой скорости инференса, исключая необходимость аренды дорогостоящих облачных мощностей для работы с длинным контекстом.

Ключом к успеху стала оптимизация аппаратной конфигурации, ориентированная на максимальную пропускную способность памяти и эффективное использование видеокарт предыдущих поколений. Автор проекта подробно описывает подбор комплектующих, настройку системы охлаждения и программные методы квантования, которые позволяют запускать современные LLM без потери качества генерации. Такой подход открывает новые возможности для локального развертывания сложных агентных систем и обработки больших массивов данных в приватной среде.

Реализация проекта доказывает, что для задач, требующих работы с длинным контекстом, не всегда требуются кластеры H100. Правильная комбинация вторичного рынка серверного «железа» и современных библиотек для инференса позволяет создавать производительные локальные станции, способные конкурировать с облачными решениями по стоимости владения и доступности ресурсов для индивидуальных разработчиков.

Ключевые факты

  • Стоимость аппаратного обеспечения составила 870 евро.
  • Модель с 35 миллиардами параметров работает с контекстным окном 128 000 токенов.
  • Использованы компоненты с вторичного рынка, включая серверные GPU.
  • Достигнута скорость инференса, достаточная для комфортной работы в реальном времени.
  • Решение полностью исключает зависимость от облачных провайдеров и затраты на подписку.