Intel представила проект LLM Scaler, обеспечивающий поддержку и оптимизацию работы больших языковых моделей на графических процессорах Arc Pro B60 и B70. Инструмент направлен на повышение производительности инференса на аппаратном обеспечении Intel, позволяя эффективно использовать ресурсы дискретных видеокарт для запуска локальных моделей, что расширяет возможности развертывания ИИ-решений на рабочих станциях без необходимости использования дорогостоящих серверных ускорителей.

Программное решение ориентировано на разработчиков, которые стремятся оптимизировать запуск LLM в локальной среде. Использование специализированных библиотек Intel позволяет более эффективно распределять вычислительную нагрузку между ядрами GPU, сокращая время генерации токенов и снижая задержки при обработке запросов. Это важный шаг для экосистемы Intel, стремящейся занять нишу доступного железа для локального запуска ИИ-моделей среднего размера.

Интеграция LLM Scaler в рабочий процесс позволяет пользователям Arc Pro B-серии задействовать аппаратное ускорение для задач, которые ранее требовали более мощных или специализированных решений. Проект предоставляет необходимые драйверы и программные прослойки для бесшовной работы с популярными фреймворками, минимизируя усилия по настройке окружения и оптимизации весов моделей под архитектуру Intel Xe2.

Ключевые факты

  • Проект LLM Scaler официально поддерживает графические процессоры Intel Arc Pro B60 и B70.
  • Инструмент оптимизирует процесс инференса LLM, используя архитектуру Intel Xe2 для ускорения вычислений.
  • Решение направлено на снижение задержек при генерации текста на локальных рабочих станциях.
  • Исходный код и документация по интеграции доступны в официальном репозитории Intel на GitHub.