Проект Petals позволяет запускать крупномасштабные языковые модели на потребительском оборудовании, используя распределенную сеть по аналогии с протоколом BitTorrent. Вместо загрузки всей модели на один мощный GPU, пользователи объединяют вычислительные ресурсы своих видеокарт, что дает возможность запускать LLM с десятками миллиардов параметров без необходимости в дорогостоящих серверных кластерах.

Технология работает по принципу «коллективного инференса»: каждый участник сети загружает лишь часть весов модели, выполняя вычисления для конкретных слоев нейросети. Когда пользователь отправляет запрос, он проходит через цепочку узлов, где каждый узел обрабатывает свою часть данных и передает результат дальше. Это позволяет запускать модели, которые физически не помещаются в память одной видеокарты, обеспечивая при этом приемлемую скорость генерации текста для интерактивных задач.

Система поддерживает популярные архитектуры, включая Llama, Falcon и BLOOM. Основное преимущество подхода заключается в демократизации доступа к мощным ИИ-инструментам: разработчики и исследователи могут тестировать модели уровня 176B параметров, имея в распоряжении лишь стандартные GPU с 8–16 ГБ видеопамяти. При этом архитектура Petals устойчива к отключению отдельных узлов, так как система автоматически перераспределяет нагрузку между доступными участниками сети.

Ключевые факты

  • Petals использует распределенную архитектуру, где веса модели разделены между множеством независимых узлов.
  • Поддерживается работа с моделями размером до 176 миллиардов параметров на потребительском «железе».
  • Протокол обеспечивает устойчивость к сбоям: при выходе узла из сети вычисления продолжаются на других участниках.
  • Интеграция с библиотекой Hugging Face Transformers позволяет запускать модели через стандартный API в несколько строк кода.
  • Система ориентирована на инференс и дообучение (fine-tuning) моделей в децентрализованной среде.