Проект Petals позволяет запускать крупномасштабные языковые модели на потребительском оборудовании, используя распределенную сеть по аналогии с протоколом BitTorrent. Вместо загрузки всей модели на один мощный GPU, пользователи объединяют вычислительные ресурсы своих видеокарт, что дает возможность запускать LLM с десятками миллиардов параметров без необходимости в дорогостоящих серверных кластерах.
Технология работает по принципу «коллективного инференса»: каждый участник сети загружает лишь часть весов модели, выполняя вычисления для конкретных слоев нейросети. Когда пользователь отправляет запрос, он проходит через цепочку узлов, где каждый узел обрабатывает свою часть данных и передает результат дальше. Это позволяет запускать модели, которые физически не помещаются в память одной видеокарты, обеспечивая при этом приемлемую скорость генерации текста для интерактивных задач.
Система поддерживает популярные архитектуры, включая Llama, Falcon и BLOOM. Основное преимущество подхода заключается в демократизации доступа к мощным ИИ-инструментам: разработчики и исследователи могут тестировать модели уровня 176B параметров, имея в распоряжении лишь стандартные GPU с 8–16 ГБ видеопамяти. При этом архитектура Petals устойчива к отключению отдельных узлов, так как система автоматически перераспределяет нагрузку между доступными участниками сети.
Ключевые факты
- Petals использует распределенную архитектуру, где веса модели разделены между множеством независимых узлов.
- Поддерживается работа с моделями размером до 176 миллиардов параметров на потребительском «железе».
- Протокол обеспечивает устойчивость к сбоям: при выходе узла из сети вычисления продолжаются на других участниках.
- Интеграция с библиотекой Hugging Face Transformers позволяет запускать модели через стандартный API в несколько строк кода.
- Система ориентирована на инференс и дообучение (fine-tuning) моделей в децентрализованной среде.