Разработчик реализовал запуск языковой модели с 56 миллионами параметров, распределив вычисления между тремя микроконтроллерами ESP32-S3. Для обмена данными между узлами используется протокол ESP-NOW, обеспечивающий низкую задержку связи без необходимости подключения к Wi-Fi. Этот эксперимент демонстрирует возможность выполнения нейросетевых задач на крайне ограниченных аппаратных ресурсах за счет кластеризации доступных вычислительных мощностей.
Архитектура решения предполагает разделение весов модели и вычислительной нагрузки между несколькими чипами. Каждый ESP32-S3 выполняет свою часть операций инференса, после чего промежуточные результаты передаются на следующий узел для формирования итогового ответа. Использование ESP-NOW позволяет минимизировать накладные расходы на сетевой стек, что критично при работе с ограниченным объемом оперативной памяти микроконтроллеров.
Данный подход открывает перспективы для создания автономных распределенных систем на базе дешевого IoT-железа, способных выполнять базовые задачи обработки естественного языка без обращения к облачным серверам. Проект подчеркивает потенциал оптимизации моделей для работы на граничных устройствах (edge computing) через горизонтальное масштабирование вычислительных узлов в рамках одной локальной сети.
Ключевые факты
- Модель: LLM с 56 миллионами параметров.
- Аппаратная база: 3 микроконтроллера ESP32-S3.
- Протокол связи: ESP-NOW (беспроводной протокол с низкой задержкой).
- Метод: распределение вычислительной нагрузки и весов модели между узлами.
- Цель: реализация инференса на маломощных встраиваемых системах.