Разработчики представили решение для запуска компактной языковой модели с 180,9 млн параметров непосредственно на микроконтроллере ESP32-P4. Проект демонстрирует возможность выполнения инференса и базовых агентных функций на энергоэффективном «железе» без подключения к облачным серверам, что открывает новые перспективы для локальной автоматизации и встраиваемых систем с ограниченными вычислительными ресурсами.
Реализация опирается на оптимизацию вычислений для архитектуры ESP32, позволяя модели работать в условиях крайне ограниченного объема оперативной памяти. Это решение ориентировано на задачи, где требуется мгновенная реакция системы и полная автономность, исключающая передачу данных во внешние сети. Использование специализированных библиотек для работы с тензорами на чипах ESP32 позволяет достичь приемлемой скорости генерации токенов для простых команд и сценариев управления.
Технология открывает путь к созданию «умных» датчиков и периферийных устройств, способных интерпретировать естественный язык и выполнять логические операции без участия мощных GPU. В отличие от облачных решений, такой подход обеспечивает высокую приватность и стабильность работы в офлайн-режиме, что критически важно для промышленного интернета вещей и систем домашней автоматизации.
Ключевые факты
- Модель содержит 180,9 миллиона параметров, адаптированных для работы на микроконтроллере.
- В качестве аппаратной платформы используется чип ESP32-P4, оптимизированный для задач обработки данных.
- Реализация поддерживает выполнение агентных функций, позволяя устройству совершать действия на основе текстовых запросов.
- Весь процесс инференса происходит локально, без необходимости обращения к API внешних ИИ-провайдеров.
- Проект доступен в виде открытого исходного кода для интеграции в собственные встраиваемые системы.