Представлена архитектура Macaron-V1 — семейство открытых агентных моделей, спроектированных для непрерывного обучения в реальных условиях после развертывания. Система использует механизмы рекурсивного самосовершенствования и смесь LoRA-адаптеров (Mixture-of-LoRA), что позволяет агентам накапливать опыт и адаптироваться к новым задачам без потери ранее приобретенных навыков, обеспечивая стабильную работу в динамических средах.
Ключевой особенностью подхода является разделение процессов адаптации и оценки. Модели работают в связке с внешними контрактами, которые валидируют опыт, полученный в ходе эксплуатации. Это позволяет системе автоматически формировать новые конфигурации на основе накопленных данных, превращая каждый цикл взаимодействия с окружением в источник для дообучения и оптимизации весов модели.
Использование Mixture-of-LoRA позволяет эффективно масштабировать знания агента, подключая специализированные адаптеры для конкретных доменов. Такой подход решает проблему катастрофического забывания, с которой сталкиваются классические модели при попытке дообучения на потоковых данных. Архитектура ориентирована на создание «эмпирического интеллекта», способного эволюционировать вместе с задачами, которые он выполняет.
Ключевые факты
- Macaron-V1 реализует концепцию непрерывного обучения (continual learning) в реальных средах.
- Основной механизм адаптации базируется на рекурсивном улучшении версионированных пар «модель-обвязка».
- В архитектуре применяется технология Mixture-of-LoRA для гибкого управления знаниями.
- Система использует внешние контракты для оценки качества опыта перед его интеграцией в модель.
- Разработка направлена на создание моделей, способных к самосовершенствованию после деплоя.