Google DeepMind выпустила Cue AI — исследовательский проект, направленный на изучение навыков долгосрочного планирования у языковых моделей. В рамках работы специалисты протестировали способность ИИ разбивать сложные задачи на последовательные этапы, используя семейство моделей Gemma. Результаты показывают, как именно архитектурные особенности и методы обучения влияют на логическую связность действий агентов в динамических средах.
Исследование фокусируется на преодолении типичных проблем LLM, таких как галлюцинации при выполнении многошаговых инструкций и потеря контекста в процессе принятия решений. Команда DeepMind разработала специализированные бенчмарки, которые оценивают не только финальный результат, но и промежуточную логику, которую модель выстраивает для достижения цели. Это позволяет глубже понять, как именно трансформеры справляются с задачами, требующими последовательного мышления.
Проект является частью инициативы Gemmaverse, направленной на развитие открытых инструментов для анализа поведения моделей. Полученные данные помогают разработчикам лучше настраивать стратегии промптинга и методы дообучения для повышения надежности агентных систем, работающих в реальных бизнес-сценариях или при автоматизации сложных рабочих процессов.
Ключевые факты
- Cue AI базируется на семействе открытых моделей Gemma от Google DeepMind.
- Основная цель проекта — оценка и улучшение навыков долгосрочного планирования (long-horizon planning) у ИИ.
- Исследование включает разработку новых методик тестирования логических цепочек в многошаговых задачах.
- Проект интегрирован в экосистему Gemmaverse, предоставляющую ресурсы для анализа поведения моделей.
- Работа направлена на снижение ошибок при выполнении комплексных инструкций, требующих последовательной обработки данных.