Исследователи провели сравнительный анализ способности современных языковых моделей решать сложные логические задачи на примере игры Baba Is You. В тесте участвовали Kimi K3, Opus 5, Grok 4.5 и Gemini 3.6 Flash. Эксперимент показал, как модели справляются с нестандартными правилами и пространственным мышлением, где требуется глубокое понимание контекста и планирование действий для достижения цели.

Игра Baba Is You выбрана не случайно: она требует от игрока манипулировать объектами и правилами игры, что является серьезным испытанием для нейросетей. В отличие от стандартных бенчмарков, здесь модель должна не просто извлекать знания, а выстраивать логические цепочки в динамически меняющейся среде. Это позволяет оценить «рассуждающие» способности моделей в условиях, близких к реальному программированию или решению инженерных задач.

Результаты демонстрируют разрыв в производительности между моделями при работе с абстрактными правилами. Некоторые системы показывают высокую точность в простых сценариях, но теряют эффективность при усложнении логических связей. Анализ подчеркивает, что даже передовые архитектуры сталкиваются с трудностями при необходимости долгосрочного планирования и учета множественных зависимостей в рамках одной сессии.

Ключевые факты

  • В тестировании приняли участие модели Kimi K3, Opus 5, Grok 4.5 и Gemini 3.6 Flash.
  • Методология основана на прохождении уровней игры Baba Is You, требующей изменения механик через перестановку блоков с правилами.
  • Бенчмарк оценивает способность моделей к логическому выводу (reasoning) и адаптации к изменяющимся условиям среды.
  • Исследование выявило критические различия в том, как модели интерпретируют пространственные отношения и причинно-следственные связи в игровом поле.