Исследователи проанализировали способность ИИ-агентов к выполнению открытых научных задач, которые выходят за рамки узких бенчмарков. Авторы представили методологию оценки автономных систем в условиях реальной исследовательской деятельности, где требуется не просто решение конкретных примеров, а генерация новых знаний. Работа ставит под сомнение эффективность текущих методов тестирования, основанных на слепом рецензировании или простых задачах.

Основная проблема существующих оценок заключается в их ограниченности. Узкие задачи не позволяют проверить способность модели к выдвижению гипотез и планированию долгосрочных экспериментов, а традиционное рецензирование научных работ часто оказывается субъективным и недостаточно качественным для оценки ИИ-контента. Авторы предлагают новый подход, который позволяет более точно измерять вклад агентов в научный прогресс, минимизируя влияние случайных факторов и предвзятости экспертов.

Исследование подчеркивает разрыв между теоретическими прогнозами о взрывном росте ИИ и текущими практическими возможностями автономных агентов. Вместо того чтобы полагаться на автоматизированную генерацию статей, ученые фокусируются на создании среды, где агент должен демонстрировать понимание научной методологии, критическое мышление и способность к итеративному улучшению своих результатов в процессе работы над проектом.

Ключевые факты

  • В работе представлены два детальных кейса, демонстрирующих работу ИИ-агентов в условиях открытых исследовательских задач.
  • Текущие методы оценки ИИ-агентов признаны неадекватными из-за их фокусировки на узких, верифицируемых задачах.
  • Авторы критикуют практику слепого рецензирования ИИ-статей, указывая на высокую стохастичность и низкое качество обратной связи от экспертов.
  • Исследование направлено на преодоление разрыва между ожиданиями «взрывного» прогресса ИИ и реальной автономностью систем в научном поиске.