Исследователи выявили фундаментальную проблему в системах автоматизированного научного поиска, которые полагаются на краткосрочную оптимизацию экспериментов. Использование метрик вроде ожидаемого прироста информации на единицу затрат часто приводит к неэффективным решениям. Авторы предлагают концепцию Capability-Gated Planning, позволяющую системам лучше оценивать долгосрочную ценность действий, которые не приносят мгновенного результата, но открывают доступ к новым методам исследования.
Современные автономные агенты, занимающиеся научными открытиями, часто работают по принципу «близорукого» выбора (myopic selection). Они выбирают следующий шаг, максимизируя локальную полезность, что позволяет быстро получать промежуточные данные. Однако такой подход игнорирует конструктивные действия — шаги, которые сами по себе не дают новых знаний, но создают инфраструктуру или инструменты для будущих, более масштабных прорывов.
В работе показано, что без учета «стоимости достижения цели» (cost-to-goal) системы склонны застревать в локальных минимумах, выбирая простые, но малозначимые эксперименты. Новый метод планирования позволяет агентам осознанно инвестировать ресурсы в подготовку среды и инструментов, что критически важно для сложных многоэтапных задач, где успех зависит от последовательного накопления возможностей, а не от случайного перебора гипотез.
Ключевые факты
- Выявлена структурная неэффективность алгоритмов, максимизирующих только ожидаемый прирост информации на единицу стоимости.
- Предложен подход Capability-Gated Planning для оценки действий, которые расширяют возможности системы, а не дают прямой результат.
- Обоснована необходимость перехода от миопического выбора к долгосрочному планированию в автоматизированных лабораториях.
- Исследование подчеркивает важность «конструктивных действий», которые создают базу для будущих научных открытий.