Исследователи проанализировали эффективность систем автоматизированного поиска, таких как OpenEvolve и TTT-Discover, и пришли к выводу об отсутствии универсально превосходящего метода. Авторы подчеркивают, что текущие системы представляют собой сложные комбинации стратегий выбора родителей, управления архивами и распределения вычислительного бюджета, что делает их сравнение крайне затруднительным из-за высокой стоимости запусков и стохастической природы процессов.
В работе отмечается, что существующие подходы часто сравниваются на ограниченном количестве экспериментов, что не позволяет выявить объективные преимущества конкретных архитектур. Вместо поиска «идеального» алгоритма авторы предлагают рассматривать системы автоматизированного поиска как модульные конструкторы. Такой подход позволяет гибко адаптировать компоненты под конкретные задачи, вместо слепого использования готовых «рецептов», которые могут быть неэффективны в специфических условиях.
Результаты исследования указывают на необходимость стандартизации методов оценки в области автоматизированного научного открытия. Поскольку каждый запуск требует значительных вычислительных ресурсов, авторы настаивают на внедрении более строгих статистических протоколов для валидации результатов. Это позволит исследователям лучше понимать, какие именно компоненты системы вносят основной вклад в успех эксперимента, а какие являются избыточными или контрпродуктивными.
Ключевые факты
- Системы OpenEvolve и TTT-Discover были проанализированы как примеры комплексных «рецептов» для автоматизированного поиска.
- Основная проблема текущих методов заключается в их стохастичности и высокой стоимости каждого отдельного экспериментального запуска.
- Исследование доказывает, что выбор стратегии архивирования и отбора родителей критически зависит от конкретной целевой задачи.
- Авторы призывают к переходу от оценки «черных ящиков» к модульному анализу компонентов систем автоматизированного открытия.
- Работа подчеркивает необходимость увеличения статистической мощности тестов для корректного сравнения различных архитектур поиска.