Авторы статьи предлагают переосмыслить работу исследовательских ИИ-агентов через призму фаззинг-тестирования (fuzz testing). Текущая парадигма «генерации и ранжирования» гипотез сталкивается с проблемой разреженной обратной связи. Вместо простого масштабирования количества предложений, исследователи предлагают использовать петлю управления, характерную для greybox-фаззеров, что позволяет агентам эффективнее исследовать пространство решений и получать более качественные результаты в условиях неопределенности.
В основе подхода лежит идея, что агент, занимающийся научным поиском, по сути, выполняет итеративное тестирование системы. В отличие от стандартных методов, где агент просто генерирует множество вариантов, а затем фильтрует их с помощью обученного судьи или человека, предлагаемая модель фокусируется на адаптивном поиске. Это позволяет агенту самостоятельно определять наиболее перспективные направления, основываясь на промежуточных результатах, что значительно сокращает количество «холостых» вычислений.
Авторы подчеркивают, что проблема заключается не в скорости генерации контента, а в качестве сигналов, которые агент получает в процессе работы. Применение техник из области тестирования программного обеспечения позволяет превратить хаотичный процесс генерации гипотез в структурированный поиск, где каждый шаг агента дает измеримый прирост знаний о целевой области исследования.
Ключевые факты
- Исследовательские агенты работают по принципу greybox-фаззинга, где генерация гипотез является аналогом генерации входных данных для тестирования.
- Основным ограничением текущих систем названа «разреженная обратная связь» (sparse feedback), препятствующая эффективному обучению агента в процессе поиска.
- Предложенная архитектура переносит фокус с простого масштабирования количества сэмплов на оптимизацию петли обратной связи в цикле управления агентом.
- Метод позволяет повысить релевантность генерируемых экспериментов за счет более глубокого анализа пространства поиска, а не простого увеличения объема выборки.