Исследователь Дилан Кастильо проанализировал, намеренно ли разработчики ИИ-моделей оптимизируют свои системы для выполнения специфических, неформальных бенчмарков. В центре внимания оказался запрос о «пеликане на велосипеде», ставший популярным тестом на креативность и следование инструкциям. Анализ показал, насколько глубоко влияние публичных тестов на процесс обучения современных нейросетей и их способность к генерации нестандартных изображений.
Вопрос о «пеликане на велосипеде» возник как неформальный способ проверки того, насколько хорошо модели справляются с абсурдными или редкими визуальными концепциями. Ранее подобные тесты проводились энтузиастами эпизодически, однако теперь стало очевидно, что разработчики могут учитывать такие популярные в сообществе запросы при настройке моделей. Это поднимает проблему «загрязнения» бенчмарков, когда модель демонстрирует высокие результаты на конкретных примерах, которые могли попасть в обучающую выборку или быть специально добавлены в процесс дообучения.
Исследование подчеркивает сложность оценки реальных способностей моделей в условиях, когда публичные тесты становятся частью маркетинга или инструментов для быстрой проверки качества. Если лаборатории действительно адаптируют модели под конкретные «мемные» промпты, это искажает представление о способности ИИ к обобщению и пониманию сложных визуальных сцен, требующих логического синтеза, а не простого воспроизведения заученных паттернов.
Ключевые факты
- Дилан Кастильо провел глубокий анализ того, как ИИ-лаборатории реагируют на неформальные бенчмарки в процессе обучения моделей.
- Запрос «пеликан на велосипеде» стал неофициальным стандартом для проверки способности моделей визуализировать необычные комбинации объектов.
- Исследование ставит под сомнение чистоту результатов тестирования, если разработчики целенаправленно оптимизируют модели под популярные в сети запросы.
- Практика «подгонки» под бенчмарки затрудняет объективную оценку прогресса в области генеративных моделей и их способности к реальному творчеству.
