Бывший исследователь OpenAI Эндрю Хо и ученый из Кембриджа Адам Хант запускают стартап, ориентированный на создание специализированных наборов данных. Эксперты прогнозируют, что в ближайшие годы индустрия инвестирует до 100 миллиардов долларов в качественные данные, так как простое масштабирование моделей перестает давать качественный прирост универсальности, приводя лишь к узкой специализации ИИ в кодинге и математике.

Проблема заключается в том, что современные большие языковые модели демонстрируют признаки стагнации или даже регресса в областях, не связанных с их основным обучением. Вместо того чтобы становиться более гибкими, системы «затачиваются» под конкретные задачи, что ограничивает их применимость в широком спектре интеллектуальных процессов. Авторы инициативы считают, что будущее ИИ зависит не только от вычислительных мощностей, но и от фундаментального изменения подходов к подготовке обучающих выборок.

Инвестиции в данные становятся новым стратегическим приоритетом для лабораторий ИИ. Переход от парадигмы «больше данных — лучше модель» к стратегии «качественные и специализированные данные — эффективнее модель» может стать ключевым драйвером развития индустрии в ближайшее десятилетие. Это потребует создания новых инфраструктурных решений для сбора, фильтрации и синтеза высокоточных обучающих материалов.

Ключевые факты

  • Эндрю Хо покинул OpenAI, чтобы основать компанию, специализирующуюся на подготовке данных для обучения нейросетей.
  • Прогноз инвестиций в специализированные обучающие данные достигает 100 миллиардов долларов.
  • Текущие модели показывают высокую эффективность в программировании и математике, но теряют универсальность в других дисциплинах.
  • Исследователи подчеркивают, что масштабирование вычислительных мощностей без улучшения качества данных достигло предела эффективности.