Разработчики представили Fitter — инструмент для автоматизации парсинга веб-данных, который делегирует написание конфигураций LLM. Вместо создания классических скриптов на Python или JavaScript, система использует языковые модели для формирования JSON-конфигов, определяющих структуру извлечения контента. Это упрощает поддержку парсеров при изменении верстки сайтов и ускоряет процесс настройки под новые задачи.

Основная идея проекта заключается в отделении логики парсинга от кода. Пользователь описывает целевые данные, а модель подбирает селекторы и правила обработки, которые затем исполняются движком. Такой подход позволяет создавать гибкие пайплайны сбора данных, устойчивые к динамическим изменениям фронтенда, что критически важно для наполнения RAG-систем и обучения моделей актуальной информацией из сети.

Инструмент ориентирован на интеграцию в агентные рабочие процессы, где требуется автономный сбор данных без постоянного участия инженера. Использование конфигурационного подхода снижает порог входа для настройки сложных сценариев парсинга и позволяет динамически адаптировать правила сбора под различные типы ресурсов в рамках одного агентного цикла.

Ключевые факты

  • Fitter использует LLM для автоматической генерации JSON-конфигураций, описывающих логику извлечения данных.
  • Система исключает необходимость написания кастомного кода для каждого нового сайта, заменяя его декларативным описанием.
  • Инструмент оптимизирован для работы в агентных средах, требующих автономного сбора и структурирования данных.
  • Проект доступен в формате open-source на GitHub для интеграции в существующие инфраструктуры обработки данных.