Команда FermiSense продемонстрировала, что специализированное дообучение компактной модели с 9 миллиардами параметров с использованием обучения с подкреплением (RL) позволяет превзойти проприетарные модели уровня GPT-4 в узкоспециализированных задачах. Бюджет эксперимента составил всего 500 долларов, что доказывает высокую эффективность дообучения открытых архитектур для автоматизации бизнес-процессов, требующих глубокой экспертизы в анализе товарных каталогов.

В основе подхода лежит использование метода RL для настройки модели на специфические критерии оценки качества контента. В отличие от стандартных моделей общего назначения, которые часто ошибаются при работе с узкими отраслевыми данными, дообученная система показала более высокую точность в выявлении несоответствий в описаниях товаров и проверке атрибутов. Это позволяет компаниям снизить зависимость от дорогостоящих API и внедрять локальные решения с предсказуемым поведением.

Результаты исследования подчеркивают сдвиг в сторону использования небольших, но узкоспециализированных моделей. Вместо попыток адаптировать огромные языковые модели под все задачи бизнеса, разработчики могут достигать лучших метрик качества, фокусируясь на качественных наборах данных и эффективных методах дообучения, что значительно сокращает операционные расходы на инференс.

Ключевые факты

  • Использовалась открытая модель с 9 миллиардами параметров (9B).
  • Стоимость процесса дообучения с применением RL составила 500 долларов.
  • Модель показала превосходство над frontier-моделями в задачах review товарных каталогов.
  • Метод позволяет значительно снизить затраты на автоматизацию процессов контроля качества данных в ритейле.