Исследование Rakuen Software сравнивает эффективность популярных локальных моделей при извлечении фактов из неструктурированного текста. В тесте участвовали модели Llama 3, Mistral, Phi-3 и Gemma, оцениваемые по точности парсинга данных в JSON. Результаты показывают, что выбор архитектуры и размера модели критически влияет на качество извлечения, при этом некоторые компактные модели демонстрируют результаты, сопоставимые с более тяжелыми аналогами.
Авторы сосредоточились на практическом сценарии: превращении текстовых описаний в строгие JSON-схемы. Это одна из наиболее востребованных задач при построении RAG-систем и автоматизации обработки документов. В ходе эксперимента проверялась устойчивость моделей к формату вывода и их способность придерживаться заданных ограничений без галлюцинаций, что является ключевым барьером при работе с локальным инференсом.
Результаты подчеркивают важность выбора модели под конкретную задачу. В то время как крупные модели показывают высокую точность в сложных логических цепочках, компактные решения (до 8 млрд параметров) часто оказываются эффективнее для задач классификации и извлечения сущностей благодаря низким задержкам и меньшим требованиям к вычислительным ресурсам. Исследование также затрагивает влияние промпт-инжиниринга на стабильность ответов в локальных средах.
Ключевые факты
- В тестировании участвовали модели Llama 3 (8B), Mistral (7B), Phi-3 (3.8B) и Gemma (2B/7B).
- Основной метрикой стала способность моделей корректно возвращать валидный JSON без дополнительных пояснений.
- Выявлено, что модели с меньшим количеством параметров требуют более строгих системных промптов для предотвращения генерации лишнего текста.
- Исследование подтверждает, что локальные модели способны заменить облачные API в задачах извлечения данных при условии правильного подбора квантованной версии модели.