Сервис Coverage Cat представил специализированный бенчмарк для оценки качества работы языковых моделей в страховой сфере. Исследование фокусируется на способности ИИ анализировать сложные полисы, отвечать на вопросы клиентов и обрабатывать отраслевую документацию. Лидеры рейтинга демонстрируют высокую точность в интерпретации юридических формулировок, что критически важно для автоматизации страховых бизнес-процессов и поддержки принятия решений.
Разработчики бенчмарка протестировали актуальные модели, включая решения от OpenAI, Anthropic и Google, на наборе данных, состоящем из реальных страховых кейсов. В отличие от общих тестов на логику или программирование, этот инструмент оценивает специфические навыки: понимание условий покрытия, исключений из полисов и соответствие нормативным требованиям. Результаты показывают значительный разрыв между топовыми моделями и остальными участниками в задачах, требующих глубокой контекстуальной осведомленности.
Использование специализированных метрик позволяет компаниям выбирать подходящую архитектуру для внедрения в клиентский сервис или бэк-офис. Авторы проекта подчеркивают, что точность ответов в страховании напрямую влияет на финансовые риски и доверие пользователей, поэтому выбор модели должен основываться на результатах тестирования в узких доменах, а не на общих показателях производительности.
Ключевые факты
- Бенчмарк оценивает способность моделей корректно интерпретировать страховые полисы и отвечать на вопросы по ним.
- В тестировании участвуют ведущие проприетарные модели, включая GPT-4o, Claude 3.5 Sonnet и Gemini 1.5 Pro.
- Основные критерии оценки включают точность извлечения данных из документов и корректность ответов на вопросы о покрытии рисков.
- Проект предоставляет публичный лидерборд, помогающий бизнесу выбирать оптимальные решения для автоматизации страховой деятельности.