Исследователи проанализировали, насколько точно современные языковые модели способны идентифицировать этические ценности в конкретных жизненных ситуациях. В основе работы лежит классификация по десяти базовым ценностям Шварца. Тестирование проводилось на специально подготовленном наборе из 1000 русскоязычных текстов, что позволило оценить способность моделей к корректной интерпретации моральных аспектов в различных контекстах.

Авторы работы сосредоточились на проверке фундаментального навыка моделей — распознавании ценностного подтекста, который является базовым требованием для дальнейшей оценки этичности ответов ИИ. В отличие от предыдущих исследований, которые часто полагались на общие опросы, данный подход использует контролируемую задачу классификации (top-1 recognition). Это позволяет более точно понять, какие именно категории ценностей вызывают у моделей наибольшие трудности при интерпретации.

Результаты исследования показывают, что модели демонстрируют разную степень уверенности при работе с различными типами ценностей. Понимание того, где именно возникают когнитивные искажения или ошибки классификации, критически важно для настройки алайнмента и повышения предсказуемости поведения систем в социально значимых диалогах. Полученные данные дают основу для создания более совершенных бенчмарков, ориентированных на культурно-специфичные и этические аспекты работы ИИ.

Ключевые факты

  • Методология исследования базируется на десяти базовых ценностях по теории Шварца.
  • Тестовый набор данных включает 1000 уникальных русскоязычных ситуативных текстов.
  • Оценка проводилась как задача контролируемого распознавания (top-1 recognition).
  • Работа направлена на выявление конкретных ценностных категорий, в которых модели чаще всего допускают ошибки интерпретации.