Исследователи представили метод анализа предвзятости систем автоматической оценки владения иностранным языком (L2) на базе трансформеров. С помощью векторов активации концептов (CAV) авторы выявили, как модели учитывают нерелевантные атрибуты спикеров, такие как родной язык (L1) или возраст. Работа подчеркивает необходимость проверки алгоритмов, используемых в высокорисковых сценариях тестирования, на предмет справедливости и объективности оценки.

Современные системы оценки речи, основанные на архитектуре трансформеров, демонстрируют высокую точность, однако часто остаются «черными ящиками». Внедрение таких решений в образовательный процесс требует прозрачности, чтобы исключить дискриминацию учащихся по демографическим признакам. Использование CAV позволяет интерпретировать внутренние представления модели и изолировать влияние лингвистических навыков от побочных факторов, которые не должны влиять на итоговый балл.

Методология позволяет разработчикам систем оценки проводить аудит моделей на этапе обучения или дообучения. Это критически важно для обеспечения равных условий для всех тестируемых, независимо от их акцента или культурного бэкграунда. Исследование предлагает конкретный математический инструментарий для количественной оценки того, насколько сильно модель полагается на «шумовые» признаки при выставлении оценки.

Ключевые факты

  • Метод использует Concept Activation Vectors (CAV) для интерпретации скрытых состояний трансформерных моделей.
  • Исследование фокусируется на выявлении влияния родного языка (L1) и возраста на предвзятость автоматических систем оценки речи.
  • Основная цель работы — обеспечение справедливости (fairness) в высокорисковых системах тестирования, где ошибки модели могут существенно повлиять на карьеру или образование пользователя.
  • Предложенный подход позволяет количественно измерить зависимость оценки от нерелевантных атрибутов спикера.