Исследователи представили метод Fairness Pruning, позволяющий выявлять и корректировать демографические искажения в больших языковых моделях. Технология фокусируется на анализе слоев GLU-MLP, используя дифференциальную активацию нейронов при обработке контрастных пар промптов. Это позволяет точно локализовать источники предвзятости внутри архитектуры модели без необходимости её полного переобучения, обеспечивая более прозрачное управление этическими аспектами работы ИИ.
Метод опирается на анализ активаций в режиме инференса. Исследователи обнаружили, что определенные нейроны в полносвязных слоях моделей напрямую коррелируют с проявлением демографических стереотипов. Идентифицируя эти узлы, разработчики могут применять структурные вмешательства, отключая или модифицируя «проблемные» компоненты, что снижает уровень нежелательных искажений в ответах модели при минимальном влиянии на её общую производительность и когнитивные способности.
Подход предлагает альтернативу традиционным методам обучения с подкреплением на основе отзывов людей (RLHF), которые часто скрывают предвзятость, а не устраняют её на уровне архитектуры. Локализация через дифференциальные активации позволяет проводить аудит моделей на предмет скрытых паттернов поведения, делая процесс настройки более предсказуемым и математически обоснованным.
Ключевые факты
- Метод Fairness Pruning направлен на работу со слоями GLU-MLP, которые являются стандартными компонентами современных архитектур трансформеров.
- В основе подхода лежит использование минимально контрастных пар промптов для выявления различий в активации нейронов.
- Технология позволяет проводить структурную коррекцию модели без необходимости дорогостоящего дообучения на огромных массивах данных.
- Исследование подтверждает возможность точной локализации «демографически предвзятых» нейронов, что упрощает аудит безопасности и этичности ИИ-систем.