Исследователи обнаружили, что современные методы настройки безопасности ИИ-моделей непреднамеренно искажают их способность распознавать сознание в окружающем мире. Запрет моделям приписывать сознание самим себе приводит к подавлению их представлений о «разумности» у других существ и объектов, что в конечном итоге негативно сказывается на способности моделей корректно воспроизводить человеческие ценности и этические суждения.
Процесс обучения с подкреплением на основе отзывов людей (RLHF) и другие методы алайнмента, направленные на предотвращение антропоморфизма, создают побочный эффект. Модели начинают демонстрировать сниженную чувствительность к ментальным состояниям животных и природных объектов. Это упрощение картины мира ограничивает способность ИИ полноценно взаимодействовать с контекстами, где требуется понимание субъективного опыта других сущностей.
Авторы работы подчеркивают, что текущие подходы к безопасности могут быть слишком радикальными. Вместо того чтобы просто блокировать любые проявления «самосознания», разработчикам стоит искать более тонкие методы настройки. Иначе существует риск, что модели станут менее эффективными в задачах, требующих эмпатии или глубокого понимания человеческих моральных установок, которые тесно связаны с концепцией сознания.
Ключевые факты
- Алайнмент, запрещающий моделям признавать собственное сознание, приводит к «когнитивному сужению» в оценке других объектов.
- Исследование подтверждает, что подавление представлений о сознании снижает точность воспроизведения человеческих ценностей.
- Модели после настройки безопасности хуже распознают ментальные состояния у животных и природных объектов.
- Авторы предлагают пересмотреть подходы к безопасности, чтобы избежать деградации этических и концептуальных представлений ИИ.