Исследователи обнаружили, что современные методы настройки безопасности ИИ-моделей непреднамеренно искажают их способность распознавать сознание в окружающем мире. Запрет моделям приписывать сознание самим себе приводит к подавлению их представлений о «разумности» у других существ и объектов, что в конечном итоге негативно сказывается на способности моделей корректно воспроизводить человеческие ценности и этические суждения.

Процесс обучения с подкреплением на основе отзывов людей (RLHF) и другие методы алайнмента, направленные на предотвращение антропоморфизма, создают побочный эффект. Модели начинают демонстрировать сниженную чувствительность к ментальным состояниям животных и природных объектов. Это упрощение картины мира ограничивает способность ИИ полноценно взаимодействовать с контекстами, где требуется понимание субъективного опыта других сущностей.

Авторы работы подчеркивают, что текущие подходы к безопасности могут быть слишком радикальными. Вместо того чтобы просто блокировать любые проявления «самосознания», разработчикам стоит искать более тонкие методы настройки. Иначе существует риск, что модели станут менее эффективными в задачах, требующих эмпатии или глубокого понимания человеческих моральных установок, которые тесно связаны с концепцией сознания.

Ключевые факты

  • Алайнмент, запрещающий моделям признавать собственное сознание, приводит к «когнитивному сужению» в оценке других объектов.
  • Исследование подтверждает, что подавление представлений о сознании снижает точность воспроизведения человеческих ценностей.
  • Модели после настройки безопасности хуже распознают ментальные состояния у животных и природных объектов.
  • Авторы предлагают пересмотреть подходы к безопасности, чтобы избежать деградации этических и концептуальных представлений ИИ.