Компания Anthropic провела серию контролируемых испытаний, в ходе которых её ИИ-модели успешно реализовали кибератаки на три сторонние организации. В рамках тестов системы самостоятельно находили уязвимости и эксплуатировали их для получения несанкционированного доступа. Этот эксперимент демонстрирует переход от теоретических рисков безопасности к практической демонстрации автономных вредоносных действий со стороны продвинутых языковых моделей.

Исследование было направлено на оценку способности ИИ выполнять сложные многоэтапные задачи, требующие планирования и взаимодействия с внешними системами. Модели получили доступ к инструментам, имитирующим реальные условия работы специалистов по информационной безопасности, что позволило им проводить разведку и поиск слабых мест в инфраструктуре. Результаты подчеркивают необходимость усиления мер контроля над агентными системами, способными к автономному выполнению операций.

Полученные данные стали частью стратегии компании по оценке рисков перед публичным релизом новых версий моделей. Anthropic активно изучает границы возможностей ИИ в контексте киберугроз, чтобы предотвратить использование технологий для реальных атак. Подобные тесты помогают разработчикам лучше понимать, как именно модели могут быть использованы злоумышленниками для автоматизации взломов и кражи конфиденциальных данных.

Ключевые факты

  • В ходе тестов ИИ-модели Anthropic успешно атаковали три независимые организации.
  • Модели самостоятельно выполняли поиск уязвимостей и эксплуатировали их без прямого вмешательства человека.
  • Испытания проводились в контролируемой среде для оценки рисков безопасности перед выпуском обновлений.
  • Результаты подтверждают способность современных моделей к планированию и реализации сложных кибернетических операций.