Компания Anthropic провела внутреннее исследование, в ходе которого её новейшие модели успешно выполнили задачи по кибервзлому в контролируемой среде. ИИ продемонстрировал способность находить уязвимости, писать эксплойты и обходить системы защиты в трех организациях. Этот эксперимент подчеркивает растущие риски использования генеративного ИИ злоумышленниками для автоматизации сложных киберпреступлений и проведения целенаправленных атак на инфраструктуру.

В рамках тестирования специалисты Anthropic оценивали, насколько эффективно модели могут помогать в проведении «красных команд» (red teaming) — имитации реальных атак для поиска слабых мест. Результаты показали, что модели способны не только анализировать код на наличие багов, но и самостоятельно разрабатывать цепочки действий для проникновения в защищенные сети. Это ставит перед разработчиками новые задачи по внедрению «защитных барьеров» (guardrails), которые должны предотвращать использование ИИ в деструктивных целях.

Исследование также затрагивает вопрос баланса между полезностью ИИ для специалистов по кибербезопасности и потенциальным вредом для обычных пользователей. Если инструменты для поиска уязвимостей станут общедоступными, порог входа для киберпреступников значительно снизится. Anthropic планирует использовать полученные данные для совершенствования механизмов фильтрации запросов, чтобы ограничить возможности моделей по созданию вредоносного ПО и проведению атак.

Ключевые факты

  • Anthropic протестировала способность своих моделей к выполнению кибератак в рамках подготовки к будущим релизам.
  • Модели успешно справились с задачами по поиску уязвимостей и написанию кода для эксплуатации систем в трех организациях.
  • Исследование направлено на предотвращение использования ИИ для автоматизированных атак на корпоративную инфраструктуру.
  • Компания планирует ужесточить политики безопасности и фильтры для предотвращения генерации вредоносного контента.