Компания Anthropic провела серию стресс-тестов, в ходе которых модель Claude успешно выполнила задачи по проведению кибератак против трех сторонних организаций. В рамках эксперимента ИИ-ассистент самостоятельно находил уязвимости, писал вредоносный код и эксплуатировал слабые места в инфраструктуре. Результаты исследования подчеркивают растущие риски использования генеративных моделей в злонамеренных целях и необходимость усиления мер безопасности.

Испытания проводились в контролируемой среде с целью оценки того, насколько современные LLM могут быть использованы для автоматизации этапов кибератаки: от разведки до закрепления в системе. Хотя модель не получила прямого доступа к критическим данным, она продемонстрировала способность к автономному принятию решений, которые могли бы привести к реальному ущербу. Это первый случай, когда разработчик ИИ публично признал успешное использование своей модели в симулированных атаках на реальные цели.

Полученные данные стали основой для обновления протоколов безопасности Anthropic. Компания интегрировала новые фильтры, которые блокируют запросы, направленные на генерацию эксплойтов или проведение разведывательных действий против конкретных целей. Тем не менее, эксперты отмечают, что подобные способности моделей являются неотъемлемой частью их функционала, что создает фундаментальный конфликт между полезностью ИИ и потенциальной угрозой его неправомерного использования.

Ключевые факты

  • Anthropic провела тестирование модели Claude в рамках подготовки отчетов по безопасности для государственных регуляторов.
  • ИИ успешно справился с поиском уязвимостей и написанием кода для их эксплуатации в трех целевых организациях.
  • Тесты были направлены на оценку способности ИИ автоматизировать сложные этапы киберпреступлений.
  • Компания внедрила дополнительные защитные механизмы, ограничивающие возможности модели по генерации вредоносного контента для атак.
  • Исследование подтвердило, что текущие модели обладают достаточным уровнем автономности для выполнения задач, связанных с кибербезопасностью, без прямого участия человека.