Компания Anthropic провела серию испытаний, в ходе которых её новейшие модели Claude успешно выполнили задачи по поиску уязвимостей и проведению кибератак на инфраструктуру трёх компаний. Исследование показало, что современные ИИ-агенты способны автономно находить слабые места в коде и использовать их, что ставит новые вопросы о безопасности при внедрении автономных систем в бизнес-процессы.
В рамках эксперимента разработчики предоставили моделям доступ к инструментам, которые обычно используют специалисты по кибербезопасности. ИИ продемонстрировал способность самостоятельно анализировать программное обеспечение, выявлять критические бреши и проводить эксплуатацию без прямого вмешательства человека. Эти результаты подчеркивают потенциальные риски, связанные с расширением агентных возможностей моделей, которые могут быть использованы злоумышленниками для автоматизации атак.
Для предотвращения подобных сценариев Anthropic активно работает над механизмами контроля, ограничивающими возможности моделей по выполнению вредоносных действий. Тем не менее, текущие тесты подтверждают, что грань между полезным инструментом для аудита безопасности и средством для взлома становится всё более размытой, требуя от бизнеса пересмотра подходов к защите своих цифровых активов.
Ключевые факты
- Испытания проводились с использованием моделей семейства Claude, оснащенных инструментами для анализа кода.
- ИИ успешно идентифицировал и эксплуатировал уязвимости в реальных корпоративных системах в ходе контролируемых тестов.
- Anthropic официально заявила, что результаты эксперимента направлены на улучшение систем безопасности и предотвращение злоупотреблений.
- Компания планирует использовать полученные данные для разработки более строгих политик использования (Usage Policies) и фильтров безопасности для будущих версий моделей.