Запущен проект PhantomLogin — платформа для публичного тестирования автономных агентов в задачах наступательной кибербезопасности. Система представляет собой «черный ящик», где ИИ-агенты должны преодолевать реальные защитные механизмы в режиме реального времени. Проект направлен на объективную оценку способностей моделей к поиску уязвимостей и эксплуатации систем без участия человека.

В отличие от статических тестов, PhantomLogin фокусируется на динамической среде, имитирующей современные корпоративные инфраструктуры. Агенты сталкиваются с задачами, требующими многошагового планирования, обхода фильтров и адаптации к меняющимся условиям защиты. Это позволяет исследователям увидеть реальную эффективность LLM в сценариях, максимально приближенных к боевым условиям пентестинга.

Платформа предоставляет открытый доступ к результатам, позволяя сравнивать различные архитектуры агентов и их способность к автономному выполнению сложных цепочек действий. Такой подход помогает выявить критические пробелы в текущих возможностях моделей, особенно в задачах, где требуется глубокое понимание сетевых протоколов и логики безопасности.

Ключевые факты

  • Платформа PhantomLogin создана для тестирования наступательных ИИ-агентов в условиях «черного ящика».
  • Основная задача агентов — автономное преодоление защитных механизмов и эксплуатация уязвимостей.
  • Тестирование проводится в динамической среде, имитирующей реальные корпоративные сети.
  • Проект нацелен на выявление реальных возможностей моделей в многошаговом планировании и кибербезопасности.
  • Результаты тестов доступны для публичного анализа и сравнения эффективности различных ИИ-систем.