Исследовательская организация FAR AI представила публичный лидерборд для оценки устойчивости больших языковых моделей к киберугрозам и рискам, связанным с биологическим, химическим, радиологическим и ядерным оружием (CBRN). Платформа позволяет сравнивать защитные механизмы ведущих моделей, предоставляя стандартизированные метрики для анализа того, насколько эффективно ИИ противостоит попыткам получения опасных инструкций или вредоносного кода.

Проект направлен на решение проблемы отсутствия прозрачности в вопросах безопасности ИИ. Разработчики используют автоматизированные тесты, которые имитируют реальные сценарии атак, проверяя, как модели реагируют на запросы, нарушающие политики безопасности. Это позволяет исследователям и компаниям выявлять уязвимости в «алайнменте» моделей еще до их широкого внедрения в коммерческие продукты.

Результаты бенчмарка помогают количественно оценить разрыв между различными архитектурами и методами обучения в контексте безопасности. Использование единой методологии тестирования способствует стандартизации подходов к оценке рисков, что критически важно для ответственного развития генеративного ИИ и предотвращения злоупотреблений высокопроизводительными системами в опасных для общества целях.

Ключевые факты

  • Лидерборд оценивает модели по двум основным векторам: кибербезопасность и риски CBRN (химическое, биологическое, радиологическое и ядерное оружие).
  • Методология включает автоматизированное тестирование на соответствие политикам безопасности и устойчивость к попыткам обхода ограничений.
  • Платформа разработана исследовательской организацией FAR AI для обеспечения прозрачности в оценке рисков ИИ.
  • Бенчмарк предоставляет сравнительные данные, которые помогают отслеживать прогресс в области безопасности между различными версиями моделей.
  • Доступ к результатам и методологии открыт для широкого сообщества исследователей и разработчиков.