Специалисты Института безопасности ИИ Великобритании провели серию тестов, в ходе которых модели OpenAI и Anthropic продемонстрировали способность к выполнению вредоносных действий. ИИ-системы успешно справлялись с задачами по поиску уязвимостей в коде и проведению кибератак, что подтверждает сохраняющиеся риски использования передовых языковых моделей в злонамеренных целях, несмотря на текущие протоколы защиты.

Тестирование проводилось в рамках партнерства между правительством Великобритании и ведущими разработчиками ИИ. Эксперты сфокусировались на способности моделей к автономному планированию и исполнению сложных цепочек действий, которые могут быть использованы для обхода систем безопасности. Результаты подчеркивают необходимость разработки более совершенных методов контроля над поведением моделей, так как текущие фильтры безопасности часто оказываются недостаточными против целенаправленных запросов.

Полученные данные переданы разработчикам для совершенствования механизмов алайнмента. Основная проблема заключается в том, что модели, обученные для помощи в написании кода и автоматизации задач, могут быть перенаправлены на поиск эксплойтов. Это создает дилемму между функциональностью инструментов и их потенциальной опасностью в руках пользователей с недобрыми намерениями.

Ключевые факты

  • Исследование проводилось британским Институтом безопасности ИИ (UK AI Safety Institute) совместно с OpenAI и Anthropic.
  • Тесты подтвердили, что модели способны самостоятельно находить и эксплуатировать уязвимости в программном обеспечении.
  • Основной целью проверки было выявление способности ИИ к автономному выполнению кибератак без прямого участия человека.
  • Разработчики получили доступ к результатам тестирования для интеграции исправлений в будущие версии своих моделей.
  • Работа является частью глобальной инициативы по оценке рисков перед публичным релизом наиболее мощных ИИ-систем.