Исследователи в области наступательной кибербезопасности сталкиваются с серьезными ограничениями при использовании LLM от OpenAI и Anthropic. Встроенные механизмы безопасности (guardrails) часто блокируют запросы, связанные с поиском уязвимостей и разработкой эксплойтов, что затрудняет легитимную работу экспертов по тестированию систем на проникновение и анализу защищенности программного обеспечения.
Специалисты отмечают, что жесткие фильтры моделей не всегда способны отличить этичное исследование от вредоносной активности. В результате эксперты вынуждены тратить время на обход ограничений или поиск альтернативных решений, что снижает эффективность поиска критических багов. Это создает парадоксальную ситуацию, когда инструменты, призванные повысить безопасность, препятствуют выявлению реальных угроз.
Проблема усугубляется тем, что разработчики моделей стремятся минимизировать риски злоупотребления ИИ, однако текущие методы фильтрации часто оказываются слишком грубыми. Исследователи подчеркивают необходимость создания специализированных режимов работы для профессионалов, которые позволили бы использовать потенциал больших языковых моделей без постоянных блокировок при решении задач по анализу кода и поиску векторов атак.
Ключевые факты
- OpenAI и Anthropic внедрили строгие фильтры безопасности, которые ограничивают генерацию контента, связанного с кибератаками.
- Исследователи наступательной безопасности сообщают о частых ложноположительных срабатываниях, блокирующих легитимные задачи по поиску уязвимостей.
- Текущие механизмы защиты моделей не имеют гибких настроек для верифицированных специалистов, работающих в сфере информационной безопасности.
- Ограничения вынуждают экспертов искать обходные пути, что замедляет процессы аудита и анализа защищенности систем.
