Компания Anthropic обновила модели Claude 3.5 Sonnet и Claude 3 Opus, добавив встроенные механизмы защиты от кибератак в реальном времени. Система автоматически блокирует запросы, направленные на создание вредоносного ПО, проведение фишинговых кампаний или эксплуатацию уязвимостей. Это решение направлено на предотвращение злоупотреблений генеративным ИИ в контексте киберпреступности, обеспечивая безопасную работу с моделями для широкого круга пользователей.
Новый функционал работает на уровне анализа входящих промптов и исходящих ответов. Если модель распознает попытку использования своих мощностей для подготовки кибератаки, она прерывает генерацию и выдает предупреждение о нарушении политики безопасности. Механизм интегрирован непосредственно в архитектуру инференса, что позволяет минимизировать задержки при проверке контента.
Разработчики подчеркивают, что внедрение этих мер является частью стратегии ответственного использования ИИ. Система настроена на выявление специфических паттернов, характерных для вредоносной активности, включая попытки написания обфусцированного кода или генерации текстов для социальной инженерии. При этом легитимные задачи по написанию кода или анализу безопасности остаются доступными.
Ключевые факты
- Защита внедрена для моделей Claude 3.5 Sonnet и Claude 3 Opus.
- Система работает в режиме реального времени, анализируя промпты на предмет вредоносных намерений.
- Блокировке подлежат запросы, связанные с созданием эксплойтов, фишингом и вредоносным ПО.
- Механизм интегрирован в инфраструктуру Anthropic для предотвращения злоупотреблений без существенного влияния на производительность.