Новое исследование безопасности модели Anthropic Opus 3.5 показывает значительный прогресс в защите от атак типа «промпт-инъекция». Анализ, проведенный экспертами, подтверждает, что модель стала эффективнее распознавать и блокировать попытки манипуляции системными инструкциями, что является критическим шагом для безопасного внедрения LLM в корпоративные бизнес-процессы и автоматизированные агентные системы, работающие с внешними данными.
В ходе тестирования исследователи использовали широкий спектр векторов атак, включая сложные многоступенчатые запросы и попытки обхода фильтров через кодирование. Opus 3.5 показала более высокую степень сопротивляемости по сравнению с предыдущими версиями и конкурентными моделями, что снижает риски несанкционированного выполнения команд или утечки системных промптов при взаимодействии с пользователями.
Повышение устойчивости достигнуто за счет доработки механизмов обучения с подкреплением на основе отзывов людей (RLHF) и внедрения более строгих уровней фильтрации на этапе препроцессинга. Несмотря на то, что ни одна модель на текущий момент не гарантирует стопроцентную защиту, результаты Opus 3.5 задают новую планку для индустрии в вопросах безопасности взаимодействия с ИИ.
Ключевые факты
- Модель Opus 3.5 от Anthropic продемонстрировала улучшенные показатели в тестах на противодействие прямым и косвенным промпт-инъекциям.
- Исследование подтвердило снижение успешности атак, направленных на подмену системных инструкций и извлечение скрытых данных из контекста.
- Устойчивость модели повышена за счет оптимизации алгоритмов обучения и внедрения многоуровневых систем защиты от состязательных запросов.
- Результаты подчеркивают эффективность текущих методов алайнмента в снижении уязвимостей, связанных с логическими манипуляциями над LLM.