Anthropic опубликовала системную карту (System Card) для модели Claude 3.5 Opus, подробно описывающую подходы к обеспечению безопасности и оценке рисков. Документ раскрывает методологию тестирования модели на предмет склонности к опасным действиям, включая кибератаки, биологические угрозы и манипулятивное поведение, а также демонстрирует результаты работы механизмов защиты при взаимодействии с пользователями.

Системная карта представляет собой детальный отчет о том, как компания проводит «красные команды» (red teaming) для выявления уязвимостей до публичного релиза. В материале разбираются конкретные сценарии, в которых модель может потенциально нарушить политики безопасности, и объясняется, как именно разработчики настраивали систему для минимизации таких рисков. Особое внимание уделено способности модели следовать сложным инструкциям без выхода за рамки установленных ограничений.

Публикация подчеркивает переход к более прозрачному подходу в оценке возможностей продвинутых LLM. Anthropic делится данными о том, как Claude 3.5 Opus справляется с задачами, требующими высокого уровня рассуждения, и какие меры предосторожности были приняты для предотвращения злоупотреблений в критических областях. Это позволяет лучше понять архитектурные приоритеты компании при создании моделей следующего поколения.

Ключевые факты

  • Anthropic провела многоуровневое тестирование Claude 3.5 Opus на устойчивость к генерации вредоносного кода и инструкций по созданию опасных веществ.
  • В отчете задокументированы результаты оценки модели в условиях попыток обхода фильтров безопасности (jailbreak) с использованием методов социальной инженерии.
  • Методология включает как автоматизированные бенчмарки, так и экспертную оценку специалистов по кибербезопасности и биологическим рискам.
  • Системная карта подтверждает, что модель демонстрирует значительное снижение вероятности выполнения запросов, нарушающих политику использования, по сравнению с предыдущими версиями.