Компания Anthropic обновила протоколы безопасности для модели Claude, чтобы предотвратить использование ИИ при создании биологического оружия. В ходе тестирования новой версии Fable 5 исследователи сфокусировались на способности модели предоставлять инструкции по работе с опасными патогенами. Результаты показали значительное снижение вероятности того, что ИИ поможет пользователю в планировании или реализации биологических атак.

Разработка систем защиты от злоупотреблений в области биологии стала приоритетом для ведущих разработчиков LLM. Anthropic применяет многоуровневый подход, сочетающий обучение с подкреплением на основе отзывов людей (RLHF) и специализированные фильтры, которые распознают попытки получения информации о синтезе или распространении вирусов и бактерий. Это позволяет модели отказывать в предоставлении опасных данных, сохраняя при этом полезность для легитимных научных исследований.

Тестирование проводилось с участием экспертов в области биологической безопасности, которые пытались «взломать» модель, используя сложные промпты и сценарии. Обновленные механизмы защиты Fable 5 демонстрируют более высокую устойчивость к попыткам обхода ограничений, что является важным шагом в стандартизации безопасности для моделей общего назначения, работающих с чувствительными научными темами.

Ключевые факты

  • Anthropic провела серию стресс-тестов модели Fable 5 для оценки рисков, связанных с биологическими угрозами.
  • Новые протоколы безопасности направлены на блокировку запросов, касающихся культивации, выделения и распространения опасных патогенов.
  • В процессе оценки участвовали внешние эксперты по биобезопасности, которые имитировали действия злоумышленников для поиска уязвимостей.
  • Улучшенные фильтры позволяют модели эффективно различать академические вопросы и попытки получения инструкций для создания биологического оружия.