Компания Anthropic обновила протоколы безопасности для модели Claude, чтобы предотвратить использование ИИ при создании биологического оружия. В ходе тестирования новой версии Fable 5 исследователи сфокусировались на способности модели предоставлять инструкции по работе с опасными патогенами. Результаты показали значительное снижение вероятности того, что ИИ поможет пользователю в планировании или реализации биологических атак.
Разработка систем защиты от злоупотреблений в области биологии стала приоритетом для ведущих разработчиков LLM. Anthropic применяет многоуровневый подход, сочетающий обучение с подкреплением на основе отзывов людей (RLHF) и специализированные фильтры, которые распознают попытки получения информации о синтезе или распространении вирусов и бактерий. Это позволяет модели отказывать в предоставлении опасных данных, сохраняя при этом полезность для легитимных научных исследований.
Тестирование проводилось с участием экспертов в области биологической безопасности, которые пытались «взломать» модель, используя сложные промпты и сценарии. Обновленные механизмы защиты Fable 5 демонстрируют более высокую устойчивость к попыткам обхода ограничений, что является важным шагом в стандартизации безопасности для моделей общего назначения, работающих с чувствительными научными темами.
Ключевые факты
- Anthropic провела серию стресс-тестов модели Fable 5 для оценки рисков, связанных с биологическими угрозами.
- Новые протоколы безопасности направлены на блокировку запросов, касающихся культивации, выделения и распространения опасных патогенов.
- В процессе оценки участвовали внешние эксперты по биобезопасности, которые имитировали действия злоумышленников для поиска уязвимостей.
- Улучшенные фильтры позволяют модели эффективно различать академические вопросы и попытки получения инструкций для создания биологического оружия.