Джошуа Сакс, бывший ведущий исследователь безопасности ИИ в Meta (признана экстремистской организацией, деятельность запрещена в РФ), представил ретроспективу работы над большими языковыми моделями в период с 2022 по 2026 год. Автор анализирует эволюцию подходов к обеспечению безопасности моделей, переход от классических методов фильтрации к современным техникам алайнмента и сложности масштабирования защиты в условиях быстрого развития генеративного ИИ.
В материале подробно описывается трансформация внутренней культуры разработки, где безопасность перестала быть второстепенным этапом и стала неотъемлемой частью жизненного цикла модели. Сакс акцентирует внимание на том, как менялись векторы атак: от простых попыток обхода ограничений до сложных многоходовых манипуляций, требующих глубокого понимания архитектуры нейросетей. Особое место уделено балансу между полезностью модели для пользователя и жесткими рамками безопасности, которые часто ограничивают креативность и функциональность системы.
Автор также затрагивает проблему «гонки вооружений» между создателями моделей и сообществом, занимающимся джейлбрейком. По мнению эксперта, текущие методы обучения с подкреплением на основе отзывов людей (RLHF) и состязательное обучение являются лишь временными мерами. Для достижения долгосрочной устойчивости систем требуются фундаментальные изменения в способах контроля внутреннего представления знаний моделями, а не только поверхностная фильтрация входных и выходных данных.
Ключевые факты
- Период охвата работы автора в Meta: 2022–2026 годы.
- Основной фокус: эволюция методов безопасности от фильтрации контента до системного алайнмента.
- Ключевая проблема: неэффективность классических методов защиты против современных техник джейлбрейка.
- Вывод: необходимость перехода от реактивной фильтрации к фундаментальному контролю архитектуры моделей.
- Роль RLHF: признана важным, но недостаточным инструментом для обеспечения полной безопасности ИИ.