Команда Thinking Machines представила стратегический подход к публикации моделей с открытыми весами, который позволяет сбалансировать доступность технологий и риски злоупотребления. Авторы предлагают внедрять многоуровневые механизмы контроля, включая технические ограничения на этапе обучения и пост-тренинга, чтобы минимизировать возможность использования ИИ в опасных целях, сохраняя при этом преимущества открытой экосистемы для инноваций.
Основная проблема текущей модели открытого распространения заключается в отсутствии инструментов для отзыва доступа или ограничения функциональности после того, как веса модели оказались в публичном доступе. Предложенная концепция смещает фокус с попыток полного контроля над распространением файлов на создание «безопасных по умолчанию» архитектур. Это достигается за счет глубокой фильтрации обучающих данных и внедрения специфических методов алайнмента, которые делают модель менее эффективной при попытках генерации вредоносного контента.
Авторы подчеркивают, что текущие методы оценки безопасности часто не учитывают специфику открытых моделей, где любой пользователь может снять установленные ограничения. Решением может стать создание стандартизированных протоколов «безопасного релиза», которые включают не только проверку на токсичность, но и стресс-тестирование модели на устойчивость к попыткам обхода встроенных этических фильтров (jailbreak).
Ключевые факты
- Концепция предполагает переход от модели «открыто всё» к «безопасному открытому доступу» через фильтрацию данных на этапе пре-тренинга.
- Предложены методы усиления алайнмента, которые сложнее поддаются деструктивному файн-тюнингу со стороны конечных пользователей.
- Внедрение стандартов оценки безопасности должно стать обязательным этапом перед публикацией весов в открытый доступ.
- Стратегия направлена на снижение рисков использования ИИ для создания биологического оружия или проведения масштабных кибератак.