Mistral AI выпустила Shieldstral 1.0 3B — легковесную модель-классификатор для модерации контента, работающую с открытыми весами. В отличие от традиционных систем, привязанных к жестким таксономиям вреда, Shieldstral использует адаптивный подход: политики безопасности задаются пользователем на естественном языке непосредственно во время инференса. Это позволяет гибко настраивать фильтрацию без необходимости дообучения модели под конкретные задачи.

Модель построена на архитектуре, оптимизированной для быстрой обработки данных, и демонстрирует эффективность, сопоставимую с гораздо более крупными решениями (в семь раз превышающими её по размеру). Благодаря компактности в 3 миллиарда параметров, Shieldstral можно эффективно развертывать в инфраструктуре для обеспечения безопасности в реальном времени, минимизируя задержки при проверке текстового и визуального контента.

Метод работы классификатора основан на бинарной логике «да/нет», где на вход подается запрос с описанием политики, а на выходе генерируется откалиброванный показатель безопасности. Такой подход значительно упрощает интеграцию в существующие пайплайны обработки данных, позволяя операторам оперативно менять правила модерации в зависимости от контекста или требований регуляторов, не пересобирая при этом всю агентную систему.

Ключевые факты

  • Модель содержит 3 миллиарда параметров, что обеспечивает высокую скорость инференса.
  • Shieldstral 1.0 поддерживает мультимодальный ввод, работая как с текстом, так и с изображениями.
  • Политики безопасности задаются через plain-language запросы без необходимости переобучения (retraining).
  • Система выдает откалиброванный скор безопасности за один проход (forward pass).
  • Эффективность классификации соответствует показателям моделей, которые в 7 раз больше по количеству параметров.