Компания Mistral AI выпустила Shieldstral — специализированную мультимодальную модель с 3 миллиардами параметров, предназначенную для классификации контента и обеспечения безопасности. Несмотря на малый размер, модель демонстрирует эффективность, превосходящую аналоги, которые в семь раз крупнее. Решение ориентировано на фильтрацию вредоносного контента и повышение надежности систем ИИ при работе с пользовательскими запросами.

Shieldstral разработана как инструмент для фильтрации входных данных и ответов моделей, что позволяет разработчикам внедрять надежные механизмы модерации без значительных затрат вычислительных ресурсов. Модель способна распознавать широкий спектр небезопасного контента, включая попытки обхода ограничений (jailbreak), генерацию опасных инструкций и нежелательные материалы, сохраняя при этом высокую скорость инференса.

Использование компактных моделей для задач безопасности становится важным трендом в индустрии, так как это позволяет интегрировать слои защиты непосредственно в пайплайны обработки запросов с минимальной задержкой. Shieldstral доступна в открытых весах, что дает возможность компаниям развертывать её локально, обеспечивая приватность данных и полный контроль над политиками безопасности внутри своих инфраструктурных решений.

Ключевые факты

  • Размер модели составляет 3 миллиарда параметров.
  • Shieldstral превосходит по точности классификации модели, объем которых превышает её в 7 раз.
  • Модель поддерживает мультимодальную обработку, что расширяет возможности фильтрации контента.
  • Решение доступно с открытыми весами для локального развертывания и интеграции в существующие системы.
  • Основная задача модели — автоматическое обнаружение и блокировка вредоносных запросов и ответов в реальном времени.