Компания Mistral AI выпустила Shieldstral — специализированную мультимодальную модель с 3 миллиардами параметров, предназначенную для классификации контента и обеспечения безопасности. Несмотря на малый размер, модель демонстрирует эффективность, превосходящую аналоги, которые в семь раз крупнее. Решение ориентировано на фильтрацию вредоносного контента и повышение надежности систем ИИ при работе с пользовательскими запросами.
Shieldstral разработана как инструмент для фильтрации входных данных и ответов моделей, что позволяет разработчикам внедрять надежные механизмы модерации без значительных затрат вычислительных ресурсов. Модель способна распознавать широкий спектр небезопасного контента, включая попытки обхода ограничений (jailbreak), генерацию опасных инструкций и нежелательные материалы, сохраняя при этом высокую скорость инференса.
Использование компактных моделей для задач безопасности становится важным трендом в индустрии, так как это позволяет интегрировать слои защиты непосредственно в пайплайны обработки запросов с минимальной задержкой. Shieldstral доступна в открытых весах, что дает возможность компаниям развертывать её локально, обеспечивая приватность данных и полный контроль над политиками безопасности внутри своих инфраструктурных решений.
Ключевые факты
- Размер модели составляет 3 миллиарда параметров.
- Shieldstral превосходит по точности классификации модели, объем которых превышает её в 7 раз.
- Модель поддерживает мультимодальную обработку, что расширяет возможности фильтрации контента.
- Решение доступно с открытыми весами для локального развертывания и интеграции в существующие системы.
- Основная задача модели — автоматическое обнаружение и блокировка вредоносных запросов и ответов в реальном времени.