Компания Mistral AI выпустила Shieldstral — специализированную модель с 3 миллиардами параметров, предназначенную для проверки входящих и исходящих данных на соответствие правилам безопасности. В отличие от традиционных систем, она использует естественный язык для анализа запросов, что позволяет достичь точности, сопоставимой с моделями в семь раз большего размера, при возможности локального запуска.

Новый подход к фильтрации основан на принципе «да/нет»-вопросов, которые оператор может задавать модели в режиме реального времени. Это избавляет от необходимости полагаться на жестко заданные категории безопасности от сторонних провайдеров. Разработчики получают гибкий инструмент, который можно адаптировать под специфические требования конкретного приложения или корпоративной политики без переобучения основной модели.

Компактность Shieldstral делает её эффективным решением для инфраструктуры, где важна низкая задержка и конфиденциальность. Модель способна работать на стандартном серверном оборудовании, обеспечивая при этом высокий уровень защиты от вредоносного контента, галлюцинаций или нежелательных ответов, что критически важно для внедрения LLM в бизнес-процессы.

Ключевые факты

  • Модель содержит 3 миллиарда параметров, что в 7 раз меньше многих аналогов с аналогичной эффективностью.
  • Метод анализа основан на интерпретации естественного языка, а не на фиксированных классификаторах.
  • Shieldstral поддерживает настройку критериев безопасности «на лету» (runtime) без изменения архитектуры.
  • Модель доступна для локального развертывания, что исключает передачу данных сторонним сервисам фильтрации.