Исследователи опубликовали 5% выборку специализированного датасета, предназначенного для обучения языковых моделей защите промышленных систем управления (ICS) и операционных технологий (OT). Набор данных содержит верифицированные примеры атак и сценариев реагирования, что позволяет улучшить способность ИИ-агентов выявлять угрозы в критической инфраструктуре и автоматизировать процессы анализа инцидентов в сложных промышленных средах.

Использование специализированных данных критически важно для дообучения моделей, которые должны работать в специфических доменах, где стандартные наборы данных общего назначения показывают низкую эффективность. Промышленные сети имеют уникальные протоколы и архитектуры, поэтому наличие качественных, размеченных данных с подтвержденным происхождением помогает снизить количество ложноположительных срабатываний при мониторинге безопасности.

Данный релиз ориентирован на разработчиков систем безопасности и специалистов по машинному обучению, работающих над созданием специализированных LLM для промышленного сектора. Доступ к таким данным позволяет проводить более точное дообучение (fine-tuning) моделей, адаптируя их к специфике работы с SCADA-системами и другими компонентами промышленной автоматизации, где цена ошибки крайне высока.

Ключевые факты

  • Датасет содержит 5% от общего объема данных, собранных для обучения моделей защите OT/ICS.
  • Основной фокус набора данных — обучение моделей выявлению атак и инцидентов в промышленных сетях.
  • Материалы включают верифицированные сценарии, что обеспечивает высокую достоверность обучающей выборки.
  • Ресурс размещен на платформе Hugging Face для свободного доступа и интеграции в пайплайны машинного обучения.