Исследователи опубликовали 5% выборку специализированного датасета, предназначенного для обучения языковых моделей защите промышленных систем управления (ICS) и операционных технологий (OT). Набор данных содержит верифицированные примеры атак и сценариев реагирования, что позволяет улучшить способность ИИ-агентов выявлять угрозы в критической инфраструктуре и автоматизировать процессы анализа инцидентов в сложных промышленных средах.
Использование специализированных данных критически важно для дообучения моделей, которые должны работать в специфических доменах, где стандартные наборы данных общего назначения показывают низкую эффективность. Промышленные сети имеют уникальные протоколы и архитектуры, поэтому наличие качественных, размеченных данных с подтвержденным происхождением помогает снизить количество ложноположительных срабатываний при мониторинге безопасности.
Данный релиз ориентирован на разработчиков систем безопасности и специалистов по машинному обучению, работающих над созданием специализированных LLM для промышленного сектора. Доступ к таким данным позволяет проводить более точное дообучение (fine-tuning) моделей, адаптируя их к специфике работы с SCADA-системами и другими компонентами промышленной автоматизации, где цена ошибки крайне высока.
Ключевые факты
- Датасет содержит 5% от общего объема данных, собранных для обучения моделей защите OT/ICS.
- Основной фокус набора данных — обучение моделей выявлению атак и инцидентов в промышленных сетях.
- Материалы включают верифицированные сценарии, что обеспечивает высокую достоверность обучающей выборки.
- Ресурс размещен на платформе Hugging Face для свободного доступа и интеграции в пайплайны машинного обучения.