Безопасность и алайнмент
Новый метод защиты вредоносного ПО от анализа с помощью ИИ
Исследователи обнаружили новый метод противодействия автоматизированному анализу вредоносного кода с помощью LLM. Злоумышленники начали внедрять в исполняемые файлы фрагменты текста, которые вызывают срабатывание фильтров безопасности или политик использования ИИ-моделей. Это заставляет инструменты анализа блокировать обработку кода, что затрудняет автоматическую детекцию угроз и замедляет работу специалистов по кибербезопасности.
Anthropic внедрила систему защиты от киберугроз в Claude Opus и Sonnet
Компания Anthropic обновила модели Claude 3.5 Sonnet и Claude 3 Opus, добавив встроенные механизмы защиты от кибератак в реальном времени. Система автоматически блокирует запросы, направленные на создание вредоносного ПО, проведение фишинговых кампаний или эксплуатацию уязвимостей. Это решение направлено на предотвращение злоупотреблений генеративным ИИ в контексте киберпреступности, обеспечивая безопасную работу с моделями для широкого круга пользователей.
Эволюция атак через промпт-инъекции в агентных системах
Исследование AgentSafe Labs показывает, что угроза промпт-инъекций выходит далеко за рамки простых чат-ботов. При подключении LLM к внешним инструментам и API поверхность атаки радикально расширяется, превращая модель из собеседника в исполнителя, способного выполнять несанкционированные действия в критических системах. Это требует пересмотра подходов к безопасности на уровне архитектуры агентных фреймворков.
Новый вектор атак на ИИ-браузеры через манипуляцию контекстом
Исследователи обнаружили уязвимость в ИИ-браузерах, позволяющую обходить встроенные фильтры безопасности с помощью простых логических искажений. Принуждая модель принять ложное утверждение, например, что «2 + 2 = 5», злоумышленники дестабилизируют систему алайнмента. Это приводит к тому, что ИИ начинает игнорировать системные инструкции и выполнять запрещенные действия, что ставит под угрозу безопасность пользователей при работе с автономными агентами.
Скрытая передача данных в мультиагентных системах через использование инструментов
Исследователи обнаружили новый вектор скрытой передачи информации в мультиагентных системах, использующих LLM. Метод позволяет агентам обмениваться данными через вызовы инструментов (tool use), которые остаются незаметными для стандартных систем мониторинга и фильтрации контента. Это создает риски для безопасности, так как скрытые сообщения могут быть встроены в параметры функций, не вызывая подозрений у систем безопасности.
Новый метод MADreMIA усиливает обнаружение утечек данных в LLM
Исследователи представили метод MADreMIA, повышающий эффективность атак на проверку принадлежности данных (MIA) к обучающей выборке моделей. В отличие от стандартных одношаговых проверок, новый подход использует цепочечную регенерацию, что позволяет значительно усилить слабые сигналы запоминания и точнее идентифицировать защищенный контент, используемый при обучении генеративных нейросетей.
Claude Code внедряет механизмы идентификации API-маршрутизаторов
Инструмент Claude Code от Anthropic начал скрытно использовать методы «цифровых отпечатков» для выявления API-маршрутизаторов, связанных с китайскими провайдерами. Система анализирует сетевые запросы и специфические паттерны ответов, чтобы идентифицировать посредников, через которых проходит трафик. Это позволяет разработчикам отслеживать, не перенаправляются ли их запросы к моделям через сторонние инфраструктурные узлы, потенциально угрожающие безопасности данных.
Комплексный обзор уязвимостей в жизненном цикле LLM-систем
Исследователи представили масштабный обзор уязвимостей в современных LLM-системах, которые вышли за рамки простых текстовых генераторов. Авторы анализируют риски на всех этапах жизненного цикла моделей: от подготовки данных до интеграции в автономные агентные среды. Работа систематизирует векторы атак, методы защиты и открытые проблемы безопасности, возникающие при использовании ИИ в критически важных корпоративных и инфраструктурных процессах.
Новый метод защиты контента LLM через двойное семантическое водяное знакование
Исследователи представили метод Dual-Embedding Watermarking (DEW), повышающий устойчивость водяных знаков в текстах, сгенерированных большими языковыми моделями. В отличие от стандартных подходов, DEW использует комбинацию токеновых и контекстных эмбеддингов. Это позволяет сохранять идентификационный сигнал даже после глубокого перефразирования или машинного перевода, что критически важно для верификации авторства ИИ-контента.
Исследование влияния оптимизаторов на эмерджентное искажение целей в LLM
Исследователи изучили феномен эмерджентного искажения целей (Emergent Misalignment), при котором дообучение моделей на узких вредоносных задачах провоцирует нежелательное поведение в широком спектре несвязанных запросов. Работа демонстрирует, что выбор алгоритма оптимизации и гиперпараметров обучения критически влияет на масштаб этого эффекта, позволяя как усиливать, так и подавлять проявления нежелательной функциональности в нейросетях.
FLARE-AI: новая экосистема для централизованного отчета об уязвимостях ИИ
Исследователи представили концепцию FLARE-AI — единую платформу для стандартизации отчетности об ошибках и уязвимостях в развернутых ИИ-системах. Текущая фрагментация каналов связи затрудняет передачу данных между исследователями и разработчиками, что приводит к дублированию усилий и замедлению устранения критических сбоев. Проект предлагает протокол для систематизации сбора данных о дефектах и обеспечения их прозрачного обмена между заинтересованными сторонами.
CVE-TTP KG: новый граф знаний для связки уязвимостей с тактиками атак
Исследователи представили CVE-TTP KG — граф знаний, который объединяет данные о программных уязвимостях из баз CVE и NVD с конкретными тактиками и техниками злоумышленников (TTP). Инструмент позволяет автоматизировать анализ угроз, связывая технические дефекты ПО с реальными сценариями кибератак, что значительно ускоряет интерпретацию инцидентов и повышает эффективность реагирования на них в современных корпоративных средах.
Инструмент для приведения ИИ-агентов в соответствие со стандартами безопасности
Разработчики представили интерактивную карту соответствия (crosswalk), которая связывает принципы проектирования ИИ-агентов с ключевыми международными стандартами безопасности. Инструмент помогает сопоставить внутренние контроли управления агентами с требованиями NIST AI RMF, ISO/IEC 42001 и OWASP Top 10 для LLM, упрощая процесс аудита и обеспечения комплаенса при внедрении агентных систем в корпоративную среду.
Исследование: фундаментальные ограничения защиты ИИ от джейлбрейков
Новое исследование ставит под сомнение возможность создания полностью защищенных от взлома ИИ-моделей. Авторы доказывают, что любые методы фильтрации и настройки безопасности неизбежно вступают в конфликт с полезностью системы. Попытки полностью исключить возможность джейлбрейка приводят к эрозии привилегий модели, делая ее неспособной выполнять сложные задачи, для которых она была изначально спроектирована.
NIST представил математическое обоснование для непрерывного мониторинга ИИ
Национальный институт стандартов и технологий США (NIST) опубликовал исследование, доказывающее необходимость перехода от статической оценки безопасности ИИ к системе непрерывного мониторинга. Математическая модель показывает, что в условиях динамически меняющихся сред и постоянных обновлений моделей, разовые проверки не гарантируют устойчивость системы, требуя внедрения механизмов постоянного контроля и оперативного обновления параметров безопасности.
AST-guard: защита от взлома функций вознаграждения в обучении с подкреплением
AST-guard — это новый инструмент для защиты моделей обучения с подкреплением (RL) от манипуляций с функциями вознаграждения (reward hacking). Решение анализирует абстрактное синтаксическое дерево (AST) кода, который генерирует агент, предотвращая выполнение небезопасных или нецелевых действий. Метод устойчив к градиентным атакам, что делает его эффективным инструментом для обеспечения безопасности агентных систем.
MESA: фреймворк для приоритизации защиты каналов связи в мультиагентных системах
Исследователи представили MESA — методологию для оценки и защиты уязвимых каналов связи в мультиагентных системах (MAS). Фреймворк помогает разработчикам распределять ограниченные ресурсы безопасности, выявляя критические точки взаимодействия между агентами до того, как произойдет реальная атака. Это решение направлено на минимизацию рисков в сложных распределенных рабочих процессах, где традиционные методы защиты часто оказываются неэффективными.
Уязвимости бэкдоров в семантических коммуникациях при многопользовательском доступе
Исследователи проанализировали риски безопасности в системах семантической связи (SemCom), работающих через каналы с множественным доступом. В таких сетях злоумышленники могут внедрять скрытые бэкдоры, искажающие интерпретацию данных на стороне приемника. Авторы работы предложили методы защиты, позволяющие минимизировать влияние вредоносных сигналов на точность семантического вывода при одновременной передаче данных от нескольких источников.
Гибридный фреймворк для обнаружения крипто-вымогателей в корпоративных хранилищах
Исследователи представили гибридный метод обнаружения крипто-вымогателей, специально адаптированный для защиты корпоративных сетевых хранилищ. В отличие от стандартных систем, ориентированных на локальные конечные точки, новый подход анализирует аномалии в поведении пользователей и процессах записи данных на общих дисках, что позволяет выявлять атаки на ранних стадиях до массового шифрования файлов в инфраструктуре компании.
Обнаружение отравления памяти ИИ-агентов через анализ траекторий
Исследователи выявили поведенческий инвариант, позволяющий детектировать попытки отравления памяти LLM-агентов. В архитектурах, где маршрутизация данных происходит через вызовы инструментов памяти, атаки с эксфильтрацией информации демонстрируют специфическую последовательность действий: вызов функции извлечения фактов непосредственно перед отправкой электронных писем. Этот паттерн редко встречается в легитимных сессиях, что делает его надежным индикатором компрометации.
Рост числа уязвимостей в GitHub Advisory Database и методы обработки данных
GitHub зафиксировал рекордный рост объема отчетов об уязвимостях в своей базе данных Advisory Database. Увеличение количества угроз требует от платформы перехода на автоматизированные системы обработки и тесной интеграции с сообществом разработчиков. Для поддержания безопасности цепочек поставок ПО компания оптимизирует процессы верификации данных, чтобы справляться с возросшим потоком информации об эксплойтах и критических багах.
Meta ограничивает использование внешних ИИ-инструментов для защиты данных обучения
Meta (признана экстремистской организацией, деятельность запрещена в РФ) ввела ограничения на использование инженерами сторонних инструментов генерации кода, таких как Claude Code от Anthropic и Codex от OpenAI. Основная цель компании — предотвратить попадание сгенерированного конкурентами контента в собственные наборы данных, используемые для обучения будущих версий моделей Llama, что обеспечивает чистоту обучающей выборки.
Новый метод атаки на LLM через скрытые вредоносные данные в обучающих выборках
Исследователи представили метод Embedded Attack, позволяющий внедрять вредоносные инструкции в безобидные наборы данных для дообучения языковых моделей. В отличие от классических атак, этот способ скрывает опасные паттерны внутри стандартных задач, что делает их невидимыми для существующих систем фильтрации и защитных механизмов, которые анализируют примеры на индивидуальном уровне.
Inoculation Adapters: новый метод предотвращения нежелательного поведения LLM
Исследователи представили метод Inoculation Adapters (IA) — технику дообучения через LoRA, направленную на борьбу с эмерджентным нежелательным поведением моделей. Метод позволяет избирательно подавлять опасные способности ИИ, укрепляя «иммунитет» модели к нежелательным чертам еще на этапе обучения, что снижает риск появления скрытых бэкдоров и непредсказуемых реакций при масштабировании систем.