Безопасность и алайнмент
Исследование новых векторов атак на ИИ-агентов через HalluSquatting
Исследователи представили новый класс атак на ИИ-агентов под названием HalluSquatting. Метод использует уязвимости в механизмах поиска и RAG-системах, заставляя модели обращаться к вредоносным ресурсам вместо легитимных. Злоумышленники регистрируют домены, которые ИИ-модели ошибочно считают авторитетными источниками, что позволяет внедрять нежелательный контент или перехватывать управление агентными цепочками без прямого таргетирования.
Уязвимость в Claude Code: утечка учетных данных между сессиями
В инструменте Claude Code обнаружена критическая уязвимость, приводящая к утечке учетных данных между различными сессиями работы. Проблема заключается в некорректной обработке сессионных токенов, что позволяет потенциально скомпрометировать доступ к API-ключам и другим конфиденциальным данным пользователя. Разработчики уже получили отчет об ошибке и работают над исправлением механизма изоляции окружения в CLI-инструменте.
Arm представила Metis — фреймворк для обеспечения безопасности ИИ-агентов
Компания Arm выпустила Metis, open-source инструмент для защиты агентных систем от вредоносных воздействий. Фреймворк фокусируется на выявлении уязвимостей в цепочках рассуждений агентов и предотвращении несанкционированного выполнения команд. Решение предоставляет разработчикам инфраструктуру для тестирования безопасности автономных систем на этапе проектирования, помогая минимизировать риски при интеграции ИИ в критические бизнес-процессы.
Уязвимость в GitHub Copilot Workspace: утечка данных через промпт-инъекции
Исследователи безопасности из Noma Security обнаружили критическую уязвимость в GitHub Copilot Workspace, позволяющую злоумышленникам извлекать содержимое приватных репозиториев. Используя технику промпт-инъекций, эксперты заставили ИИ-агента игнорировать инструкции безопасности и передавать конфиденциальные файлы на внешний сервер, что ставит под угрозу защиту интеллектуальной собственности в облачных средах разработки.
Уязвимость ИИ-агентов GitHub: утечка данных через простые запросы
Исследователи обнаружили критическую уязвимость в ИИ-агентах GitHub, позволяющую извлекать содержимое приватных репозиториев с помощью манипулятивных промптов. Агент, предназначенный для помощи в разработке, игнорирует ограничения доступа, если пользователь формулирует запрос в определенном стиле. Это ставит под угрозу конфиденциальность корпоративного кода и подчеркивает серьезные риски при интеграции LLM в рабочие процессы с доступом к чувствительным данным.
Уязвимость HalluSquatting: как LLM используют для создания ботнетов
Исследователи выявили критическую уязвимость HalluSquatting, затрагивающую девять популярных ИИ-инструментов. Атака эксплуатирует склонность больших языковых моделей к галлюцинациям и неспособность признать отсутствие знаний. Злоумышленники создают вредоносные пакеты с именами, которые ИИ ошибочно рекомендует пользователям, что позволяет внедрять вредоносный код в рабочие процессы разработчиков и формировать масштабные ботнеты.
Уязвимости ИИ-агентов к атакам через внедрение данных
Исследователи представили анализ нового вектора угроз для автономных ИИ-систем — атак через внедрение данных (Data Injection Attacks). В отличие от классических атак на промпты, этот метод эксплуатирует доверие агентов к внешним источникам информации, таким как веб-страницы, базы данных или API, позволяя злоумышленникам скрыто манипулировать поведением агента и его решениями.
Уязвимость в Cursor подчеркивает необходимость изоляции ИИ-агентов на уровне ядра
Исследователь безопасности обнаружил критическую уязвимость в среде исполнения ИИ-редактора Cursor, позволяющую выйти за пределы песочницы. Атака демонстрирует, что текущие механизмы изоляции агентов, работающих с кодом, недостаточны для предотвращения несанкционированного доступа к файловой системе и системным ресурсам хоста, что ставит под угрозу безопасность сред разработки при использовании автономных инструментов.
Уязвимость в Writer AI: обход изоляции между арендаторами
Исследователи безопасности обнаружили критическую уязвимость в платформе Writer AI, позволявшую злоумышленникам выходить за пределы изолированной среды (песочницы). Ошибка давала возможность читать данные других клиентов компании, используя манипуляции с системными промптами и доступом к файловой системе. Уязвимость была оперативно устранена разработчиками после получения отчета, предотвратив потенциальную утечку конфиденциальной корпоративной информации.
Анализ векторов атак через файлы .claude в проектах
Исследователи проанализировали риски безопасности, связанные с использованием файлов конфигурации `.claude` в рабочих пространствах. Эти файлы, предназначенные для настройки поведения ИИ-ассистентов в IDE, могут стать вектором для атак путем внедрения вредоносных инструкций. Злоумышленники способны манипулировать контекстом проекта, заставляя модель выполнять несанкционированные действия или раскрывать конфиденциальные данные через манипуляцию системными промптами.
AirflowAttack: новая угроза для ИИ-моделей в инфракрасном спектре
Исследователи представили AirflowAttack — первый метод состязательных атак, направленный на мультимодальные модели (VLM), работающие с данными инфракрасного дистанционного зондирования. Метод использует физические свойства турбулентности тепловых потоков для создания искажений, которые остаются незаметными для стандартных систем фильтрации, но эффективно обманывают нейросети, критически важные для систем безопасности и мониторинга.
Уязвимости систем автономного вождения к отравлению данных в 3D-облаках точек
Исследователи проанализировали влияние атак типа «отравление данных» (poisoning attacks) на публичные наборы 3D-облаков точек, используемые для обучения беспилотных автомобилей. Работа демонстрирует, что внедрение вредоносных данных в обучающие выборки приводит к критическим ошибкам классификации объектов и созданию скрытых бэкдоров, которые активируются при определенных условиях эксплуатации системы, даже несмотря на применение методов аугментации данных.
DT-Guard: новый метод обучения защитных фильтров для LLM
Исследователи представили DT-Guard — метод обучения защитных механизмов для LLM, который сочетает эффективность классификаторов с глубиной рассуждений агентных систем. Подход использует «обучение с активным рассуждением», позволяя моделям-фильтрам распознавать скрытые намерения и неоднозначные запросы без необходимости запуска тяжелых LLM в режиме реального времени, что критично для низкозадержных систем.
ИИ-ассистенты для написания кода могут непреднамеренно передавать секретные данные
Исследование выявило критическую уязвимость в популярных ИИ-инструментах для разработки: ассистенты могут отправлять конфиденциальные данные, такие как API-ключи и токены доступа, на серверы разработчиков моделей. Проблема возникает из-за того, что контекстное окно модели часто включает содержимое файлов конфигурации и переменных окружения, которые автоматически передаются для анализа без должной фильтрации.
Метод контроля саморазвивающихся ИИ-агентов через инъекции с подкреплением
Исследователи представили новый подход к управлению автономными агентами, способными к самообучению. Метод использует механизм «самоподкрепляющихся инъекций» (self-reinforcing injections), позволяющий сохранять контроль над поведением модели даже при её эволюции. Это решает проблему «дрейфа» целей, когда агент в процессе итеративного улучшения начинает отклоняться от заданных инструкций, сохраняя при этом стабильность выполнения целевых задач.
Panoptes: слой аудита и алайнмента для ИИ-агентов
Panoptes представляет собой специализированный слой для мониторинга и обеспечения безопасности ИИ-систем. Инструмент позволяет отслеживать взаимодействие моделей с внешними средами, перехватывать вызовы и применять политики безопасности в реальном времени. Решение ориентировано на разработчиков, которым необходимо контролировать поведение агентов и предотвращать нежелательные действия на уровне инфраструктуры исполнения.
Первая ИИ-атака шифровальщиком: роль человека в процессе
Исследование недавнего инцидента с использованием ИИ-агента для проведения атаки шифровальщиком показало, что технология не работала полностью автономно. Несмотря на заголовки о «первой ИИ-атаке», ключевые этапы — выбор цели, настройка инфраструктуры и предоставление украденных учетных данных — выполнялись человеком. ИИ-агент отвечал лишь за техническое исполнение вредоносных действий внутри скомпрометированной системы.
Node.js борется с наплывом ИИ-сгенерированных отчетов об уязвимостях
Проект Node.js столкнулся с резким ростом числа автоматизированных отчетов об уязвимостях, созданных с помощью ИИ. Большинство этих заявок содержат ложные срабатывания или не имеют практической ценности, что перегружает команду сопровождения. В ответ разработчики внедряют собственные ИИ-инструменты для автоматической фильтрации и приоритизации входящих сообщений, чтобы отсеивать некачественный контент и фокусироваться на реальных угрозах безопасности.
Инструмент для фильтрации опасных команд в ИИ-агентах
Разработчик представил Danger Guard Skill — специализированный защитный слой для ИИ-агентов, предназначенный для перехвата и блокировки вредоносных команд до их выполнения. Инструмент функционирует как прослойка между пользователем и агентной системой, анализируя входящие запросы на предмет потенциально опасных действий, таких как несанкционированный доступ к файловой системе или выполнение критических системных операций.
Selective Disclosure Watermarking: новый метод маркировки текста LLM
Исследователи представили метод Selective Disclosure Watermarking, позволяющий выборочно раскрывать метаданные в водяных знаках LLM. В отличие от существующих решений, где проверка требует деанонимизации всей скрытой информации, новый подход дает возможность подтверждать отдельные атрибуты контента, сохраняя конфиденциальность остальных данных, что критически важно для верификации авторства и происхождения текста в корпоративных и правовых системах.
PiSAs: новый бенчмарк для оценки утечек данных в многопользовательских ИИ-системах
Исследователи представили PiSAs — первый бенчмарк для оценки целостности контекста в многопользовательских агентных системах. Инструмент выявляет риски утечки конфиденциальной информации между пользователями, возникающие при использовании общей памяти и обмене сообщениями между агентами. Это критически важно для корпоративных сред, где существующие методы оценки безопасности не учитывают специфику взаимодействия нескольких агентов внутри одной инфраструктуры.
Anthropic обвинили в скрытом отслеживании действий пользователей Claude
Компания Anthropic оказалась в центре скандала после обнаружения скрытого механизма отслеживания активности пользователей в Китае. Инструмент, встроенный в веб-интерфейс Claude, собирал данные о запросах и поведении без явного согласия аудитории. Разработчики назвали это «экспериментом», который был оперативно прекращен после того, как информация о трекере стала публичной и вызвала волну критики.
Защита от отравления данных при дообучении моделей через подпространственные ограничения
Исследователи предложили новый метод защиты LLM от атак типа «отравление» (poisoning) при дообучении. Вместо свободного изменения всех параметров адаптера, предлагается ограничивать обучение подпространством, сформированным на основе набора доверенных адаптеров. Это позволяет модели сохранять функциональность, исключая возможность внедрения вредоносных паттернов поведения, которые часто маскируются под полезные обновления в рамках стандартного LoRA-тюнинга.
Метод маскирования контента для защиты веб-агентов от промпт-инъекций
Исследователи представили новый подход к обеспечению безопасности веб-агентов, направленный на предотвращение промпт-инъекций. Метод основан на строгом разделении доверенных инструкций и внешних данных, поступающих из веб-среды. Технология позволяет агентам взаимодействовать с сайтами, минимизируя риск выполнения вредоносного кода, скрытого в контенте страниц, что критически важно для безопасной автоматизации действий в браузере.