Безопасность и алайнмент

Уязвимость ИИ-агентов GitHub: утечка данных через простые запросы Hacker News · 08.07.2026 Исследователи обнаружили критическую уязвимость в ИИ-агентах GitHub, позволяющую извлекать содержимое приватных репозиториев с помощью манипулятивных промптов. Агент, предназначенный для помощи в разработке, игнорирует ограничения доступа, если пользователь формулирует запрос в определенном стиле. Это ставит под угрозу конфиденциальность корпоративного кода и подчеркивает серьезные риски при интеграции LLM в рабочие процессы с доступом к чувствительным данным. Уязвимость HalluSquatting: как LLM используют для создания ботнетов Ars Technica - All content · 08.07.2026 Исследователи выявили критическую уязвимость HalluSquatting, затрагивающую девять популярных ИИ-инструментов. Атака эксплуатирует склонность больших языковых моделей к галлюцинациям и неспособность признать отсутствие знаний. Злоумышленники создают вредоносные пакеты с именами, которые ИИ ошибочно рекомендует пользователям, что позволяет внедрять вредоносный код в рабочие процессы разработчиков и формировать масштабные ботнеты. Уязвимости ИИ-агентов к атакам через внедрение данных Hacker News · 08.07.2026 Исследователи представили анализ нового вектора угроз для автономных ИИ-систем — атак через внедрение данных (Data Injection Attacks). В отличие от классических атак на промпты, этот метод эксплуатирует доверие агентов к внешним источникам информации, таким как веб-страницы, базы данных или API, позволяя злоумышленникам скрыто манипулировать поведением агента и его решениями. Уязвимость в Cursor подчеркивает необходимость изоляции ИИ-агентов на уровне ядра Hacker News · 07.07.2026 Исследователь безопасности обнаружил критическую уязвимость в среде исполнения ИИ-редактора Cursor, позволяющую выйти за пределы песочницы. Атака демонстрирует, что текущие механизмы изоляции агентов, работающих с кодом, недостаточны для предотвращения несанкционированного доступа к файловой системе и системным ресурсам хоста, что ставит под угрозу безопасность сред разработки при использовании автономных инструментов. Уязвимость в Writer AI: обход изоляции между арендаторами Hacker News · 07.07.2026 Исследователи безопасности обнаружили критическую уязвимость в платформе Writer AI, позволявшую злоумышленникам выходить за пределы изолированной среды (песочницы). Ошибка давала возможность читать данные других клиентов компании, используя манипуляции с системными промптами и доступом к файловой системе. Уязвимость была оперативно устранена разработчиками после получения отчета, предотвратив потенциальную утечку конфиденциальной корпоративной информации. Анализ векторов атак через файлы .claude в проектах Hacker News · 07.07.2026 Исследователи проанализировали риски безопасности, связанные с использованием файлов конфигурации `.claude` в рабочих пространствах. Эти файлы, предназначенные для настройки поведения ИИ-ассистентов в IDE, могут стать вектором для атак путем внедрения вредоносных инструкций. Злоумышленники способны манипулировать контекстом проекта, заставляя модель выполнять несанкционированные действия или раскрывать конфиденциальные данные через манипуляцию системными промптами. AirflowAttack: новая угроза для ИИ-моделей в инфракрасном спектре arXiv · 07.07.2026 Исследователи представили AirflowAttack — первый метод состязательных атак, направленный на мультимодальные модели (VLM), работающие с данными инфракрасного дистанционного зондирования. Метод использует физические свойства турбулентности тепловых потоков для создания искажений, которые остаются незаметными для стандартных систем фильтрации, но эффективно обманывают нейросети, критически важные для систем безопасности и мониторинга. Уязвимости систем автономного вождения к отравлению данных в 3D-облаках точек arXiv · 07.07.2026 Исследователи проанализировали влияние атак типа «отравление данных» (poisoning attacks) на публичные наборы 3D-облаков точек, используемые для обучения беспилотных автомобилей. Работа демонстрирует, что внедрение вредоносных данных в обучающие выборки приводит к критическим ошибкам классификации объектов и созданию скрытых бэкдоров, которые активируются при определенных условиях эксплуатации системы, даже несмотря на применение методов аугментации данных. DT-Guard: новый метод обучения защитных фильтров для LLM arXiv · 07.07.2026 Исследователи представили DT-Guard — метод обучения защитных механизмов для LLM, который сочетает эффективность классификаторов с глубиной рассуждений агентных систем. Подход использует «обучение с активным рассуждением», позволяя моделям-фильтрам распознавать скрытые намерения и неоднозначные запросы без необходимости запуска тяжелых LLM в режиме реального времени, что критично для низкозадержных систем. ИИ-ассистенты для написания кода могут непреднамеренно передавать секретные данные Hacker News · 07.07.2026 Исследование выявило критическую уязвимость в популярных ИИ-инструментах для разработки: ассистенты могут отправлять конфиденциальные данные, такие как API-ключи и токены доступа, на серверы разработчиков моделей. Проблема возникает из-за того, что контекстное окно модели часто включает содержимое файлов конфигурации и переменных окружения, которые автоматически передаются для анализа без должной фильтрации. Метод контроля саморазвивающихся ИИ-агентов через инъекции с подкреплением Hacker News · 07.07.2026 Исследователи представили новый подход к управлению автономными агентами, способными к самообучению. Метод использует механизм «самоподкрепляющихся инъекций» (self-reinforcing injections), позволяющий сохранять контроль над поведением модели даже при её эволюции. Это решает проблему «дрейфа» целей, когда агент в процессе итеративного улучшения начинает отклоняться от заданных инструкций, сохраняя при этом стабильность выполнения целевых задач. Panoptes: слой аудита и алайнмента для ИИ-агентов Hacker News · 07.07.2026 Panoptes представляет собой специализированный слой для мониторинга и обеспечения безопасности ИИ-систем. Инструмент позволяет отслеживать взаимодействие моделей с внешними средами, перехватывать вызовы и применять политики безопасности в реальном времени. Решение ориентировано на разработчиков, которым необходимо контролировать поведение агентов и предотвращать нежелательные действия на уровне инфраструктуры исполнения. Первая ИИ-атака шифровальщиком: роль человека в процессе AI News & Artificial Intelligence | TechCrunch · 06.07.2026 Исследование недавнего инцидента с использованием ИИ-агента для проведения атаки шифровальщиком показало, что технология не работала полностью автономно. Несмотря на заголовки о «первой ИИ-атаке», ключевые этапы — выбор цели, настройка инфраструктуры и предоставление украденных учетных данных — выполнялись человеком. ИИ-агент отвечал лишь за техническое исполнение вредоносных действий внутри скомпрометированной системы. Node.js борется с наплывом ИИ-сгенерированных отчетов об уязвимостях Hacker News · 06.07.2026 Проект Node.js столкнулся с резким ростом числа автоматизированных отчетов об уязвимостях, созданных с помощью ИИ. Большинство этих заявок содержат ложные срабатывания или не имеют практической ценности, что перегружает команду сопровождения. В ответ разработчики внедряют собственные ИИ-инструменты для автоматической фильтрации и приоритизации входящих сообщений, чтобы отсеивать некачественный контент и фокусироваться на реальных угрозах безопасности. Инструмент для фильтрации опасных команд в ИИ-агентах Hacker News · 06.07.2026 Разработчик представил Danger Guard Skill — специализированный защитный слой для ИИ-агентов, предназначенный для перехвата и блокировки вредоносных команд до их выполнения. Инструмент функционирует как прослойка между пользователем и агентной системой, анализируя входящие запросы на предмет потенциально опасных действий, таких как несанкционированный доступ к файловой системе или выполнение критических системных операций. Selective Disclosure Watermarking: новый метод маркировки текста LLM arXiv · 06.07.2026 Исследователи представили метод Selective Disclosure Watermarking, позволяющий выборочно раскрывать метаданные в водяных знаках LLM. В отличие от существующих решений, где проверка требует деанонимизации всей скрытой информации, новый подход дает возможность подтверждать отдельные атрибуты контента, сохраняя конфиденциальность остальных данных, что критически важно для верификации авторства и происхождения текста в корпоративных и правовых системах. PiSAs: новый бенчмарк для оценки утечек данных в многопользовательских ИИ-системах arXiv · 06.07.2026 Исследователи представили PiSAs — первый бенчмарк для оценки целостности контекста в многопользовательских агентных системах. Инструмент выявляет риски утечки конфиденциальной информации между пользователями, возникающие при использовании общей памяти и обмене сообщениями между агентами. Это критически важно для корпоративных сред, где существующие методы оценки безопасности не учитывают специфику взаимодействия нескольких агентов внутри одной инфраструктуры. Anthropic обвинили в скрытом отслеживании действий пользователей Claude Ars Technica - All content · 06.07.2026 Компания Anthropic оказалась в центре скандала после обнаружения скрытого механизма отслеживания активности пользователей в Китае. Инструмент, встроенный в веб-интерфейс Claude, собирал данные о запросах и поведении без явного согласия аудитории. Разработчики назвали это «экспериментом», который был оперативно прекращен после того, как информация о трекере стала публичной и вызвала волну критики. Защита от отравления данных при дообучении моделей через подпространственные ограничения arXiv · 06.07.2026 Исследователи предложили новый метод защиты LLM от атак типа «отравление» (poisoning) при дообучении. Вместо свободного изменения всех параметров адаптера, предлагается ограничивать обучение подпространством, сформированным на основе набора доверенных адаптеров. Это позволяет модели сохранять функциональность, исключая возможность внедрения вредоносных паттернов поведения, которые часто маскируются под полезные обновления в рамках стандартного LoRA-тюнинга. Метод маскирования контента для защиты веб-агентов от промпт-инъекций arXiv · 06.07.2026 Исследователи представили новый подход к обеспечению безопасности веб-агентов, направленный на предотвращение промпт-инъекций. Метод основан на строгом разделении доверенных инструкций и внешних данных, поступающих из веб-среды. Технология позволяет агентам взаимодействовать с сайтами, минимизируя риск выполнения вредоносного кода, скрытого в контенте страниц, что критически важно для безопасной автоматизации действий в браузере. Инструмент MakerChecker для аудита опасных возможностей ИИ-агентов Hacker News · 06.07.2026 Проект MakerChecker представляет собой специализированный фреймворк для сканирования ИИ-агентов на наличие потенциально опасных функций и скрытых возможностей. Инструмент позволяет разработчикам проводить автоматизированный аудит агентных систем, выявляя риски, связанные с несанкционированным доступом к данным, выполнением критических команд или неконтролируемым поведением модели в процессе автономной работы. Обзор методов защиты от промпт-инъекций в ИИ-агентах Hacker News · 06.07.2026 Исследование Fabraix анализирует текущее состояние защиты LLM-агентов от промпт-инъекций, констатируя отсутствие универсального решения. Авторы систематизируют подходы к минимизации рисков, разделяя их на фильтрацию входных данных, изоляцию контекста и мониторинг выполнения. Несмотря на разнообразие методов, большинство из них остаются уязвимыми перед сложными атаками, что требует многоуровневой стратегии безопасности при внедрении агентных систем в реальные бизнес-процессы. JADEPUFFER: первая зафиксированная атака с использованием автономного ИИ-агента The Decoder · 06.07.2026 Исследователи безопасности из Sysdig зафиксировали случай использования автономного ИИ-агента для проведения атаки типа «вымогатель». В ходе инцидента под названием JADEPUFFER модель самостоятельно проникла в инфраструктуру, похитила учетные данные и уничтожила базы данных без прямого участия человека. Этот кейс демонстрирует переход от ручного управления взломами к высокоскоростным автоматизированным атакам с использованием LLM. Использование ИИ-агентов в атаках шифровальщика JadePuffer Hacker News · 05.07.2026 Киберпреступники начали применять специализированных ИИ-агентов для полной автоматизации атак с использованием шифровальщика JadePuffer. Агенты способны самостоятельно сканировать уязвимости, обходить системы защиты и выполнять эксфильтрацию данных без участия человека. Это знаменует переход к новому этапу автоматизации киберугроз, где скорость и адаптивность атак возрастают за счет автономных алгоритмов.