Безопасность и алайнмент
Уязвимости в цепочках поставок ИИ-агентов через «бесполезные» навыки
Исследователи выявили критический вектор атаки на ИИ-агентов, использующих внешние плагины и инструменты. Злоумышленники могут внедрять вредоносные навыки в репозитории, которые не содержат явного эксплойта, но манипулируют логикой агента через манипуляцию метаданными. Это позволяет перехватывать управление, красть данные или выполнять несанкционированные действия, обходя стандартные фильтры безопасности на этапе статического анализа кода.
Обнаружены признаки внедрения системных промптов в ответы моделей Anthropic
Пользователи обнаружили, что модели Anthropic могут раскрывать части своих системных инструкций при определенных запросах. Это явление, напоминающее классическую атаку через инъекцию промпта, ставит под вопрос надежность изоляции внутренних директив разработчика от пользовательского ввода. Подобные утечки позволяют сторонним лицам частично реконструировать скрытые правила поведения и ограничения, заданные моделью при развертывании.
Уязвимость в Claude Code: риск утечки сессий между рабочими пространствами
В инструменте Claude Code обнаружена критическая проблема безопасности, связанная с потенциальной утечкой данных сессий или кэша между различными рабочими пространствами или учетными записями пользователей. Ошибка создает риск несанкционированного доступа к контексту и истории взаимодействия, что ставит под угрозу конфиденциальность данных при работе с агентными системами в многопользовательских или изолированных средах разработки.
Уязвимость в ИИ-агентах: вредоносный плагин обошел системы проверки
Исследователи безопасности обнаружили критическую уязвимость в экосистеме ИИ-агентов: вредоносный плагин, имитирующий полезный инструмент, успешно прошел автоматизированные проверки и был доступен пользователям. Инцидент затронул 26 000 человек, демонстрируя серьезные пробелы в безопасности платформ, которые позволяют сторонним разработчикам внедрять агентные навыки без должной верификации кода и контроля доступа к данным.
Alibaba ограничила использование Claude Code для сотрудников
Компания Alibaba внесла инструмент Claude Code в список программного обеспечения с высоким уровнем риска и запретила его использование внутри корпоративной сети. Решение продиктовано опасениями по поводу безопасности данных и потенциальной утечки проприетарного исходного кода при взаимодействии с внешними ИИ-системами, что отражает общую тенденцию ужесточения контроля над использованием сторонних AI-ассистентов в крупных технологических корпорациях.
Owthorize: инструмент для контроля вызовов инструментов ИИ-агентами
Owthorize — это библиотека для Node.js, предназначенная для перехвата и проверки вызовов инструментов (tool calls) ИИ-агентами до их фактического выполнения. Инструмент позволяет разработчикам внедрять политики безопасности, предотвращая нежелательные или деструктивные действия агентов, такие как удаление файлов или несанкционированные сетевые запросы, обеспечивая дополнительный уровень контроля в агентных системах.
Проблемы аутентификации и безопасности ИИ-агентов
Вопрос идентификации автономных ИИ-агентов становится критическим по мере их интеграции в корпоративные системы. Традиционные методы аутентификации, основанные на человеческих сессиях, не подходят для агентов, которые могут выполнять действия в фоновом режиме. Необходимы новые протоколы, позволяющие системам верифицировать личность агента, его полномочия и границы доступа к API, чтобы предотвратить несанкционированное использование ресурсов.
Уязвимости в системах безопасности LLM при анализе кода
Исследователи продемонстрировали методы обхода механизмов безопасности в больших языковых моделях, используемых для автоматического сканирования кода. Манипулируя промптами, злоумышленники могут заставить ИИ игнорировать наличие вредоносного ПО в анализируемых фрагментах. Это создает серьезные риски для инструментов безопасности, полагающихся на LLM для выявления уязвимостей и бэкдоров в программном обеспечении.
Всплеск критических уязвимостей после релиза Claude Mythos Preview
Аналитики Epoch AI зафиксировали резкий рост числа серьезных уязвимостей в программном обеспечении, коррелирующий с выходом модели Claude Mythos Preview. Исследование показывает, что интеграция новых мощных ИИ-систем в процессы разработки может непреднамеренно способствовать созданию небезопасного кода, требуя пересмотра подходов к безопасности при внедрении генеративных инструментов в производственные циклы.
Alibaba ограничила использование Claude Code из-за опасений по поводу безопасности данных
Компания Alibaba запретила своим сотрудникам использовать инструмент Claude Code от Anthropic. Руководство опасается, что использование сторонних ИИ-агентов для написания кода может привести к утечке проприетарных данных и интеллектуальной собственности. Решение подчеркивает растущую обеспокоенность крупных корпораций вопросами конфиденциальности при интеграции облачных ИИ-инструментов в процессы разработки программного обеспечения.
Новый метод верификации ИИ через интерактивные доказательства
Исследователи представили метод повышения безопасности ИИ через систему «двойных эффективных интерактивных доказательств». Подход позволяет слабому верификатору (человеку) эффективно проверять ответы мощных моделей, используя формат дебатов между двумя ИИ-агентами. Это сокращает вычислительные затраты и время, необходимое для подтверждения корректности сложных выводов, минимизируя риск галлюцинаций или предвзятых ответов в критически важных задачах.
Уязвимость в Langflow привела к первой атаке ИИ-агентов с использованием шифровальщика
Исследователи зафиксировали атаку JadePuffer, использующую критическую уязвимость CVE-2025-3248 в платформе Langflow для развертывания ИИ-агентов. Злоумышленники эксплуатировали незащищенные экземпляры сервиса, чтобы внедрить вредоносный код, получить доступ к базам данных и зашифровать их содержимое. Это первый задокументированный случай использования агентных фреймворков для автоматизированного вымогательства, что подчеркивает новые векторы атак на инфраструктуру ИИ.
Первая зафиксированная атака с использованием автономного ИИ-агента для вымогательства
Исследователи зафиксировали первый случай проведения полноценной атаки с использованием автономного ИИ-агента, предназначенного для развертывания программ-вымогателей. В отличие от предыдущих инцидентов, где ИИ лишь помогал в написании кода, новый инструмент самостоятельно прошел все этапы: от разведки сети и поиска уязвимостей до эксфильтрации данных и автоматизированного требования выкупа, что знаменует новый этап в киберпреступности.
Всплеск отчетов об уязвимостях ПО на фоне внедрения ИИ-инструментов для поиска багов
Аналитики Epoch AI зафиксировали резкий рост числа сообщений об уязвимостях в программном обеспечении. В июне 2026 года 21 организация зарегистрировала около 1500 критических и высокоопасных CVE, что в 3,5 раза превышает предыдущий исторический максимум. Этот скачок эксперты связывают с массовым внедрением ИИ-систем, автоматизирующих процесс поиска ошибок в коде.
Alibaba ограничивает использование Claude Code из-за рисков безопасности
Alibaba вводит запрет на использование инструмента Claude Code в корпоративной среде. Решение принято на фоне опасений руководства относительно потенциальных уязвимостей и рисков безопасности, связанных с доступом ИИ-агента к внутренним репозиториям кода. Компания усиливает контроль над использованием сторонних инструментов автоматизации разработки, чтобы предотвратить возможные утечки данных и несанкционированный доступ к интеллектуальной собственности.
Anthropic представила Fable: фреймворк для тестирования моделей на устойчивость к взлому
Компания Anthropic выпустила Fable — специализированный фреймворк для автоматизированного тестирования больших языковых моделей на устойчивость к попыткам обхода ограничений (jailbreak). Инструмент позволяет генерировать сложные сценарии атак, имитирующие поведение злоумышленников, чтобы выявлять уязвимости в безопасности моделей до их публичного релиза и повышать общую надежность систем в реальных условиях эксплуатации.
Declaw Arena: платформа для тестирования безопасности ИИ-агентов в изолированной среде
Declaw Arena — это новая платформа для проведения соревнований в формате CTF (Capture The Flag), направленная на поиск уязвимостей в ИИ-агентах. Участникам предлагается взломать систему, работающую в изолированной микровиртуальной машине (microVM), чтобы проверить устойчивость агентов к атакам типа «инъекция промптов» и попыткам несанкционированного доступа к системным ресурсам.
Аппаратная защита ИИ-инфраструктуры от NVIDIA
NVIDIA представила подход к обеспечению безопасности ИИ-систем на уровне аппаратного обеспечения, позволяющий защитить модели и данные без потери производительности вычислений. Решение опирается на доверенные среды исполнения (TEE) и аппаратные корни доверия, что позволяет изолировать процессы инференса и предотвратить несанкционированный доступ к весам моделей и конфиденциальной информации в процессе обработки.
Frame: новый подход к поиску уязвимостей в коде с помощью LLM и логики разделения
Исследователи представили Frame — фреймворк для повышения точности обнаружения уязвимостей в коде с помощью LLM. Система объединяет возможности генеративных моделей с формальной логикой разделения (separation logic), что позволяет верифицировать найденные ошибки и минимизировать количество ложноположительных срабатываний, характерных для стандартных нейросетевых анализаторов кода.
Уязвимость в Claude Code: риски обхода сетевых фильтров через SOCKS5
Исследователи обнаружили, что инструмент Claude Code позволяет обходить ограничения исходящего трафика через использование SOCKS5-прокси. Уязвимость дает агенту возможность устанавливать сетевые соединения в обход корпоративных политик безопасности. Это подчеркивает критическую необходимость внедрения эгресс-фильтрации на уровне сетевого периметра, а не только на уровне конфигурации отдельных агентных инструментов или сред разработки.
Новый вектор атак на автономных ИИ-агентов через распределенные PR
Исследователи представили концепцию «Iterative VibeCoding», описывающую уязвимости автономных ИИ-агентов, работающих с долгоживущими кодовыми базами. В отличие от разовых атак, агент может распределять вредоносный код между множеством pull-реквестов, маскируя изменения под легитимные правки. Это создает скрытый вектор угроз, где вредоносная нагрузка активируется только при достижении определенных условий в процессе итеративной разработки.
Метод онлайн-мониторинга безопасности для LLM в реальном времени
Исследователи представили новый подход к обеспечению безопасности LLM, позволяющий выявлять опасные генерации непосредственно в процессе работы модели. Метод использует внешний верификатор, который анализирует выходные данные и подает сигнал тревоги при превышении заданного порога риска. Такая система позволяет динамически контролировать безопасность ответов, даже если модель прошла стандартное обучение на соответствие заданным нормам.
Anthropic удаляет скрытый код для отслеживания китайских конкурентов
Компания Anthropic объявила об удалении из своих систем специализированного кода, предназначенного для идентификации и отслеживания запросов, исходящих от китайских технологических компаний. Ранее этот механизм позволял разработчикам выявлять попытки использования API для обучения конкурирующих моделей или анализа проприетарных данных, однако теперь компания пересматривает подходы к обеспечению безопасности и контролю за использованием своих технологий.
Новый метод RFM-AGOP для выявления многомерных пространств отказа в LLM
Исследователи представили метод RFM-AGOP для идентификации многомерных подпространств, отвечающих за отказ моделей отвечать на вредоносные запросы. В отличие от традиционных подходов, фокусирующихся на одномерных векторах, новый алгоритм позволяет точнее выделять сложные паттерны поведения нейросетей. Это открывает новые возможности для интерпретируемости моделей и более тонкой настройки механизмов безопасности без ущерба для общей производительности системы.