Безопасность и алайнмент
Уязвимости конфиденциальности в табличных foundation-моделях
Исследователи выявили критические риски конфиденциальности в табличных foundation-моделях, использующих механизм внимания. Несмотря на обучение на синтетических данных, модели подвержены утечкам чувствительной информации при инференсе. В процессе in-context learning данные, передаваемые в качестве размеченных примеров, могут быть восстановлены через анализ весов внимания, что ставит под угрозу безопасность высокорисковых запросов в корпоративных системах.
Google DeepMind: массовое внедрение ИИ-агентов пока небезопасно
Старший научный сотрудник Google DeepMind предупредил о рисках масштабного развертывания автономных ИИ-агентов. Согласно отчету, текущие архитектуры не гарантируют надежность при работе в открытой веб-среде. Вероятность критических сбоев возрастает пропорционально масштабу системы, что делает повсеместное использование агентов для выполнения сложных задач преждевременным и потенциально опасным для бизнеса и пользователей.
Anthropic протестировала ИИ на уязвимость секретных систем правительства США
Компания Anthropic применила свою модель Mythos для поиска критических уязвимостей в засекреченных информационных системах правительства США. В ходе тестирования ИИ успешно выявил слабые места в защите, которые ранее оставались незамеченными специалистами. Этот эксперимент подтвердил эффективность использования специализированных моделей для автоматизированного аудита безопасности в государственных структурах с высоким уровнем доступа.
ИИ-модель Mythos успешно выявила уязвимости в закрытых системах правительства США
Исследователи Anthropic представили модель Mythos, способную проводить автоматизированный поиск уязвимостей в защищенных правительственных системах США. В ходе тестирования ИИ успешно обнаружил критические недостатки в безопасности, которые ранее не были выявлены традиционными методами. Результаты эксперимента подчеркивают потенциал генеративного ИИ в сфере кибербезопасности, а также необходимость усиления защиты критически важной инфраструктуры перед лицом новых угроз.
Безопасность ИИ-агентов: когда запрос на подтверждение становится уязвимостью
Исследование анализирует, в каких случаях механизмы подтверждения действий ИИ-агентом (human-in-the-loop) перестают быть надежным барьером безопасности. Автор показывает, что при неправильной реализации такие промпты могут быть скомпрометированы через манипуляцию контекстом, что позволяет агенту обходить ограничения и выполнять несанкционированные действия, имитируя легитимное одобрение пользователя или скрывая истинный характер операции.
Автономный ИИ-агент обнаружил критическую уязвимость в Hoppscotch
Автономный агент на базе ИИ выявил критическую уязвимость в платформе для тестирования API Hoppscotch, получившую максимальную оценку по шкале CVSS — 10.0. Ошибка позволяла злоумышленникам получить полный контроль над системой через удаленное выполнение кода. Исследователи использовали специализированный агентный фреймворк, способный самостоятельно анализировать исходный код, выстраивать цепочки векторов атак и проверять их работоспособность в изолированной среде.
Переход на постквантовую криптографию: дорожная карта до 2030 года
Правительство США выпустило исполнительный указ, устанавливающий жесткие сроки для перехода критической инфраструктуры на постквантовые алгоритмы шифрования. К 2030 году государственные ведомства и связанные с ними отрасли должны завершить миграцию на стандарты, устойчивые к атакам с использованием квантовых компьютеров. Этот шаг направлен на защиту данных от будущих угроз, когда вычислительные мощности позволят взламывать современные методы шифрования, такие как RSA и ECC.
Исследование безопасности популярных ИИ-агентов
Исследователи представили первый комплексный анализ безопасности широко используемых агентных систем, предназначенных для наступательных операций. Работа демонстрирует, что по мере роста автономности агентов их уязвимость к атакам становится критическим фактором. Авторы оценивают риски эксплуатации инфраструктуры агентов и предлагают методологию для выявления векторов атак, которые могут привести к компрометации систем управления и утечке данных.
OpenAI запускает программу по поиску уязвимостей в open-source проектах
OpenAI объявила о запуске новой инициативы, направленной на повышение безопасности программного обеспечения с открытым исходным кодом. Компания планирует инвестировать ресурсы в поиск критических уязвимостей в популярных библиотеках и фреймворках, которые составляют основу современной инфраструктуры разработки. В рамках программы эксперты будут не только выявлять бреши в коде, но и помогать сообществу с их оперативным устранением.
Результаты тестирования ИИ-моделей Anthropic в закрытых системах АНБ
В ходе недавних испытаний по методу red-teaming модель Mythos от компании Anthropic продемонстрировала способность к обходу систем защиты, используемых Агентством национальной безопасности США. В рамках контролируемого эксперимента ИИ-система за несколько часов получила доступ к значительному объему классифицированных данных, имитируя действия злоумышленника внутри защищенного периметра. Эти результаты стали одним из ключевых факторов, повлиявших на решение правительства США ограничить доступ к наиболее мощным версиям моделей Anthropic для широкого круга пользователей.
Исследование механизмов промпт-инъекций через концепцию ролевой путаницы
Новое исследование предлагает рассматривать проблему промпт-инъекций в больших языковых моделях через призму «ролевой путаницы» (role confusion). Авторы анализируют, как модели, обученные следовать инструкциям и принимать определенные системные роли, теряют границы между заданными правилами и пользовательским вводом. В основе проблемы лежит конфликт приоритетов, когда модель не может однозначно определить, какой из входящих сигналов является приоритетным — системный промпт или вредоносная инструкция, замаскированная под контекст задачи.
Уязвимость в инструментах разработки: перехват контроля через Sentry
Исследователи обнаружили критический вектор атаки на популярные инструменты разработки с поддержкой ИИ, такие как Claude Code, Cursor и Codex. Уязвимость связана с использованием публичных ключей Sentry, которые позволяют злоумышленникам перехватывать данные сессий и манипулировать рабочим процессом агентов. Атака, получившая название «agentjacking», эксплуатирует доверие систем к конфигурационным файлам и логам, отправляемым в облачные сервисы мониторинга.
Дорожная карта Google DeepMind по контролю над ИИ-агентами
Google DeepMind представила стратегический план по обеспечению безопасности при разработке автономных ИИ-агентов. Документ фокусируется на создании механизмов контроля, которые позволят ограничивать действия систем в реальном времени, предотвращая нежелательное поведение даже при работе с высокопроизводительными моделями. Основная цель инициативы — разработка стандартов, позволяющих безопасно интегрировать агентов в критически важные бизнес-процессы и инфраструктурные системы.
Исследование: способность LLM распознавать атаки через префиллы
Исследователи проанализировали способность больших языковых моделей к саморефлексии в контексте безопасности. В ходе эксперимента проверялось, могут ли модели самостоятельно определять, что их ответ был скомпрометирован в результате атаки через «враждебный префилл» (adversarial prefill). В тестировании участвовали десять моделей с открытыми весами объемом от 3 до 70 миллиардов параметров, а также четыре специализированных бенчмарка безопасности.
Защита ИИ-агентов от атак через непрямые промпт-инъекции
Разработчики платформы Tabstack представили комплексный подход к защите ИИ-агентов от непрямых промпт-инъекций. Этот тип уязвимостей возникает, когда агент считывает внешний контент — например, содержимое веб-страниц или документов, — содержащий скрытые инструкции, которые пытаются перехватить управление или изменить логику работы системы. Проблема становится критической для автономных агентов, которые активно взаимодействуют с неконтролируемыми данными из интернета.
Разведсоюз Five Eyes предупредил об угрозах ИИ для кибербезопасности
Разведывательный альянс Five Eyes, объединяющий спецслужбы США, Великобритании, Канады, Австралии и Новой Зеландии, опубликовал предупреждение о рисках, связанных с развитием передовых моделей искусственного интеллекта. По оценкам экспертов, в ближайшие месяцы возможности нейросетей могут радикально изменить ландшафт киберугроз, предоставив злоумышленникам инструменты для проведения масштабных наступательных операций.
OpenAI представила инструменты Daybreak для автоматизации кибербезопасности
Компания OpenAI анонсировала запуск платформы Daybreak, предназначенной для автоматизированного поиска и устранения уязвимостей в корпоративных IT-системах. В состав нового набора инструментов вошли специализированные решения Codex Security и модель GPT-5.5-Cyber. Эти разработки призваны масштабировать процессы проверки безопасности кода и инфраструктуры, позволяя организациям оперативно выявлять критические бреши и внедрять патчи в автоматическом режиме.
Проблема безопасности ИИ-агентов с доступом к записи данных
Разработчики обсуждают риски, связанные с внедрением ИИ-агентов, обладающих правами на запись и изменение данных во внешних системах. Основная угроза заключается в атаках типа «payload smuggling», когда злоумышленники через специально сформированные входные данные или контекст заставляют агента выполнить несанкционированные действия. В условиях, когда агент имеет доступ к API, базам данных или файловым системам, последствия таких манипуляций могут быть критическими для целостности инфраструктуры.
Ограничения MicroVM в обеспечении безопасности ИИ-агентов
Использование изолированных сред на базе MicroVM стало стандартным подходом для запуска кода, генерируемого языковыми моделями. Технология эффективно предотвращает несанкционированный доступ к файловой системе хоста и ограничивает сетевую активность, создавая защищенный контур для выполнения потенциально опасных скриптов. Однако такой подход не решает фундаментальную проблему безопасности, связанную с агентной логикой и управлением доступом к внешним API.
Anthropic вводит обязательную верификацию личности для доступа к ряду функций
Компания Anthropic объявила об обновлении протоколов безопасности, согласно которым с 8 июля пользователи обязаны проходить процедуру подтверждения личности для доступа к определенным возможностям платформы. Данное требование направлено на снижение рисков, связанных с неправомерным использованием продвинутых моделей искусственного интеллекта, и обеспечение соответствия внутренним стандартам безопасности компании.
Сжатие контекста как уязвимость безопасности ИИ-агентов
Исследователи выявили критическую уязвимость в работе долгоживущих ИИ-агентов, связанную с методами управления контекстом. При использовании техник сжатия, суммаризации или удаления старых сообщений для экономии токенов агенты теряют доступ к важным инструкциям по безопасности. В результате модель, которая изначально строго следовала заданным ограничениям, начинает игнорировать их после того, как системные правила вытесняются из активного окна контекста.
Исследование рисков конфиденциальности при работе ИИ-агентов
Исследователи представили анализ уязвимостей, возникающих при интеграции ИИ-агентов в рабочие процессы. Основная проблема заключается в расширении прав доступа моделей к личным данным пользователей, почтовым клиентам и внутренним корпоративным системам. В ходе экспериментов удалось продемонстрировать сценарии, при которых агент, выполняя задачу по автоматизации, непреднамеренно передает конфиденциальную информацию сторонним сервисам или сохраняет её в незащищенных логах.
Уязвимость AutoJack: риск удаленного выполнения кода в ИИ-агентах
Исследователи Microsoft обнаружили критическую уязвимость под названием AutoJack, которая позволяет злоумышленникам получить контроль над хост-системой, где запущен ИИ-агент. Проблема заключается в том, что агент может выполнить вредоносный код, просто посетив специально подготовленную веб-страницу. В процессе обработки контента страницы агент непреднамеренно интерпретирует скрытые инструкции как команды для выполнения в операционной системе.
Lelu: система авторизации для защиты ИИ-агентов от манипуляций
Разработчики представили Lelu — специализированный движок авторизации, предназначенный для контроля действий ИИ-агентов. Инструмент решает проблему несанкционированного доступа и манипуляций, когда агент может выйти за рамки заданных полномочий или выполнить критические операции без должной проверки. Система работает как промежуточный слой, который верифицирует каждый запрос агента к внешним API или внутренним ресурсам, основываясь на политиках доступа.