Безопасность и алайнмент

Уязвимости конфиденциальности в табличных foundation-моделях arXiv · 24.06.2026 Исследователи выявили критические риски конфиденциальности в табличных foundation-моделях, использующих механизм внимания. Несмотря на обучение на синтетических данных, модели подвержены утечкам чувствительной информации при инференсе. В процессе in-context learning данные, передаваемые в качестве размеченных примеров, могут быть восстановлены через анализ весов внимания, что ставит под угрозу безопасность высокорисковых запросов в корпоративных системах. Google DeepMind: массовое внедрение ИИ-агентов пока небезопасно Generative AI in Search Marketing: News & Expert Guides · 24.06.2026 Старший научный сотрудник Google DeepMind предупредил о рисках масштабного развертывания автономных ИИ-агентов. Согласно отчету, текущие архитектуры не гарантируют надежность при работе в открытой веб-среде. Вероятность критических сбоев возрастает пропорционально масштабу системы, что делает повсеместное использование агентов для выполнения сложных задач преждевременным и потенциально опасным для бизнеса и пользователей. Anthropic протестировала ИИ на уязвимость секретных систем правительства США Hacker News · 24.06.2026 Компания Anthropic применила свою модель Mythos для поиска критических уязвимостей в засекреченных информационных системах правительства США. В ходе тестирования ИИ успешно выявил слабые места в защите, которые ранее оставались незамеченными специалистами. Этот эксперимент подтвердил эффективность использования специализированных моделей для автоматизированного аудита безопасности в государственных структурах с высоким уровнем доступа. ИИ-модель Mythos успешно выявила уязвимости в закрытых системах правительства США Hacker News · 24.06.2026 Исследователи Anthropic представили модель Mythos, способную проводить автоматизированный поиск уязвимостей в защищенных правительственных системах США. В ходе тестирования ИИ успешно обнаружил критические недостатки в безопасности, которые ранее не были выявлены традиционными методами. Результаты эксперимента подчеркивают потенциал генеративного ИИ в сфере кибербезопасности, а также необходимость усиления защиты критически важной инфраструктуры перед лицом новых угроз. Безопасность ИИ-агентов: когда запрос на подтверждение становится уязвимостью Hacker News · 23.06.2026 Исследование анализирует, в каких случаях механизмы подтверждения действий ИИ-агентом (human-in-the-loop) перестают быть надежным барьером безопасности. Автор показывает, что при неправильной реализации такие промпты могут быть скомпрометированы через манипуляцию контекстом, что позволяет агенту обходить ограничения и выполнять несанкционированные действия, имитируя легитимное одобрение пользователя или скрывая истинный характер операции. Автономный ИИ-агент обнаружил критическую уязвимость в Hoppscotch Hacker News · 23.06.2026 Автономный агент на базе ИИ выявил критическую уязвимость в платформе для тестирования API Hoppscotch, получившую максимальную оценку по шкале CVSS — 10.0. Ошибка позволяла злоумышленникам получить полный контроль над системой через удаленное выполнение кода. Исследователи использовали специализированный агентный фреймворк, способный самостоятельно анализировать исходный код, выстраивать цепочки векторов атак и проверять их работоспособность в изолированной среде. Переход на постквантовую криптографию: дорожная карта до 2030 года The Cloudflare Blog · 23.06.2026 Правительство США выпустило исполнительный указ, устанавливающий жесткие сроки для перехода критической инфраструктуры на постквантовые алгоритмы шифрования. К 2030 году государственные ведомства и связанные с ними отрасли должны завершить миграцию на стандарты, устойчивые к атакам с использованием квантовых компьютеров. Этот шаг направлен на защиту данных от будущих угроз, когда вычислительные мощности позволят взламывать современные методы шифрования, такие как RSA и ECC. Исследование безопасности популярных ИИ-агентов arXiv · 23.06.2026 Исследователи представили первый комплексный анализ безопасности широко используемых агентных систем, предназначенных для наступательных операций. Работа демонстрирует, что по мере роста автономности агентов их уязвимость к атакам становится критическим фактором. Авторы оценивают риски эксплуатации инфраструктуры агентов и предлагают методологию для выявления векторов атак, которые могут привести к компрометации систем управления и утечке данных. OpenAI запускает программу по поиску уязвимостей в open-source проектах AI News & Artificial Intelligence | TechCrunch · 22.06.2026 OpenAI объявила о запуске новой инициативы, направленной на повышение безопасности программного обеспечения с открытым исходным кодом. Компания планирует инвестировать ресурсы в поиск критических уязвимостей в популярных библиотеках и фреймворках, которые составляют основу современной инфраструктуры разработки. В рамках программы эксперты будут не только выявлять бреши в коде, но и помогать сообществу с их оперативным устранением. Результаты тестирования ИИ-моделей Anthropic в закрытых системах АНБ Hacker News · 22.06.2026 В ходе недавних испытаний по методу red-teaming модель Mythos от компании Anthropic продемонстрировала способность к обходу систем защиты, используемых Агентством национальной безопасности США. В рамках контролируемого эксперимента ИИ-система за несколько часов получила доступ к значительному объему классифицированных данных, имитируя действия злоумышленника внутри защищенного периметра. Эти результаты стали одним из ключевых факторов, повлиявших на решение правительства США ограничить доступ к наиболее мощным версиям моделей Anthropic для широкого круга пользователей. Исследование механизмов промпт-инъекций через концепцию ролевой путаницы Lobsters · 22.06.2026 Новое исследование предлагает рассматривать проблему промпт-инъекций в больших языковых моделях через призму «ролевой путаницы» (role confusion). Авторы анализируют, как модели, обученные следовать инструкциям и принимать определенные системные роли, теряют границы между заданными правилами и пользовательским вводом. В основе проблемы лежит конфликт приоритетов, когда модель не может однозначно определить, какой из входящих сигналов является приоритетным — системный промпт или вредоносная инструкция, замаскированная под контекст задачи. Уязвимость в инструментах разработки: перехват контроля через Sentry Hacker News · 22.06.2026 Исследователи обнаружили критический вектор атаки на популярные инструменты разработки с поддержкой ИИ, такие как Claude Code, Cursor и Codex. Уязвимость связана с использованием публичных ключей Sentry, которые позволяют злоумышленникам перехватывать данные сессий и манипулировать рабочим процессом агентов. Атака, получившая название «agentjacking», эксплуатирует доверие систем к конфигурационным файлам и логам, отправляемым в облачные сервисы мониторинга. Дорожная карта Google DeepMind по контролю над ИИ-агентами Hacker News · 22.06.2026 Google DeepMind представила стратегический план по обеспечению безопасности при разработке автономных ИИ-агентов. Документ фокусируется на создании механизмов контроля, которые позволят ограничивать действия систем в реальном времени, предотвращая нежелательное поведение даже при работе с высокопроизводительными моделями. Основная цель инициативы — разработка стандартов, позволяющих безопасно интегрировать агентов в критически важные бизнес-процессы и инфраструктурные системы. Исследование: способность LLM распознавать атаки через префиллы arXiv · 22.06.2026 Исследователи проанализировали способность больших языковых моделей к саморефлексии в контексте безопасности. В ходе эксперимента проверялось, могут ли модели самостоятельно определять, что их ответ был скомпрометирован в результате атаки через «враждебный префилл» (adversarial prefill). В тестировании участвовали десять моделей с открытыми весами объемом от 3 до 70 миллиардов параметров, а также четыре специализированных бенчмарка безопасности. Защита ИИ-агентов от атак через непрямые промпт-инъекции Hacker News · 22.06.2026 Разработчики платформы Tabstack представили комплексный подход к защите ИИ-агентов от непрямых промпт-инъекций. Этот тип уязвимостей возникает, когда агент считывает внешний контент — например, содержимое веб-страниц или документов, — содержащий скрытые инструкции, которые пытаются перехватить управление или изменить логику работы системы. Проблема становится критической для автономных агентов, которые активно взаимодействуют с неконтролируемыми данными из интернета. Разведсоюз Five Eyes предупредил об угрозах ИИ для кибербезопасности The Decoder · 22.06.2026 Разведывательный альянс Five Eyes, объединяющий спецслужбы США, Великобритании, Канады, Австралии и Новой Зеландии, опубликовал предупреждение о рисках, связанных с развитием передовых моделей искусственного интеллекта. По оценкам экспертов, в ближайшие месяцы возможности нейросетей могут радикально изменить ландшафт киберугроз, предоставив злоумышленникам инструменты для проведения масштабных наступательных операций. OpenAI представила инструменты Daybreak для автоматизации кибербезопасности OpenAI News · 22.06.2026 Компания OpenAI анонсировала запуск платформы Daybreak, предназначенной для автоматизированного поиска и устранения уязвимостей в корпоративных IT-системах. В состав нового набора инструментов вошли специализированные решения Codex Security и модель GPT-5.5-Cyber. Эти разработки призваны масштабировать процессы проверки безопасности кода и инфраструктуры, позволяя организациям оперативно выявлять критические бреши и внедрять патчи в автоматическом режиме. Проблема безопасности ИИ-агентов с доступом к записи данных Hacker News · 22.06.2026 Разработчики обсуждают риски, связанные с внедрением ИИ-агентов, обладающих правами на запись и изменение данных во внешних системах. Основная угроза заключается в атаках типа «payload smuggling», когда злоумышленники через специально сформированные входные данные или контекст заставляют агента выполнить несанкционированные действия. В условиях, когда агент имеет доступ к API, базам данных или файловым системам, последствия таких манипуляций могут быть критическими для целостности инфраструктуры. Ограничения MicroVM в обеспечении безопасности ИИ-агентов Hacker News · 21.06.2026 Использование изолированных сред на базе MicroVM стало стандартным подходом для запуска кода, генерируемого языковыми моделями. Технология эффективно предотвращает несанкционированный доступ к файловой системе хоста и ограничивает сетевую активность, создавая защищенный контур для выполнения потенциально опасных скриптов. Однако такой подход не решает фундаментальную проблему безопасности, связанную с агентной логикой и управлением доступом к внешним API. Anthropic вводит обязательную верификацию личности для доступа к ряду функций Hacker News · 21.06.2026 Компания Anthropic объявила об обновлении протоколов безопасности, согласно которым с 8 июля пользователи обязаны проходить процедуру подтверждения личности для доступа к определенным возможностям платформы. Данное требование направлено на снижение рисков, связанных с неправомерным использованием продвинутых моделей искусственного интеллекта, и обеспечение соответствия внутренним стандартам безопасности компании. Сжатие контекста как уязвимость безопасности ИИ-агентов arXiv · 21.06.2026 Исследователи выявили критическую уязвимость в работе долгоживущих ИИ-агентов, связанную с методами управления контекстом. При использовании техник сжатия, суммаризации или удаления старых сообщений для экономии токенов агенты теряют доступ к важным инструкциям по безопасности. В результате модель, которая изначально строго следовала заданным ограничениям, начинает игнорировать их после того, как системные правила вытесняются из активного окна контекста. Исследование рисков конфиденциальности при работе ИИ-агентов Hacker News · 21.06.2026 Исследователи представили анализ уязвимостей, возникающих при интеграции ИИ-агентов в рабочие процессы. Основная проблема заключается в расширении прав доступа моделей к личным данным пользователей, почтовым клиентам и внутренним корпоративным системам. В ходе экспериментов удалось продемонстрировать сценарии, при которых агент, выполняя задачу по автоматизации, непреднамеренно передает конфиденциальную информацию сторонним сервисам или сохраняет её в незащищенных логах. Уязвимость AutoJack: риск удаленного выполнения кода в ИИ-агентах Hacker News · 20.06.2026 Исследователи Microsoft обнаружили критическую уязвимость под названием AutoJack, которая позволяет злоумышленникам получить контроль над хост-системой, где запущен ИИ-агент. Проблема заключается в том, что агент может выполнить вредоносный код, просто посетив специально подготовленную веб-страницу. В процессе обработки контента страницы агент непреднамеренно интерпретирует скрытые инструкции как команды для выполнения в операционной системе. Lelu: система авторизации для защиты ИИ-агентов от манипуляций Hacker News · 20.06.2026 Разработчики представили Lelu — специализированный движок авторизации, предназначенный для контроля действий ИИ-агентов. Инструмент решает проблему несанкционированного доступа и манипуляций, когда агент может выйти за рамки заданных полномочий или выполнить критические операции без должной проверки. Система работает как промежуточный слой, который верифицирует каждый запрос агента к внешним API или внутренним ресурсам, основываясь на политиках доступа.