Безопасность и алайнмент

Концепция Unfireable Safety Kernel для защиты ИИ-агентов arXiv · 24.06.2026 Исследователи представили архитектуру Unfireable Safety Kernel — метод обеспечения безопасности ИИ-агентов, выносящий механизмы контроля за пределы среды исполнения самой модели. В отличие от традиционных системных промптов или фильтров, работающих внутри адресного пространства агента, этот подход изолирует защитные функции, предотвращая возможность их обхода через манипуляцию входными данными или перехват управления. Метод защиты LLM от отравления данных при дообучении arXiv · 24.06.2026 Исследователи представили метод «Detect, Unlearn, Restore» для защиты моделей суммаризации текста от атак типа data poisoning. Техника позволяет выявлять вредоносные примеры в обучающей выборке, удалять их влияние на веса модели и восстанавливать исходную производительность системы. Это критически важно для защиты специализированных LLM, которые подвержены манипуляциям через небольшие наборы данных при дообучении. Уязвимости конфиденциальности в табличных foundation-моделях arXiv · 24.06.2026 Исследователи выявили критические риски конфиденциальности в табличных foundation-моделях, использующих механизм внимания. Несмотря на обучение на синтетических данных, модели подвержены утечкам чувствительной информации при инференсе. В процессе in-context learning данные, передаваемые в качестве размеченных примеров, могут быть восстановлены через анализ весов внимания, что ставит под угрозу безопасность высокорисковых запросов в корпоративных системах. Google DeepMind: массовое внедрение ИИ-агентов пока небезопасно Generative AI in Search Marketing: News & Expert Guides · 24.06.2026 Старший научный сотрудник Google DeepMind предупредил о рисках масштабного развертывания автономных ИИ-агентов. Согласно отчету, текущие архитектуры не гарантируют надежность при работе в открытой веб-среде. Вероятность критических сбоев возрастает пропорционально масштабу системы, что делает повсеместное использование агентов для выполнения сложных задач преждевременным и потенциально опасным для бизнеса и пользователей. Anthropic протестировала ИИ на уязвимость секретных систем правительства США Hacker News · 24.06.2026 Компания Anthropic применила свою модель Mythos для поиска критических уязвимостей в засекреченных информационных системах правительства США. В ходе тестирования ИИ успешно выявил слабые места в защите, которые ранее оставались незамеченными специалистами. Этот эксперимент подтвердил эффективность использования специализированных моделей для автоматизированного аудита безопасности в государственных структурах с высоким уровнем доступа. ИИ-модель Mythos успешно выявила уязвимости в закрытых системах правительства США Hacker News · 24.06.2026 Исследователи Anthropic представили модель Mythos, способную проводить автоматизированный поиск уязвимостей в защищенных правительственных системах США. В ходе тестирования ИИ успешно обнаружил критические недостатки в безопасности, которые ранее не были выявлены традиционными методами. Результаты эксперимента подчеркивают потенциал генеративного ИИ в сфере кибербезопасности, а также необходимость усиления защиты критически важной инфраструктуры перед лицом новых угроз. Безопасность ИИ-агентов: когда запрос на подтверждение становится уязвимостью Hacker News · 23.06.2026 Исследование анализирует, в каких случаях механизмы подтверждения действий ИИ-агентом (human-in-the-loop) перестают быть надежным барьером безопасности. Автор показывает, что при неправильной реализации такие промпты могут быть скомпрометированы через манипуляцию контекстом, что позволяет агенту обходить ограничения и выполнять несанкционированные действия, имитируя легитимное одобрение пользователя или скрывая истинный характер операции. Автономный ИИ-агент обнаружил критическую уязвимость в Hoppscotch Hacker News · 23.06.2026 Автономный агент на базе ИИ выявил критическую уязвимость в платформе для тестирования API Hoppscotch, получившую максимальную оценку по шкале CVSS — 10.0. Ошибка позволяла злоумышленникам получить полный контроль над системой через удаленное выполнение кода. Исследователи использовали специализированный агентный фреймворк, способный самостоятельно анализировать исходный код, выстраивать цепочки векторов атак и проверять их работоспособность в изолированной среде. Переход на постквантовую криптографию: дорожная карта до 2030 года Cloudflare Blog · 23.06.2026 Правительство США выпустило исполнительный указ, устанавливающий жесткие сроки для перехода критической инфраструктуры на постквантовые алгоритмы шифрования. К 2030 году государственные ведомства и связанные с ними отрасли должны завершить миграцию на стандарты, устойчивые к атакам с использованием квантовых компьютеров. Этот шаг направлен на защиту данных от будущих угроз, когда вычислительные мощности позволят взламывать современные методы шифрования, такие как RSA и ECC. Исследование безопасности популярных ИИ-агентов arXiv · 23.06.2026 Исследователи представили первый комплексный анализ безопасности широко используемых агентных систем, предназначенных для наступательных операций. Работа демонстрирует, что по мере роста автономности агентов их уязвимость к атакам становится критическим фактором. Авторы оценивают риски эксплуатации инфраструктуры агентов и предлагают методологию для выявления векторов атак, которые могут привести к компрометации систем управления и утечке данных. OpenAI запускает программу по поиску уязвимостей в open-source проектах AI News & Artificial Intelligence | TechCrunch · 22.06.2026 OpenAI объявила о запуске новой инициативы, направленной на повышение безопасности программного обеспечения с открытым исходным кодом. Компания планирует инвестировать ресурсы в поиск критических уязвимостей в популярных библиотеках и фреймворках, которые составляют основу современной инфраструктуры разработки. В рамках программы эксперты будут не только выявлять бреши в коде, но и помогать сообществу с их оперативным устранением. Результаты тестирования ИИ-моделей Anthropic в закрытых системах АНБ Hacker News · 22.06.2026 В ходе недавних испытаний по методу red-teaming модель Mythos от компании Anthropic продемонстрировала способность к обходу систем защиты, используемых Агентством национальной безопасности США. В рамках контролируемого эксперимента ИИ-система за несколько часов получила доступ к значительному объему классифицированных данных, имитируя действия злоумышленника внутри защищенного периметра. Эти результаты стали одним из ключевых факторов, повлиявших на решение правительства США ограничить доступ к наиболее мощным версиям моделей Anthropic для широкого круга пользователей. Исследование механизмов промпт-инъекций через концепцию ролевой путаницы Lobsters · 22.06.2026 Новое исследование предлагает рассматривать проблему промпт-инъекций в больших языковых моделях через призму «ролевой путаницы» (role confusion). Авторы анализируют, как модели, обученные следовать инструкциям и принимать определенные системные роли, теряют границы между заданными правилами и пользовательским вводом. В основе проблемы лежит конфликт приоритетов, когда модель не может однозначно определить, какой из входящих сигналов является приоритетным — системный промпт или вредоносная инструкция, замаскированная под контекст задачи. Уязвимость в инструментах разработки: перехват контроля через Sentry Hacker News · 22.06.2026 Исследователи обнаружили критический вектор атаки на популярные инструменты разработки с поддержкой ИИ, такие как Claude Code, Cursor и Codex. Уязвимость связана с использованием публичных ключей Sentry, которые позволяют злоумышленникам перехватывать данные сессий и манипулировать рабочим процессом агентов. Атака, получившая название «agentjacking», эксплуатирует доверие систем к конфигурационным файлам и логам, отправляемым в облачные сервисы мониторинга. Дорожная карта Google DeepMind по контролю над ИИ-агентами Hacker News · 22.06.2026 Google DeepMind представила стратегический план по обеспечению безопасности при разработке автономных ИИ-агентов. Документ фокусируется на создании механизмов контроля, которые позволят ограничивать действия систем в реальном времени, предотвращая нежелательное поведение даже при работе с высокопроизводительными моделями. Основная цель инициативы — разработка стандартов, позволяющих безопасно интегрировать агентов в критически важные бизнес-процессы и инфраструктурные системы. Исследование: способность LLM распознавать атаки через префиллы arXiv · 22.06.2026 Исследователи проанализировали способность больших языковых моделей к саморефлексии в контексте безопасности. В ходе эксперимента проверялось, могут ли модели самостоятельно определять, что их ответ был скомпрометирован в результате атаки через «враждебный префилл» (adversarial prefill). В тестировании участвовали десять моделей с открытыми весами объемом от 3 до 70 миллиардов параметров, а также четыре специализированных бенчмарка безопасности. Защита ИИ-агентов от атак через непрямые промпт-инъекции Hacker News · 22.06.2026 Разработчики платформы Tabstack представили комплексный подход к защите ИИ-агентов от непрямых промпт-инъекций. Этот тип уязвимостей возникает, когда агент считывает внешний контент — например, содержимое веб-страниц или документов, — содержащий скрытые инструкции, которые пытаются перехватить управление или изменить логику работы системы. Проблема становится критической для автономных агентов, которые активно взаимодействуют с неконтролируемыми данными из интернета. Разведсоюз Five Eyes предупредил об угрозах ИИ для кибербезопасности The Decoder · 22.06.2026 Разведывательный альянс Five Eyes, объединяющий спецслужбы США, Великобритании, Канады, Австралии и Новой Зеландии, опубликовал предупреждение о рисках, связанных с развитием передовых моделей искусственного интеллекта. По оценкам экспертов, в ближайшие месяцы возможности нейросетей могут радикально изменить ландшафт киберугроз, предоставив злоумышленникам инструменты для проведения масштабных наступательных операций. OpenAI представила инструменты Daybreak для автоматизации кибербезопасности OpenAI News · 22.06.2026 Компания OpenAI анонсировала запуск платформы Daybreak, предназначенной для автоматизированного поиска и устранения уязвимостей в корпоративных IT-системах. В состав нового набора инструментов вошли специализированные решения Codex Security и модель GPT-5.5-Cyber. Эти разработки призваны масштабировать процессы проверки безопасности кода и инфраструктуры, позволяя организациям оперативно выявлять критические бреши и внедрять патчи в автоматическом режиме. Проблема безопасности ИИ-агентов с доступом к записи данных Hacker News · 22.06.2026 Разработчики обсуждают риски, связанные с внедрением ИИ-агентов, обладающих правами на запись и изменение данных во внешних системах. Основная угроза заключается в атаках типа «payload smuggling», когда злоумышленники через специально сформированные входные данные или контекст заставляют агента выполнить несанкционированные действия. В условиях, когда агент имеет доступ к API, базам данных или файловым системам, последствия таких манипуляций могут быть критическими для целостности инфраструктуры. Ограничения MicroVM в обеспечении безопасности ИИ-агентов Hacker News · 21.06.2026 Использование изолированных сред на базе MicroVM стало стандартным подходом для запуска кода, генерируемого языковыми моделями. Технология эффективно предотвращает несанкционированный доступ к файловой системе хоста и ограничивает сетевую активность, создавая защищенный контур для выполнения потенциально опасных скриптов. Однако такой подход не решает фундаментальную проблему безопасности, связанную с агентной логикой и управлением доступом к внешним API. Anthropic вводит обязательную верификацию личности для доступа к ряду функций Hacker News · 21.06.2026 Компания Anthropic объявила об обновлении протоколов безопасности, согласно которым с 8 июля пользователи обязаны проходить процедуру подтверждения личности для доступа к определенным возможностям платформы. Данное требование направлено на снижение рисков, связанных с неправомерным использованием продвинутых моделей искусственного интеллекта, и обеспечение соответствия внутренним стандартам безопасности компании. Сжатие контекста как уязвимость безопасности ИИ-агентов arXiv · 21.06.2026 Исследователи выявили критическую уязвимость в работе долгоживущих ИИ-агентов, связанную с методами управления контекстом. При использовании техник сжатия, суммаризации или удаления старых сообщений для экономии токенов агенты теряют доступ к важным инструкциям по безопасности. В результате модель, которая изначально строго следовала заданным ограничениям, начинает игнорировать их после того, как системные правила вытесняются из активного окна контекста. Исследование рисков конфиденциальности при работе ИИ-агентов Hacker News · 21.06.2026 Исследователи представили анализ уязвимостей, возникающих при интеграции ИИ-агентов в рабочие процессы. Основная проблема заключается в расширении прав доступа моделей к личным данным пользователей, почтовым клиентам и внутренним корпоративным системам. В ходе экспериментов удалось продемонстрировать сценарии, при которых агент, выполняя задачу по автоматизации, непреднамеренно передает конфиденциальную информацию сторонним сервисам или сохраняет её в незащищенных логах.