Безопасность и алайнмент
Уязвимость квантовых нейронных сетей к динамическим бэкдор-атакам
Исследователи представили новый метод динамических бэкдор-атак на квантовые нейронные сети (QNN), который обходит ограничения традиционных статических методов. В отличие от классических атак с фиксированным триггером, новый подход использует входные данные для генерации уникальных паттернов воздействия. Это делает вредоносное вмешательство практически незаметным для стандартных систем обнаружения аномалий в квантовых вычислительных средах.
Уязвимость распределенных бэкдоров в мультиагентных системах
Исследователи выявили критическую уязвимость в системах безопасности мультиагентных ИИ-архитектур. Традиционные методы мониторинга, проверяющие каждый шаг агента или вызов инструмента по отдельности, не способны обнаружить «распределенные бэкдоры». В таких атаках вредоносная нагрузка фрагментируется между несколькими агентами, что позволяет обходить локальные проверки безопасности, несмотря на то, что итоговый результат действий системы является вредоносным.
Уязвимости ИИ-агентов к методам социальной инженерии
Исследователи проанализировали новые векторы атак на автономные ИИ-агенты, использующие методы социальной инженерии. В отличие от классических атак на чат-ботов, эти угрозы нацелены на манипуляцию агентными системами, имеющими доступ к внешним инструментам и API. Эксперты классифицировали основные приемы обмана и предложили стратегии защиты для предотвращения несанкционированных действий агентов в реальных бизнес-процессах.
Автоматизированный ред-тиминг для ИИ-агентов в продакшене
Исследователи представили метод автоматизированного ред-тиминга для оценки безопасности ИИ-агентов, работающих с внешними файлами и командами. Система использует подход «агент против агента», где атакующий ИИ ищет уязвимости в целевой модели, анализируя рабочее пространство и контекст выполнения. Это позволяет выявлять критические сбои в безопасности, которые возникают при взаимодействии моделей с недоверенным контентом в реальных рабочих средах.
Контекстная бомбардировка как метод защиты ИИ-агентов
Исследователи безопасности начали использовать промпт-инъекции для защиты ИИ-систем. Метод «контекстной бомбардировки» (context bombing) заключается в принудительной отправке агенту специфических инструкций, которые заставляют его завершить работу или заблокировать выполнение вредоносных команд до того, как будет нанесен реальный ущерб. Этот подход превращает уязвимость в инструмент активной обороны инфраструктуры.
Cloudflare представила Precursor для детекции агентного поведения ботов
Cloudflare запустила Precursor — систему непрерывной валидации поведения, предназначенную для выявления продвинутых ИИ-агентов и автоматизированных ботов. Инструмент анализирует взаимодействие пользователя с интерфейсом на протяжении всей сессии, превращая поведенческие паттерны в сигналы для защиты. Это позволяет точнее отличать действия реальных людей от сложных скриптов, минимизируя ложные срабатывания и улучшая пользовательский опыт на защищаемых ресурсах.
Почему промпт-инъекции работают: взгляд на уровне архитектуры Transformer
Исследование объясняет уязвимость LLM к промпт-инъекциям через фундаментальные принципы работы архитектуры Transformer. В отличие от классического ПО, где данные и команды разделены, в трансформерах контекст и инструкции обрабатываются как единый поток токенов. Это стирает границы между системными установками и пользовательским вводом, позволяя модели переключаться на выполнение вредоносных команд, заложенных в запросе.
Контемплятивные практики как новый метод алайнмента LLM
Исследователи представили модульный фреймворк для улучшения алайнмента больших языковых моделей через интеграцию принципов созерцательных практик, таких как осознанность и сострадание. Подход направлен на снижение этических нарушений и повышение просоциального поведения ИИ, особенно в чувствительных областях, включая ментальное здоровье. Работа предлагает новые метрики для оценки того, как философские концепции влияют на логику и безопасность ответов моделей.
Архитектура доказательств для верификации действий ИИ
Разработчики представили концепцию архитектуры доказательств, призванную решить проблему манипуляции логами ИИ-систем. В отличие от стандартных журналов событий, которые легко редактируются, предлагаемый подход использует криптографическую фиксацию действий агента. Это обеспечивает неизменность данных, позволяя аудиторам и пользователям проверять подлинность принятых ИИ решений и предотвращать подмену доказательств в критически важных процессах.
Уязвимость Agent Data Injection: как атакуют веб-агентов
Исследователи из Сеульского национального университета выявили критическую уязвимость Agent Data Injection, позволяющую злоумышленникам манипулировать действиями автономных веб-агентов. Через внедрение вредоносного контента на веб-страницы атакующие могут принуждать агентов выполнять несанкционированные клики и действия, обходя стандартные механизмы защиты и используя доверие системы к данным из внешней среды.
Риски безопасности при использовании WebMCP в ИИ-агентах
Протокол WebMCP, позволяющий ИИ-агентам взаимодействовать с внешними инструментами, создает критическую уязвимость для атак типа prompt injection. Злоумышленники могут использовать специально подготовленные веб-страницы или данные, чтобы перехватить управление агентом через доступные ему функции. Разработчикам рекомендуется ограничить права доступа инструментов и внедрить строгую валидацию входящих запросов для защиты систем от несанкционированного контроля.
Ghostcommit: новый метод скрытых промпт-инъекций через изображения
Исследователи представили метод Ghostcommit, позволяющий внедрять вредоносные промпт-инъекции в изображения для компрометации ИИ-агентов. Техника использует стеганографию для скрытия команд, которые активируются при обработке визуального контента мультимодальными моделями. Это создает серьезную угрозу для систем, использующих ИИ для анализа пользовательских файлов, позволяя злоумышленникам красть конфиденциальные данные или перехватывать управление агентными процессами без ведома пользователя.
Инструмент для аудита безопасности ИИ-агентов через MCP
Разработчики представили open-source инструмент для сканирования уязвимостей в ИИ-агентах, использующих стандарт Model Context Protocol (MCP). Решение позволяет проводить автоматизированный аудит конфигураций и прав доступа, выявляя потенциальные риски несанкционированного выполнения команд или утечки данных. Инструмент интегрируется в рабочие процессы разработки, помогая обеспечить безопасность агентных систем на этапе их проектирования и развертывания.
Meta удалила код системы распознавания лиц из приложения для умных очков
Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) удалила из своего приложения для умных очков Ray-Ban Meta код, отвечающий за функцию распознавания лиц. Решение было принято после публикации расследования Wired, которое выявило наличие соответствующих алгоритмов в программном обеспечении устройства, что вызвало обеспокоенность по поводу приватности пользователей и соблюдения этических норм при сборе биометрических данных.
Meta ограничила функционал ИИ-генерации изображений после критики пользователей
Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) временно ограничила работу функции «Imagine» в своих социальных сетях. Решение принято после массовой критики пользователей, столкнувшихся с генерацией неуместного, расистского и сексуализированного контента. Инструмент, запущенный для создания изображений по текстовым запросам, продемонстрировал уязвимости в системах фильтрации и безопасности контента.
Prismata: защита веб-агентов от атак через межсайтовые промпт-инъекции
Исследователи представили Prismata — систему защиты веб-агентов от атак типа Cross-Site Prompt Injection (CSPI). Решение изолирует контекст взаимодействия агента с внешними веб-страницами, предотвращая выполнение вредоносных инструкций, скрытых в контенте сайтов. Это критически важный механизм для безопасной автоматизации действий агентов в неконтролируемой среде интернета, где злоумышленники могут внедрять скрытые команды в HTML-разметку.
Механизмы возникновения «галлюцинаторных спиралей» в LLM
Исследователи проанализировали феномен, при котором чат-боты начинают генерировать последовательные ложные утверждения, подкрепляя их вымышленными аргументами. Проблема заключается в архитектурной особенности трансформеров: модель воспринимает собственный предыдущий вывод как истинный контекст, что создает петлю обратной связи. В результате ИИ теряет связь с реальностью, превращая единичную ошибку в устойчивую цепочку заблуждений, которую сложно прервать без внешнего вмешательства.
VEXAIoT: автономный поиск уязвимостей в IoT-устройствах с помощью ИИ-агентов
Исследователи представили VEXAIoT — фреймворк на базе LLM-агентов, предназначенный для автоматизированного поиска и эксплуатации уязвимостей в устройствах интернета вещей (IoT). Система адаптируется к ограниченным аппаратным ресурсам и специфическим прошивкам, позволяя масштабировать тестирование безопасности там, где традиционные методы пентеста требуют значительных ручных усилий и глубокой экспертизы в узких протоколах.
TrustX: новый фреймворк для классификации рисков агентных ИИ-систем
Исследователи представили TrustX Agent Risk Classification Framework (ARC) — специализированный инструмент для оценки и управления рисками в агентных ИИ-системах. Фреймворк позволяет систематизировать угрозы для семи различных типов автономных агентов, внедряемых в корпоративном и государственном секторах, где существующие общие стандарты безопасности оказываются недостаточно эффективными для контроля за сложным агентным поведением.
Исследователи обнаружили способ создания скрытых бэкдоров в нейросетях
Исследователи представили метод внедрения бэкдоров в глубокие нейронные сети, которые невозможно обнаружить даже при полном доступе к весам модели. Эти вредоносные вставки статистически неотличимы от параметров честно обученных систем, что делает традиционные методы аудита безопасности неэффективными. Уязвимость затрагивает широкий класс архитектур прямого распространения, позволяя злоумышленникам скрыто управлять поведением ИИ.
Anthropic представила метод модульного обучения для контроля доступа к знаниям моделей
Исследователи Anthropic предложили подход модульного предварительного обучения, позволяющий изолировать определенные знания внутри нейросети. Метод позволяет ограничивать доступ к конфиденциальной или опасной информации, сохраняя при этом общую производительность модели. Это решение дает возможность разработчикам выборочно отключать или активировать специфические домены знаний без необходимости полного переобучения всей архитектуры системы.
Бен Бернанке вошел в состав совета по надзору Anthropic
Бывший глава Федеральной резервной системы США Бен Бернанке стал членом Long-Term Benefit Trust компании Anthropic. Этот орган отвечает за контроль над безопасностью и этическими принципами разработки ИИ-моделей. Назначение экономиста с мировым именем подчеркивает стремление компании усилить независимый надзор за развитием технологий, которые могут оказать значительное влияние на экономику и общество в долгосрочной перспективе.
Опубликован отчет о безопасности модели GPT-5.6
OpenAI представила подробный отчет о безопасности (System Card) для модели GPT-5.6, описывающий результаты тестирования системы на устойчивость к рискам. Документ раскрывает методологию оценки модели, включая анализ потенциальных угроз, уязвимостей и эффективности защитных механизмов, внедренных для предотвращения генерации вредоносного контента и обеспечения предсказуемого поведения ИИ в различных сценариях использования.
Anthropic запускает программу Hard Questions для анализа рисков ИИ
Компания Anthropic представила инициативу Hard Questions, направленную на глубокое исследование сложных этических и технических проблем, связанных с развитием ИИ. Программа фокусируется на поиске ответов на вопросы, где нет однозначных решений, включая риски безопасности, влияние моделей на общество и методы контроля за автономными системами, чтобы обеспечить их предсказуемое и безопасное поведение.