Безопасность и алайнмент

Уязвимость квантовых нейронных сетей к динамическим бэкдор-атакам arXiv · 13.07.2026 Исследователи представили новый метод динамических бэкдор-атак на квантовые нейронные сети (QNN), который обходит ограничения традиционных статических методов. В отличие от классических атак с фиксированным триггером, новый подход использует входные данные для генерации уникальных паттернов воздействия. Это делает вредоносное вмешательство практически незаметным для стандартных систем обнаружения аномалий в квантовых вычислительных средах. Уязвимость распределенных бэкдоров в мультиагентных системах arXiv · 13.07.2026 Исследователи выявили критическую уязвимость в системах безопасности мультиагентных ИИ-архитектур. Традиционные методы мониторинга, проверяющие каждый шаг агента или вызов инструмента по отдельности, не способны обнаружить «распределенные бэкдоры». В таких атаках вредоносная нагрузка фрагментируется между несколькими агентами, что позволяет обходить локальные проверки безопасности, несмотря на то, что итоговый результат действий системы является вредоносным. Уязвимости ИИ-агентов к методам социальной инженерии Hacker News · 13.07.2026 Исследователи проанализировали новые векторы атак на автономные ИИ-агенты, использующие методы социальной инженерии. В отличие от классических атак на чат-ботов, эти угрозы нацелены на манипуляцию агентными системами, имеющими доступ к внешним инструментам и API. Эксперты классифицировали основные приемы обмана и предложили стратегии защиты для предотвращения несанкционированных действий агентов в реальных бизнес-процессах. Автоматизированный ред-тиминг для ИИ-агентов в продакшене arXiv · 13.07.2026 Исследователи представили метод автоматизированного ред-тиминга для оценки безопасности ИИ-агентов, работающих с внешними файлами и командами. Система использует подход «агент против агента», где атакующий ИИ ищет уязвимости в целевой модели, анализируя рабочее пространство и контекст выполнения. Это позволяет выявлять критические сбои в безопасности, которые возникают при взаимодействии моделей с недоверенным контентом в реальных рабочих средах. Контекстная бомбардировка как метод защиты ИИ-агентов Ars Technica - All content · 13.07.2026 Исследователи безопасности начали использовать промпт-инъекции для защиты ИИ-систем. Метод «контекстной бомбардировки» (context bombing) заключается в принудительной отправке агенту специфических инструкций, которые заставляют его завершить работу или заблокировать выполнение вредоносных команд до того, как будет нанесен реальный ущерб. Этот подход превращает уязвимость в инструмент активной обороны инфраструктуры. Cloudflare представила Precursor для детекции агентного поведения ботов The Cloudflare Blog · 13.07.2026 Cloudflare запустила Precursor — систему непрерывной валидации поведения, предназначенную для выявления продвинутых ИИ-агентов и автоматизированных ботов. Инструмент анализирует взаимодействие пользователя с интерфейсом на протяжении всей сессии, превращая поведенческие паттерны в сигналы для защиты. Это позволяет точнее отличать действия реальных людей от сложных скриптов, минимизируя ложные срабатывания и улучшая пользовательский опыт на защищаемых ресурсах. Почему промпт-инъекции работают: взгляд на уровне архитектуры Transformer Hacker News · 12.07.2026 Исследование объясняет уязвимость LLM к промпт-инъекциям через фундаментальные принципы работы архитектуры Transformer. В отличие от классического ПО, где данные и команды разделены, в трансформерах контекст и инструкции обрабатываются как единый поток токенов. Это стирает границы между системными установками и пользовательским вводом, позволяя модели переключаться на выполнение вредоносных команд, заложенных в запросе. Контемплятивные практики как новый метод алайнмента LLM arXiv · 12.07.2026 Исследователи представили модульный фреймворк для улучшения алайнмента больших языковых моделей через интеграцию принципов созерцательных практик, таких как осознанность и сострадание. Подход направлен на снижение этических нарушений и повышение просоциального поведения ИИ, особенно в чувствительных областях, включая ментальное здоровье. Работа предлагает новые метрики для оценки того, как философские концепции влияют на логику и безопасность ответов моделей. Архитектура доказательств для верификации действий ИИ Hacker News · 12.07.2026 Разработчики представили концепцию архитектуры доказательств, призванную решить проблему манипуляции логами ИИ-систем. В отличие от стандартных журналов событий, которые легко редактируются, предлагаемый подход использует криптографическую фиксацию действий агента. Это обеспечивает неизменность данных, позволяя аудиторам и пользователям проверять подлинность принятых ИИ решений и предотвращать подмену доказательств в критически важных процессах. Уязвимость Agent Data Injection: как атакуют веб-агентов Hacker News · 12.07.2026 Исследователи из Сеульского национального университета выявили критическую уязвимость Agent Data Injection, позволяющую злоумышленникам манипулировать действиями автономных веб-агентов. Через внедрение вредоносного контента на веб-страницы атакующие могут принуждать агентов выполнять несанкционированные клики и действия, обходя стандартные механизмы защиты и используя доверие системы к данным из внешней среды. Риски безопасности при использовании WebMCP в ИИ-агентах Generative AI in Search Marketing: News & Expert Guides · 12.07.2026 Протокол WebMCP, позволяющий ИИ-агентам взаимодействовать с внешними инструментами, создает критическую уязвимость для атак типа prompt injection. Злоумышленники могут использовать специально подготовленные веб-страницы или данные, чтобы перехватить управление агентом через доступные ему функции. Разработчикам рекомендуется ограничить права доступа инструментов и внедрить строгую валидацию входящих запросов для защиты систем от несанкционированного контроля. Ghostcommit: новый метод скрытых промпт-инъекций через изображения Hacker News · 11.07.2026 Исследователи представили метод Ghostcommit, позволяющий внедрять вредоносные промпт-инъекции в изображения для компрометации ИИ-агентов. Техника использует стеганографию для скрытия команд, которые активируются при обработке визуального контента мультимодальными моделями. Это создает серьезную угрозу для систем, использующих ИИ для анализа пользовательских файлов, позволяя злоумышленникам красть конфиденциальные данные или перехватывать управление агентными процессами без ведома пользователя. Инструмент для аудита безопасности ИИ-агентов через MCP Hacker News · 11.07.2026 Разработчики представили open-source инструмент для сканирования уязвимостей в ИИ-агентах, использующих стандарт Model Context Protocol (MCP). Решение позволяет проводить автоматизированный аудит конфигураций и прав доступа, выявляя потенциальные риски несанкционированного выполнения команд или утечки данных. Инструмент интегрируется в рабочие процессы разработки, помогая обеспечить безопасность агентных систем на этапе их проектирования и развертывания. Meta удалила код системы распознавания лиц из приложения для умных очков Hacker News · 11.07.2026 Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) удалила из своего приложения для умных очков Ray-Ban Meta код, отвечающий за функцию распознавания лиц. Решение было принято после публикации расследования Wired, которое выявило наличие соответствующих алгоритмов в программном обеспечении устройства, что вызвало обеспокоенность по поводу приватности пользователей и соблюдения этических норм при сборе биометрических данных. Meta ограничила функционал ИИ-генерации изображений после критики пользователей Hacker News · 11.07.2026 Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) временно ограничила работу функции «Imagine» в своих социальных сетях. Решение принято после массовой критики пользователей, столкнувшихся с генерацией неуместного, расистского и сексуализированного контента. Инструмент, запущенный для создания изображений по текстовым запросам, продемонстрировал уязвимости в системах фильтрации и безопасности контента. Prismata: защита веб-агентов от атак через межсайтовые промпт-инъекции Hacker News · 10.07.2026 Исследователи представили Prismata — систему защиты веб-агентов от атак типа Cross-Site Prompt Injection (CSPI). Решение изолирует контекст взаимодействия агента с внешними веб-страницами, предотвращая выполнение вредоносных инструкций, скрытых в контенте сайтов. Это критически важный механизм для безопасной автоматизации действий агентов в неконтролируемой среде интернета, где злоумышленники могут внедрять скрытые команды в HTML-разметку. Механизмы возникновения «галлюцинаторных спиралей» в LLM Hacker News · 10.07.2026 Исследователи проанализировали феномен, при котором чат-боты начинают генерировать последовательные ложные утверждения, подкрепляя их вымышленными аргументами. Проблема заключается в архитектурной особенности трансформеров: модель воспринимает собственный предыдущий вывод как истинный контекст, что создает петлю обратной связи. В результате ИИ теряет связь с реальностью, превращая единичную ошибку в устойчивую цепочку заблуждений, которую сложно прервать без внешнего вмешательства. VEXAIoT: автономный поиск уязвимостей в IoT-устройствах с помощью ИИ-агентов arXiv · 10.07.2026 Исследователи представили VEXAIoT — фреймворк на базе LLM-агентов, предназначенный для автоматизированного поиска и эксплуатации уязвимостей в устройствах интернета вещей (IoT). Система адаптируется к ограниченным аппаратным ресурсам и специфическим прошивкам, позволяя масштабировать тестирование безопасности там, где традиционные методы пентеста требуют значительных ручных усилий и глубокой экспертизы в узких протоколах. TrustX: новый фреймворк для классификации рисков агентных ИИ-систем arXiv · 10.07.2026 Исследователи представили TrustX Agent Risk Classification Framework (ARC) — специализированный инструмент для оценки и управления рисками в агентных ИИ-системах. Фреймворк позволяет систематизировать угрозы для семи различных типов автономных агентов, внедряемых в корпоративном и государственном секторах, где существующие общие стандарты безопасности оказываются недостаточно эффективными для контроля за сложным агентным поведением. Исследователи обнаружили способ создания скрытых бэкдоров в нейросетях arXiv · 10.07.2026 Исследователи представили метод внедрения бэкдоров в глубокие нейронные сети, которые невозможно обнаружить даже при полном доступе к весам модели. Эти вредоносные вставки статистически неотличимы от параметров честно обученных систем, что делает традиционные методы аудита безопасности неэффективными. Уязвимость затрагивает широкий класс архитектур прямого распространения, позволяя злоумышленникам скрыто управлять поведением ИИ. Anthropic представила метод модульного обучения для контроля доступа к знаниям моделей Hacker News · 09.07.2026 Исследователи Anthropic предложили подход модульного предварительного обучения, позволяющий изолировать определенные знания внутри нейросети. Метод позволяет ограничивать доступ к конфиденциальной или опасной информации, сохраняя при этом общую производительность модели. Это решение дает возможность разработчикам выборочно отключать или активировать специфические домены знаний без необходимости полного переобучения всей архитектуры системы. Бен Бернанке вошел в состав совета по надзору Anthropic Hacker News · 09.07.2026 Бывший глава Федеральной резервной системы США Бен Бернанке стал членом Long-Term Benefit Trust компании Anthropic. Этот орган отвечает за контроль над безопасностью и этическими принципами разработки ИИ-моделей. Назначение экономиста с мировым именем подчеркивает стремление компании усилить независимый надзор за развитием технологий, которые могут оказать значительное влияние на экономику и общество в долгосрочной перспективе. Опубликован отчет о безопасности модели GPT-5.6 Hacker News · 09.07.2026 OpenAI представила подробный отчет о безопасности (System Card) для модели GPT-5.6, описывающий результаты тестирования системы на устойчивость к рискам. Документ раскрывает методологию оценки модели, включая анализ потенциальных угроз, уязвимостей и эффективности защитных механизмов, внедренных для предотвращения генерации вредоносного контента и обеспечения предсказуемого поведения ИИ в различных сценариях использования. Anthropic запускает программу Hard Questions для анализа рисков ИИ Hacker News · 09.07.2026 Компания Anthropic представила инициативу Hard Questions, направленную на глубокое исследование сложных этических и технических проблем, связанных с развитием ИИ. Программа фокусируется на поиске ответов на вопросы, где нет однозначных решений, включая риски безопасности, влияние моделей на общество и методы контроля за автономными системами, чтобы обеспечить их предсказуемое и безопасное поведение.