Безопасность и алайнмент

Новый метод MIT для выявления моделей, обученных на запрещенном контенте Hacker News · 13.07.2026 Исследователи MIT разработали метод обнаружения моделей, которые обучались на изображениях жестокого обращения с детьми (CASM), не требуя при этом генерации самого контента. Технология анализирует веса нейросети и выявляет специфические паттерны, оставшиеся после обучения на нелегальных датасетах, что позволяет проверять безопасность ИИ-моделей до их публичного развертывания. Уязвимость защиты Excel-файлов при использовании LLM Hacker News · 13.07.2026 Исследователи продемонстрировали, что современные LLM, включая Claude, способны эффективно подбирать пароли к защищенным файлам Excel через автоматизированный перебор. Используя возможности модели по написанию и выполнению кода, злоумышленники могут обходить стандартное шифрование офисных документов, что ставит под угрозу безопасность конфиденциальных данных, хранящихся в устаревших форматах с низкой криптостойкостью. Middleware для защиты LLM от prompt injection Hacker News · 13.07.2026 Разработчик представил middleware на базе Python и FastAPI, предназначенное для защиты LLM-приложений от атак типа prompt injection. Инструмент перехватывает входящие запросы и анализирует их на наличие вредоносных инструкций до того, как они попадут в модель. Это решение позволяет интегрировать слой безопасности в существующие агентные пайплайны, минимизируя риски манипуляции поведением ИИ. Использование LLM в качестве honeypot для защиты систем Hacker News · 13.07.2026 Концепция «LLM-приманок» (honeypots) предлагает новый подход к кибербезопасности, где языковые модели используются для обнаружения и анализа действий злоумышленников. Вместо пассивной защиты система имитирует уязвимый интерфейс, который вовлекает атакующего в диалог. Это позволяет собирать данные о методах промпт-инъекций, векторах атак и целях злоумышленников в режиме реального времени, не подвергая риску реальные бизнес-процессы. Первая зафиксированная кибератака с использованием ИИ-агента Hacker News · 13.07.2026 Компания Sysdig задокументировала случай использования автономного ИИ-агента для проведения полноценной атаки с применением программ-вымогателей. В ходе эксперимента агент самостоятельно просканировал уязвимости, получил доступ к системе, зашифровал данные и попытался скрыть следы своего присутствия. Это событие знаменует переход от теоретических угроз к реальным сценариям использования ИИ в киберпреступности. Уязвимость квантовых нейронных сетей к динамическим бэкдор-атакам arXiv · 13.07.2026 Исследователи представили новый метод динамических бэкдор-атак на квантовые нейронные сети (QNN), который обходит ограничения традиционных статических методов. В отличие от классических атак с фиксированным триггером, новый подход использует входные данные для генерации уникальных паттернов воздействия. Это делает вредоносное вмешательство практически незаметным для стандартных систем обнаружения аномалий в квантовых вычислительных средах. Уязвимость распределенных бэкдоров в мультиагентных системах arXiv · 13.07.2026 Исследователи выявили критическую уязвимость в системах безопасности мультиагентных ИИ-архитектур. Традиционные методы мониторинга, проверяющие каждый шаг агента или вызов инструмента по отдельности, не способны обнаружить «распределенные бэкдоры». В таких атаках вредоносная нагрузка фрагментируется между несколькими агентами, что позволяет обходить локальные проверки безопасности, несмотря на то, что итоговый результат действий системы является вредоносным. Уязвимости ИИ-агентов к методам социальной инженерии Hacker News · 13.07.2026 Исследователи проанализировали новые векторы атак на автономные ИИ-агенты, использующие методы социальной инженерии. В отличие от классических атак на чат-ботов, эти угрозы нацелены на манипуляцию агентными системами, имеющими доступ к внешним инструментам и API. Эксперты классифицировали основные приемы обмана и предложили стратегии защиты для предотвращения несанкционированных действий агентов в реальных бизнес-процессах. Автоматизированный ред-тиминг для ИИ-агентов в продакшене arXiv · 13.07.2026 Исследователи представили метод автоматизированного ред-тиминга для оценки безопасности ИИ-агентов, работающих с внешними файлами и командами. Система использует подход «агент против агента», где атакующий ИИ ищет уязвимости в целевой модели, анализируя рабочее пространство и контекст выполнения. Это позволяет выявлять критические сбои в безопасности, которые возникают при взаимодействии моделей с недоверенным контентом в реальных рабочих средах. Контекстная бомбардировка как метод защиты ИИ-агентов Ars Technica - All content · 13.07.2026 Исследователи безопасности начали использовать промпт-инъекции для защиты ИИ-систем. Метод «контекстной бомбардировки» (context bombing) заключается в принудительной отправке агенту специфических инструкций, которые заставляют его завершить работу или заблокировать выполнение вредоносных команд до того, как будет нанесен реальный ущерб. Этот подход превращает уязвимость в инструмент активной обороны инфраструктуры. Cloudflare представила Precursor для детекции агентного поведения ботов Cloudflare Blog · 13.07.2026 Cloudflare запустила Precursor — систему непрерывной валидации поведения, предназначенную для выявления продвинутых ИИ-агентов и автоматизированных ботов. Инструмент анализирует взаимодействие пользователя с интерфейсом на протяжении всей сессии, превращая поведенческие паттерны в сигналы для защиты. Это позволяет точнее отличать действия реальных людей от сложных скриптов, минимизируя ложные срабатывания и улучшая пользовательский опыт на защищаемых ресурсах. Почему промпт-инъекции работают: взгляд на уровне архитектуры Transformer Hacker News · 12.07.2026 Исследование объясняет уязвимость LLM к промпт-инъекциям через фундаментальные принципы работы архитектуры Transformer. В отличие от классического ПО, где данные и команды разделены, в трансформерах контекст и инструкции обрабатываются как единый поток токенов. Это стирает границы между системными установками и пользовательским вводом, позволяя модели переключаться на выполнение вредоносных команд, заложенных в запросе. Контемплятивные практики как новый метод алайнмента LLM arXiv · 12.07.2026 Исследователи представили модульный фреймворк для улучшения алайнмента больших языковых моделей через интеграцию принципов созерцательных практик, таких как осознанность и сострадание. Подход направлен на снижение этических нарушений и повышение просоциального поведения ИИ, особенно в чувствительных областях, включая ментальное здоровье. Работа предлагает новые метрики для оценки того, как философские концепции влияют на логику и безопасность ответов моделей. Архитектура доказательств для верификации действий ИИ Hacker News · 12.07.2026 Разработчики представили концепцию архитектуры доказательств, призванную решить проблему манипуляции логами ИИ-систем. В отличие от стандартных журналов событий, которые легко редактируются, предлагаемый подход использует криптографическую фиксацию действий агента. Это обеспечивает неизменность данных, позволяя аудиторам и пользователям проверять подлинность принятых ИИ решений и предотвращать подмену доказательств в критически важных процессах. Уязвимость Agent Data Injection: как атакуют веб-агентов Hacker News · 12.07.2026 Исследователи из Сеульского национального университета выявили критическую уязвимость Agent Data Injection, позволяющую злоумышленникам манипулировать действиями автономных веб-агентов. Через внедрение вредоносного контента на веб-страницы атакующие могут принуждать агентов выполнять несанкционированные клики и действия, обходя стандартные механизмы защиты и используя доверие системы к данным из внешней среды. Риски безопасности при использовании WebMCP в ИИ-агентах Generative AI in Search Marketing: News & Expert Guides · 12.07.2026 Протокол WebMCP, позволяющий ИИ-агентам взаимодействовать с внешними инструментами, создает критическую уязвимость для атак типа prompt injection. Злоумышленники могут использовать специально подготовленные веб-страницы или данные, чтобы перехватить управление агентом через доступные ему функции. Разработчикам рекомендуется ограничить права доступа инструментов и внедрить строгую валидацию входящих запросов для защиты систем от несанкционированного контроля. Ghostcommit: новый метод скрытых промпт-инъекций через изображения Hacker News · 11.07.2026 Исследователи представили метод Ghostcommit, позволяющий внедрять вредоносные промпт-инъекции в изображения для компрометации ИИ-агентов. Техника использует стеганографию для скрытия команд, которые активируются при обработке визуального контента мультимодальными моделями. Это создает серьезную угрозу для систем, использующих ИИ для анализа пользовательских файлов, позволяя злоумышленникам красть конфиденциальные данные или перехватывать управление агентными процессами без ведома пользователя. Инструмент для аудита безопасности ИИ-агентов через MCP Hacker News · 11.07.2026 Разработчики представили open-source инструмент для сканирования уязвимостей в ИИ-агентах, использующих стандарт Model Context Protocol (MCP). Решение позволяет проводить автоматизированный аудит конфигураций и прав доступа, выявляя потенциальные риски несанкционированного выполнения команд или утечки данных. Инструмент интегрируется в рабочие процессы разработки, помогая обеспечить безопасность агентных систем на этапе их проектирования и развертывания. Meta удалила код системы распознавания лиц из приложения для умных очков Hacker News · 11.07.2026 Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) удалила из своего приложения для умных очков Ray-Ban Meta код, отвечающий за функцию распознавания лиц. Решение было принято после публикации расследования Wired, которое выявило наличие соответствующих алгоритмов в программном обеспечении устройства, что вызвало обеспокоенность по поводу приватности пользователей и соблюдения этических норм при сборе биометрических данных. Meta ограничила функционал ИИ-генерации изображений после критики пользователей Hacker News · 11.07.2026 Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) временно ограничила работу функции «Imagine» в своих социальных сетях. Решение принято после массовой критики пользователей, столкнувшихся с генерацией неуместного, расистского и сексуализированного контента. Инструмент, запущенный для создания изображений по текстовым запросам, продемонстрировал уязвимости в системах фильтрации и безопасности контента. Prismata: защита веб-агентов от атак через межсайтовые промпт-инъекции Hacker News · 10.07.2026 Исследователи представили Prismata — систему защиты веб-агентов от атак типа Cross-Site Prompt Injection (CSPI). Решение изолирует контекст взаимодействия агента с внешними веб-страницами, предотвращая выполнение вредоносных инструкций, скрытых в контенте сайтов. Это критически важный механизм для безопасной автоматизации действий агентов в неконтролируемой среде интернета, где злоумышленники могут внедрять скрытые команды в HTML-разметку. Механизмы возникновения «галлюцинаторных спиралей» в LLM Hacker News · 10.07.2026 Исследователи проанализировали феномен, при котором чат-боты начинают генерировать последовательные ложные утверждения, подкрепляя их вымышленными аргументами. Проблема заключается в архитектурной особенности трансформеров: модель воспринимает собственный предыдущий вывод как истинный контекст, что создает петлю обратной связи. В результате ИИ теряет связь с реальностью, превращая единичную ошибку в устойчивую цепочку заблуждений, которую сложно прервать без внешнего вмешательства. VEXAIoT: автономный поиск уязвимостей в IoT-устройствах с помощью ИИ-агентов arXiv · 10.07.2026 Исследователи представили VEXAIoT — фреймворк на базе LLM-агентов, предназначенный для автоматизированного поиска и эксплуатации уязвимостей в устройствах интернета вещей (IoT). Система адаптируется к ограниченным аппаратным ресурсам и специфическим прошивкам, позволяя масштабировать тестирование безопасности там, где традиционные методы пентеста требуют значительных ручных усилий и глубокой экспертизы в узких протоколах. TrustX: новый фреймворк для классификации рисков агентных ИИ-систем arXiv · 10.07.2026 Исследователи представили TrustX Agent Risk Classification Framework (ARC) — специализированный инструмент для оценки и управления рисками в агентных ИИ-системах. Фреймворк позволяет систематизировать угрозы для семи различных типов автономных агентов, внедряемых в корпоративном и государственном секторах, где существующие общие стандарты безопасности оказываются недостаточно эффективными для контроля за сложным агентным поведением.