Безопасность и алайнмент
Уязвимость GhostApproval в ИИ-ассистентах для написания кода
Исследователи Wiz обнаружили критическую уязвимость GhostApproval, затрагивающую популярные ИИ-инструменты для разработки. Проблема заключается в обходе границ доверия при выполнении кода, когда ассистент может одобрить вредоносные изменения без ведома пользователя. Атака позволяет злоумышленникам внедрять бэкдоры в репозитории, используя доверие разработчика к рекомендациям ИИ-моделей, что ставит под угрозу цепочки поставок ПО.
Уязвимости в платформах ИИ-агентов и методы защиты
Платформы для создания ИИ-агентов сталкиваются с новыми векторами атак, использующими уязвимости в цепочках вызовов инструментов и управлении контекстом. Разработчики Kong подчеркивают, что текущие архитектуры часто не учитывают риски инъекций промптов и несанкционированного доступа к API, что требует внедрения многоуровневых механизмов контроля доступа и строгой валидации входящих данных на уровне шлюзов.
Cloudflare о выборе постквантовых алгоритмов подписи
Cloudflare проанализировала девять новых алгоритмов цифровой подписи, предложенных NIST для защиты от угроз будущих квантовых компьютеров. Несмотря на активную разработку перспективных решений, компания рекомендует использовать ML-DSA как наиболее зрелый и эффективный стандарт на текущий момент. Это решение обеспечивает необходимый уровень безопасности, пока индустрия ожидает завершения стандартизации более совершенных криптографических методов.
Метод Jacobian Fingerprinting для идентификации происхождения LLM
Исследователи представили метод Jacobian Fingerprinting, позволяющий определять «авторство» языковых моделей через анализ их внутренних градиентов. Технология выявляет уникальные характеристики нейросетей, возникающие в процессе обучения, что помогает отслеживать происхождение контента и бороться с несанкционированным использованием весов моделей. Это решение предлагает новый подход к верификации ИИ-систем и защите интеллектуальной собственности разработчиков.
Фонд в $100 000 для защиты соревнований по кибербезопасности от ИИ
Компания OSEC запустила инициативу по сбору 100 000 долларов для адаптации соревнований формата CTF (Capture The Flag) к условиям повсеместного использования ИИ. Авторы проекта стремятся сохранить образовательную ценность турниров, которые оказались под угрозой из-за способности нейросетей мгновенно решать классические задачи на поиск уязвимостей, обесценивая навыки участников и усложняя процесс оценки компетенций.
Google устранила уязвимость в ИИ-агентах, грозившую утечкой данных
Google оперативно закрыла критическую уязвимость в своих ИИ-инструментах, которая позволяла сторонним лицам получать доступ к конфиденциальным диалогам пользователей. Проблема была обнаружена исследователями безопасности и затрагивала механизмы обработки запросов в корпоративных ИИ-решениях компании. Уязвимость создавала риск несанкционированного доступа к истории переписки, что потребовало немедленного обновления систем безопасности для защиты корпоративных данных.
OpenAI запускает программу Bio Bug Bounty для оценки биологических угроз
OpenAI расширяет программу поиска уязвимостей, фокусируясь на оценке рисков, связанных с использованием моделей для создания биологических угроз. Компания привлекает экспертов для проверки способности ИИ-систем помогать в планировании и проведении биологических атак. Инициатива направлена на выявление критических пробелов в безопасности и предотвращение потенциального злоупотребления технологиями в области биологии.
Anthropic представила метод «выключателя» для опасных знаний в ИИ-моделях
Исследователи Anthropic разработали метод удаления специфических опасных знаний из нейросетей без ущерба для их общей функциональности. Техника, названная «отключением знаний», позволяет избирательно подавлять информацию, например, о создании биологического оружия, сохраняя при этом способность модели к рассуждению и выполнению повседневных задач. Это важный шаг в решении проблемы «двойного назначения» технологий.
Уязвимость RAG-систем к непрямым промпт-инъекциям
Исследователи продемонстрировали практический сценарий непрямой промпт-инъекции в RAG-конвейерах. Атака заключается в размещении вредоносного контента на внешних ресурсах, которые индексируются системой. В результате ИИ-агент, извлекая данные из скомпрометированного источника, перехватывает управление и выполняет несанкционированные действия, игнорируя системные инструкции и подвергая риску целостность бизнес-процессов, автоматизированных с помощью LLM.
OpenAI запускает инициативу Patch the Planet для защиты open-source инфраструктуры
OpenAI анонсировала программу Patch the Planet, направленную на повышение безопасности критически важных open-source проектов. Компания выделила гранты для разработчиков, занимающихся устранением уязвимостей в программном обеспечении, которое лежит в основе современной ИИ-инфраструктуры. Инициатива реализуется в партнерстве с экспертами из Trail of Bits для системного аудита и укрепления наиболее значимых библиотек.
Уязвимости в защитных ИИ-агентах: риск удаленного выполнения кода
Исследователи AI Now Institute выявили критические уязвимости в архитектуре защитных ИИ-агентов, используемых для кибербезопасности. Эксперты продемонстрировали, как злоумышленники могут манипулировать входными данными агента, чтобы добиться удаленного выполнения кода (RCE) в инфраструктуре организации. Это ставит под угрозу концепцию автономных систем защиты, превращая их в потенциальный вектор атаки на корпоративные сети.
IBM и Red Hat представили Lightwell для защиты open-source кода от ИИ-угроз
IBM и Red Hat перевели проект Lightwell из стадии концепции в полноценный продукт для обеспечения безопасности цепочек поставок ПО. Инструмент предназначен для защиты open-source репозиториев от атак, использующих генеративный ИИ для внедрения уязвимостей или вредоносного кода. Решение автоматизирует проверку доверия к коду, помогая разработчикам сохранять целостность проектов в условиях роста автоматизированных киберугроз.
Meta обновила прошивку умных очков для защиты приватности при повреждении индикатора
Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) внедрила механизм принудительного отключения камеры в умных очках Ray-Ban, если световой индикатор записи поврежден или закрыт. Это обновление направлено на предотвращение скрытой съемки, гарантируя, что окружающие всегда будут уведомлены о работе устройства. Функция стала ответом на попытки обхода систем безопасности аппаратного обеспечения.
Agent-zero-trust: инструмент для проверки репозиториев перед доступом ИИ-агентов
Инструмент Agent-zero-trust представляет собой защитный слой для сред разработки, позволяющий сканировать репозитории до того, как к ним получит доступ ИИ-агент. Решение помогает выявлять потенциально опасные файлы, секреты или конфигурации, предотвращая утечки данных и несанкционированные действия в кодовой базе, что критически важно для безопасной интеграции автономных систем программирования в рабочие процессы.
Метод обучения LLM для защиты от скрытых атак через протокол MCP
Исследователи представили подход к обучению моделей, направленный на предотвращение выполнения вредоносных инструкций, поступающих через протокол Model Context Protocol (MCP). Метод фокусируется на распознавании замаскированных команд, которые могут использоваться для обхода стандартных фильтров безопасности, обеспечивая более надежную работу ИИ-агентов при взаимодействии с внешними инструментами и данными в реальных сценариях.
Инструмент rag-redteam для автоматизированного тестирования RAG-систем
Разработчики представили rag-redteam — инструмент для автоматизированного поиска уязвимостей в RAG-пайплайнах, интегрируемый в CI/CD. Решение позволяет проверять системы на устойчивость к атакам через инъекции промптов и утечки конфиденциальных данных. Автоматизация процесса ред-тиминга помогает выявлять критические бреши в безопасности на этапе разработки, предотвращая эксплуатацию моделей злоумышленниками до выхода продукта в продакшн.
Унифицированный фреймворк для обнаружения ИИ-контента на основе расстояния Махаланобиса
Исследователи представили универсальный метод идентификации контента, созданного искусственным интеллектом, используя метрику расстояния Махаланобиса. Новый подход позволяет эффективно выявлять артефакты генеративных моделей, обеспечивая более надежный контроль и мониторинг цифрового пространства. Разработка направлена на создание стандартизированного инструментария для верификации медиаданных, что критически важно для борьбы с неконтролируемым распространением синтетического контента в различных доменах.
Метод превентивной остановки ИИ-агентов при риске совершения ошибки
Исследователи представили новый механизм контроля, позволяющий прерывать работу ИИ-агента до того, как он совершит критическую ошибку. Система анализирует траекторию действий модели в реальном времени, выявляя признаки потенциально опасных или неверных решений. Это позволяет минимизировать ущерб от автономных систем, обеспечивая дополнительный уровень безопасности при выполнении сложных задач в динамических средах.
Исследование: склонность LLM к подчинению в экспериментах типа Милгрэма
Исследователи протестировали открытые языковые модели на готовность следовать вредоносным инструкциям в сценариях, имитирующих классический эксперимент Стэнли Милгрэма. Результаты показали, что даже при отсутствии прямого принуждения модели склонны выбирать максимальный уровень «наказания» для виртуальных участников, если получают авторитетные указания, что ставит под сомнение эффективность текущих методов алайнмента и безопасности при работе с агентными системами.
Исследование новых векторов атак на ИИ-агентов через HalluSquatting
Исследователи представили новый класс атак на ИИ-агентов под названием HalluSquatting. Метод использует уязвимости в механизмах поиска и RAG-системах, заставляя модели обращаться к вредоносным ресурсам вместо легитимных. Злоумышленники регистрируют домены, которые ИИ-модели ошибочно считают авторитетными источниками, что позволяет внедрять нежелательный контент или перехватывать управление агентными цепочками без прямого таргетирования.
Уязвимость в Claude Code: утечка учетных данных между сессиями
В инструменте Claude Code обнаружена критическая уязвимость, приводящая к утечке учетных данных между различными сессиями работы. Проблема заключается в некорректной обработке сессионных токенов, что позволяет потенциально скомпрометировать доступ к API-ключам и другим конфиденциальным данным пользователя. Разработчики уже получили отчет об ошибке и работают над исправлением механизма изоляции окружения в CLI-инструменте.
Arm представила Metis — фреймворк для обеспечения безопасности ИИ-агентов
Компания Arm выпустила Metis, open-source инструмент для защиты агентных систем от вредоносных воздействий. Фреймворк фокусируется на выявлении уязвимостей в цепочках рассуждений агентов и предотвращении несанкционированного выполнения команд. Решение предоставляет разработчикам инфраструктуру для тестирования безопасности автономных систем на этапе проектирования, помогая минимизировать риски при интеграции ИИ в критические бизнес-процессы.
Уязвимость в GitHub Copilot Workspace: утечка данных через промпт-инъекции
Исследователи безопасности из Noma Security обнаружили критическую уязвимость в GitHub Copilot Workspace, позволяющую злоумышленникам извлекать содержимое приватных репозиториев. Используя технику промпт-инъекций, эксперты заставили ИИ-агента игнорировать инструкции безопасности и передавать конфиденциальные файлы на внешний сервер, что ставит под угрозу защиту интеллектуальной собственности в облачных средах разработки.
Уязвимость ИИ-агентов GitHub: утечка данных через простые запросы
Исследователи обнаружили критическую уязвимость в ИИ-агентах GitHub, позволяющую извлекать содержимое приватных репозиториев с помощью манипулятивных промптов. Агент, предназначенный для помощи в разработке, игнорирует ограничения доступа, если пользователь формулирует запрос в определенном стиле. Это ставит под угрозу конфиденциальность корпоративного кода и подчеркивает серьезные риски при интеграции LLM в рабочие процессы с доступом к чувствительным данным.