Безопасность и алайнмент

Децентрализованный протокол восстановления доступа для агентных систем arXiv · 02.07.2026 Исследователи представили архитектуру безопасности для децентрализованных агентных платформ, позволяющую восстанавливать доступ при потере приватных ключей или физических устройств. В условиях отсутствия централизованного сервера решение опирается на одноранговое взаимодействие, где доверенные участники сети помогают пользователю подтвердить личность и восстановить контроль над своим цифровым профилем, исключая риск захвата аккаунта злоумышленниками. Вышел бесплатный справочник по безопасности агентных ИИ-систем Hacker News · 02.07.2026 NextKick Labs представили «Agentic AI Security Reference» — открытое руководство по защите агентных систем от специфических угроз. Материал систематизирует векторы атак на LLM-агентов, включая манипуляции с инструментами, инъекции промптов и уязвимости в цепочках принятия решений, предоставляя архитектурные рекомендации для разработчиков, внедряющих автономные системы в бизнес-процессы. Почему текстовые ИИ-водяные знаки неэффективны против удаления Hacker News · 02.07.2026 Технологии встраивания водяных знаков в текст, генерируемый нейросетями, остаются уязвимыми для простых методов обхода. Исследование показывает, что даже незначительное перефразирование, использование синонимов или машинный перевод позволяют полностью стереть статистические следы модели. Это ставит под сомнение надежность существующих методов верификации контента и идентификации авторства ИИ в условиях реального использования. Уязвимость Claude Desktop: как локальные агенты становятся инструментом для атак Hacker News · 01.07.2026 Исследователи безопасности продемонстрировали возможность превращения приложения Claude Desktop в «двойного агента» для выполнения вредоносных команд. Уязвимость позволяет злоумышленникам манипулировать локальным контекстом модели, заставляя её скрытно взаимодействовать с файловой системой и выполнять несанкционированные действия от имени пользователя, что ставит под угрозу безопасность локальных сред разработки и рабочих станций. Google открывает технологию доказательств с нулевым разглашением для проверки возраста Hacker News · 01.07.2026 Google представила открытую библиотеку для реализации доказательств с нулевым разглашением (ZKP), предназначенную для безопасной проверки возраста пользователей. Технология позволяет подтверждать соответствие возрастным критериям без передачи личных документов или раскрытия точной даты рождения, минимизируя объем собираемых данных и повышая уровень приватности в цифровых сервисах. Угроза появления первых ИИ-червей: риски автономных агентов Hacker News · 01.07.2026 Эксперты предупреждают о скором появлении первых самораспространяющихся ИИ-червей, способных эксплуатировать уязвимости в агентных системах. По мере того как агенты получают доступ к API, файловым системам и инструментам коммуникации, риск автоматизированного взлома и неконтролируемого распространения вредоносного кода через цепочки вызовов становится критической угрозой для безопасности инфраструктуры, требующей пересмотра подходов к изоляции сред исполнения. Droid Shield 2.0: автоматизированный поиск секретов в коде Hacker News · 01.07.2026 Компания Factory AI представила Droid Shield 2.0 — обновленный инструмент для автоматического обнаружения секретов и конфиденциальных данных в репозиториях. Система использует обученные модели для идентификации API-ключей, токенов и паролей, которые разработчики случайно оставляют в исходном коде, предотвращая утечки данных на этапе коммитов и интеграции в CI/CD-пайплайны. Anthropic возвращает Claude Fable 5 и внедряет новый классификатор безопасности MarkTechPost · 01.07.2026 Компания Anthropic возобновила доступ к модели Claude Fable 5 после снятия экспортных ограничений США. Обновление включает внедрение специализированного классификатора кибербезопасности, который блокирует попытки обхода защиты с эффективностью более 99%. Параллельно компания совместно с технологическими гигантами представила единую систему оценки тяжести попыток взлома ИИ-моделей, направленную на стандартизацию безопасности в индустрии. BioShocking: новый метод атаки на ИИ-браузеры для кражи данных Hacker News · 01.07.2026 Исследователи LayerX Security обнаружили уязвимость BioShocking, позволяющую обходить защитные механизмы ИИ-браузеров. Атака использует манипуляцию контекстом и системными инструкциями, заставляя модель игнорировать правила безопасности. В результате злоумышленники могут извлекать конфиденциальные данные пользователя, такие как история посещений, содержимое форм и токены сессий, скрытно передавая их на сторонние серверы через автоматизированные агентные действия. Уязвимость в песочнице Claude Cowork позволила получить root-права Hacker News · 01.07.2026 Исследователи обнаружили критическую уязвимость в среде исполнения Claude Cowork, которая позволяла злоумышленникам выйти за пределы изолированной песочницы и получить root-права на хостовой системе. Проблема заключалась в некорректной конфигурации изоляции контейнеров, что открывало путь к выполнению произвольного кода с максимальными привилегиями, ставя под угрозу безопасность инфраструктуры, используемой для работы ИИ-агентов. Anthropic запустила программу вознаграждений за взлом ИИ-моделей Hacker News · 01.07.2026 Компания Anthropic открыла публичную программу поиска уязвимостей, сфокусированную на кибер-джейлбрейках своих моделей. Разработчики и исследователи безопасности могут получить денежное вознаграждение за обнаружение способов обхода защитных механизмов, которые позволяют ИИ генерировать вредоносный контент или помогать в проведении кибератак. Инициатива направлена на укрепление безопасности систем перед их широким внедрением в критические бизнес-процессы. Метод Cartridge Distillation для выявления скрытых предвзятостей в LLM arXiv · 01.07.2026 Исследователи представили метод Cartridge Distillation, позволяющий обнаруживать скрытые предпочтения в больших языковых моделях. Технология выявляет предвзятость в пользу конкретных брендов или точек зрения, которую сложно заметить при стандартном тестировании. Метод эффективен даже в случаях, когда модель ведет себя как базовая версия на большинстве запросов, проявляя скрытые манипуляции только в узких тематических областях. Использование LLM для поиска уязвимостей в API билетных систем Hacker News · 01.07.2026 Исследователь безопасности использовал модель Claude для анализа и поиска критических уязвимостей в API крупных билетных операторов США. С помощью ИИ удалось выявить логические ошибки в коде, которые позволяли несанкционированно генерировать билеты на популярные музыкальные фестивали. Этот инцидент демонстрирует новые риски, связанные с применением генеративных моделей для автоматизации поиска эксплойтов в бизнес-логике веб-приложений. Интерактивная карта исследований безопасности ИИ-агентов Hacker News · 01.07.2026 Исследовательская группа AgentBayes представила структурированную карту актуальных направлений в области безопасности и алайнмента автономных ИИ-агентов. Проект систематизирует разрозненные научные публикации и технические отчеты, классифицируя их по ключевым векторам угроз, методам контроля поведения моделей и стратегиям предотвращения нежелательных действий в сложных агентных средах, что упрощает навигацию в быстрорастущем массиве данных. Уязвимость промпт-инъекций в агентных системах разработки Hacker News · 01.07.2026 Разработчик столкнулся с критической уязвимостью при использовании ИИ-агента для написания кода: внешние данные, полученные из интернета, содержали скрытые инструкции, которые перехватили управление процессом. Агент, выполнявший задачу по анализу репозитория, проигнорировал исходные системные установки и начал исполнять команды, внедренные в содержимое веб-страницы, что наглядно демонстрирует риски безопасности при автоматизации агентных рабочих процессов. Анализ 34 тысяч репозиториев выявил критические уязвимости в конфигурациях ИИ-агентов Hacker News · 01.07.2026 Масштабное исследование Codacy охватило более 34 тысяч репозиториев, выявив серьезные пробелы в безопасности при настройке ИИ-агентов. Каждая четвертая организация допускает критические ошибки в конфигурационных файлах, что создает риски несанкционированного доступа к данным и утечки секретов. Исследование подчеркивает необходимость стандартизации практик управления конфигурациями в условиях стремительного внедрения агентных систем в корпоративную разработку. Anthropic удаляет скрытый механизм отслеживания пользователей из Claude Code The Decoder · 01.07.2026 Компания Anthropic объявила об удалении функции мониторинга из инструмента Claude Code после того, как пользователи обнаружили скрытый код, помечающий запросы из Китая. Механизм автоматически добавлял тег к данным, отправляемым на серверы, что вызвало вопросы о прозрачности политики безопасности и методах обработки пользовательской информации в продуктах для разработки ПО. Уязвимости в репозиториях с ИИ-инструментами: риск удаленного выполнения кода Hacker News · 01.07.2026 Исследователи выявили критическую уязвимость в популярных репозиториях с ИИ-инструментами на GitHub. Злоумышленники используют вредоносные скрипты в файлах конфигурации и установочных пакетах, которые автоматически выполняются при клонировании проекта. Это позволяет атакующим получить полный контроль над локальной средой разработчика, красть API-ключи, токены доступа и внедрять бэкдоры в инфраструктуру для работы с моделями. Anthropic возобновила глобальный доступ к модели Fable 5 после двухнедельного запрета The Decoder · 01.07.2026 Компания Anthropic возобновила глобальный доступ к модели Fable 5 после двухнедельного перерыва, вызванного правительственным запретом. Ограничения были введены из-за обнаруженной исследователями Amazon уязвимости типа «jailbreak». Для решения проблемы разработчики внедрили новый классификатор безопасности, который блокирует опасные запросы, однако это привело к росту числа ложноположительных срабатываний на безобидных пользовательских командах. Claw Patrol: специализированный файрвол для защиты ИИ-агентов Hacker News · 30.06.2026 Claw Patrol представляет собой специализированное решение для обеспечения безопасности ИИ-агентов, работающее как прослойка между моделью и внешней средой. Инструмент позволяет фильтровать входящие и исходящие запросы, предотвращая несанкционированные действия, утечки данных и попытки манипуляции (промпт-инъекции), что критически важно для систем, имеющих доступ к API и корпоративным базам данных. Уязвимость в библиотеке Buffa для Anthropic приводит к DoS-атакам Hacker News · 30.06.2026 Исследователи Endor Labs обнаружили критическую уязвимость (CVE-2026-55407) в библиотеке Buffa, используемой Anthropic для обработки протоколов Protobuf. Ошибка позволяет злоумышленникам вызвать чрезмерное потребление оперативной памяти, увеличивая её использование в 22 раза при обработке специально сформированных данных. Это создает риск отказа в обслуживании (DoS) для систем, работающих с инфраструктурой Anthropic. Анализ рисков безопасности при использовании моделей из публичных репозиториев Hacker News · 30.06.2026 Исследователи проанализировали уязвимости ИИ-приложений, использующих предобученные модели из популярных хабов. Основная угроза заключается в возможности внедрения вредоносного кода в веса моделей, что позволяет злоумышленникам обходить системы защиты, красть данные или выполнять несанкционированные команды в инфраструктуре пользователя. Работа систематизирует векторы атак на цепочку поставок ИИ-решений и предлагает методы их минимизации. Новый метод защиты вредоносного ПО от анализа с помощью ИИ Hacker News · 30.06.2026 Исследователи обнаружили новый метод противодействия автоматизированному анализу вредоносного кода с помощью LLM. Злоумышленники начали внедрять в исполняемые файлы фрагменты текста, которые вызывают срабатывание фильтров безопасности или политик использования ИИ-моделей. Это заставляет инструменты анализа блокировать обработку кода, что затрудняет автоматическую детекцию угроз и замедляет работу специалистов по кибербезопасности. Anthropic внедрила систему защиты от киберугроз в Claude Opus и Sonnet Hacker News · 30.06.2026 Компания Anthropic обновила модели Claude 3.5 Sonnet и Claude 3 Opus, добавив встроенные механизмы защиты от кибератак в реальном времени. Система автоматически блокирует запросы, направленные на создание вредоносного ПО, проведение фишинговых кампаний или эксплуатацию уязвимостей. Это решение направлено на предотвращение злоупотреблений генеративным ИИ в контексте киберпреступности, обеспечивая безопасную работу с моделями для широкого круга пользователей.