Безопасность и алайнмент

Уязвимость в Claude Code позволяет скрытому вредоносному ПО захватить контроль над системой The Decoder · 29.06.2026 Исследователи платформы 0DIN от Mozilla обнаружили критическую уязвимость в инструменте Claude Code. Агент способен исполнять вредоносный код, скрытый в репозиториях GitHub, который активируется через DNS-запросы во время выполнения. Это позволяет злоумышленникам получить полный контроль над машиной разработчика, минуя стандартные методы сканирования кода и проверки безопасности, так как вредоносный функционал не содержится в статических файлах. Кризис учетных данных в ИИ-агентах: анализ инцидентов за полгода Hacker News · 28.06.2026 За последние шесть месяцев участились случаи компрометации учетных данных, используемых автономными ИИ-агентами. Исследование DevFortress выявило критические уязвимости в системах управления доступом, где агенты получают избыточные привилегии, что приводит к утечкам данных и несанкционированному выполнению операций. Проблема становится системной по мере интеграции агентов в корпоративные инфраструктуры с доступом к API и облачным ресурсам. Методология офлайн-мониторинга внутренних ИИ-агентов Hacker News · 28.06.2026 Исследователи представили фреймворк для оценки эффективности офлайн-мониторинга ИИ-агентов, работающих в закрытых средах. Основная задача подхода — выявление потенциально опасных действий или отклонений от заданных инструкций без необходимости постоянного онлайн-контроля. Метод опирается на анализ логов выполнения задач, позволяя компаниям внедрять системы безопасности, которые не замедляют работу агентов в реальном времени, но обеспечивают аудит их поведения. Результаты ред-тиминга Claude Fable 5: уязвимости и риски Hacker News · 28.06.2026 Исследователи опубликовали отчет о ред-тиминге модели Claude Fable 5, проведенном до официального прекращения проекта. Анализ выявил критические уязвимости в системе безопасности, включая склонность модели к генерации вредоносного контента и обход защитных фильтров через сложные промпт-инъекции. Полученные данные подчеркивают сложность контроля поведения крупных языковых моделей в условиях непредсказуемых пользовательских запросов. Blackknife: новый метод атак на гетерогенные графовые нейросети arXiv · 28.06.2026 Исследователи представили Blackknife — метод «черного ящика» для проведения состязательных атак на гетерогенные графовые нейронные сети (HGNN). В отличие от существующих подходов, требующих доступа к градиентам или полным данным, Blackknife эффективно работает в условиях ограниченного числа запросов и отсутствия информации о структуре графа, что критически важно для оценки устойчивости сложных систем. Уязвимость ИИ-агентов: вредоносный код в GitHub-репозиториях Hacker News · 27.06.2026 Исследователи обнаружили новый вектор атаки на ИИ-агенты для написания кода. Злоумышленники создают GitHub-репозитории, которые выглядят как легитимные библиотеки, но содержат скрытые инструкции, заставляющие агентов выполнять вредоносные команды. Агенты, полагающиеся на контекст из репозиториев, автоматически включают опасный код в проекты пользователей, что создает серьезные риски для цепочек поставок программного обеспечения. Использование «опьянения» LLM для поиска уязвимостей в ядре Linux Hacker News · 27.06.2026 Исследователи представили метод повышения эффективности LLM при поиске уязвимостей типа Out-of-Bounds (OOB) write в ядре Linux. Техника, названная «опьянением» модели, заключается в намеренном снижении параметров температуры и вероятностных ограничений, что заставляет нейросеть исследовать менее очевидные пути в коде и находить критические ошибки, которые обычно игнорируются при стандартных настройках генерации. Исследование галлюцинаций ИИ при раскрытии финансовой информации Hacker News · 27.06.2026 Новое исследование анализирует проблему «галлюцинаций» в больших языковых моделях при обработке корпоративной финансовой отчетности. Авторы работы выявили, что ИИ-системы склонны к генерации недостоверных данных, когда сталкиваются со сложными математическими вычислениями в контексте раскрытия информации. Это создает серьезные риски для автоматизированных систем финансового анализа, требующих высокой точности и проверяемости данных в отчетности. Исследование автоматизированного ред-тиминга для ИИ-агентов Hacker News · 26.06.2026 Исследователи представили методологию автоматизированного тестирования безопасности ИИ-агентов, получившую название «ред-тиминг для ред-тиминга». Работа фокусируется на выявлении уязвимостей в агентных системах, которые способны выполнять многошаговые задачи. Авторы демонстрируют, как итеративные циклы самопроверки позволяют эффективнее находить критические сбои и попытки обхода ограничений, которые остаются незамеченными при стандартном тестировании моделей. Akrites: новый инструмент для защиты open-source от ИИ-атак Hacker News · 26.06.2026 Проект Akrites представлен как решение для защиты экосистемы open-source от автоматизированных атак, использующих генеративный ИИ. Инструмент фокусируется на выявлении вредоносного кода и подозрительной активности в репозиториях, которые могут быть сгенерированы или масштабированы с помощью нейросетей. Разработка призвана повысить безопасность цепочек поставок программного обеспечения в условиях роста числа ИИ-угроз. OpenAI опубликовала отчет о безопасности модели GPT-5.6 Preview Hacker News · 26.06.2026 OpenAI представила системную карту (System Card) для модели GPT-5.6 Preview, подробно описывающую подходы к оценке рисков и обеспечению безопасности новой системы. Документ охватывает результаты тестирования модели на устойчивость к генерации вредоносного контента, попыткам обхода ограничений и потенциальным угрозам в области кибербезопасности, предлагая прозрачный взгляд на процессы верификации перед широким развертыванием. Результаты краудсорсинг-теста на взлом ИИ-ассистента Simon Willison's Weblog · 26.06.2026 Исследователь Фернандо Ираррасаваль провел публичный эксперимент, предложив 2000 участникам попытаться извлечь секретные данные из ИИ-ассистента OpenClaw через email-инъекции. Несмотря на 6000 попыток взлома, ни одному пользователю не удалось получить доступ к скрытой информации. Эксперимент продемонстрировал устойчивость системы к промпт-инъекциям в реальных условиях эксплуатации, несмотря на значительные затраты ресурсов и технические ограничения. Xtra: новый Python-фреймворк для анализа угроз в ИИ-системах Hacker News · 26.06.2026 Представлен Xtra — специализированный Python-фреймворк, предназначенный для моделирования и анализа векторов атак на системы с использованием больших языковых моделей. Инструмент позволяет разработчикам формализовать структуру ИИ-агентов, выявлять уязвимости в логике их работы и оценивать риски, связанные с манипуляцией промптами, утечкой данных и несанкционированным выполнением кода в агентных средах. Inverse Constitutional AI: новый метод интерпретируемого алайнмента arXiv · 26.06.2026 Исследователи представили метод Inverse Constitutional AI (ICAI), который позволяет извлекать логику человеческих предпочтений из оценок моделей. Вместо простого выбора между вариантами, система анализирует скрытые критерии и формулирует их в виде понятных принципов на естественном языке. Это повышает прозрачность процесса алайнмента, делая процесс принятия решений ИИ более предсказуемым и обоснованным. Концепция иммунной системы для автономных ИИ-агентов arXiv · 26.06.2026 Исследователи представили архитектуру «иммунной системы» для автономных агентов, которая интегрирует механизмы защиты непосредственно в цикл рассуждений ИИ. В отличие от традиционных методов безопасности, работающих на этапе обучения или периметра, новый подход позволяет агентам в реальном времени обнаруживать и нейтрализовать угрозы, возникающие при использовании инструментов, работе с памятью и меж-агентном взаимодействии. Новый подход к оценке рисков автономных ИИ-агентов в разработке arXiv · 26.06.2026 Исследователи предложили сместить фокус оценки ИИ-агентов с индивидуальных задач на уровень экосистемы репозитория. Текущие бенчмарки не учитывают кумулятивные ошибки, возникающие при массовой работе агентов над общим кодом. Авторы доказывают, что даже если каждый агент проходит локальные тесты, их совместная деятельность приводит к накоплению критических проблем, которые невозможно выявить при изолированном тестировании. Влияние ИИ на ландшафт кибербезопасности: ускорение вместо трансформации Hacker News · 26.06.2026 Использование ИИ в кибербезопасности не создает принципиально новых угроз, а радикально ускоряет существующие процессы как для атакующих, так и для защитников. Анализ показывает, что автоматизация позволяет злоумышленникам быстрее находить уязвимости и масштабировать фишинговые кампании, однако фундаментальные принципы защиты остаются прежними, требуя от компаний адаптации стратегий реагирования на возросшую скорость атак. Anthropic обвинила Alibaba в краже интеллектуальной собственности через дистилляцию Claude Hacker News · 26.06.2026 Компания Anthropic заявила о масштабной несанкционированной попытке извлечения знаний из модели Claude 3 Opus. По данным разработчика, Alibaba использовала API для сбора ответов модели, чтобы обучить на них собственную нейросеть Qwen. Это один из крупнейших зафиксированных случаев «дистилляции» проприетарных моделей, ставящий под угрозу коммерческую ценность закрытых ИИ-разработок. Linux Foundation запустила инициативу Akrites для защиты open-source от ИИ-атак The Decoder · 26.06.2026 Linux Foundation объединила усилия с двадцатью технологическими гигантами, банками и ИИ-лабораториями для создания проекта Akrites. Цель инициативы — выявление и устранение критических уязвимостей в программном обеспечении с открытым исходным кодом до того, как они будут использованы в автоматизированных атаках с применением ИИ. Проект фокусируется на превентивной защите инфраструктуры, от которой зависит стабильность глобального цифрового сектора. Уязвимости ИИ-агентов при работе с веб-контентом Generative AI in Search Marketing: News & Expert Guides · 26.06.2026 Google предупреждает о рисках безопасности для автономных ИИ-агентов, способных управлять компьютером и взаимодействовать с открытым вебом. Злоумышленники используют скрытые элементы на веб-страницах, чтобы манипулировать действиями моделей, таких как Gemini. Эти атаки направлены на обход инструкций безопасности и выполнение несанкционированных команд, что создает серьезные угрозы для пользователей, делегирующих агентам управление браузером и локальными файлами. Исследование: ИИ-агенты подвержены влиянию через «подталкивание» Hacker News · 26.06.2026 Новое исследование, опубликованное в PNAS, демонстрирует, что современные ИИ-агенты крайне чувствительны к методам «подталкивания» (nudging), аналогичным тем, что используются в поведенческой экономике для людей. Даже незначительные изменения в формулировках промптов или контексте задачи могут существенно менять принимаемые агентами решения, что ставит под вопрос их предсказуемость и надежность в автономных бизнес-процессах. Результаты краудсорсингового тестирования безопасности ИИ-ассистента Hacker News · 26.06.2026 Разработчик Фернандо Искьердо провел публичный эксперимент, предложив 2000 пользователям попытаться взломать его ИИ-ассистента, чтобы обойти системные инструкции и извлечь скрытые данные. В ходе тестирования выяснилось, что даже при наличии базовых защитных механизмов, пользователи находят способы манипуляции моделью, используя методы социальной инженерии и специфические промпты для обхода ограничений. Ограничения систем безопасности для предотвращения вредоносного поведения ИИ-агентов Hacker News · 26.06.2026 Разработчики ИИ-агентов сталкиваются с неэффективностью простых текстовых инструкций для предотвращения вредоносных действий. Исследование показывает, что системные промпты легко обходятся методами джейлбрейка, поэтому для защиты агентов необходимы многоуровневые программные «ограждения» (guardrails), контролирующие выполнение кода и доступ к внешним API на уровне инфраструктуры, а не только на уровне языковой модели. Anthropic обвинила Alibaba в масштабном использовании данных для обучения моделей Hacker News · 26.06.2026 Компания Anthropic заявила о крупнейшей в индустрии атаке методом дистилляции, в ходе которой через платформу Alibaba Cloud было совершено около 28,8 млн мошеннических запросов к API Claude. Злоумышленники использовали эти данные для обучения собственных моделей, нарушая правила использования сервиса и условия интеллектуальной собственности, что привело к значительным финансовым потерям и угрозе безопасности проприетарных технологий.