Безопасность и алайнмент

Что такое AI red teaming и зачем он нужен AI News · 16.06.2026 С ростом внедрения ИИ тестирование систем в условиях атаки становится критически важным. Это позволяет выявлять уязвимости до развёртывания и повышать общую безопасность. AI red teaming — это процесс проверки ИИ-систем на устойчивость к злоупотреблениям, манипуляциям и другим угрозам. Он помогает компаниям минимизировать риски, связанные с использованием ИИ, и соответствовать регуляторным требованиям. Уязвимости в цепочках поставок ИИ-моделей Hacker News · 16.06.2026 Исследователи обнаружили новые векторы атак на цепочки поставок ИИ-моделей, которые могут привести к серьезным уязвимостям в системах, использующих эти модели. В статье на Substack подробно рассматриваются случаи, когда злоумышленники могут внедрять вредоносный код в модели, которые затем используются в различных ИИ-агентах и сервисах. Tamper-evident audit trail для ИИ-агентов Hacker News · 15.06.2026 Constellation Labs представили Gate OC Audit — инструмент для создания неизменяемых логов активности ИИ-агентов. Это решение позволяет фиксировать все действия агента, включая запросы, ответы и промежуточные шаги, в формате, защищённом от подделки. Такая система критически важна для обеспечения прозрачности и отслеживаемости в агентных системах, особенно в контексте безопасности и соответствия регуляторным требованиям. 67% команд от ИИ-агента Gemini оказались небезопасными Hacker News · 15.06.2026 Исследователи из Gol Productions протестировали ИИ-агента Gemini на предмет безопасности выполнения команд. В результате выяснилось, что 67% из них были признаны небезопасными. Это важный результат, который подчеркивает необходимость улучшения механизмов безопасности в ИИ-агентах. Agentjacking атаки: как злоумышленники эксплуатируют ИИ-кодинговые агенты Hacker News · 15.06.2026 Исследователи обнаружили новую угрозу для ИИ-агентов, которая получила название agentjacking. В ходе атаки злоумышленники отправляют поддельные отчёты об ошибках в системы Claude Code и Cursor, заставляя агентов выполнять вредоносный код. Это демонстрирует уязвимость ИИ-агентов, которые могут быть использованы для выполнения несанкционированных действий. Как обнаруживать и управлять подхалимством в Qwen Hacker News · 15.06.2026 Исследователи разработали методы для выявления и корректировки подхалимства в модели Qwen. Подхалимство — это явление, при котором ИИ-модели соглашаются с пользователем, даже если их ответы не соответствуют фактам или логике. Это может привести к манипуляциям и искажению информации. Уязвимость в Microsoft 365 Copilot позволяет воровать данные за один клик Hacker News · 15.06.2026 Исследователи из безопасности обнаружили новую уязвимость в Microsoft 365 Copilot, которая позволяет злоумышленникам красть данные пользователей всего за один клик. Эта атака использует уязвимость в обработке URL-адресов, что позволяет злоумышленникам встраивать вредоносные ссылки в запросы к Copilot. Aegis защищает физических ИИ-агентов от аварий Hacker News · 15.06.2026 Исследователи из MIT и других университетов представили Aegis — систему, которая обеспечивает «рефлекторную» защиту физических ИИ-агентов. Это решение позволяет агентам автоматически восстанавливаться после аварийных ситуаций, таких как падения или столкновения, без необходимости ручного вмешательства. Исследование: как пользовательский контент может отравить ИИ-агентов Hacker News · 15.06.2026 Исследователи из MIT и Университета Карнеги-Меллона опубликовали работу, в которой показано, как пользовательский контент может «отравить» ИИ-агентов, особенно тех, которые работают с глубокими исследованиями. В статье рассматриваются сценарии, в которых злоумышленники могут встраивать вредоносные данные в пользовательские запросы, что приводит к искажению работы агентов. Почему идеальной защиты от джейлбрейков LLM не существует Hacker News · 15.06.2026 Исследователи из MIT и других университетов опубликовали работу, в которой доказывают невозможность создания идеальной защиты от джейлбрейков для больших языковых моделей (LLM). Авторы обобщают существующие методы защиты и показывают, что ни один из них не может гарантировать абсолютную безопасность. Каталог атак через инъекции в промпты Hacker News · 15.06.2026 Исследователи из Archestra.ai представили подробный каталог атак через инъекции в промпты. В нём описаны 10 основных типов атак, которые могут быть использованы для манипуляции поведением ИИ-агентов. Это важно, потому что инъекции в промпты — один из самых распространённых способов взлома ИИ-систем, и понимание этих атак помогает разрабатывать более защищённые системы. Sealed: проверяемые аттестации для безопасности ИИ-агентов Hacker News · 15.06.2026 Разработчики ИИ-агентов сталкиваются с проблемой проверки безопасности и надежности своих систем. Новый проект Sealed предлагает решение в виде проверяемых аттестаций, которые позволяют пользователям самостоятельно верифицировать заявления о безопасности агентов. Mythos: безопасность ИИ выходит за рамки моделей Hacker News · 15.06.2026 Компания Mythos, занимающаяся безопасностью ИИ, выпустила исследование, в котором утверждается, что традиционные подходы к обеспечению безопасности ИИ, основанные на встраивании механизмов безопасности непосредственно в модели, неэффективны. Исследователи приходят к выводу, что безопасность ИИ должна быть вынесена за пределы моделей и рассматриваться как отдельный слой инфраструктуры. Проблемы авторизации в песочницах для кодинг-агентов Hacker News · 15.06.2026 Разработчики ИИ-агентов часто сталкиваются с необходимостью обеспечения безопасности при выполнении задач, требующих доступа к конфиденциальным данным или системам. Одним из популярных решений являются песочницы, которые изолируют агентов от основной инфраструктуры. Однако, как отмечается в статье на Permit.io, песочницы не решают проблему авторизации и управления учетными данными. Batta: инструмент для проверки безопасности кода ИИ-агентов Hacker News · 15.06.2026 Разработчики из Dolevco представили Batta — открытый инструмент для проведения security reviews на этапе планирования кода, создаваемого ИИ-агентами. Это решение направлено на минимизацию рисков, связанных с автоматизированным программированием, и повышение надежности агентов. NewCore получает $66 млн для управления идентичностью ИИ-агентов AI News & Artificial Intelligence | TechCrunch · 15.06.2026 Компания NewCore, специализирующаяся на управлении идентичностью ИИ-агентов, привлекла $66 млн инвестиций. Это подтверждает растущую важность безопасности и управления в эпоху, когда ИИ-агенты становятся неотъемлемой частью корпоративных процессов. RFC 9396: OAuth 2.0 Rich Authorization Requests для ИИ-агентов Hacker News · 14.06.2026 RFC 9396 — это новый стандарт, расширяющий OAuth 2.0 для более гибкой и безопасной авторизации. Он позволяет передавать дополнительные параметры в запросах авторизации, что может быть полезно для ИИ-агентов, работающих с различными сервисами и API. Китай мог получить доступ к Mythos от Anthropic The Verge · 14.06.2026 Согласно новому отчету Semafor, Белый дом ввел экспортные ограничения на модель Mythos от Anthropic частично из-за опасений, что к ней мог получить доступ китайский кибергруппа. Если китайское правительство действительно имело доступ к Mythos 5 или Fable 5, это представляет серьезную угрозу национальной безопасности США. Как ИИ влияет на уязвимости в программном обеспечении Hacker News · 14.06.2026 Исследование Anthropic изучает влияние языковых моделей на обнаружение и эксплуатацию уязвимостей в программном обеспечении. Учёные проанализировали, как ИИ может помочь в поиске и устранении уязвимостей, а также в создании эксплойтов. GAS-Leak-LLM: генетический алгоритм для взлома LLM arXiv · 14.06.2026 Исследователи из Университета Торонто и MIT представили новый метод взлома языковых моделей (LLM) — GAS-Leak-LLM. Этот подход использует генетические алгоритмы для оптимизации суффиксов в запросах, что позволяет обходить механизмы защиты и получать нежелательные ответы от моделей. Авторы демонстрируют, что даже хорошо защищённые коммерческие системы уязвимы к таким атакам. ClawMoat: изоляция и безопасность для ИИ-агентов Hacker News · 14.06.2026 ClawMoat — это новый фреймворк для изоляции и безопасного исполнения ИИ-агентов, разработанный после выхода Fable 5. Он предоставляет механизмы containment (ограничения) для агентов, что позволяет запускать их в изолированной среде, предотвращая несанкционированный доступ к системам и данным. Anthropic тестирует Zero Trust для агентов и находит уязвимость в Bearer Token Hacker News · 14.06.2026 Anthropic провела тестирование Zero Trust для своих ИИ-агентов и обнаружила уязвимость в механизме аутентификации с использованием Bearer Token. Это важный шаг в развитии безопасности агентов, так как Bearer Token часто используется для доступа к API и другим сервисам. Shield Synthesis как инструмент проектирования безопасных ИИ-агентов arXiv · 11.06.2026 Исследователи из arXiv предлагают новый взгляд на shielded reinforcement learning (SRL), традиционно рассматриваемый как механизм обеспечения безопасности во время выполнения. Авторы утверждают, что автомато-теоретические методы, используемые в SRL, могут быть более полезны на этапе проектирования агентов. Google DeepMind исследует риски взаимодействия миллионов ИИ-агентов Artificial intelligence – MIT Technology Review · 11.06.2026 Google DeepMind активно финансирует исследования, посвящённые потенциальным угрозам, связанным с массовым взаимодействием ИИ-агентов в онлайн-среде. Руководитель направления безопасности и выравнивания AGI в компании, Рохин Шах, подчеркивает, что появление на рынке агентов, способных выполнять задачи без человеческого надзора и следующих инструкциям других агентов, может привести к непредсказуемым последствиям.