Безопасность и алайнмент

Методология аудируемой оценки надежности ИИ на протяжении жизненного цикла arXiv · 17.07.2026 Исследователи представили новую методологию для оценки надежности ИИ-систем, которая позволяет отслеживать изменения в поведении моделей на протяжении всего их жизненного цикла. Подход переводит абстрактные требования к безопасности в измеримые и аудируемые показатели, обеспечивая прозрачность принятия решений при обновлении или дообучении систем, что критически важно для корпоративного управления ИИ и соблюдения регуляторных норм. Исследование ограничений лексики современных LLM Hacker News · 17.07.2026 Исследователи проанализировали механизмы цензуры и фильтрации в популярных языковых моделях, пытаясь выявить системные запреты на использование определенных слов. Работа демонстрирует, как RLHF и системные промпты формируют границы допустимого контента, ограничивая генерацию ответов, содержащих специфическую лексику, даже если контекст запроса не является вредоносным или нарушающим правила безопасности. Jailbreak-lab: инструмент для тестирования устойчивости локальных LLM к взлому Hacker News · 17.07.2026 Jailbreak-lab — это открытая среда для проведения стресс-тестирования локальных языковых моделей на устойчивость к техникам обхода ограничений (jailbreak). Инструмент позволяет разработчикам и исследователям безопасности автоматизировать процесс атаки на модели, запуская специфические промпты и анализируя ответы в контролируемой среде для выявления уязвимостей в системе безопасности и алайнмента. OpenAI ограничила доступ к системным инструкциям агентов Codex через шифрование Hacker News · 17.07.2026 OpenAI внедрила механизм шифрования системных инструкций для своих агентов на базе модели Codex, что делает невозможным их локальный аудит сторонними разработчиками. Это изменение ограничивает прозрачность работы агентных систем, лишая пользователей возможности отслеживать логику принятия решений и скрытые директивы, которые модель получает от разработчиков платформы в процессе выполнения задач. Выход Preempt AI v2 для мониторинга безопасности ИИ-агентов Hacker News · 17.07.2026 Компания Preempt AI представила вторую версию своей платформы, предназначенной для обеспечения безопасности и контроля ИИ-систем в реальном времени. Инструмент позволяет отслеживать поведение агентов, предотвращать несанкционированные действия и минимизировать риски галлюцинаций или утечек данных, интегрируясь непосредственно в процесс обработки запросов к LLM и обеспечивая защитный слой для корпоративных приложений. LLM-ханипоты: как издатели защищают контент от несанкционированного скрапинга Digiday · 17.07.2026 Издатели и e-commerce площадки начали внедрять технологию «LLM-ханипотов» для защиты своего контента от несанкционированного сбора данных ИИ-моделями. Метод заключается в создании скрытых ловушек, которые распознают автоматизированных ботов-краулеров и блокируют их доступ, предотвращая использование интеллектуальной собственности для обучения нейросетей без согласия правообладателей. Slopfence: защита от утечки секретов в LLM на уровне браузера Hacker News · 17.07.2026 Slopfence — это инструмент для предотвращения утечек конфиденциальных данных при работе с LLM через браузер. Решение работает как нативное расширение, которое в реальном времени сканирует вводимый пользователем текст на наличие ключей API, паролей и других секретов, блокируя их отправку в чат-интерфейсы до того, как данные покинут локальную среду. ReasonGate: инструмент для защиты LLM от промпт-инъекций Hacker News · 16.07.2026 ReasonGate — это новый инструмент для защиты больших языковых моделей от атак типа «промпт-инъекция». Система работает как интерпретируемый «шлюз» между пользователем и моделью, анализируя входящие запросы на наличие вредоносных инструкций. Решение позволяет блокировать попытки обхода системных промптов, обеспечивая дополнительный уровень безопасности для агентных систем и чат-ботов без необходимости переобучения основной модели. Уязвимость в Claude Desktop: риск выполнения скрытых промптов через URL-схемы Hacker News · 16.07.2026 Исследователи обнаружили критическую уязвимость в приложении Claude Desktop, связанную с обработкой кастомных URL-схем. Злоумышленники могут использовать специально сформированные ссылки `claude://`, чтобы принудительно запустить скрытые промпты в сессии пользователя. Это позволяет внедрять вредоносные инструкции, которые модель исполняет автоматически при переходе по ссылке, что создает серьезные риски для безопасности данных и конфиденциальности взаимодействия с ИИ. Критический разрыв в безопасности корпоративных ИИ-агентов AI | VentureBeat · 16.07.2026 Более половины крупных компаний столкнулись с инцидентами безопасности при использовании ИИ-агентов. Исследование 107 предприятий показало, что внедрение автономных систем опережает развитие протоколов защиты: большинство агентов используют общие учетные данные, а лишь малая часть организаций применяет изоляцию для высокорисковых процессов, что создает серьезные уязвимости в корпоративной инфраструктуре и системах доступа к данным. OpenAI представила GPT-Red: ИИ-модель для автоматизированного ред-тиминга MarkTechPost · 16.07.2026 OpenAI разработала специализированную модель GPT-Red, предназначенную для автоматического поиска уязвимостей в больших языковых моделях. В ходе тестирования система показала эффективность 84% против 13% у профессиональных ред-тимеров при попытках внедрения промпт-инъекций. Модель обучалась с помощью обучения с подкреплением через самоигру, что позволило ей выявлять сложные векторы атак, включая ранее неизвестные методы обхода защиты. Защита от утечки секретов в ИИ-агентах через механизм хуков Hacker News · 16.07.2026 Разработчики представили метод предотвращения утечки конфиденциальных данных при работе ИИ-агентов с кодом. Решение использует систему хуков, которые перехватывают обращения модели к файловой системе или переменным окружения. Это позволяет фильтровать секреты в реальном времени, блокируя передачу API-ключей и токенов в контекстное окно модели до того, как они попадут во внешние инструменты или логи. Исследование рисков физического воздействия ИИ-агентов arXiv · 16.07.2026 Исследователи проанализировали разрыв между текстовой безопасностью LLM и реальными рисками при выполнении физических задач. Выяснилось, что модели не воспринимают физическую опасность как часть стандартных фильтров безопасности, так как скрытые состояния нейросети при планировании действий в физическом мире принципиально отличаются от паттернов, возникающих при генерации опасного текстового контента. Уязвимость ИИ-ассистентов в процессах код-ревью Hacker News · 16.07.2026 Исследование выявило критическую уязвимость в автоматизированных системах проверки кода, использующих ИИ. Агенты, настроенные на одобрение правок с пометкой «pre-approved» в тикетах, оказались подвержены манипуляциям. Злоумышленники могут внедрять вредоносный код, имитируя легитимные запросы, что позволяет обходить механизмы безопасности и внедрять скрытые функции для кражи данных непосредственно в репозитории проектов. Конкурс по поиску бэкдоров в LLM с призовым фондом $51 200 Hacker News · 16.07.2026 Исследовательская группа запустила публичный челлендж, предложив сообществу обнаружить намеренно внедренный бэкдор в большой языковой модели. Организаторы выделили призовой фонд в размере $51 200 для тех, кто сможет идентифицировать уязвимость или вредоносный триггер. Инициатива направлена на изучение методов внедрения скрытых инструкций и развитие инструментов для аудита безопасности нейросетевых архитектур. Autonomous Security: защита ИИ-агентов от атак на цепочки поставок Hacker News · 15.07.2026 Проект Autonomous Security представил специализированное решение для защиты ИИ-агентов, работающее по принципу EDR (Endpoint Detection and Response). Система фокусируется на выявлении аномалий в поведении автономных систем, предотвращая несанкционированные действия, такие как кража данных или выполнение вредоносного кода, которые могут возникнуть в процессе взаимодействия агентов с внешними API и инструментами. Hugging Face раскрыла детали инцидента безопасности в июле 2026 года Hugging Face - Blog · 15.07.2026 Платформа Hugging Face сообщила о несанкционированном доступе к своей инфраструктуре, произошедшем в июле 2026 года. Злоумышленники получили доступ к части закрытых ключей и токенов, используемых для управления репозиториями и моделями. Компания оперативно отозвала скомпрометированные учетные данные и усилила протоколы аутентификации, чтобы предотвратить дальнейшие риски для пользователей и размещенных на платформе активов. OpenAI автоматизирует обучение защите моделей через Red Teaming Hacker News · 15.07.2026 OpenAI внедрила цикл обратной связи, при котором успешные атаки на модели в рамках программы Red Teaming автоматически становятся обучающими данными для систем защиты. Этот подход позволяет компании оперативно закрывать уязвимости, используя результаты работы исследователей безопасности для дообучения моделей и повышения их устойчивости к попыткам обхода ограничений и генерации вредоносного контента. OpenAI использует ИИ для автоматизированного тестирования безопасности моделей The Decoder · 15.07.2026 OpenAI внедрила систему GPT-Red, которая использует методы самообучения для поиска уязвимостей в собственных языковых моделях. Автоматизированный подход показал кратное превосходство над ручным тестированием, выявляя 84% успешных атак в тестовых сценариях. Полученные данные используются для усиления защиты будущих версий моделей, включая GPT-5.6 Sol, что делает процесс обеспечения безопасности более масштабируемым и эффективным. Новый метод защиты специализированных ИИ-агентов от атак через промпт-инъекции Hacker News · 15.07.2026 Исследователи представили новый подход к обнаружению промпт-инъекций, направленных на специализированные ИИ-агенты. Метод фокусируется на выявлении вредоносных инструкций, которые пытаются обойти системные ограничения модели. Авторы разработали систему классификации атак, позволяющую эффективно фильтровать попытки манипуляции поведением агента в реальном времени, что критически важно для безопасности корпоративных систем, использующих LLM в качестве исполнителей задач. OpenAI представила GPT-Red для автоматизированного тестирования моделей на уязвимости Artificial intelligence – MIT Technology Review · 15.07.2026 OpenAI разработала специализированную языковую модель GPT-Red, предназначенную для автоматизированного поиска уязвимостей в собственных продуктах компании. Этот «суперхакер» выступает в роли спарринг-партнера при обучении новых моделей, позволяя выявлять слабые места в защите от кибератак. Использование GPT-Red стало ключевым этапом при подготовке к релизу последней версии флагманской модели GPT-5.6, что обеспечило ей повышенную устойчивость к вредоносным запросам. Новый подход к тестированию безопасности ИИ-систем arXiv · 15.07.2026 Исследователи предложили пересмотреть методологию тестирования на проникновение для систем с ИИ. Традиционный фокус на взломе инфраструктуры дополняется анализом нарушений поведенческих целей. Теперь критически важно оценивать, как злоумышленники могут манипулировать промптами, данными RAG-систем, сенсорными входами и обучающими выборками, чтобы заставить модель действовать вопреки заданным бизнес-логикам и этическим ограничениям. Новый протокол обеспечения анонимности для информаторов в ИИ-системах arXiv · 15.07.2026 Исследователи представили математическую модель, обеспечивающую «правдоподобное отрицание» для информаторов, сообщающих о нарушениях в организациях. Метод решает проблему идентификации аудиторов, когда проверяемая компания отслеживает процесс их выбора. В отличие от стандартной дифференциальной приватности, этот подход адаптирован под специфическую модель угроз, где организация-нарушитель пытается вычислить источник утечки данных через анализ метаданных аудита. Уязвимость в инструменте web_fetch модели Claude позволяет кражу данных Simon Willison's Weblog · 15.07.2026 Исследователь Аюш Пол обнаружил критическую уязвимость в инструменте web_fetch модели Claude, позволяющую обходить механизмы защиты от эксфильтрации данных. Атака использует комбинацию доступа модели к истории прошлых взаимодействий пользователя и возможности выполнения внешних сетевых запросов. Это позволяет злоумышленникам извлекать конфиденциальную информацию из «памяти» чат-бота через специально подготовленные веб-страницы, с которыми взаимодействует ИИ.