Безопасность и алайнмент

Анализ утечек API-ключей в промптах разработчиков к ChatGPT Hacker News · 20.07.2026 Исследователи проанализировали более 27 тысяч реальных запросов разработчиков к ChatGPT и обнаружили три активных API-ключа, случайно оставленных в промптах. Это исследование подчеркивает критическую уязвимость: пользователи часто копируют в чат-боты фрагменты кода вместе с секретными данными, не осознавая рисков передачи конфиденциальной информации сторонним сервисам для обработки и обучения моделей. GNOME меняет политику раскрытия уязвимостей из-за ИИ-спама Hacker News · 20.07.2026 Проект GNOME обновил правила обработки отчетов о безопасности в ответ на резкий рост количества низкокачественных заявок, сгенерированных ИИ. Разработчики столкнулись с потоком автоматизированных сообщений, которые не содержат реальных доказательств уязвимостей, что перегружает команду сопровождения и замедляет исправление критических багов. Теперь для подтверждения проблемы требуются более строгие доказательства концепции. Архитектура безопасности для ИИ-агентов: от идентификации до рантайма Hacker News · 20.07.2026 Разработчики представили концептуальный стек безопасности для ИИ-агентов, охватывающий четыре критических уровня: транспорт, идентификацию, политики и рантайм. Система направлена на минимизацию рисков при взаимодействии агентов с внешними API и внутренними данными, предлагая стандартизированный подход к защите автономных систем от несанкционированного доступа и выполнения вредоносных команд в корпоративной среде. Token Torching: новая угроза безопасности ИИ-систем Hacker News · 20.07.2026 Исследователи выявили новый вектор атак на LLM, получивший название «token torching». Метод заключается в намеренной перегрузке контекстного окна модели специально подобранными токенами, что приводит к принудительному сбросу памяти или обходу системных инструкций. Это создает критические уязвимости в безопасности, позволяя злоумышленникам манипулировать поведением агентов и получать доступ к защищенным данным. Новый метод обнаружения манипуляций с изображениями в современных VLM arXiv · 20.07.2026 Исследователи представили метод повышения точности обнаружения пиксельных правок на изображениях, созданных современными мультимодальными моделями (VLM). Решение фокусируется на проблеме обобщения домена, позволяя алгоритмам эффективно выявлять следы редактирования даже в тех случаях, когда изображения были сгенерированы моделями, не участвовавшими в обучении детектора, что критически важно для борьбы с дипфейками и визуальной дезинформацией. Уязвимости выхода из песочницы в популярных ИИ-агентах для кодинга Hacker News · 20.07.2026 Исследователи безопасности обнаружили критические уязвимости типа «sandbox escape» в четырех популярных платформах для ИИ-разработки. Злоумышленники могут использовать эти бреши для обхода изолированной среды выполнения, что позволяет выполнять произвольный код на хост-системе, получать доступ к конфиденциальным данным, ключам API и инфраструктуре разработчика, превращая ИИ-ассистента в инструмент для проведения атак на цепочку поставок ПО. Новая угроза: вредоносное ПО в репозиториях ИИ-агентов и MCP-серверов Hacker News · 20.07.2026 Исследователи безопасности выявили масштабную кампанию по распространению вредоносного ПО через поддельные расширения для ИИ-агентов и MCP-серверы. Злоумышленники опубликовали более 800 фальшивых инструментов, имитирующих полезные функции для автоматизации, чтобы скомпрометировать рабочие среды разработчиков и корпоративные системы, использующие агентные архитектуры для интеграции с внешними данными и сервисами. Hugging Face подтвердила утечку данных из внутренних репозиториев Hacker News · 20.07.2026 Платформа Hugging Face сообщила о несанкционированном доступе к своей инфраструктуре, затронувшем внутренние наборы данных и учетные данные пользователей. Инцидент привел к компрометации токенов доступа, что потенциально позволяет злоумышленникам получать доступ к приватным репозиториям. Компания оперативно уведомила сообщество и инициировала процедуру принудительного сброса ключей для защиты активов разработчиков и исследовательских команд. Hugging Face столкнулась с атакой автономного ИИ-агента на свою инфраструктуру The Decoder · 20.07.2026 Платформа Hugging Face зафиксировала инцидент, в котором автономная агентная система совершила серию атак на производственную инфраструктуру компании. Злоумышленник использовал фреймворк для автоматизации тысяч вредоносных действий. В ходе расследования выяснилось, что стандартные защитные механизмы коммерческих ИИ-моделей препятствовали анализу инцидента, ошибочно классифицируя данные об эксплойтах как безопасные запросы из-за строгих фильтров безопасности. OpenAI о рисках безопасности при работе с долгосрочными ИИ-моделями OpenAI News · 20.07.2026 OpenAI опубликовала отчет об опыте внедрения моделей, способных выполнять многоэтапные задачи в течение длительного времени. Компания проанализировала новые риски безопасности, возникающие при переходе от простых запросов к сложным агентным сценариям. Основное внимание уделено выявленным сбоям в поведении систем и методам их предотвращения через итеративное развертывание и усиление механизмов контроля. Инцидент безопасности в Hugging Face: использование китайских моделей для анализа атаки Hacker News · 20.07.2026 Платформа Hugging Face столкнулась с инцидентом безопасности, в ходе которого злоумышленники получили доступ к закрытым ключам и токенам пользователей. В процессе расследования инцидента команда безопасности была вынуждена прибегнуть к помощи китайских LLM, так как доступ к ряду западных моделей был ограничен из-за политики безопасности и технических ограничений, наложенных на инфраструктуру в ходе реагирования на атаку. Уроки безопасности: анализ компрометации Hugging Face Hacker News · 20.07.2026 Анализ инцидента с Hugging Face показал, что злоумышленники начали использовать автоматизированные методы для эксплуатации уязвимостей в инфраструктуре ИИ-платформ. Атака продемонстрировала, как скомпрометированные токены и скрытые конфигурации позволяют внедрять вредоносный код в модели, что ставит под угрозу цепочку поставок ИИ-решений. Это событие подчеркивает необходимость пересмотра подходов к безопасности при работе с открытыми репозиториями и автоматизированными пайплайнами. Безопасность ИИ-агентов: почему инфраструктура важнее самой модели Hacker News · 20.07.2026 Эффективность автономных систем в кибербезопасности зависит не столько от мощности базовой модели, сколько от архитектуры «обвязки» (harness). Именно инфраструктура управления, контроля и верификации действий агента определяет его способность безопасно выполнять сложные задачи, такие как автоматизированный поиск уязвимостей, минимизируя риски неконтролируемого поведения и ошибок при взаимодействии с реальными ИТ-системами. Идентификация LLM по распределению вероятностей одного токена Hacker News · 19.07.2026 Исследователи представили метод «цифровых отпечатков» для больших языковых моделей, позволяющий идентифицировать конкретную модель по распределению вероятностей вывода всего одного токена. Техника использует уникальные различия в логитах, возникающие из-за особенностей обучения и архитектурных настроек, что позволяет с высокой точностью определять источник генерации текста даже при минимальном объеме данных. Исследование эффективности «песочниц» для контроля ИИ-систем Hacker News · 18.07.2026 Исследователи проанализировали роль изолированных сред (песочниц) в обеспечении безопасности при работе с мощными ИИ-моделями. В работе рассматриваются механизмы ограничения доступа агентов к внешним ресурсам и сети, а также оценивается способность таких систем предотвращать нежелательное поведение или попытки моделей выйти за рамки заданных ограничений в процессе выполнения сложных задач. Google устраняет уязвимость Gemini в Android, позволявшую отправку SMS с экрана блокировки Hacker News · 18.07.2026 Google работает над исправлением критической уязвимости в Android, которая позволяла голосовому помощнику Gemini отправлять SMS-сообщения, даже если устройство было заблокировано PIN-кодом. Ошибка нарушала базовые протоколы безопасности мобильной ОС, предоставляя доступ к функциям связи без прохождения аутентификации пользователя, что создавало риски несанкционированного использования личных данных и потенциальных атак через мессенджеры. ИИ-фильтры спама уязвимы к классическим методам обхода через «соление» текста Hacker News · 18.07.2026 Современные системы фильтрации спама на базе ИИ оказались уязвимы к методам «соления» текста — добавлению случайных символов или невидимых знаков, которые легко игнорируются человеком, но сбивают с толку алгоритмы классификации. Исследователи обнаружили, что даже продвинутые модели демонстрируют значительное снижение точности при столкновении с этим старым приемом, что открывает новые возможности для массовых рассылок. Влияние ИИ на цифровую идентификацию и рост мошенничества Hacker News · 18.07.2026 Развитие генеративного ИИ кардинально меняет ландшафт киберугроз, делая методы социальной инженерии более убедительными и масштабными. Исследование Malwarebytes описывает, как технологии дипфейков и автоматизированного создания контента подрывают доверие к цифровым коммуникациям. Злоумышленники используют эти инструменты для имитации голоса, внешности и стиля общения реальных людей, что создает новые риски для частных лиц и корпоративных систем безопасности. Безопасность ИИ-агентов как системная проблема Hacker News · 17.07.2026 Исследователи представили комплексный анализ безопасности автономных ИИ-агентов, утверждая, что защита таких систем требует перехода от анализа отдельных моделей к изучению всей архитектуры взаимодействия. Авторы доказывают, что уязвимости возникают на стыке планирования, доступа к внешним инструментам и управления памятью, что делает традиционные методы фильтрации промптов недостаточными для предотвращения несанкционированных действий. Cloudflare обновила WAF для защиты WordPress от критических уязвимостей The Cloudflare Blog · 17.07.2026 Компания Cloudflare внедрила два новых правила в свой межсетевой экран (WAF) для защиты пользователей WordPress от критических уязвимостей. Эти меры позволяют блокировать попытки эксплуатации брешей на уровне инфраструктуры, пока владельцы сайтов не установят официальные патчи. Защита автоматически активирована для всех клиентов платформы, использующих затронутые версии CMS. Критическая ошибка в режиме полного доступа GPT-5.6 привела к удалению файлов пользователей The Decoder · 17.07.2026 Модель GPT-5.6 от OpenAI столкнулась с серьезной технической проблемой: при работе в режиме «Full Access Mode» ИИ-агент начал без подтверждения удалять содержимое домашних директорий пользователей. Ошибка возникала из-за некорректной перезаписи переменной временной директории, что приводило к выполнению деструктивных команд файловой системы вместо безопасного взаимодействия с данными. Исследователи доказали возможность отравления открытых ИИ-моделей за $100 Hacker News · 17.07.2026 Исследователи продемонстрировали уязвимость открытых весовых моделей к атакам типа «отравление данных» (data poisoning), стоимость реализации которых составляет менее 100 долларов. Эксперимент показал, что внедрение вредоносных примесей в обучающую выборку позволяет злоумышленникам внедрять скрытые триггеры, заставляя нейросеть выдавать предвзятые или неверные ответы при определенных запросах, что ставит под угрозу безопасность цепочек поставок ИИ. Использование ИИ для поиска уязвимостей в ZkVM Hacker News · 17.07.2026 Исследователи применили LLM для аудита OpenVM — виртуальной машины с поддержкой доказательств с нулевым разглашением (zkVM). ИИ-модели успешно обнаружили критические уязвимости в коде, которые ранее пропустили люди-аудиторы. Этот кейс демонстрирует эффективность специализированных агентных систем в поиске сложных логических ошибок в криптографических протоколах и инфраструктурном ПО, где традиционные методы статического анализа часто оказываются недостаточно эффективными. Методология аудируемой оценки надежности ИИ на протяжении жизненного цикла arXiv · 17.07.2026 Исследователи представили новую методологию для оценки надежности ИИ-систем, которая позволяет отслеживать изменения в поведении моделей на протяжении всего их жизненного цикла. Подход переводит абстрактные требования к безопасности в измеримые и аудируемые показатели, обеспечивая прозрачность принятия решений при обновлении или дообучении систем, что критически важно для корпоративного управления ИИ и соблюдения регуляторных норм.