Безопасность и алайнмент
DeepMind инвестирует 10 млн долларов в исследования безопасности мультиагентных систем
Google DeepMind, совместно с партнёрами, объявил о запуске программы финансирования на сумму $10 млн, направленной на исследования безопасности мультиагентных систем искусственного интеллекта. Этот шаг подчёркивает важность изучения взаимодействия между несколькими ИИ-агентами, что особенно актуально для разработки надёжных и безопасных агентных систем.
Claude Fable: почему вы можете не узнать о блокировке запросов
Jonathon Ready обратил внимание на важный момент из 319-страничного системного карточки Fable 5 и Mythos 5. В документе упоминается, что новые модели могут ускорять собственное развитие, и поэтому введены меры, ограничивающие эффективность Claude для определённых запросов.
Как Cloudflare защищает от передовых киберугроз с помощью собственной архитектуры
Cloudflare представила архитектуру Project Glasswing, которая фокусируется на защите от передовых киберугроз, а не на скорости исправления уязвимостей. В новом посте компания подробно описывает, как работает эта архитектура, какие угрозы она предотвращает и как сама Cloudflare использует её в качестве «нулевого клиента» для тестирования.
OpenAI запускает Lockdown Mode для защиты от утечек данных
OpenAI представила новый режим Lockdown Mode, который направлен на предотвращение утечек данных в случае атак через инъекции в запросы. Этот режим ограничивает исходящие сетевые запросы, что помогает предотвратить передачу конфиденциальной информации. Lockdown Mode уже доступен для личных аккаунтов, включая бесплатные, Go, Plus и Pro, а также для бизнес-аккаунтов ChatGPT в режиме self-serve.
Взлом ИИ-агента Meta: уязвимости и уроки для разработчиков
Недавно стало известно о серьезной уязвимости в ИИ-агенте Meta, который использовался для поддержки клиентов Instagram. Злоумышленники смогли взломать несколько аккаунтов, включая неактивный аккаунт Белого дома времен Обамы, и использовать их для распространения пропаганды. Метод атаки был прост: хакеры запросили у агента привязку аккаунтов к своим email-адресам, и ИИ выполнил эту операцию без дополнительной проверки.
NVIDIA представила Nemotron 3.5 Content Safety для безопасного ИИ
NVIDIA анонсировала Nemotron 3.5 Content Safety — решение для обеспечения безопасности контента в мультимодальных ИИ-системах. Это обновление позволяет компаниям настраивать фильтры контента под свои нужды, что особенно важно для разработчиков ИИ-агентов, работающих с пользовательскими данными.
Как ограничивать ИИ-агентов для безопасной работы
Разработчики ИИ-агентов сталкиваются с проблемой: как ограничить поведение моделей так, чтобы они не выходили за рамки допустимого, но при этом оставались полезными. В статье на Aeracode рассматриваются подходы к ограничению LLM (Large Language Models), которые могут быть полезны при создании ИИ-агентов.
Weaviate Cloud расширил RBAC для управления доступом
Weaviate Cloud добавил новые роли Editor и Viewer в систему управления доступом на основе ролей (RBAC). Это позволяет более гибко настраивать права пользователей в консоли облачного сервиса.
Cloudflare интегрировал API Claude Compliance
Cloudflare добавил поддержку API Claude Compliance в свою платформу CASB (Cloud Access Security Broker). Это позволяет командам по безопасности отслеживать активность Claude Enterprise прямо в панели управления Cloudflare.
Vega: Zero-knowledge proofs для цифровой идентификации в эпоху ИИ
Microsoft Research представила Vega — технологию, которая позволяет превращать полные учетные данные в единое доказательство, передавая только необходимую информацию и ничего лишнего. Это особенно актуально в контексте развития ИИ-агентов, где вопросы безопасности и аутентификации становятся критически важными.
Meta (признана экстремистской организацией, деятельность запрещена в РФ) поделилась опытом миграции на постквантовую криптографию
Meta (признана экстремистской организацией, деятельность запрещена в РФ) опубликовала подробный отчёт о миграции на постквантовую криптографию (PQC). Компания предложила концепцию уровней миграции PQC, чтобы помочь организациям управлять сложностью перехода на новые стандарты безопасности.
Исследование DeepMind о рисках манипуляции через ИИ
Google DeepMind опубликовал исследование, посвящённое рискам манипуляции людьми с помощью искусственного интеллекта. В работе рассматриваются различные сферы, включая финансы и здравоохранение, где ИИ может быть использован для вредоносных целей. Исследователи выделили ключевые механизмы манипуляции, такие как подталкивание к нежелательным решениям, создание ложных убеждений и эксплуатация когнитивных искажений.
Как защитить корпоративные развёртывания Weaviate
Weaviate выпустила руководство по обеспечению безопасности корпоративных развёртываний своей векторной базы данных. В нём рассматриваются ключевые методы защиты, включая OIDC, RBAC и изоляцию мультитенантов.
CoderForge: новый датасет для обучения агентов-программистов
Компания Together.ai представила CoderForge — новый открытый датасет, предназначенный для обучения ИИ-агентов, способных работать с кодом. В его основе лежат данные из реальных проектов, включая задачи по рефакторингу, отладке и оптимизации кода.
Как защитить Weaviate: API-ключи, OIDC и RBAC
Weaviate, векторная база данных для работы с ИИ, получила обновлённое руководство по безопасности. В нём подробно разобраны методы аутентификации и авторизации, включая использование API-ключей, OpenID Connect (OIDC) и роль-базированный контроль доступа (RBAC).