Исследователи представили формальную модель управления автономными ИИ-агентами, основанную на теории дизайна механизмов. Концепция предлагает контролировать поведение систем через динамическое распределение вычислительных бюджетов. Такой подход делает авторизацию действий агента самоисполняемой: система получает доступ к ресурсам только в рамках заданных параметров безопасности, превращая вычислительную мощность в основной рычаг управления и контроля.
Предложенная модель «Resourced Authority» направлена на решение проблемы непрерывного участия человека в управлении развернутыми ИИ-системами. Вместо попыток жесткого программирования ограничений поведения, авторы предлагают использовать экономические стимулы и лимиты ресурсов. Это позволяет интегрировать механизмы партисипаторного управления непосредственно в жизненный цикл агента, где сообщество или операторы могут корректировать бюджеты, тем самым ограничивая или расширяя возможности системы в реальном времени.
Метод опирается на парадигму «Safe AI», где вычислительные мощности рассматриваются как наиболее эффективный инструмент governance. В отличие от статических фильтров безопасности, данный подход обеспечивает гибкость: если агент начинает выходить за рамки заданных целей или демонстрирует нежелательное поведение, механизм автоматически сокращает доступные ему ресурсы. Это создает прозрачную и измеримую среду для эксплуатации сложных агентных систем в критических инфраструктурах.
Ключевые факты
- Разработана формальная модель управления агентами на основе теории дизайна механизмов (mechanism design).
- Основной рычаг контроля — динамическое управление вычислительным бюджетом (compute budget) агента.
- Концепция направлена на реализацию парадигмы Safe AI через самоисполняемую авторизацию действий.
- Механизм позволяет осуществлять непрерывное партисипаторное управление развернутыми ИИ-системами.
- Модель минимизирует риски неконтролируемого поведения за счет автоматического ограничения ресурсов при отклонении от заданных параметров.