Внутренняя ошибка в Amazon привела к непредвиденным расходам в размере 1,8 миллиона долларов при использовании модели Claude для выполнения рутинной задачи по написанию кода. Из-за сбоя в логике обработки данных система превысила запланированный бюджет на 860%, продемонстрировав критические риски при масштабировании агентных решений без должного контроля затрат и мониторинга API-запросов в реальном времени.

Инцидент произошел из-за того, что скрипт, предназначенный для автоматизации простых операций, попал в бесконечный цикл. В результате модель Anthropic Claude непрерывно генерировала и обрабатывала запросы, что привело к экспоненциальному росту потребления токенов. Эта ситуация подчеркивает уязвимость корпоративных систем, использующих LLM, перед ошибками в архитектуре агентных пайплайнов, где отсутствие жестких лимитов на выполнение может привести к катастрофическим финансовым потерям.

Случай стал показательным примером необходимости внедрения многоуровневых систем защиты, включая автоматические «предохранители» (circuit breakers) и жесткие квоты на уровне отдельных API-ключей. Компании, внедряющие генеративный ИИ в бизнес-процессы, сталкиваются с тем, что стоимость ошибки при автоматизации возрастает пропорционально скорости работы моделей, что требует новых подходов к управлению инфраструктурой и финансовому контролю над агентными системами.

Ключевые факты

  • Сумма непредвиденных расходов составила 1,8 миллиона долларов США.
  • Превышение установленного бюджета на выполнение задачи достигло 860%.
  • Причиной инцидента стал бесконечный цикл в коде, который привел к избыточному потреблению токенов моделью Claude.
  • Инцидент выявлен в ходе анализа внутренней отчетности Amazon по использованию ресурсов ИИ.