Бизнес столкнулся с проблемой «токенокалипсиса» — резким и непредсказуемым ростом затрат на использование LLM. Внутренние данные Accenture показывают, что основной объем потребления токенов генерируют не инженеры, а сотрудники из бизнес-подразделений, использующие ИИ-инструменты без должного контроля. Это вынуждает компании пересматривать стратегии внедрения и внедрять жесткие лимиты на использование API.

Проблема заключается в отсутствии прозрачности того, как именно сотрудники расходуют бюджеты на инференс. Часто простые задачи, такие как анализ длинных PDF-документов или генерация объемных отчетов, приводят к списанию огромного количества токенов. В условиях, когда стоимость запросов к передовым моделям остается высокой, бесконтрольное использование ИИ-ассистентов становится серьезной статьей расходов, сопоставимой с затратами на облачную инфраструктуру.

Для оптимизации расходов компании начинают внедрять системы мониторинга потребления токенов на уровне отдельных пользователей и отделов. Также пересматриваются подходы к выбору моделей: вместо использования наиболее мощных и дорогих решений для простых задач бизнес переходит на более компактные и дешевые модели, способные выполнять узкоспециализированные функции с меньшими затратами ресурсов.

Ключевые факты

  • Основной драйвер роста расходов на токены — нетехнические специалисты, использующие ИИ для повседневных задач.
  • Accenture зафиксировала значительный объем потребления токенов сотрудниками, не связанными с разработкой ПО.
  • Одной из главных причин перерасхода стали неоптимальные методы обработки документов, включая загрузку длинных PDF-файлов в контекстное окно моделей.
  • Компании переходят к стратегии «бюджетирования токенов» для предотвращения неконтролируемых финансовых потерь.
  • Оптимизация включает переход на специализированные или менее ресурсоемкие модели для выполнения рутинных операций.