Журналисты The New York Times провели масштабный эксперимент, оценив эффективность современных ИИ-агентов в выполнении типичных офисных задач. В ходе тестирования системы пытались автоматизировать процессы обработки данных, планирования и подготовки документов, с которыми ежедневно сталкиваются сотрудники. Результаты показали как значительный потенциал в ускорении рутины, так и критические ограничения в точности и автономности при работе со сложными бизнес-сценариями.

В рамках исследования эксперты отобрали несколько популярных агентных платформ и поставили перед ними задачи, требующие многошагового планирования и взаимодействия с внешним ПО. Выяснилось, что агенты успешно справляются с узкоспециализированными операциями, такими как извлечение данных из таблиц или составление черновиков писем, однако часто допускают ошибки при необходимости контекстного анализа или проверки достоверности информации.

Основной вывод эксперимента заключается в том, что текущие инструменты пока не способны полностью заменить человека в комплексных процессах. Вместо этого они демонстрируют высокую эффективность в качестве ассистентов, работающих под контролем оператора. Разрыв между возможностями моделей и требованиями корпоративной среды остается существенным, особенно в вопросах безопасности данных и обработки неструктурированных запросов.

Ключевые факты

  • В эксперименте оценивалась способность ИИ-агентов выполнять задачи по планированию, анализу данных и созданию контента.
  • Выявлено, что системы показывают высокую скорость в рутинных операциях, но требуют постоянного надзора из-за риска галлюцинаций.
  • Основным барьером для внедрения названа сложность интеграции агентов в существующие корпоративные рабочие процессы.
  • Исследование подчеркивает, что текущий уровень автономности агентов ограничен выполнением отдельных задач, а не полноценных бизнес-функций.