Журналисты The New York Times провели масштабный эксперимент, оценив эффективность современных ИИ-агентов в выполнении типичных офисных задач. В ходе тестирования системы пытались автоматизировать процессы обработки данных, планирования и подготовки документов, с которыми ежедневно сталкиваются сотрудники. Результаты показали как значительный потенциал в ускорении рутины, так и критические ограничения в точности и автономности при работе со сложными бизнес-сценариями.
В рамках исследования эксперты отобрали несколько популярных агентных платформ и поставили перед ними задачи, требующие многошагового планирования и взаимодействия с внешним ПО. Выяснилось, что агенты успешно справляются с узкоспециализированными операциями, такими как извлечение данных из таблиц или составление черновиков писем, однако часто допускают ошибки при необходимости контекстного анализа или проверки достоверности информации.
Основной вывод эксперимента заключается в том, что текущие инструменты пока не способны полностью заменить человека в комплексных процессах. Вместо этого они демонстрируют высокую эффективность в качестве ассистентов, работающих под контролем оператора. Разрыв между возможностями моделей и требованиями корпоративной среды остается существенным, особенно в вопросах безопасности данных и обработки неструктурированных запросов.
Ключевые факты
- В эксперименте оценивалась способность ИИ-агентов выполнять задачи по планированию, анализу данных и созданию контента.
- Выявлено, что системы показывают высокую скорость в рутинных операциях, но требуют постоянного надзора из-за риска галлюцинаций.
- Основным барьером для внедрения названа сложность интеграции агентов в существующие корпоративные рабочие процессы.
- Исследование подчеркивает, что текущий уровень автономности агентов ограничен выполнением отдельных задач, а не полноценных бизнес-функций.