Исследователи проанализировали переход от жестких JSON-схем к программному вызову инструментов (tool calling) в LLM. Использование кода позволяет моделям естественным образом цепочками связывать и параллельно выполнять задачи, выходя за рамки обучающих данных. Авторы провели систематическую оценку производительности различных поколений моделей в реальных условиях, выявив ключевые преимущества и ограничения такого подхода для построения автономных агентов.
Традиционные методы вызова инструментов через JSON часто ограничивают гибкость агентов при выполнении сложных многошаговых операций. Программный подход, при котором модель генерирует исполняемый код для взаимодействия с внешними API и базами данных, значительно расширяет возможности автоматизации. Это позволяет агентам динамически адаптироваться к изменяющимся условиям среды, выполняя вычисления и логические операции непосредственно в процессе исполнения задачи.
В работе подчеркивается, что способность моделей писать и исполнять код становится критическим фактором для их трансформации в полноценных агентов. Исследование демонстрирует, как именно архитектурные изменения в моделях влияют на их умение эффективно использовать инструменты в условиях реальных бизнес-процессов, где требуется высокая точность и предсказуемость выполнения последовательностей действий.
Ключевые факты
- Программный вызов инструментов заменяет статичные JSON-структуры на динамические скрипты, поддерживающие параллелизм.
- Исследование охватывает сравнение текущих и предыдущих поколений моделей на стандартизированных бенчмарках.
- Использование кода позволяет агентам выполнять цепочки действий, которые выходят за пределы их базовых обучающих датасетов.
- Работа сфокусирована на оценке надежности агентов при выполнении задач в реальных условиях эксплуатации.