HARTOS — это экспериментальная операционная система, которая автоматически перенаправляет сложные запросы от менее мощных моделей к более производительным LLM. Система анализирует контекст задачи и самостоятельно принимает решение о необходимости эскалации, оптимизируя баланс между скоростью ответа, стоимостью вычислений и качеством генерации в рамках агентных рабочих процессов.
Архитектура системы построена на принципе иерархического делегирования. Вместо того чтобы использовать одну универсальную модель для всех типов операций, HARTOS классифицирует входящие задачи. Простые запросы обрабатываются локально или быстрыми компактными моделями, что снижает задержки, в то время как задачи, требующие глубокого рассуждения или сложной логики, передаются в облачные API с более мощными параметрами.
Такой подход позволяет разработчикам создавать агентные системы, которые не переплачивают за избыточные вычислительные мощности при выполнении рутинных операций. Интеграция подобного механизма в агентный пайплайн позволяет гибко управлять бюджетом токенов и повышать общую надежность выполнения цепочек действий, где критически важна точность на каждом этапе.
Ключевые факты
- HARTOS реализует паттерн динамической эскалации моделей для оптимизации затрат и производительности.
- Система автоматически определяет сложность задачи и выбирает подходящую LLM для её решения.
- Проект ориентирован на снижение стоимости инференса за счет отказа от использования тяжелых моделей для простых задач.
- Исходный код и логика работы системы доступны в репозитории на GitHub под брендом Hertz AI.