Исследование производительности моделей Kimi K3 и GPT-5.6 Sol на бенчмарке DeepSWE показало различия в их специализации. При 904 запусках GPT-5.6 Sol продемонстрировала лучшие показатели pass@1, тогда как Kimi K3 оказалась эффективнее в метрике pass@4. Использование стратегии маршрутизации между этими моделями позволяет достичь успеха в 85,6% случаев, оптимизируя баланс между качеством кода и затратами.
Анализ подчеркивает важность выбора модели в зависимости от конкретных требований к разработке. Хотя GPT-5.6 Sol показывает более высокую точность с первой попытки, Kimi K3 предлагает значительное преимущество в экономической эффективности. При использовании Kimi K3 стоимость решения задач оказывается в 2,8 раза ниже, что делает её предпочтительным выбором для сценариев, где допустимы повторные попытки генерации.
Комбинированный подход, при котором запросы распределяются между моделями, позволяет максимизировать производительность систем автоматизированного программирования. Маршрутизация между Kimi K3 и GPT-5.6 Sol обеспечивает высокую надежность выполнения задач, сохраняя при этом контроль над бюджетом на инференс. Данные результаты подтверждают эффективность агентных систем, использующих несколько моделей для решения сложных инженерных задач.
Ключевые факты
- Проведено 904 тестовых запуска на бенчмарке DeepSWE для оценки качества генерации кода.
- Модель GPT-5.6 Sol лидирует по показателю pass@1, обеспечивая высокую точность с первой итерации.
- Kimi K3 превосходит конкурента в метрике pass@4, обеспечивая в 2,8 раза больше решенных задач на каждый потраченный доллар.
- Использование системы маршрутизации между двумя моделями позволяет достичь успеха в 85,6% случаев.
