Специалисты провели масштабное тестирование моделей Kimi K3 и Claude Fable 5 на бенчмарке DeepSWE, выполнив 452 прогона для оценки эффективности написания кода. Результаты показали, что Claude Fable 5 демонстрирует более высокую точность в решении задач с первой попытки, однако Kimi K3 значительно превосходит конкурента по показателю экономической эффективности, обеспечивая почти трехкратное преимущество в количестве решенных задач на каждый потраченный доллар.
Бенчмарк DeepSWE ориентирован на проверку способности моделей к автономному решению инженерных задач в реальных репозиториях. В ходе эксперимента Claude Fable 5 показала преимущество в метрике pass@1, опередив Kimi K3 на 1,4 процентных пункта. Это подтверждает способность модели к более точному следованию инструкциям при написании кода с минимальным количеством итераций.
С другой стороны, Kimi K3 продемонстрировала лучшие результаты в метрике pass@4, что указывает на высокую надежность модели при многократных попытках решения сложных задач. Учитывая разницу в стоимости инференса, Kimi K3 оказалась в 2,8 раза эффективнее с точки зрения затрат на успешное выполнение задачи, что делает её более выгодным решением для масштабных процессов автоматизации разработки.
Ключевые факты
- Проведено 452 полных прогона (rollouts) на базе бенчмарка DeepSWE.
- Claude Fable 5 опережает Kimi K3 на 1,4 п.п. по показателю pass@1.
- Kimi K3 лидирует по метрике pass@4, демонстрируя высокую стабильность при повторных попытках.
- Экономическая эффективность Kimi K3 в 2,8 раза выше, чем у Claude Fable 5, в расчете на количество решенных задач за доллар.
