Исследование Together AI сравнило эффективность моделей DeepSeek-V4 Flash и GPT-5.6 Luna на бенчмарке DeepSWE, включающем 900 запусков. Результаты показывают, что GPT-5.6 Luna превосходит конкурента по качеству кода (метрика pass@1 на 14 пунктов выше), однако DeepSeek-V4 Flash демонстрирует значительно более высокую экономическую эффективность, обеспечивая в 4,8 раза больше успешных решений на каждый потраченный доллар.

Бенчмарк DeepSWE ориентирован на оценку способностей LLM к решению сложных инженерных задач в реальных репозиториях. Разрыв в 14 процентных пунктов по точности выполнения задач (pass@1) подчеркивает лидерство GPT-5.6 Luna в качестве генерации кода, что делает её предпочтительным выбором для сценариев, где критически важна безошибочность результата с первой попытки.

С другой стороны, показатель стоимости решения задач становится ключевым фактором для масштабируемых систем разработки. Преимущество DeepSeek-V4 Flash в 4,8 раза по эффективности затрат указывает на то, что для многих прикладных задач, где допустима итеративная доработка или требуется массовая обработка кода, использование более доступных моделей позволяет существенно оптимизировать бюджеты на инференс без критической потери производительности.

Ключевые факты

  • Проведено 900 тестовых запусков (rollouts) на платформе DeepSWE для каждой модели.
  • GPT-5.6 Luna опережает DeepSeek-V4 Flash на 14 пунктов по метрике pass@1.
  • DeepSeek-V4 Flash обеспечивает в 4,8 раза больше успешных решений на каждый потраченный доллар.
  • Исследование сфокусировано на сравнении качества кода и экономической эффективности инференса в задачах разработки.