Исследователи представили метод SpecFirst, решающий проблему низкой эффективности ИИ-агентов при создании программного обеспечения с нуля. В отличие от задач, где есть готовая кодовая база, написание кода по документации остается сложным вызовом. Новый подход внедряет этап поведенческой спецификации как обязательный шаг, что радикально улучшает способность моделей генерировать работающий код по естественному языку.
Текущие бенчмарки, такие как ProgramBench, демонстрируют, что даже передовые языковые модели справляются с задачами написания кода с нуля менее чем в 1% случаев, если в распоряжении есть только текстовое описание и исполняемый бинарный файл в качестве оракула. SpecFirst меняет этот процесс, заставляя агента сначала формализовать требования и ожидаемое поведение системы, прежде чем приступать к написанию реализации.
Этот метод позволяет агентам лучше структурировать процесс разработки, минимизируя галлюцинации и логические ошибки, возникающие при попытке немедленного написания кода. Интеграция этапа спецификации как «гражданина первого класса» в агентный цикл позволяет модели проверять свои гипотезы о функциональности программы до того, как она будет скомпилирована или запущена, что значительно повышает вероятность успешного прохождения тестов.
Ключевые факты
- Метод SpecFirst вводит этап поведенческой спецификации как обязательный шаг в процессе синтеза программ.
- В текущих тестах на бенчмарке ProgramBench стандартные модели решают менее 1% задач при создании кода с нуля.
- Подход использует исполняемые бинарные файлы в качестве поведенческого оракула для верификации спецификаций.
- Методология направлена на устранение разрыва между задачами доработки существующего кода и написанием новых программ с чистого листа.