Команда KwaiKAT из компании Kuaishou выпустила технический отчет о модели KAT-Coder-V2.5, ориентированной на решение задач программирования. Разработчики утверждают, что ключевым ограничением агентных систем является не масштаб модели, а качество инфраструктуры обучения. Инструмент AutoBuilder позволил создать более 100 000 верифицируемых репозиториев, что значительно повысило точность выполнения задач и снизило количество ошибок в процессе обучения с подкреплением.

Основной фокус работы смещен с увеличения количества параметров на создание надежной среды для обучения агентов. Авторы внедрили систему автоматизированной сборки окружений, которая позволила масштабировать процесс подготовки данных для 12 различных языков программирования. Это позволило модели лучше понимать структуру реальных репозиториев и контекст разработки, минимизируя галлюцинации при генерации кода.

Важным этапом стала интеграция «песочницы» (sandbox audit), которая проверяет корректность кода в реальном времени. Такой подход позволил отсеивать нерабочие решения на этапе обучения, что критически важно для агентных систем, работающих с долгосрочным планированием и многошаговым написанием кода. Результаты показывают, что качество среды напрямую коррелирует с эффективностью автономного программирования.

Ключевые факты

  • Модель обучена на более чем 100 000 верифицируемых репозиториях, охватывающих 12 языков программирования.
  • Использование инструмента AutoBuilder повысило успешность построения сред для обучения с 16,5% до 57,2%.
  • Внедрение аудита через «песочницу» позволило сократить ошибки в обратной связи при обучении с подкреплением с 16% до менее чем 1%.
  • Разработчики подчеркивают, что качество инфраструктуры данных является более значимым фактором для агентных способностей, чем размер самой нейросети.