Исследователи представили OctoLong — метод дообучения языковых моделей, направленный на повышение эффективности работы с длинными контекстами. В отличие от стандартных подходов, использующих разрозненные документы, OctoLong фокусируется на кросс-репозиторных связях в коде. Это позволяет моделям лучше улавливать зависимости в сложных программных проектах, что критически важно для разработки агентных систем и глубокого анализа кода.
Современные модели часто сталкиваются с дефицитом качественных данных для обучения длинному контексту, так как существующие корпуса перенасыщены книгами или статьями, где связи между удаленными фрагментами текста выражены слабо. Авторы OctoLong предлагают использовать структуру программных репозиториев, где логические зависимости между файлами и модулями создают естественную среду для тренировки способности модели удерживать контекст на больших дистанциях.
Метод демонстрирует, что качество данных для обучения «длинному окну» важнее, чем простое увеличение объема токенов. Использование связных программных контекстов позволяет моделям эффективнее справляться с задачами, требующими понимания архитектуры проекта целиком, а не только отдельных функций. Это приближает возможности LLM к решению задач, где необходимо учитывать взаимосвязи между множеством файлов в рамках одного рабочего процесса.
Ключевые факты
- OctoLong фокусируется на обучении моделей через анализ кросс-репозиторных зависимостей в коде.
- Метод направлен на решение проблемы нехватки качественных данных с длинными логическими связями в существующих корпусах.
- Подход значительно улучшает способность моделей к in-context learning и работе в рамках сложных агентных сценариев.
- Исследование подчеркивает преимущество структурированных данных (код) перед неструктурированными (книги) при масштабировании контекстного окна.