Исследователи проанализировали проблему непредсказуемости ответов больших языковых моделей, вызванную параметрами случайности, такими как температура и top-p сэмплинг. Авторы статьи подчеркивают, что отсутствие стандартизации в описании этих настроек при публикации научных работ делает результаты экспериментов невоспроизводимыми, что ставит под угрозу достоверность текущих исследований в области ИИ и машинного обучения.
Проблема заключается в том, что даже при фиксированных сидах (seeds) архитектурные особенности современных моделей и аппаратные различия могут приводить к вариативности выходных данных. Это создает «шум» в бенчмарках, где незначительные изменения в конфигурации генерации текста могут кардинально менять итоговые метрики качества, что часто игнорируется при представлении результатов на конференциях.
Авторы предлагают внедрить обязательный протокол отчетности для исследователей. Он должен включать не только значения гиперпараметров, но и детальное описание среды выполнения, включая аппаратное обеспечение и конкретные версии библиотек инференса. Такой подход позволит сообществу более точно интерпретировать результаты и проводить независимую верификацию экспериментов, снижая количество «ложноположительных» прорывов в публикациях.
Ключевые факты
- Основные параметры случайности, влияющие на результат: температура (temperature), top-p и top-k сэмплинг.
- Отсутствие стандартизированных отчетов о конфигурации генерации затрудняет воспроизводимость экспериментов в 70% случаев.
- Предложенный протокол требует фиксации аппаратной среды, версий библиотек и всех параметров сэмплирования.
- Вариативность ответов сохраняется даже при использовании фиксированных сидов из-за особенностей параллельных вычислений на GPU.