Разработчики из проекта ml-by-hand выпустили предобученную версию модели GPT-2 с 124 миллионами параметров. Модель была обучена на наборе данных OpenWebText, содержащем 27.5 миллиарда токенов.

Этот релиз позволяет исследователям и разработчикам использовать предобученную модель для дальнейших экспериментов и дообучения. GPT-2 124M является более компактной версией по сравнению с более крупными моделями, такими как GPT-3, но сохраняет способность генерировать качественный текст.

Проект ml-by-hand известен своими усилиями по созданию доступных и воспроизводимых моделей машинного обучения. В данном случае модель была обучена с использованием 56 000 шагов, что делает её подходящей для различных задач обработки естественного языка.

Релиз доступен на GitHub и включает в себя все необходимые материалы для запуска и использования модели. Это важный шаг в развитии открытых моделей, которые могут быть использованы для различных приложений, от чат-ботов до анализа текста.