Разработчик обучил с нуля языковую модель объемом 30 миллионов параметров, чтобы проверить гипотезу о существовании «пола масштабирования» (scaling floor) — теоретического предела, ниже которого модели перестают эффективно обучаться. Результаты эксперимента показали, что даже при столь малом количестве параметров модель продолжает демонстрировать стабильное снижение функции потерь, опровергая предположения о необходимости огромных вычислительных мощностей для достижения прогресса.

В ходе работы использовался датасет TinyStories, что позволило сфокусироваться на качестве данных при ограниченных ресурсах. Автор проекта применил стандартную архитектуру трансформера, отказавшись от сложных методов оптимизации, чтобы изолировать влияние масштаба параметров на итоговую производительность. Полученные данные подтверждают, что закономерности масштабирования (scaling laws) сохраняют свою предсказательную силу даже в микро-масштабах, если процесс обучения организован корректно.

Этот кейс важен для понимания того, как именно архитектурные решения и качество обучающей выборки влияют на сходимость модели. Вместо поиска «магического» порога параметров, исследование смещает фокус на эффективность использования данных и стабильность градиентных обновлений. Это открывает возможности для более доступного обучения специализированных моделей, не требующих инфраструктуры уровня дата-центров.

Ключевые факты

  • Модель содержит 30 миллионов параметров, что значительно меньше современных индустриальных стандартов.
  • Обучение проводилось с нуля (from scratch) без использования предварительно обученных весов.
  • В качестве основного обучающего набора данных был выбран корпус TinyStories.
  • Эксперимент показал отсутствие «пола масштабирования», подтверждая непрерывную зависимость потерь от объема вычислений.
  • Проект демонстрирует, что даже на малых моделях можно достичь предсказуемой динамики обучения при соблюдении чистоты данных.