Исследователи проанализировали способность нейросетевых моделей объемом около 100 млрд параметров формировать внутреннее представление карты ночного неба. Выяснилось, что большинство открытых LLM содержат декодируемые данные о расположении небесных объектов в своем остаточном потоке (residual stream). Эти знания часто проявляются в главных компонентах активаций при запросах о пространственной близости звезд и созвездий.
Авторы работы изучили, как именно модели кодируют астрономические данные, не имея прямого доступа к визуальным сенсорам. Результаты показывают, что в процессе обучения на текстовых корпусах модели выстраивают сложные многомерные структуры, которые отражают физические и пространственные отношения объектов реального мира. Эти представления оказываются достаточно устойчивыми и извлекаемыми через анализ активаций нейронов.
Данное открытие подтверждает гипотезу о том, что современные языковые модели способны формировать «мировые модели» (world models), выходящие за рамки простого статистического предсказания следующего токена. Понимание того, как именно концепции пространства и геометрии фиксируются в весах моделей, помогает лучше интерпретировать механизмы принятия решений и логических выводов внутри архитектур трансформеров.
Ключевые факты
- Исследование охватило открытые языковые модели с параметризацией около 100 миллиардов параметров.
- Астрономические данные о расположении объектов обнаруживаются в главных компонентах активаций модели.
- Представление карты неба декодируется из остаточного потока (residual stream) без необходимости дообучения.
- Результаты подтверждают наличие глубоких пространственных репрезентаций, сформированных исключительно на текстовых данных.