Исследователи представили метод Cloud-ScPO для улучшения математических рассуждений в LLM без необходимости в размеченных данных или внешних моделях вознаграждения. Подход опирается на анализ геометрии скрытых состояний модели, позволяя извлекать предпочтения непосредственно из траекторий рассуждений. Это снижает зависимость от дорогостоящей человеческой разметки и верифицированных ответов при обучении моделей с подкреплением.
Традиционные методы оптимизации предпочтений (DPO, PPO) требуют наличия пар «выбранный-отклоненный» ответов, что затрудняет масштабирование обучения для сложных задач. Cloud-ScPO анализирует внутренние представления модели в процессе генерации цепочки рассуждений. Метод выявляет закономерности в скрытых состояниях, которые коррелируют с успешным решением задачи, и использует их как сигнал для дообучения.
Такой подход позволяет использовать неразмеченные данные для повышения точности моделей в задачах, требующих многошаговой логики. Использование внутренней геометрии скрытых пространств открывает путь к более эффективному самообучению моделей, где модель сама определяет качество своих промежуточных шагов, опираясь на структуру своих же внутренних представлений.
Ключевые факты
- Метод Cloud-ScPO исключает потребность в верифицированных ответах и внешних reward-моделях.
- Оптимизация базируется на анализе геометрии скрытых состояний (hidden-state geometry) в процессе генерации.
- Подход ориентирован на улучшение математических рассуждений и логических цепочек в LLM.
- Техника работает в полуавтоматическом режиме (semi-supervised), используя внутренние сигналы модели для формирования предпочтений.