Исследователи представили Penelope — архитектурный подход, позволяющий моделям выполнять сложные структурированные рассуждения без увеличения количества параметров или удлинения цепочки рассуждений (CoT). Метод использует локализованную латентную рекурсию, что позволяет выносить вычислительно затратные процессы за пределы авторегрессионной генерации токенов, снижая накладные расходы на инференс и повышая эффективность обработки логических задач.
Традиционные методы улучшения логических способностей моделей часто опираются либо на масштабирование количества параметров, что ведет к росту затрат на обучение и развертывание, либо на использование Chain-of-Thought. Последний подход привязывает вычислительную мощность к длине выходной последовательности, что делает процесс неоптимальным для задач, требующих глубокой проработки структуры без необходимости вывода промежуточных текстовых шагов.
Penelope внедряет механизм скрытой рекурсии, который позволяет модели «размышлять» внутри латентного пространства. Это дает возможность выполнять многошаговые вычисления, не увеличивая количество токенов в ответе. Такой подход особенно эффективен для сценариев, где требуется высокая точность логических выводов при ограниченных вычислительных ресурсах и строгих требованиях к задержке генерации.
Ключевые факты
- Метод Penelope заменяет необходимость в длинных цепочках рассуждений (CoT) на локализованную латентную рекурсию.
- Архитектура позволяет разделять вычислительную сложность задачи и длину генерируемого текста.
- Подход снижает требования к вычислительным мощностям при сохранении высокого качества структурированного мышления.
- Технология направлена на оптимизацию инференса моделей, решающих задачи с высокой когнитивной нагрузкой.