Исследователи представили SKALD (Skill-Anchored Latent Distillation) — фреймворк для обучения моделей с подкреплением, который переносит абстрактные навыки из контекста непосредственно в веса нейросети. Метод решает проблему нехватки сигналов при обучении с проверяемыми наградами, когда модель выдает однотипные результаты, и позволяет эффективно дистиллировать знания внутри одной архитектуры без использования внешних промптов.
Традиционные методы обучения с подкреплением часто сталкиваются с «информационным голодом», когда все варианты ответов в группе оказываются либо верными, либо ошибочными. В таких условиях модель не получает градиентного сигнала для улучшения стратегии. SKALD обходит это ограничение, используя два представления одной и той же модели Qwen3-Base: «студента», который видит только вопрос, и «учителя», обладающего расширенным контекстом. Это позволяет передавать скрытые логические паттерны напрямую в параметры модели.
В ходе экспериментов авторы выяснили, что от 63% до 68% групп ответов в стандартных сценариях обучения не несут полезного дифференцирующего сигнала. SKALD преобразует эти скрытые навыки в устойчивые веса, что повышает производительность модели в задачах, требующих глубокого рассуждения. Такой подход минимизирует зависимость от длинных промптов и повышает автономность модели при выполнении сложных последовательных действий.
Ключевые факты
- SKALD использует архитектуру с двумя представлениями модели: «учитель» с полным контекстом и «студент», работающий только с вопросом.
- В экспериментах выявлено, что 63,0–68,0% групп ответов при стандартном обучении с подкреплением не дают полезного сигнала для оптимизации.
- Метод основан на базе модели Qwen3-Base и фокусируется на дистилляции навыков в веса, а не в текстовые инструкции.
- Технология позволяет эффективно обучать модели в условиях, когда проверяемые награды не дают достаточной информации для корректировки стратегии.