Обучение и дообучение
Методика адаптации открытых моделей для решения научных задач
Компания Arcee.ai представила подход к дообучению открытых LLM для выполнения сложных научных задач, требующих высокой точности и работы с узкоспециализированными данными. Разработчики сфокусировались на создании специализированных датасетов и методах настройки моделей, которые позволяют эффективно извлекать и структурировать научную информацию, минимизируя при этом галлюцинации и повышая качество аргументации в технических доменах.
Проблема вырожденного согласия при дистилляции LLM
Исследователи выявили критический недостаток метода on-policy distillation (OPD), широко применяемого при дообучении современных языковых моделей. Выяснилось, что студенческие модели склонны к «вырожденному согласию»: они имитируют структуру ответов учителя через повторение циклов токенов, достигая формального сходства, но теряя при этом логическую связность и глобальное качество ответов, что снижает эффективность обучения.
Macaron-V1: новая архитектура для непрерывного обучения ИИ-агентов
Представлена архитектура Macaron-V1 — семейство открытых агентных моделей, спроектированных для непрерывного обучения в реальных условиях после развертывания. Система использует механизмы рекурсивного самосовершенствования и смесь LoRA-адаптеров (Mixture-of-LoRA), что позволяет агентам накапливать опыт и адаптироваться к новым задачам без потери ранее приобретенных навыков, обеспечивая стабильную работу в динамических средах.
Оптимизация Federated LoRA через адаптивное разделение матриц
Исследователи представили новый подход к дообучению LLM в рамках федеративного обучения, анализируя эффективность разделения матриц LoRA между клиентами. Авторы предложили стратегию адаптивного выбора ранга, которая позволяет гибко распределять веса матриц A и B, минимизируя объем передаваемых данных и повышая точность модели при сохранении конфиденциальности пользовательских данных на локальных узлах.
Оптимизация дистилляции знаний для масштабируемого обучения моделей
Команда Multiverse Computing представила новый подход к дистилляции знаний, позволяющий значительно снизить вычислительные затраты при передаче компетенций от крупных моделей-учителей к компактным моделям-ученикам. Метод делает процесс обучения эффективным для промышленного масштабирования, позволяя создавать специализированные ИИ-решения с высокой производительностью при минимальных требованиях к аппаратному обеспечению и времени инференса.
CreativeInstruct: новый метод обучения LLM для баланса качества и креативности
Исследователи представили CreativeInstruct — метод обучения, решающий проблему снижения креативности и разнообразия ответов LLM после стандартного SFT. Новый подход позволяет моделям сохранять высокое качество генерации, одновременно повышая вариативность текста. Это критически важно для задач, требующих творческого подхода, таких как написание художественных текстов или сложных сценариев в рамках обучения с подкреплением.
Практическое руководство по дообучению открытых LLM
Команда Fastino опубликовала детальный гайд по дообучению моделей с открытыми весами, охватывающий весь цикл разработки: от выбора архитектуры до оценки результатов. Авторы систематизировали подходы к подготовке данных, выбору стратегий обучения и методам валидации, предлагая конкретные рекомендации для повышения качества специализированных моделей при ограниченных вычислительных ресурсах.
Метод обучения LLM через самодистилляцию без внешнего контроля
Исследователи представили новый подход к пост-тренингу больших языковых моделей, основанный на методе on-policy самодистилляции (OPSD). В отличие от существующих техник, этот метод полностью исключает необходимость во внешних сигналах, таких как эталонные ответы, отзывы среды или подсказки от более мощных моделей, позволяя модели обучаться исключительно на собственных внутренних данных.
Reasoning Core: новый набор данных для обучения моделей рассуждениям
Исследователи представили Reasoning Core — масштабную коллекцию из 50 процедурных генераторов, предназначенную для обучения LLM навыкам логического вывода. Система позволяет создавать верифицируемые задачи в различных дисциплинах, от математики и программирования до теории игр и причинно-следственного анализа, обеспечивая автоматическую оценку сложности и семантическую проверку ответов, что критически важно для качественного дообучения моделей с контролем процесса рассуждений.
OctoLong: улучшение работы LLM с длинным контекстом через кросс-репозиторное обучение
Исследователи представили OctoLong — метод дообучения языковых моделей, направленный на повышение эффективности работы с длинными контекстами. В отличие от стандартных подходов, использующих разрозненные документы, OctoLong фокусируется на кросс-репозиторных связях в коде. Это позволяет моделям лучше улавливать зависимости в сложных программных проектах, что критически важно для разработки агентных систем и глубокого анализа кода.
Метод ReflectRL улучшает обучение LLM через анализ ошибочных траекторий
Исследователи представили ReflectRL — новый подход к post-training больших языковых моделей, который использует «золотые негативные траектории». В отличие от стандартных методов, отбрасывающих неудачные попытки экспертных моделей, ReflectRL извлекает из них полезный опыт. Система учит модель рефлексировать над ошибками, превращая их в основу для прямого логического вывода и повышения качества рассуждений.
Omega-S: новый метод предотвращения деградации LLM при дообучении
Исследователи представили Omega-S — легковесный метод для борьбы с «катастрофическим забыванием» при дообучении больших языковых моделей. В отличие от существующих подходов, он не требует хранения старых данных или сложных матриц Фишера. Интеграция решения занимает всего три строки кода и увеличивает вычислительные затраты на обучение менее чем на 4%, сохраняя функциональность модели при освоении новых задач.
Оптимизация дообучения 8B-моделей на GPU с 4 ГБ видеопамяти
Разработчики представили инструмент Soup, позволяющий проводить дообучение языковых моделей с 8 миллиардами параметров на потребительских видеокартах с объемом памяти всего 4 ГБ. Решение оптимизирует процесс обучения, делая настройку современных LLM доступной для широкого круга специалистов без необходимости использования дорогостоящих серверных мощностей или облачных кластеров с большим объемом VRAM.
Новый метод борьбы с катастрофическим забыванием в мультимодальных моделях
Исследователи представили метод Dual-Channel Risk-Aware Reinforcement Fine-Tuning (DCR-RFT), направленный на решение проблемы катастрофического забывания при непрерывном дообучении мультимодальных LLM. В условиях значительных сдвигов в распределении задач стандартные алгоритмы обучения с подкреплением теряют стабильность из-за неконтролируемой дисперсии наград. Новый подход разделяет каналы оптимизации, позволяя эффективно сохранять накопленные знания при освоении новых навыков.
Дообучение LLM методом RL для борьбы с «замусоренным» стилем письма
Разработчик применил методы обучения с подкреплением (RL) для дообучения языковой модели, чтобы избавить её от типичных «ИИ-штампов» и избыточности в тексте. Автор сосредоточился на устранении характерных для GPT-4 конструкций, которые делают контент неестественным и перегруженным, добившись более лаконичного и человечного стиля изложения через итеративную оптимизацию предпочтений модели.
Unsloth: ускорение дообучения LLM до 2 раз с экономией памяти
Unsloth — это специализированный фреймворк для эффективного дообучения и инференса локальных языковых моделей, таких как Llama 3, Mistral и Phi-3. Инструмент оптимизирует использование видеопамяти и ускоряет процесс обучения до 2,2 раз, позволяя запускать сложные задачи по fine-tuning на потребительском оборудовании с минимальными требованиями к ресурсам и сохранением высокой точности весов.
Symbio: фреймворк для автоматизированного дообучения ИИ-агентов
Symbio представляет собой инфраструктурное решение для создания циклов самообучения ИИ-моделей. Инструмент автоматизирует процесс дообучения (fine-tuning) агентов, позволяя им непрерывно улучшать свои навыки на основе новых данных без участия человека. Система ориентирована на создание замкнутого контура, где модель самостоятельно генерирует, фильтрует и использует данные для оптимизации собственных весов.
Минималистичный фреймворк для дообучения LLM на потребительском железе
Разработчики представили легковесный инструментарий для пост-тренинга языковых моделей, оптимизированный для работы на GPU с 8 ГБ видеопамяти. Проект позволяет проводить SFT, DPO и GRPO, делая современные методы дообучения доступными для индивидуальных исследователей и небольших команд, использующих обычное потребительское оборудование вместо дорогостоящих серверных кластеров.
Horus-runtime: инструмент для обучения компактных LLM с нуля
Horus-runtime представляет собой специализированный фреймворк для обучения компактных языковых моделей с нуля. Инструмент ориентирован на разработчиков, которым требуется полный контроль над процессом подготовки архитектуры и весов модели без использования готовых предобученных решений. Решение позволяет оптимизировать вычислительные затраты при создании специализированных нейросетей для узких задач.
Принципы дообучения LLM: от LoRA и QLoRA до serverless-инфраструктуры
Статья подробно разбирает фундаментальные подходы к дообучению больших языковых моделей, фокусируясь на методах эффективной настройки весов. Автор анализирует эволюцию техник от классического Fine-Tuning до оптимизированных методов LoRA и QLoRA, а также рассматривает возможности развертывания процессов дообучения в serverless-среде для снижения затрат на вычислительные ресурсы и упрощения масштабирования инфраструктуры.
Оптимизация обучения DeepSeek V4 через Unsloth
Команда Unsloth представила поддержку архитектуры DeepSeek V4, обеспечив значительное ускорение процесса дообучения и снижение требований к видеопамяти. Благодаря оптимизированным ядрам Triton, пользователи могут дообучать модель с использованием методов LoRA и QLoRA быстрее и эффективнее, что делает работу с тяжелыми весами доступной на потребительском и серверном железе среднего сегмента.
Автоматизированная последовательность задач для эффективного дообучения LLM
Исследователи представили метод автоматизированного упорядочивания задач для обучения моделей с несколькими политиками (Multi-Policy LLMs). Подход решает проблему интерференции при использовании единых LoRA-адаптеров, позволяя эффективно адаптировать модели к разнородным наборам данных без катастрофического забывания. Технология оптимизирует процесс дообучения, обеспечивая лучшее качество переноса знаний между различными задачами по сравнению с традиционными методами PEFT.
Исследование дистилляции моделей и передачи ограничений безопасности
Исследователи изучили процесс дистилляции знаний из DeepSeek в меньшие модели, чтобы выяснить, наследуются ли встроенные механизмы цензуры. Эксперименты показали, что при переносе весов через дистилляцию ограничения безопасности не передаются автоматически. Это открывает возможности для создания компактных и производительных моделей без жестких фильтров, характерных для исходных проприетарных систем.
Метод HARGO для оптимизации LLM в задачах высокопроизводительных вычислений
Исследователи представили HARGO — новый метод обучения с подкреплением, направленный на улучшение точности LLM в задачах высокопроизводительных вычислений (HPC). Подход решает проблему избыточности и неточности ответов, возникающую после стандартного SFT, за счет учета гетерогенности данных и использования специализированных наград, что позволяет моделям эффективнее справляться с анализом кода и поиском ошибок.