Обучение и дообучение

Метод Co-Adaptive Multi-Task LoRA для эффективного дообучения моделей на нескольких доменах arXiv · 03.07.2026 Исследователи представили метод Co-Adaptive Multi-Task LoRA, который решает проблему конфликтов при одновременном дообучении LLM на данных из разных доменов. В отличие от стандартных подходов с фиксированным смешиванием данных, новый алгоритм динамически управляет участием каждого домена в процессе обучения, оптимизируя распределение весов адаптера для предотвращения взаимного ухудшения качества моделей при многозадачном обучении. Непрерывное дообучение LLM-агентов в процессе выполнения задач arXiv · 03.07.2026 Исследователи представили метод Agentic Test-Time Training (TTT), позволяющий LLM-агентам адаптировать веса модели непосредственно во время выполнения многошаговых задач. В отличие от стандартных подходов, обновляющих модель один раз, этот метод обеспечивает непрерывную корректировку стратегии агента, предотвращая деградацию производительности, зацикливание на пройденных состояниях и потерю эффективных алгоритмов при работе над длинными траекториями. DemoPSD: новый метод обучения LLM через модуляцию разногласий arXiv · 02.07.2026 Исследователи представили метод DemoPSD (Disagreement-Modulated Policy Self-Distillation), направленный на улучшение процесса самодистилляции больших языковых моделей. Новый подход решает проблему переобучения на паттернах внутри домена, возникающую при использовании стандартной дистилляции, где модель выступает одновременно учителем и учеником. Метод динамически регулирует влияние учительских подсказок, повышая качество логических рассуждений модели. Метод Neuron-Aware для самообучения LLM без участия человека arXiv · 02.07.2026 Исследователи представили метод Neuron-Aware Data Selection, позволяющий дообучать большие языковые модели без использования человеческой разметки или внешних экспертных данных. Технология опирается на самодистилляцию, где модель использует собственные выходы в качестве обучающих сигналов. Подход фокусируется на отборе наиболее информативных данных через анализ активации нейронов, что значительно повышает качество генерации в специализированных областях при отсутствии дорогостоящих аннотаций. Методология дообучения LLM для улучшения качества ИИ-продуктов в продакшене Hacker News · 02.07.2026 Эффективная работа с LLM в продакшене требует перехода от разового внедрения к циклическому процессу дообучения. Разработчики используют итеративные петли обратной связи, чтобы адаптировать модели под специфические бизнес-задачи, повышая точность ответов и снижая количество галлюцинаций. Такой подход позволяет превратить базовые модели в специализированные инструменты, способные стабильно решать прикладные задачи в реальных условиях эксплуатации. Обучение LLM с нуля за 315 долларов: опыт создания модели Tessera-1B Hacker News · 02.07.2026 Разработчик представил Tessera-1B — языковую модель с 1 миллиардом параметров, обученную с нуля с бюджетом всего 315 долларов. Автор опубликовал веса модели, полный набор данных и код обучения на платформе Hugging Face. Этот проект демонстрирует доступность создания компактных моделей для задач, где критически важна эффективность ресурсов и низкая стоимость инференса. Специализированная модель Qwen3-0.6B для парсинга индийских адресов Hacker News · 01.07.2026 Разработчик представил дообученную версию компактной языковой модели Qwen3-0.6B, оптимизированную для извлечения структурированных данных из неформатированных индийских адресов. Использование метода LoRA позволило адаптировать легковесную модель под специфические задачи обработки естественного языка, обеспечивая высокую точность парсинга при минимальных требованиях к вычислительным ресурсам, что критически важно для локальных систем обработки данных. ZO-Act: новый метод эффективного дообучения LLM без обратного распространения ошибки arXiv · 01.07.2026 Исследователи представили ZO-Act — метод дообучения больших языковых моделей с использованием оптимизации нулевого порядка. Технология позволяет обновлять веса моделей без классического обратного распространения ошибки, что критично при ограниченных ресурсах памяти. Метод ограничивает возмущения весов фиксированными подпространствами, основанными на активациях, что значительно снижает дисперсию оценок и повышает качество обучения по сравнению с традиционными подходами. IEEE запускает образовательный курс по обучению больших языковых моделей Hacker News · 01.07.2026 Инженерная организация IEEE представила комплексный учебный курс, посвященный методологии обучения больших языковых моделей (LLM). Программа охватывает полный цикл разработки: от подготовки наборов данных и выбора архитектуры нейронных сетей до тонкой настройки моделей и оценки их производительности. Курс ориентирован на инженеров и специалистов, стремящихся систематизировать знания в области современного машинного обучения. Разработка цикла обучения LLM на базе JAX Hacker News · 30.06.2026 Автор детально описывает процесс создания низкоуровневого цикла обучения для большой языковой модели с использованием фреймворка JAX. В материале разбираются ключевые аспекты настройки вычислительного графа, управления состоянием модели и оптимизации параллельных вычислений, что позволяет эффективно масштабировать процесс обучения на кластерах GPU или TPU, обеспечивая высокую производительность при работе с архитектурой трансформеров. AutoTrainess: автономная система для самообучения языковых моделей arXiv · 30.06.2026 Исследователи представили AutoTrainess — фреймворк для автоматизации процесса дообучения языковых моделей без участия человека. Система позволяет ИИ-агентам самостоятельно планировать итерации обучения, генерировать качественные наборы данных, проводить тренировочные запуски и оценивать результаты. Это решение направлено на преодоление трудоемкости текущих процессов пост-тренинга, превращая цикл улучшения моделей в автономный инженерный пайплайн. DOPD: новый метод дистилляции моделей с использованием привилегированной информации arXiv · 29.06.2026 Исследователи представили метод Dual On-policy Distillation (DOPD), направленный на повышение эффективности обучения компактных моделей через дистилляцию знаний. Подход решает проблему потери качества при использовании привилегированной информации, разделяя процессы обучения учителя и ученика. Это позволяет передавать более точные сигналы на уровне токенов, улучшая производительность моделей без необходимости в чрезмерных вычислительных ресурсах. Дистилляция знаний из закрытых LLM: новый подход к обучению компактных моделей Hacker News · 28.06.2026 Исследователи представили метод дистилляции знаний из «черных ящиков» — проприетарных больших языковых моделей — для обучения более компактных и эффективных нейросетей. Подход позволяет переносить сложные логические способности и лингвистические навыки от гигантских моделей к меньшим архитектурам, сохраняя высокую производительность при значительном снижении требований к вычислительным ресурсам и затратам на инференс. Дообучение LLM на текстах философской школы Адвайта-Веданта Hacker News · 27.06.2026 Разработчик представил модель Turiya, дообученную на корпусе текстов классической индийской философии Адвайта-Веданта. Проект демонстрирует возможности адаптации языковых моделей для глубокого анализа узкоспециализированных философских и теологических доктрин, позволяя системе генерировать ответы, соответствующие терминологии и логике недвойственности, что открывает новые пути для применения ИИ в гуманитарных исследованиях и интеллектуальном поиске. Подготовка данных для SFT на основе набора Open-SWE-Traces от NVIDIA MarkTechPost · 26.06.2026 Опубликовано руководство по работе с датасетом Open-SWE-Traces от NVIDIA, предназначенным для дообучения ИИ-агентов в сфере программной инженерии. Методика включает потоковую обработку данных из Hugging Face, нормализацию многоходовых диалогов, извлечение программных патчей и анализ метрик использования инструментов, что позволяет эффективно готовить обучающие выборки для моделей, решающих задачи разработки ПО. Дообучение LLM на потребительском железе: практический гайд Hacker News · 25.06.2026 Разработчик успешно провел дообучение языковой модели на базе Apple Silicon, используя минимальные вычислительные ресурсы. Процесс занял около 15 минут и обошелся менее чем в один цент в пересчете на затраты электроэнергии. Этот кейс демонстрирует доступность локального дообучения моделей с использованием современных методов оптимизации, таких как QLoRA, на обычном персональном компьютере без необходимости аренды облачных GPU. Использование RL-обучения для улучшения агентных способностей LLM arXiv · 24.06.2026 Исследователи обнаружили, что стандартное обучение с подкреплением (RL) при дообучении моделей уже содержит скрытый потенциал для улучшения агентных навыков. Авторы работы доказывают, что этот процесс позволяет эффективно оценивать пошаговые действия моделей без необходимости в сложных внешних системах вознаграждения, что критически важно для решения долгосрочных задач в стохастических средах, где традиционные методы аннотирования данных практически не работают. Метод FORCE для эффективного обучения VLA-моделей через подкрепление arXiv · 24.06.2026 Исследователи представили метод FORCE для дообучения Vision-Language-Action моделей с использованием обучения с подкреплением. Подход решает проблему низкой эффективности сбора данных и «катастрофического забывания» при переходе от имитационного обучения к RL. Алгоритм использует калиброванный прогрев Q-функции и самодистилляцию, что позволяет моделям превосходить ограничения исходных обучающих датасетов и быстрее адаптироваться к сложным задачам управления. Ускорение дообучения трансформеров с NVIDIA NeMo AutoModel Hugging Face - Blog · 24.06.2026 NVIDIA представила интеграцию NeMo AutoModel с библиотекой Hugging Face, позволяющую значительно ускорить процесс дообучения больших языковых моделей. Решение автоматизирует настройку конфигураций и оптимизацию вычислений, позволяя разработчикам эффективнее использовать аппаратные ресурсы при работе с архитектурами трансформеров. Инструментарий упрощает переход от прототипирования к масштабируемому обучению на GPU, минимизируя ручную настройку параметров. Tessera: генерация LoRA-адаптеров для ИИ-агентов менее чем за секунду Hacker News · 23.06.2026 Проект Tessera предлагает новый подход к повышению эффективности инференса ИИ-агентов через динамическую генерацию LoRA-адаптеров в режиме реального времени. Технология позволяет создавать специализированные веса для конкретных сессий менее чем за одну секунду, что значительно ускоряет адаптацию моделей под узкие задачи без необходимости длительного дообучения или использования тяжелых общих моделей. OpenThoughts-Agent: новый подход к подготовке данных для обучения ИИ-агентов arXiv · 23.06.2026 Исследователи представили OpenThoughts-Agent — методологию создания обучающих датасетов, направленную на повышение универсальности агентных моделей. В отличие от узкоспециализированных решений, ориентированных на конкретные бенчмарки, данный подход позволяет обучать модели, способные эффективно справляться с широким спектром задач, требующих многошагового планирования, рассуждения и взаимодействия с внешними инструментами в различных средах. Масштабируемые законы дистилляции LLM для узкоспециализированных задач arXiv · 23.06.2026 Исследователи вывели эмпирические законы масштабирования для дистилляции LLM, позволяющие прогнозировать качество сжатых моделей в зависимости от объема данных и коэффициента компрессии. Работа решает проблему высокой стоимости и задержек при развертывании крупных моделей, предлагая математически обоснованный подход к созданию компактных и эффективных версий нейросетей для специфических доменов без потери критических знаний. Релиз prime-rl 0.6.0 для обучения масштабных MoE-моделей MarkTechPost · 23.06.2026 Компания Prime Intellect представила обновленный фреймворк prime-rl версии 0.6.0, предназначенный для асинхронного обучения с подкреплением (RL) на базе архитектур Mixture-of-Experts (MoE) с триллионными параметрами. Инструмент ориентирован на решение сложных агентных задач, требующих работы с длинными контекстами и высокой вычислительной эффективностью. В ходе тестирования система продемонстрировала возможность обучения модели GLM-5 с длиной последовательности до 131 тысячи токенов. Randomized YaRN: новый метод улучшения работы LLM с длинными контекстами arXiv · 22.06.2026 Исследователи представили метод Randomized YaRN, направленный на решение проблемы ограниченной длины контекста в больших языковых моделях. Большинство современных LLM проходят предварительное обучение на относительно коротких последовательностях, а затем адаптируются для работы с длинными текстами. Однако даже после дообучения такие модели часто демонстрируют снижение качества при обработке данных, значительно превышающих длину, использованную в процессе адаптации.