Обучение и дообучение

Исследование: почему ИИ-репетиторы не работают так, как ожидается arXiv · 14.06.2026 Исследователи из MIT и Стэнфорда опубликовали работу, в которой ставят под сомнение эффективность современных ИИ-репетиторов. Проблема в том, что текущие методы оценки и обучения таких систем основаны на предположении, что студенты будут активно взаимодействовать с ИИ-репетитором, следуя его подсказкам и шагам. Однако в реальном мире это происходит далеко не всегда. InstantForget удаляет вредоносные данные без переобучения модели arXiv · 14.06.2026 Исследователи из MIT и других университетов представили метод InstantForget, который позволяет удалять вредоносные данные (backdoors) из обученных моделей без переобучения. Это особенно важно для ИИ-агентов, которые могут сталкиваться с подозрительными или вредоносными данными в процессе работы. Anthropic представила фреймворк для оценки экономического влияния ИИ Hacker News · 14.06.2026 Anthropic, один из ведущих разработчиков ИИ-моделей, опубликовала документ, посвящённый экономическому влиянию искусственного интеллекта. В нём представлен фреймворк для оценки последствий внедрения ИИ в различные отрасли экономики. Документ подробно рассматривает вопросы производительности, занятости и распределения доходов, что особенно важно для понимания долгосрочных эффектов ИИ. Как избежать локальных минимумов в обучении ИИ-агентов Hacker News · 13.06.2026 В обсуждении на Hacker News пользователи делятся опытом и стратегиями, как избежать или выйти из локальных минимумов при обучении больших языковых моделей (LLM). Локальные минимумы — это ситуации, когда модель перестаёт улучшаться, застревая в неоптимальных решениях. Это особенно актуально для разработчиков ИИ-агентов, где качество модели напрямую влияет на эффективность агентов. Новый датасет для улучшения аудио-языковых моделей arXiv · 12.06.2026 Исследователи представили AudioDER — новый датасет, предназначенный для улучшения способностей аудио-языковых моделей (LALMs) к сложному аудио-рассуждению. LALMs уже демонстрируют высокие результаты в различных задачах понимания аудио, но их возможности в области сложного анализа и интерпретации звуковых данных остаются ограниченными. Как on-policy distillation меняет параметры моделей arXiv · 11.06.2026 Исследователи из MIT и DeepMind изучили влияние on-policy distillation (OPD) на параметры моделей. Этот метод сочетает траектории студента, полученные в реальных условиях, с плотным супервизором от учителя. Авторы анализировали несколько языковых и визуально-языковых моделей и выявили два ключевых результата. Новый фреймворк для обучения ИИ-агентов в условиях зависимости данных arXiv · 11.06.2026 Исследователи из Arxiv представили новый фреймворк для обучения ИИ-агентов, который учитывает зависимость данных. В статье "Learning with Simulators: No Regret in a Computationally Bounded World" авторы рассматривают минимальные предположения, необходимые для генерализации в условиях, где данные не являются независимыми. Это особенно важно для ИИ-агентов, которые часто работают с последовательными или взаимосвязанными данными, например, в задачах планирования или взаимодействия с окружающей средой. NVIDIA FLARE Auto-FL ускоряет исследования федеративного обучения с помощью ИИ-агентов NVIDIA Technical Blog · 09.06.2026 NVIDIA представила новую систему Auto-FL в рамках своего фреймворка Federated Learning and Analytics Research (FLARE). Эта система использует ИИ-агентов для автоматизации и ускорения исследований в области федеративного обучения (FL). Федеративное обучение позволяет обучать модели на распределённых данных без их централизации, что особенно важно для задач, связанных с конфиденциальностью и безопасностью данных. Tencent представил фреймворк UniRL для обучения мультимодальных моделей GitHub · 08.06.2026 Компания Tencent выпустила фреймворк UniRL, предназначенный для обучения мультимодальных моделей с использованием подкрепляющего обучения (Reinforcement Learning). Этот инструмент позволяет интегрировать различные типы данных, включая текст, изображения и видео, в единый процесс обучения. Это особенно важно для разработки ИИ-агентов, которые должны эффективно обрабатывать и анализировать разнообразные данные. OpenEnv: открытая платформа для обучения агентов через RL Hugging Face - Blog · 07.06.2026 Команда Hugging Face анонсировала OpenEnv — открытую платформу для обучения ИИ-агентов с использованием подхода Reinforcement Learning (RL). Платформа предоставляет набор инструментов и инфраструктуру для создания, тестирования и развертывания агентов, способных взаимодействовать с окружающей средой и учиться на основе обратной связи. Ускорение RL-тренировок на 50% с помощью DAS Together.ai · 23.04.2026 Исследователи из Together AI предложили метод DAS (Distribution-Aware Speculative Decoding), который ускоряет процесс rollout в reinforcement learning (RL) на 50% без потери качества. Rollout — это этап, когда агент тестирует свои действия в среде, и он часто становится узким местом в обучении RL-моделей. Decoupled DiLoCo от DeepMind для устойчивого распределённого обучения Google DeepMind News · 22.04.2026 DeepMind представила новый подход к распределённому обучению нейронных сетей — Decoupled DiLoCo (Decoupled Distributed Learning with Communication). Этот метод позволяет значительно повысить устойчивость и эффективность обучения моделей в условиях ограниченной или ненадёжной связи между узлами. В отличие от традиционных методов, где синхронизация данных между узлами может стать узким местом, Decoupled DiLoCo использует асинхронный обмен информацией, что делает процесс обучения более гибким и устойчивым к сбоям. На Replicate появилась возможность тонкой настройки моделей видео Replicate's blog · 23.01.2025 Платформа Replicate добавила поддержку тонкой настройки моделей видео. Пользователи могут адаптировать HunyuanVideo от Tencent под свои нужды, изменяя стиль, движение и персонажей.