Обучение и дообучение
Исследование: почему ИИ-репетиторы не работают так, как ожидается
Исследователи из MIT и Стэнфорда опубликовали работу, в которой ставят под сомнение эффективность современных ИИ-репетиторов. Проблема в том, что текущие методы оценки и обучения таких систем основаны на предположении, что студенты будут активно взаимодействовать с ИИ-репетитором, следуя его подсказкам и шагам. Однако в реальном мире это происходит далеко не всегда.
InstantForget удаляет вредоносные данные без переобучения модели
Исследователи из MIT и других университетов представили метод InstantForget, который позволяет удалять вредоносные данные (backdoors) из обученных моделей без переобучения. Это особенно важно для ИИ-агентов, которые могут сталкиваться с подозрительными или вредоносными данными в процессе работы.
Anthropic представила фреймворк для оценки экономического влияния ИИ
Anthropic, один из ведущих разработчиков ИИ-моделей, опубликовала документ, посвящённый экономическому влиянию искусственного интеллекта. В нём представлен фреймворк для оценки последствий внедрения ИИ в различные отрасли экономики. Документ подробно рассматривает вопросы производительности, занятости и распределения доходов, что особенно важно для понимания долгосрочных эффектов ИИ.
Как избежать локальных минимумов в обучении ИИ-агентов
В обсуждении на Hacker News пользователи делятся опытом и стратегиями, как избежать или выйти из локальных минимумов при обучении больших языковых моделей (LLM). Локальные минимумы — это ситуации, когда модель перестаёт улучшаться, застревая в неоптимальных решениях. Это особенно актуально для разработчиков ИИ-агентов, где качество модели напрямую влияет на эффективность агентов.
Новый датасет для улучшения аудио-языковых моделей
Исследователи представили AudioDER — новый датасет, предназначенный для улучшения способностей аудио-языковых моделей (LALMs) к сложному аудио-рассуждению. LALMs уже демонстрируют высокие результаты в различных задачах понимания аудио, но их возможности в области сложного анализа и интерпретации звуковых данных остаются ограниченными.
Как on-policy distillation меняет параметры моделей
Исследователи из MIT и DeepMind изучили влияние on-policy distillation (OPD) на параметры моделей. Этот метод сочетает траектории студента, полученные в реальных условиях, с плотным супервизором от учителя. Авторы анализировали несколько языковых и визуально-языковых моделей и выявили два ключевых результата.
Новый фреймворк для обучения ИИ-агентов в условиях зависимости данных
Исследователи из Arxiv представили новый фреймворк для обучения ИИ-агентов, который учитывает зависимость данных. В статье "Learning with Simulators: No Regret in a Computationally Bounded World" авторы рассматривают минимальные предположения, необходимые для генерализации в условиях, где данные не являются независимыми. Это особенно важно для ИИ-агентов, которые часто работают с последовательными или взаимосвязанными данными, например, в задачах планирования или взаимодействия с окружающей средой.
NVIDIA FLARE Auto-FL ускоряет исследования федеративного обучения с помощью ИИ-агентов
NVIDIA представила новую систему Auto-FL в рамках своего фреймворка Federated Learning and Analytics Research (FLARE). Эта система использует ИИ-агентов для автоматизации и ускорения исследований в области федеративного обучения (FL). Федеративное обучение позволяет обучать модели на распределённых данных без их централизации, что особенно важно для задач, связанных с конфиденциальностью и безопасностью данных.
Tencent представил фреймворк UniRL для обучения мультимодальных моделей
Компания Tencent выпустила фреймворк UniRL, предназначенный для обучения мультимодальных моделей с использованием подкрепляющего обучения (Reinforcement Learning). Этот инструмент позволяет интегрировать различные типы данных, включая текст, изображения и видео, в единый процесс обучения. Это особенно важно для разработки ИИ-агентов, которые должны эффективно обрабатывать и анализировать разнообразные данные.
OpenEnv: открытая платформа для обучения агентов через RL
Команда Hugging Face анонсировала OpenEnv — открытую платформу для обучения ИИ-агентов с использованием подхода Reinforcement Learning (RL). Платформа предоставляет набор инструментов и инфраструктуру для создания, тестирования и развертывания агентов, способных взаимодействовать с окружающей средой и учиться на основе обратной связи.
Ускорение RL-тренировок на 50% с помощью DAS
Исследователи из Together AI предложили метод DAS (Distribution-Aware Speculative Decoding), который ускоряет процесс rollout в reinforcement learning (RL) на 50% без потери качества. Rollout — это этап, когда агент тестирует свои действия в среде, и он часто становится узким местом в обучении RL-моделей.
Decoupled DiLoCo от DeepMind для устойчивого распределённого обучения
DeepMind представила новый подход к распределённому обучению нейронных сетей — Decoupled DiLoCo (Decoupled Distributed Learning with Communication). Этот метод позволяет значительно повысить устойчивость и эффективность обучения моделей в условиях ограниченной или ненадёжной связи между узлами. В отличие от традиционных методов, где синхронизация данных между узлами может стать узким местом, Decoupled DiLoCo использует асинхронный обмен информацией, что делает процесс обучения более гибким и устойчивым к сбоям.
На Replicate появилась возможность тонкой настройки моделей видео
Платформа Replicate добавила поддержку тонкой настройки моделей видео. Пользователи могут адаптировать HunyuanVideo от Tencent под свои нужды, изменяя стиль, движение и персонажей.