Обучение и дообучение
Новый датасет для улучшения аудио-языковых моделей
Исследователи представили AudioDER — новый датасет, предназначенный для улучшения способностей аудио-языковых моделей (LALMs) к сложному аудио-рассуждению. LALMs уже демонстрируют высокие результаты в различных задачах понимания аудио, но их возможности в области сложного анализа и интерпретации звуковых данных остаются ограниченными.
Как on-policy distillation меняет параметры моделей
Исследователи из MIT и DeepMind изучили влияние on-policy distillation (OPD) на параметры моделей. Этот метод сочетает траектории студента, полученные в реальных условиях, с плотным супервизором от учителя. Авторы анализировали несколько языковых и визуально-языковых моделей и выявили два ключевых результата.
Новый фреймворк для обучения ИИ-агентов в условиях зависимости данных
Исследователи из Arxiv представили новый фреймворк для обучения ИИ-агентов, который учитывает зависимость данных. В статье "Learning with Simulators: No Regret in a Computationally Bounded World" авторы рассматривают минимальные предположения, необходимые для генерализации в условиях, где данные не являются независимыми. Это особенно важно для ИИ-агентов, которые часто работают с последовательными или взаимосвязанными данными, например, в задачах планирования или взаимодействия с окружающей средой.
NVIDIA FLARE Auto-FL ускоряет исследования федеративного обучения с помощью ИИ-агентов
NVIDIA представила новую систему Auto-FL в рамках своего фреймворка Federated Learning and Analytics Research (FLARE). Эта система использует ИИ-агентов для автоматизации и ускорения исследований в области федеративного обучения (FL). Федеративное обучение позволяет обучать модели на распределённых данных без их централизации, что особенно важно для задач, связанных с конфиденциальностью и безопасностью данных.
Tencent представил фреймворк UniRL для обучения мультимодальных моделей
Компания Tencent выпустила фреймворк UniRL, предназначенный для обучения мультимодальных моделей с использованием подкрепляющего обучения (Reinforcement Learning). Этот инструмент позволяет интегрировать различные типы данных, включая текст, изображения и видео, в единый процесс обучения. Это особенно важно для разработки ИИ-агентов, которые должны эффективно обрабатывать и анализировать разнообразные данные.
OpenEnv: открытая платформа для обучения агентов через RL
Команда Hugging Face анонсировала OpenEnv — открытую платформу для обучения ИИ-агентов с использованием подхода Reinforcement Learning (RL). Платформа предоставляет набор инструментов и инфраструктуру для создания, тестирования и развертывания агентов, способных взаимодействовать с окружающей средой и учиться на основе обратной связи.
Ускорение RL-тренировок на 50% с помощью DAS
Исследователи из Together AI предложили метод DAS (Distribution-Aware Speculative Decoding), который ускоряет процесс rollout в reinforcement learning (RL) на 50% без потери качества. Rollout — это этап, когда агент тестирует свои действия в среде, и он часто становится узким местом в обучении RL-моделей.
Decoupled DiLoCo от DeepMind для устойчивого распределённого обучения
DeepMind представила новый подход к распределённому обучению нейронных сетей — Decoupled DiLoCo (Decoupled Distributed Learning with Communication). Этот метод позволяет значительно повысить устойчивость и эффективность обучения моделей в условиях ограниченной или ненадёжной связи между узлами. В отличие от традиционных методов, где синхронизация данных между узлами может стать узким местом, Decoupled DiLoCo использует асинхронный обмен информацией, что делает процесс обучения более гибким и устойчивым к сбоям.
На Replicate появилась возможность тонкой настройки моделей видео
Платформа Replicate добавила поддержку тонкой настройки моделей видео. Пользователи могут адаптировать HunyuanVideo от Tencent под свои нужды, изменяя стиль, движение и персонажей.