Машинное обучение
Гибридная архитектура LSTM и Vision Transformer для прогнозирования ошибок погоды
Исследователи представили гибридную модель машинного обучения, предназначенную для коррекции ошибок в численных прогнозах погоды высокого разрешения (NWP). Система High-Resolution Rapid Refresh (HRRR), используемая метеорологами, часто сталкивается с неточностями, вызванными сложными атмосферными процессами, такими как конвекция, влияние рельефа и динамика пограничного слоя планеты. Традиционные методы не всегда справляются с учетом вертикальной структуры атмосферы, что приводит к накоплению погрешностей в краткосрочных прогнозах.
Оптимизация обучения диффузионных трансформеров через Spot-инстансы
Исследователи представили метод Spotlight, направленный на снижение затрат при дообучении диффузионных трансформеров (DiT) с помощью обучения с подкреплением (RL). Традиционный процесс дообучения таких моделей требует использования тысяч высокопроизводительных графических процессоров, что делает его крайне ресурсоемким. Авторы работы предложили объединить два подхода: селекцию обучающих примеров (seed exploration) и использование спотовых инстансов облачных провайдеров.
Улучшение многоязычного логического вывода через управляемое слияние моделей
Исследователи представили новый метод объединения нейросетевых архитектур, направленный на повышение качества логического вывода в многоязычных задачах. Техника слияния моделей позволяет эффективно комбинировать способности специализированных систем, отвечающих за глубокое рассуждение, с возможностями моделей, обученных на широком спектре языков. Основная сложность подобных подходов заключается в конфликтах между весами исходных моделей, которые часто приводят к снижению точности итогового решения.
Новый подход к решению нейронных ОДУ
Исследователи предложили метод решения нейронных обыкновенных дифференциальных уравнений (ОДУ) с нуля. В статье на Tinyvolt подробно описаны принципы и алгоритмы, которые позволяют более точно моделировать динамические системы.
Новый подход к законам масштабирования может изменить обучение ИИ-моделей
Исследователи из Стэнфордского университета предложили новый подход к законам масштабирования, который может существенно повлиять на процесс обучения искусственных нейронных сетей. Традиционные законы масштабирования описывают, как увеличение размера модели и объёма данных влияет на её производительность. Однако новый метод позволяет более точно предсказывать, как изменения в архитектуре модели и данных повлияют на её точность и эффективность.
Новый метод параллельных вычислений на GPU для ИИ
Исследователи представили новый подход к параллельным вычислениям на графических процессорах, который может значительно ускорить обучение и инференс нейросетей. В статье, опубликованной на arXiv, авторы предлагают метод, позволяющий избежать традиционных проблем с синхронизацией и конкуренцией за ресурсы.
Практическое руководство по дообучению LLM
Исследователи представили подробное руководство по дообучению языковых моделей (LLM). Документ охватывает ключевые аспекты, включая выбор данных, настройку гиперпараметров и оценку результатов. Авторы подчеркивают важность качества данных и предлагают методы для минимизации шума и смещения.
Исследование: эмбеддинги как основа современных ИИ-моделей
Новое исследование под названием «Embeddings is all you need» предлагает радикальный взгляд на роль эмбеддингов в современных ИИ-моделях. Авторы утверждают, что эмбеддинги могут стать основой для построения более эффективных и универсальных моделей, заменяя традиционные архитектуры.
Может ли gzip стать языковой моделью
Исследователи изучают возможность использования алгоритма сжатия gzip в качестве языковой модели. В новом исследовании предложена идея, что gzip может быть адаптирован для предсказания следующего слова в тексте, аналогично традиционным языковым моделям.
Исследование: неравномерное распределение параметров в трансформерах
Учёные изучили эффективность неравномерного распределения параметров в трансформерах. Обычно архитектуры трансформеров используют одинаковую ширину во всех слоях, что приводит к равномерному распределению вычислительных ресурсов. Однако новые исследования показывают, что разные слои могут выполнять разные роли, и их вычислительные потребности могут отличаться.
Исследование: новые методы оценки сложности обучения бинарных концепций
Учёные представили исследование, посвящённое проблемам оценки сложности обучения бинарных концепций в машинном обучении. В работе рассматриваются такие ключевые показатели, как sign rank, $\mathbb{Z}_2$-index и list replicability, которые помогают определить минимальную размерность, в которой можно представить концепцию с помощью точек и полупространств.
Исследование: закономерности пиков очередей в стохастических сетях
Учёные изучили поведение пиков очередей в стохастических сетях, где множество очередей конкурирует за ограниченные ресурсы. В исследовании рассматриваются модели с зависимыми, изменяющимися во времени и адаптированными к прошлому потоками данных. Авторы показали, что при условии равномерного внутреннего запаса пропускной способности средний вектор прибытия остаётся в фиксированном сокращении области пропускной способности.
Новый метод обучения нейросетей без жесткого копирования знаний
Исследователи предложили альтернативу традиционному дистилляции знаний (knowledge distillation), где маленькие модели пытаются копировать логиты больших. Проблема в том, что это делает их слишком узкоспециализированными, ухудшая обобщающую способность.
Исследование переосмысливает методы сжатия датасетов в машинном обучении
Учёные пересмотрели подходы к dataset distillation (DD) — методу, который позволяет создавать компактные обучающие наборы данных, сохраняя ключевую информацию из больших датасетов. Исследование, опубликованное на arXiv, выявило несоответствия в оценке эффективности DD-методов, которые часто тестируются по разным протоколам, от стандартного ERM до использования одного или нескольких учителей.
Новый метод LoopWM для улучшения world models
Исследователи предложили новый подход к world models, который решает проблему баланса между точностью и вычислительными затратами. Looped World Models (LoopWM) используют итеративное уточнение скрытых состояний среды через архитектуру с общими параметрами.
Исследование: устойчивые и адаптивные трансформеры с фиксированной точкой
Учёные предложили новый подход к трансформерам с циклической архитектурой, который решает проблему распространения сигнала на больших глубинах. В статье на arXiv представлены Fixed-Point Reasoners — модели, способные адаптироваться к сложным задачам, требующим составного рассуждения.
Новый метод обучения dLLMs через самодистилляцию
Исследователи предложили новый подход к обучению диффузионных языковых моделей (dLLMs) — on-policy self-distillation (OPSD). Этот метод уже показал свою эффективность для обычных языковых моделей, но его применение к dLLMs оставалось неизученным.
Новый датасет для обнаружения кибератак с метками ATT&CK
Исследователи представили новый датасет для обнаружения многоэтапных кибератак, который включает логи систем, сетей и браузеров. Существующие публичные датасеты, такие как CICIDS и UNSW-NB15, охватывают только сетевую активность, в то время как другие, например LMDG, фокусируются на хост-активности.
Новый метод для устойчивых диффузионных политик
Исследователи предложили новый подход для повышения устойчивости диффузионных политик, которые используются в управлении физическими системами. Проблема заключается в том, что конечномерные (FD) диффузионные политики страдают от временного дрейфа из-за артефактов дискретизации, что ухудшает их производительность на длительных временных горизонтах.
Новый метод для оценки политик в reinforcement learning
Исследователи предложили новый подход к временной разнице (TD) с линейным приближением функций — ключевому методу в reinforcement learning. Классическое описание этого метода основано на обыкновенных дифференциальных уравнениях (ODE), которые отражают средние асимптотические динамики, но не учитывают стохастические флуктуации, влияющие на погрешность.
Новый метод решения нелинейных уравнений с нейросетями
Исследователи предложили новый численный метод для решения нелинейных дифференциальных уравнений с использованием физически информированных нейронных сетей (PINNs). Метод основан на подходе Беллмана-Калабы, который сводит нелинейную задачу к последовательности линейных подзадач. Каждая из них решается методом наименьших квадратов с помощью QR-разложения.
Новый подход к метаобучению в reinforcement learning
Исследователи предложили новый фреймворк для метаобучения в reinforcement learning (RL), который улучшает адаптацию агентов к новым задачам. В традиционных методах метаобучения RL задача распознавания и управление телом агента часто связаны, что усложняет извлечение общих знаний и снижает эффективность обучения.
Встраиваемый ИИ для микроконтроллеров: от данных до развёртывания
Исследователи представили системный обзор встраиваемого машинного обучения для устройств класса микроконтроллеров. В отличие от облачных сервисов, такие системы работают с ограниченными ресурсами: памятью, энергией и задержками. Авторы детализируют ключевые этапы — от сбора и предобработки данных до развёртывания моделей и оценки их работы.
Как оптимизировать трансформеры для обучения с низкой точностью
Трансформеры лежат в основе многих современных языковых и генеративных моделей. С ростом их размера увеличивается и потребление вычислительных ресурсов, особенно GPU. NVIDIA предложила методы оптимизации для обучения моделей с низкой точностью, что позволяет снизить нагрузку на оборудование.