Машинное обучение

Гибридная архитектура LSTM и Vision Transformer для прогнозирования ошибок погоды arXiv · 17.06.2026 Исследователи представили гибридную модель машинного обучения, предназначенную для коррекции ошибок в численных прогнозах погоды высокого разрешения (NWP). Система High-Resolution Rapid Refresh (HRRR), используемая метеорологами, часто сталкивается с неточностями, вызванными сложными атмосферными процессами, такими как конвекция, влияние рельефа и динамика пограничного слоя планеты. Традиционные методы не всегда справляются с учетом вертикальной структуры атмосферы, что приводит к накоплению погрешностей в краткосрочных прогнозах. Оптимизация обучения диффузионных трансформеров через Spot-инстансы arXiv · 17.06.2026 Исследователи представили метод Spotlight, направленный на снижение затрат при дообучении диффузионных трансформеров (DiT) с помощью обучения с подкреплением (RL). Традиционный процесс дообучения таких моделей требует использования тысяч высокопроизводительных графических процессоров, что делает его крайне ресурсоемким. Авторы работы предложили объединить два подхода: селекцию обучающих примеров (seed exploration) и использование спотовых инстансов облачных провайдеров. Улучшение многоязычного логического вывода через управляемое слияние моделей arXiv · 17.06.2026 Исследователи представили новый метод объединения нейросетевых архитектур, направленный на повышение качества логического вывода в многоязычных задачах. Техника слияния моделей позволяет эффективно комбинировать способности специализированных систем, отвечающих за глубокое рассуждение, с возможностями моделей, обученных на широком спектре языков. Основная сложность подобных подходов заключается в конфликтах между весами исходных моделей, которые часто приводят к снижению точности итогового решения. Новый подход к решению нейронных ОДУ Hacker News · 17.06.2026 Исследователи предложили метод решения нейронных обыкновенных дифференциальных уравнений (ОДУ) с нуля. В статье на Tinyvolt подробно описаны принципы и алгоритмы, которые позволяют более точно моделировать динамические системы. Новый подход к законам масштабирования может изменить обучение ИИ-моделей Hacker News · 17.06.2026 Исследователи из Стэнфордского университета предложили новый подход к законам масштабирования, который может существенно повлиять на процесс обучения искусственных нейронных сетей. Традиционные законы масштабирования описывают, как увеличение размера модели и объёма данных влияет на её производительность. Однако новый метод позволяет более точно предсказывать, как изменения в архитектуре модели и данных повлияют на её точность и эффективность. Новый метод параллельных вычислений на GPU для ИИ Hacker News · 17.06.2026 Исследователи представили новый подход к параллельным вычислениям на графических процессорах, который может значительно ускорить обучение и инференс нейросетей. В статье, опубликованной на arXiv, авторы предлагают метод, позволяющий избежать традиционных проблем с синхронизацией и конкуренцией за ресурсы. Практическое руководство по дообучению LLM Hacker News · 16.06.2026 Исследователи представили подробное руководство по дообучению языковых моделей (LLM). Документ охватывает ключевые аспекты, включая выбор данных, настройку гиперпараметров и оценку результатов. Авторы подчеркивают важность качества данных и предлагают методы для минимизации шума и смещения. Исследование: эмбеддинги как основа современных ИИ-моделей Hacker News · 16.06.2026 Новое исследование под названием «Embeddings is all you need» предлагает радикальный взгляд на роль эмбеддингов в современных ИИ-моделях. Авторы утверждают, что эмбеддинги могут стать основой для построения более эффективных и универсальных моделей, заменяя традиционные архитектуры. Может ли gzip стать языковой моделью Hacker News · 16.06.2026 Исследователи изучают возможность использования алгоритма сжатия gzip в качестве языковой модели. В новом исследовании предложена идея, что gzip может быть адаптирован для предсказания следующего слова в тексте, аналогично традиционным языковым моделям. Исследование: неравномерное распределение параметров в трансформерах arXiv · 16.06.2026 Учёные изучили эффективность неравномерного распределения параметров в трансформерах. Обычно архитектуры трансформеров используют одинаковую ширину во всех слоях, что приводит к равномерному распределению вычислительных ресурсов. Однако новые исследования показывают, что разные слои могут выполнять разные роли, и их вычислительные потребности могут отличаться. Исследование: новые методы оценки сложности обучения бинарных концепций arXiv · 16.06.2026 Учёные представили исследование, посвящённое проблемам оценки сложности обучения бинарных концепций в машинном обучении. В работе рассматриваются такие ключевые показатели, как sign rank, $\mathbb{Z}_2$-index и list replicability, которые помогают определить минимальную размерность, в которой можно представить концепцию с помощью точек и полупространств. Исследование: закономерности пиков очередей в стохастических сетях arXiv · 16.06.2026 Учёные изучили поведение пиков очередей в стохастических сетях, где множество очередей конкурирует за ограниченные ресурсы. В исследовании рассматриваются модели с зависимыми, изменяющимися во времени и адаптированными к прошлому потоками данных. Авторы показали, что при условии равномерного внутреннего запаса пропускной способности средний вектор прибытия остаётся в фиксированном сокращении области пропускной способности. Новый метод обучения нейросетей без жесткого копирования знаний arXiv · 16.06.2026 Исследователи предложили альтернативу традиционному дистилляции знаний (knowledge distillation), где маленькие модели пытаются копировать логиты больших. Проблема в том, что это делает их слишком узкоспециализированными, ухудшая обобщающую способность. Исследование переосмысливает методы сжатия датасетов в машинном обучении arXiv · 16.06.2026 Учёные пересмотрели подходы к dataset distillation (DD) — методу, который позволяет создавать компактные обучающие наборы данных, сохраняя ключевую информацию из больших датасетов. Исследование, опубликованное на arXiv, выявило несоответствия в оценке эффективности DD-методов, которые часто тестируются по разным протоколам, от стандартного ERM до использования одного или нескольких учителей. Новый метод LoopWM для улучшения world models arXiv · 16.06.2026 Исследователи предложили новый подход к world models, который решает проблему баланса между точностью и вычислительными затратами. Looped World Models (LoopWM) используют итеративное уточнение скрытых состояний среды через архитектуру с общими параметрами. Исследование: устойчивые и адаптивные трансформеры с фиксированной точкой arXiv · 16.06.2026 Учёные предложили новый подход к трансформерам с циклической архитектурой, который решает проблему распространения сигнала на больших глубинах. В статье на arXiv представлены Fixed-Point Reasoners — модели, способные адаптироваться к сложным задачам, требующим составного рассуждения. Новый метод обучения dLLMs через самодистилляцию arXiv · 16.06.2026 Исследователи предложили новый подход к обучению диффузионных языковых моделей (dLLMs) — on-policy self-distillation (OPSD). Этот метод уже показал свою эффективность для обычных языковых моделей, но его применение к dLLMs оставалось неизученным. Новый датасет для обнаружения кибератак с метками ATT&CK arXiv · 16.06.2026 Исследователи представили новый датасет для обнаружения многоэтапных кибератак, который включает логи систем, сетей и браузеров. Существующие публичные датасеты, такие как CICIDS и UNSW-NB15, охватывают только сетевую активность, в то время как другие, например LMDG, фокусируются на хост-активности. Новый метод для устойчивых диффузионных политик arXiv · 16.06.2026 Исследователи предложили новый подход для повышения устойчивости диффузионных политик, которые используются в управлении физическими системами. Проблема заключается в том, что конечномерные (FD) диффузионные политики страдают от временного дрейфа из-за артефактов дискретизации, что ухудшает их производительность на длительных временных горизонтах. Новый метод для оценки политик в reinforcement learning arXiv · 16.06.2026 Исследователи предложили новый подход к временной разнице (TD) с линейным приближением функций — ключевому методу в reinforcement learning. Классическое описание этого метода основано на обыкновенных дифференциальных уравнениях (ODE), которые отражают средние асимптотические динамики, но не учитывают стохастические флуктуации, влияющие на погрешность. Новый метод решения нелинейных уравнений с нейросетями arXiv · 16.06.2026 Исследователи предложили новый численный метод для решения нелинейных дифференциальных уравнений с использованием физически информированных нейронных сетей (PINNs). Метод основан на подходе Беллмана-Калабы, который сводит нелинейную задачу к последовательности линейных подзадач. Каждая из них решается методом наименьших квадратов с помощью QR-разложения. Новый подход к метаобучению в reinforcement learning arXiv · 16.06.2026 Исследователи предложили новый фреймворк для метаобучения в reinforcement learning (RL), который улучшает адаптацию агентов к новым задачам. В традиционных методах метаобучения RL задача распознавания и управление телом агента часто связаны, что усложняет извлечение общих знаний и снижает эффективность обучения. Встраиваемый ИИ для микроконтроллеров: от данных до развёртывания arXiv · 16.06.2026 Исследователи представили системный обзор встраиваемого машинного обучения для устройств класса микроконтроллеров. В отличие от облачных сервисов, такие системы работают с ограниченными ресурсами: памятью, энергией и задержками. Авторы детализируют ключевые этапы — от сбора и предобработки данных до развёртывания моделей и оценки их работы. Как оптимизировать трансформеры для обучения с низкой точностью NVIDIA Technical Blog · 16.06.2026 Трансформеры лежат в основе многих современных языковых и генеративных моделей. С ростом их размера увеличивается и потребление вычислительных ресурсов, особенно GPU. NVIDIA предложила методы оптимизации для обучения моделей с низкой точностью, что позволяет снизить нагрузку на оборудование.