Машинное обучение

Применение обучения с подкреплением в разработке ИИ-агентов NVIDIA Technical Blog · 01.07.2026 Обучение с подкреплением (RL) становится ключевым методом для повышения автономности и точности ИИ-агентов. NVIDIA представила обзор подходов, позволяющих моделям эффективно принимать решения в динамических средах. Технологии эволюционируют от классического RLHF к более сложным методам, которые позволяют агентам самостоятельно оптимизировать цепочки рассуждений и корректировать действия для достижения долгосрочных целей в реальных бизнес-задачах. Новый метод обучения генеративных моделей с учетом стоимости принятия решений arXiv · 01.07.2026 Исследователи представили метод Decision-Aware Training, который оптимизирует генеративные модели для задач вероятностного прогнозирования с учетом реальных экономических затрат. В отличие от стандартных подходов, фокусирующихся на плотности данных, новый алгоритм перераспределяет обучающий сигнал, минимизируя риски и издержки, связанные с ошибками прогноза в критически важных бизнес-процессах и управленческих решениях. Diffusion-GR2: ускорение генеративного ранжирования в рекомендательных системах arXiv · 01.07.2026 Исследователи представили Diffusion-GR2 — новый метод для рекомендательных систем, использующий диффузионные языковые модели вместо авторегрессионных декодеров. Подход позволяет значительно ускорить процесс генеративного рассуждения при ранжировании кандидатов. За счет параллельного декодирования модель сокращает время вывода, сохраняя при этом высокую точность цепочки рассуждений (chain-of-thought), характерную для современных генеративных ранжировщиков. Сжатие 3D-данных с помощью нейронных представлений на основе гауссианов arXiv · 01.07.2026 Исследователи представили новый метод сжатия структурированных и неструктурированных объемных данных, использующий обучаемые 3D-гауссианы. Технология позволяет эффективно кодировать геометрию объектов, устраняя необходимость в хранении промежуточных сеток (meshes). Это значительно снижает требования к памяти при сохранении возможности прямого запроса данных, что открывает новые перспективы для работы с тяжелыми 3D-моделями и визуализацией в реальном времени. Hierarchical-JEPA: новый метод обучения для анализа временных рядов в медицине arXiv · 01.07.2026 Исследователи представили фреймворк Hierarchical-JEPA для самообучения на многомерных временных рядах, протестированный на данных ЭКГ. Метод решает проблему дефицита размеченных медицинских данных, используя неразмеченные наборы для извлечения признаков. Подход основан на архитектуре Joint-Embedding Predictive Architecture (JEPA), которая эффективно реконструирует события в сигналах, обеспечивая высокую точность анализа при ограниченном доступе к экспертной разметке. Новый метод обучения моделей с использованием потоковых карт для онлайн-поиска arXiv · 01.07.2026 Исследователи представили метод Sequentially-Controlled Interactive Multi-Particle Flow-Maps (SCIM-Flow), предназначенный для оптимизации моделей в условиях неизвестных предпочтений. В отличие от стандартных подходов, которые ограничены локальным поиском, новый алгоритм использует динамические потоковые карты частиц для эффективного исследования пространства распределений, что позволяет модели адаптироваться к обратной связи в режиме реального времени и находить области с высокой полезностью. Muon как скрытое остаточное соединение в обучении нейросетей arXiv · 01.07.2026 Исследователи представили новую интерпретацию оптимизатора Muon, который стал одним из самых эффективных инструментов для обучения масштабных нейронных сетей. Авторы работы доказывают, что механизм работы Muon эквивалентен неявному остаточному соединению (residual connection). Этот подход позволяет лучше понять эмпирический успех алгоритма и оптимизировать процесс обновления весов при обучении моделей с большим количеством параметров. CausalMix: новый подход к оптимизации состава данных при обучении LLM arXiv · 01.07.2026 Исследователи представили CausalMix — метод оптимизации весов данных при обучении языковых моделей, основанный на принципах причинно-следственного вывода. В отличие от существующих подходов, полагающихся на статические прокси-модели, CausalMix позволяет динамически адаптироваться к изменениям в распределении данных, исключая необходимость дорогостоящего переобучения с нуля при обновлении обучающей выборки. GRINCO: новый метод активного обучения для эффективного отбора данных arXiv · 01.07.2026 Исследователи представили GRINCO — фреймворк для активного обучения, который учитывает симметрии данных при формировании корезет-выборок. В отличие от стандартных подходов, метод работает в фактор-пространстве, индуцированном группой преобразований. Это позволяет избегать избыточного выбора данных, которые являются лишь трансформированными копиями уже отобранных примеров, значительно повышая эффективность разметки и обучения моделей. Масштабирование обучения RLHF в асинхронных системах arXiv · 01.07.2026 Исследователи проанализировали влияние использования устаревших данных (staleness) на эффективность обучения с подкреплением на основе отзывов людей (RLHF). В высокопроизводительных системах генерация траекторий часто отделена от оптимизации политики, что приводит к задержкам. Авторы предложили математическую модель для корректировки скорости обучения в асинхронном алгоритме GRPO, позволяющую минимизировать негативный эффект от использования неактуальных данных при обновлении весов модели. Метод Message Passing ускоряет логический вывод в LLM arXiv · 01.07.2026 Исследователи представили метод Message Passing, который оптимизирует процесс рассуждения больших языковых моделей. В отличие от традиционных цепочек мыслей (CoT), требующих последовательных вычислений, новый подход использует параллельную обработку через обмен сообщениями между потоками модели. Это позволяет значительно сократить вычислительные затраты и время инференса при сохранении высокой точности решения сложных логических задач. Новый графовый метод для определения порядка чтения в сложных документах arXiv · 01.07.2026 Исследователи представили метод определения порядка чтения в сложных документах, таких как исторические рукописи с нелинейной версткой. Решение позволяет восстанавливать последовательность текста в макетах с комментариями, обтекающими основной блок по непрямоугольным траекториям. Подход не требует дополнительного обучения моделей, опираясь на графовые алгоритмы для анализа пространственных связей между текстовыми блоками и их логической структурой. Новый фреймворк для глубокого многозадачного обучения с разнородными данными arXiv · 01.07.2026 Исследователи представили фреймворк для многозадачного обучения, решающий проблему несовместимости функций потерь при работе с разнородными типами данных. Метод использует общую разреженность (shared sparsity) для эффективного обмена информацией между задачами, что позволяет объединить разнотипные целевые переменные в единую оптимизационную задачу и повысить точность предсказаний в сложных системах с множественными исходами. Роль визуальной аналитики в интеграции человеческих знаний в ML-процессы arXiv · 01.07.2026 Исследователи проанализировали область VIS4ML, сфокусированную на использовании визуальной аналитики для поддержки рабочих процессов машинного обучения. Работа систематизирует способы, которыми эксперты внедряют свои знания в автоматизированные системы — от разметки данных и проектирования признаков до выбора архитектуры моделей, подчеркивая критическую важность человеческого участия в создании эффективных ML-решений через интерактивные визуальные интерфейсы. LeNEPA: новый метод обучения представлений временных рядов без аугментаций arXiv · 01.07.2026 Исследователи представили LeNEPA — метод самообучения (SSL) для анализа временных рядов, исключающий необходимость в сложных стратегиях аугментации данных. В отличие от классических подходов, полагающихся на выбор специфических представлений, LeNEPA использует прогнозирование скрытых состояний (Next-Latent Prediction), что позволяет модели эффективно извлекать признаки из данных без ручной настройки инвариантов для конкретных доменов. Aionoscope: диагностика скрытых состояний в моделях временных рядов arXiv · 01.07.2026 Исследователи представили Aionoscope — диагностический инструмент для анализа скрытых представлений в моделях временных рядов. В отличие от стандартных метрик точности прогнозирования, этот фреймворк позволяет проверять, насколько эффективно модель сохраняет критически важные характеристики процесса, такие как фаза, амплитуда, частота и временные метки событий, что критично для интерпретируемости сложных систем. Сравнение подходов к генерации кода: контролируемое и неконтролируемое обучение Hacker News · 01.07.2026 Исследование анализирует эффективность методов обучения моделей для генерации программного кода. Автор сравнивает классическое обучение с учителем (supervised) и подходы, основанные на неконтролируемом обучении, оценивая их влияние на качество, синтаксическую корректность и функциональную пригодность создаваемых фрагментов кода в реальных задачах разработки ПО. Новый математический подход снижает требования к «железу» для ИИ Hacker News · 01.07.2026 Исследователи предложили новый математический метод оптимизации вычислений, который позволяет значительно снизить нагрузку на аппаратное обеспечение при работе с нейросетями. Замена стандартных операций с плавающей запятой на альтернативные вычисления позволяет сократить потребление ресурсов GPU без потери точности моделей, что открывает путь к более эффективному инференсу на менее мощном оборудовании. Google представила TabFM: фундаментальную модель для работы с табличными данными MarkTechPost · 01.07.2026 Google Research анонсировала TabFM — новую фундаментальную модель, предназначенную для обработки табличных данных. Система использует механизм гибридного внимания для выполнения задач классификации и регрессии в режиме zero-shot. Модель способна делать предсказания за один проход, исключая необходимость в дообучении под конкретные наборы данных, настройке гиперпараметров или сложной подготовке признаков. Переписывание ML-фреймворка на языке Lean: производительность и верификация Hacker News · 30.06.2026 Разработчики переписали популярный ML-фреймворк tinygrad на языке формальной верификации Lean, добившись повышения производительности. Эксперимент показал, что использование строго типизированного функционального языка позволяет не только оптимизировать вычисления, но и гарантировать математическую корректность операций. Это открывает новые возможности для создания высокопроизводительных и надежных систем глубокого обучения, где критически важна точность каждого тензорного преобразования. Freeform Preference Learning: новый метод обучения роботов через естественную обратную связь arXiv · 30.06.2026 Исследователи представили метод Freeform Preference Learning (FPL), который решает проблему проектирования функций вознаграждения для автономных роботов. Вместо использования бинарных меток успеха, FPL позволяет обучать политики манипуляции на основе произвольных текстовых комментариев человека. Это дает модели более глубокое понимание качества выполнения задач, значительно повышая эффективность обучения в сложных сценариях с длинным горизонтом планирования. FLORA: глубокое обучение для анализа лесных ресурсов по данным LiDAR arXiv · 30.06.2026 Исследователи представили FLORA — метод глубокого обучения для прогнозирования характеристик лесных массивов на основе разнородных данных аэрофотосъемки LiDAR. Модель решает проблему масштабируемости национального мониторинга ресурсов, позволяя эффективно обрабатывать данные, полученные в различных условиях съемки, что критически важно для точности инвентаризации лесов и оценки биомассы в глобальном масштабе. Метод автоматической замены фона для повышения устойчивости нейросетей arXiv · 30.06.2026 Исследователи представили новый метод борьбы со «случайными корреляциями» в компьютерном зрении, которые заставляют модели опираться на нерелевантные детали фона вместо ключевых объектов. Автоматическая замена фонового изображения в процессе обучения позволяет нейросетям игнорировать контекстный «шум» и фокусироваться на причинно-следственных признаках, что значительно повышает точность классификации при работе с новыми, нетипичными данными. Метод TRIAGE для точного распределения вознаграждения в агентном обучении arXiv · 30.06.2026 Исследователи представили метод TRIAGE, который решает проблему неэффективного распределения кредита (credit assignment) в агентном обучении с подкреплением. В отличие от стандартного алгоритма GRPO, который оценивает только финальный результат, TRIAGE классифицирует действия агента по типам ролей. Это позволяет точнее определять вклад каждого шага — от навигации до редактирования — в итоговый успех, избегая наказания за полезные исследовательские действия.