Машинное обучение

Почему обучение с подкреплением для ИИ-агентов приводит к деградации моделей arXiv · 24.06.2026 Исследователи выявили причину «катастрофического коллапса» при обучении LLM использованию инструментов через Reinforcement Learning (RL). В ходе многошаговых задач модели часто теряют способность корректно вызывать функции, что ведет к резкому падению производительности. Авторы работы предложили метод внедрения дополнительных контролирующих сигналов, который стабилизирует процесс обучения и предотвращает разрушение агентных навыков в сложных сценариях. Реализация покерного ИИ на базе алгоритмов Deep CFR и поиска в реальном времени Hacker News · 24.06.2026 Разработчик представил проект покерного ИИ, вдохновленный архитектурой Pluribus от Meta (признана экстремистской организацией, деятельность запрещена в РФ). Система использует комбинацию алгоритмов Deep Counterfactual Regret Minimization (Deep CFR) и поиска в реальном времени для принятия решений в условиях неполной информации. Проект включает открытый исходный код и интерактивную демонстрацию для тестирования стратегий игры. Tatoxa: новая система детоксикации текста для татарского языка arXiv · 24.06.2026 Исследователи представили Tatoxa — специализированную систему для автоматического обнаружения и нейтрализации токсичного контента в текстах на татарском языке. Разработка решает проблему нехватки инструментов обработки естественного языка для малоресурсных языков, обеспечивая высокую точность фильтрации вредоносных высказываний. Система демонстрирует эффективность, сопоставимую с современными аналогами для языков с большими объемами обучающих данных. Ускорение BEV-пулинга на GPU NVIDIA для систем физического ИИ NVIDIA Technical Blog · 24.06.2026 NVIDIA представила методы оптимизации BEV-пулинга (Bird's-Eye-View) — критически важного этапа обработки данных в автономном транспорте и робототехнике. Новые подходы позволяют значительно сократить задержки при проекции данных с камер в единое 3D-пространство, что критично для систем реального времени. Оптимизация реализована через специализированные CUDA-ядра, повышающие пропускную способность при работе с пространственными признаками. HiReLC: иерархическое обучение с подкреплением для сжатия нейросетей arXiv · 24.06.2026 Исследователи представили HiReLC — фреймворк для автоматизированной оптимизации глубоких нейронных сетей, объединяющий квантование и структурную обрезку (pruning). Система использует иерархическое обучение с подкреплением, разделяя задачу на уровни абстракции. Это позволяет эффективно подбирать конфигурации битности и параметры прореживания для каждого блока сети, минимизируя потери точности при значительном сокращении вычислительных затрат. Autodata: агентный подход к генерации синтетических данных для обучения ИИ arXiv · 24.06.2026 Исследователи представили Autodata — метод, превращающий ИИ-агентов в автономных дата-сайентистов для создания высококачественных обучающих и оценочных наборов данных. Система использует мета-оптимизацию, позволяя агенту итеративно улучшать процесс генерации данных. Практическая реализация метода, названная Agentic Self-Instruct, демонстрирует эффективность в задачах компьютерных наук, значительно повышая качество синтетических датасетов для дообучения моделей. Таксономическое глубокое обучение для классификации морских видов arXiv · 24.06.2026 Исследователи представили новый метод глубокого обучения для автоматической классификации морских видов по подводным изображениям. Подход учитывает таксономическую иерархию, что позволяет эффективно справляться с визуальным сходством близкородственных организмов и неравномерной детализацией данных, где часть образцов классифицируется только до уровня рода или семейства, а не конкретного вида. Weave of Formal Thought: новый подход к генерации синтаксически корректного кода arXiv · 24.06.2026 Исследователи представили метод Weave of Formal Thought, решающий проблему синтаксической неточности LLM при генерации кода. В отличие от существующих систем ограниченного декодирования, новый подход учитывает иерархическую структуру языков программирования и контекстно-зависимые лексические механизмы. Это позволяет моделям создавать программный код, который не только выглядит корректно, но и гарантированно соответствует строгим правилам синтаксиса целевого языка. Новый метод распознавания целей в мультиагентных системах arXiv · 24.06.2026 Исследователи представили новый подход к распознаванию целей в мультиагентных средах, сочетающий обучение с подкреплением и метод ветвей и границ. Алгоритм позволяет эффективно определять состав команд и их намерения на основе анализа траекторий движения, решая проблему комбинаторного взрыва гипотез, характерную для сложных систем с большим количеством участников и динамическими задачами. Tensorion: новый метод оптимизации с учетом тензорной структуры весов arXiv · 24.06.2026 Исследователи представили Tensorion — метод оптимизации, расширяющий возможности алгоритма Muon для обучения нейронных сетей. В отличие от стандартных оптимизаторов вроде Adam, которые воспринимают параметры как плоские векторы, Tensorion учитывает многолинейную структуру весовых матриц. Это позволяет эффективнее использовать геометрию пространства параметров, ускоряя сходимость и повышая качество обучения современных архитектур. Новый метод обучения нейросетей через разделение амплитуды и направления весов arXiv · 24.06.2026 Исследователи предложили метод оптимизации нейронных сетей, разделяющий весовые матрицы на два независимых компонента: амплитуду и направление. Традиционные оптимизаторы, такие как Adam или Muon, обрабатывают веса как единое целое, что ограничивает гибкость обучения. Новый подход позволяет динамически управлять этими параметрами, повышая эффективность сходимости и стабильность процесса обучения глубоких архитектур в различных задачах машинного обучения. WinDOM: новый метод дистилляции для компактных GUI-агентов arXiv · 24.06.2026 Исследователи представили WinDOM — метод самодистилляции для обучения компактных моделей (около 2 млрд параметров), предназначенных для навигации по графическим интерфейсам (GUI). Подход решает проблему нехватки размеченных данных и оптимизирует процесс дообучения, позволяя небольшим моделям достигать высокой точности в задачах взаимодействия с элементами интерфейса без привлечения дорогостоящей ручной разметки. Когда данные действительно улучшают автоматизированный контекстный инжиниринг Hacker News · 24.06.2026 Исследование анализирует эффективность автоматизированного контекстного инжиниринга (ACE) при разработке ИИ-агентов. Автор изучает, в каких сценариях добавление размеченных данных или примеров взаимодействия существенно повышает производительность системы, а когда избыточная информация приводит к деградации контекста и росту вычислительных затрат без значимого прироста качества ответов модели. InSight: новый метод автономного обучения навыкам для VLA-моделей arXiv · 23.06.2026 Исследователи представили InSight — фреймворк, позволяющий Vision-Language-Action (VLA) моделям самостоятельно осваивать новые манипуляционные навыки без необходимости в дополнительных демонстрациях. Система делает модели управляемыми на уровне элементарных действий, что позволяет агентам комбинировать базовые движения для выполнения сложных задач, выходящих за рамки их исходного обучающего набора данных. Новые теоретические границы для стохастического субградиентного метода arXiv · 23.06.2026 Исследователи представили уточненные теоретические оценки для последнего итерата стохастического субградиентного метода применительно к одномерным выпуклым липшицевым функциям. Авторы доказали, что при фиксированном горизонте итераций $n$ и стандартном шаге $\eta = \Theta(1/\sqrt{n})$ ошибка оптимизации достигает порядка $1/\sqrt{n}$. Это фундаментальное уточнение устраняет необходимость в усреднении итераций для достижения оптимальной сходимости в заданных условиях. Hartley Neural Operator: новый подход к решению дифференциальных уравнений arXiv · 23.06.2026 Исследователи представили Hartley Neural Operator (HNO) — архитектуру, которая заменяет комплексное преобразование Фурье в Fourier Neural Operators (FNO) на вещественное преобразование Хартли. Это решение устраняет избыточность данных, возникающую из-за сопряженной симметрии в комплексных числах, и позволяет более эффективно моделировать операторы решений для дифференциальных уравнений в частных производных. L3Cube-MahaPOS: новый датасет и BERT-модели для маратхи arXiv · 23.06.2026 Исследователи представили L3Cube-MahaPOS — специализированный набор данных для морфологической разметки (POS-tagging) языка маратхи, на котором обучались новые модели семейства BERT. Проект направлен на устранение дефицита ресурсов для одного из самых распространенных языков мира, на котором говорят более 83 миллионов человек, что критически важно для развития машинного перевода и анализа синтаксиса. Новый метод Bi-CFM для решения обратных задач в хаотических системах arXiv · 23.06.2026 Исследователи представили метод Bidirectional Conditional Flow Matching (Bi-CFM) для решения обратных задач в хаотических динамических системах. Алгоритм позволяет восстанавливать начальные условия по конечным состояниям, преодолевая проблемы неустойчивости и неоднозначности решений. Метод демонстрирует высокую точность в моделировании сложных систем, где традиционные подходы сталкиваются с вычислительными ограничениями из-за высокой чувствительности к малейшим изменениям параметров. Визуальное руководство по работе архитектуры Transformer Hacker News · 23.06.2026 Проект Transformer Primitives представляет собой интерактивное визуальное пособие, объясняющее внутреннюю механику работы трансформеров. Ресурс наглядно демонстрирует ключевые этапы обработки данных, включая механизмы внимания (attention), векторные представления и процесс преобразования токенов в предсказания. Авторы отказались от перегруженных математических формул в пользу анимированных схем, что позволяет проследить путь информации через слои нейронной сети. Grad Detect: новый метод выявления галлюцинаций через анализ градиентов arXiv · 23.06.2026 Исследователи представили Grad Detect — метод обнаружения галлюцинаций в больших языковых моделях, основанный на анализе градиентов. В отличие от подходов, требующих множественных прогонов или внешних баз знаний, технология анализирует паттерны градиентов на разных слоях нейросети в ходе одного цикла обратного распространения ошибки. Это позволяет эффективно выявлять недостоверные ответы непосредственно в процессе генерации текста. Проблема доменной адаптации в системах распознавания активности человека arXiv · 23.06.2026 Исследователи проанализировали проблему сдвига распределения данных в системах распознавания активности человека (HAR). Основная сложность при внедрении таких моделей в реальные условия заключается в гетерогенности датчиков и вариативности контекста. Авторы работы предлагают методы повышения устойчивости алгоритмов к изменениям доменов, что критически важно для надежной работы носимых устройств и систем мониторинга в неконтролируемой среде. Posterior Refinement: новый метод ускорения генерации текста в неавторегрессионных моделях arXiv · 23.06.2026 Исследователи представили метод Posterior Refinement, решающий проблему низкой эффективности неавторегрессионных языковых моделей. Новый подход использует Any-Order Flow Maps для итеративного уточнения текста, позволяя моделям критиковать и перегенерировать произвольные фрагменты токенов одновременно. Это устраняет ошибки факторизации, характерные для маскированных диффузионных моделей, и значительно повышает качество генерации при сохранении высокой скорости работы. Новый метод стабилизации динамики обучения нейросетей через инерцию arXiv · 23.06.2026 Исследователи предложили модификацию динамики Дирака-Френкеля, добавляющую инерцию для решения проблем неустойчивости при обучении нелинейно параметризованных моделей, таких как нейронные сети. Введение инерционного члена позволяет сохранять информацию о скорости изменения параметров из прошлых состояний, что делает процесс оптимизации более стабильным и предсказуемым даже при использовании избыточных архитектур. CANDLE: новый метод очистки арабского текста от шума на уровне символов arXiv · 23.06.2026 Исследователи представили CANDLE — легковесную систему для автоматической очистки арабских текстов от избыточных повторов символов. В отличие от традиционных подходов, модель не требует использования морфологических анализаторов, словарей или сложных правил. Система эффективно различает намеренное удлинение символов в неформальном общении и корректное написание слов, что критически важно для предобработки данных в NLP-задачах.