Машинное обучение

Автоматизация дешифровки клинописи с помощью компьютерного зрения arXiv · 21.06.2026 Исследователи представили новый пайплайн для автоматического распознавания клинописных знаков на глиняных табличках. Проект решает проблему нехватки данных в ассириологии: из полумиллиона найденных артефактов эксперты успели проанализировать лишь малую часть из-за сложности ручной расшифровки. Разработанный метод использует крупнейший на сегодняшний день размеченный датасет клинописных символов для обучения моделей компьютерного зрения. Масштабируемые байесовские модели для анализа временных рядов в астрономии arXiv · 21.06.2026 Исследователи представили новый метод обработки высокочастотных данных астрономических наблюдений, позволяющий эффективно выявлять вспышки на звездах. Традиционные гауссовские процессы (GP) часто сталкиваются с вычислительными ограничениями при работе с длинными временными рядами из-за кубической сложности алгоритмов. Авторы работы предложили решение, объединяющее амортизированный байесовский вывод и скрытые марковские модели (HMM), что позволяет значительно ускорить анализ без потери точности. Исследование влияния позиционного смещения в методах дистилляции моделей arXiv · 21.06.2026 Исследователи проанализировали эффективность метода On-Policy Distillation (OPD), который используется для ускорения обучения моделей с подкреплением через пошаговый контроль со стороны «учителя». Стандартный подход предполагает равномерное распределение весов для всех токенов при расчете функции потерь, однако новая работа доказывает, что такой метод не учитывает накопленные ошибки в длинных последовательностях. Метод динамического объединения моделей без дообучения arXiv · 21.06.2026 Исследователи представили новый подход к объединению нескольких специализированных нейросетевых экспертов в одну многозадачную модель. Традиционные методы слияния весов часто сталкиваются с проблемой интерференции параметров, когда знания одной модели конфликтуют с другой, что приводит к снижению точности по сравнению с исходными узкоспециализированными версиями. Автоматизация генерации кода для предметно-ориентированных языков arXiv · 21.06.2026 Исследователи формализовали задачу Text2DSL, направленную на автоматическое создание кода для предметно-ориентированных языков (DSL) на основе естественного языка. В отличие от генерации SQL-запросов или кода общего назначения, работа с DSL требует учета специфических синтаксических правил и ограничений безопасности, что делает задачу более сложной и узкоспециализированной. Авторы подчеркивают, что ручное написание правил для управления политиками безопасности операционных систем часто приводит к ошибкам из-за высокого порога входа. Использование системных вызовов для обнаружения новых типов уязвимостей arXiv · 21.06.2026 Исследователи представили новый подход к работе систем обнаружения вторжений (HIDS), основанный на анализе последовательностей системных вызовов. Традиционные методы обучения таких систем опираются на конкретные записи CVE (Common Vulnerabilities and Exposures), что ограничивает их эффективность при столкновении с новыми эксплойтами. Авторы работы предложили метод обобщения, позволяющий детектировать неизвестные угрозы, относящиеся к уже известным типам слабостей программного обеспечения. Новый метод повышения устойчивости многоагентных систем в условиях неточных моделей arXiv · 21.06.2026 Исследователи представили новый математический подход к решению проблемы расхождения данных между тренировочными симуляторами и реальной средой в многоагентном обучении с подкреплением (MARL). В реальных условиях разрыв между моделью и действительностью часто приводит к резкому падению производительности агентов, так как стратегическое взаимодействие между ними усиливает любые ошибки прогнозирования. Авторы работы предлагают использовать принципы дистрибутивной робастности для оптимизации стратегий. Оптимизация синтетических данных для обучения компьютерного зрения arXiv · 21.06.2026 Исследователи представили метод SmartSDG, направленный на устранение разрыва между синтетическими данными и реальными условиями в задачах компьютерного зрения. Использование сгенерированных изображений позволяет обходить проблему ручной разметки, однако качество моделей часто страдает из-за различий в освещении и сложности фона. Новый подход систематизирует влияние физически корректного непрямого освещения на точность распознавания объектов. Новый метод адаптации CLIP для работы с редкими данными arXiv · 21.06.2026 Исследователи представили метод Concept-Constrained Prompt Learning (CCPL), направленный на повышение эффективности адаптации мультимодальных моделей, таких как CLIP, к новым задачам при ограниченном количестве обучающих примеров. Традиционные подходы к настройке промптов часто приводят к переобучению на базовых классах, что снижает точность распознавания объектов, которые не встречались в процессе обучения. Глубокие нейронные сети для моделирования пьезоэлектрических композитов arXiv · 21.06.2026 Исследователи представили метод глубоких материальных сетей (Deep Material Networks) для гомогенизации пьезоэлектрических композитов. Традиционные подходы, основанные на методах прямого численного моделирования, требуют значительных вычислительных мощностей, особенно при анализе многомасштабных структур. Новый подход позволяет значительно ускорить процесс прогнозирования эффективных электромеханических свойств материалов за счет замены ресурсоемких симуляций обученными нейросетевыми моделями. Решение проблемы нестабильности обучения гибридных квантовых нейросетей arXiv · 21.06.2026 Исследователи предложили метод стабилизации процесса обучения гибридных квантовых нейронных сетей (QNN), используемых для классификации белков. Основная сложность таких моделей заключается в том, что выходные данные квантовых измерений (логиты) ограничены диапазоном от -1 до 1. При использовании стандартной функции потерь кросс-энтропии в сочетании с нормализацией softmax это ограничение приводит к математической нестабильности и замедлению сходимости алгоритма. Метод семантической коррекции для авторегрессионных визуальных моделей arXiv · 21.06.2026 Исследователи представили новый подход к повышению качества генерации изображений и видео в авторегрессионных визуальных моделях (AVM). Основная проблема таких систем заключается в многомасштабном подходе к синтезу: процесс разбивается на дискретные этапы с разной степенью детализации, из-за чего семантические ошибки, допущенные на ранних стадиях, накапливаются и приводят к искажениям в финальном результате. Generative Robust Optimisation: новый подход к оптимизации в условиях неопределенности arXiv · 21.06.2026 Исследователи представили метод Generative Robust Optimisation (GRO), который меняет подход к классической задаче робастной оптимизации. Традиционные методы опираются на жесткие геометрические ограничения для описания неопределенности, что не позволяет эффективно учитывать сложные зависимости в реальных данных. Авторы предлагают использовать глубокие генеративные модели для определения множеств неопределенности, где границы задаются образом нейросетевого декодера. Повышение устойчивости диффузионных моделей к зашумленным данным arXiv · 21.06.2026 Исследователи предложили новый метод обучения диффузионных моделей, который делает их более устойчивыми к загрязненным обучающим выборкам. Традиционный подход, основанный на минимизации среднеквадратичной ошибки (MSE), часто оказывается чувствительным к выбросам и некачественным данным, что снижает итоговое качество генерации контента. Новый метод декодирования для борьбы с повторами в LLM arXiv · 21.06.2026 Исследователи представили метод Variance-Calibrated Modulation (VCM), направленный на устранение проблемы «ловушки правдоподобия» при генерации текста большими языковыми моделями. Традиционные подходы к декодированию, такие как Top-p или Min-p, часто приводят к монотонности и избыточным повторам, так как модели склонны чрезмерно полагаться на наиболее вероятные токены, игнорируя разнообразие лексики, характерное для человеческой речи. Fed-CausalDiff: новый подход к федеративному обучению и причинно-следственному выводу arXiv · 21.06.2026 Исследователи представили фреймворк Fed-CausalDiff, объединяющий методы федеративного обучения с принципами причинно-следственного вывода (causal inference). Традиционные подходы к распределенному обучению моделей фокусируются на анализе исторических данных, что ограничивает их способность предсказывать последствия действий в динамических средах. Новый метод решает эту проблему, позволяя моделям оценивать влияние различных стратегий без необходимости централизации конфиденциальной информации. Новый метод безопасного обучения с подкреплением для долгосрочных задач arXiv · 21.06.2026 Исследователи представили новый подход к решению проблемы безопасного исследования в обучении с подкреплением (Reinforcement Learning). Основная сложность заключается в том, что агенты должны максимизировать производительность, строго соблюдая ограничения безопасности. В задачах с длинным горизонтом планирования текущие методы часто сталкиваются с накоплением ошибок оценки и ограниченными возможностями для поиска оптимальных стратегий, что делает их недостаточно надежными. Повышение точности локальных LLM при работе с IoT-данными arXiv · 21.06.2026 Исследователи предложили новый метод обработки данных с датчиков интернета вещей (IoT), который позволяет компактным локальным языковым моделям достигать точности облачных решений. Основная проблема при работе с «умными» средами заключается в том, что небольшие модели, способные функционировать на периферийных устройствах, часто демонстрируют низкие показатели в задачах численного анализа при получении «сырых» показаний датчиков. Двухэтапная модель распознавания и перевода жестового языка arXiv · 21.06.2026 Исследователи представили архитектуру глубокого обучения для автоматического распознавания жестового языка по видео и его последующего перевода на региональные языки Индии. Система решает проблему дефицита инструментов для слабослышащих людей, использующих редкие и малоресурсные языки, для которых стандартные решения на базе ИИ часто недоступны. ROMEVA: новый метод адаптации словарей для языков с низкой представленностью arXiv · 21.06.2026 Исследователи представили метод ROMEVA (Roman Urdu Embedding-preserving Vocabulary Adaptation), направленный на улучшение работы мультиязычных моделей с языками, имеющими нестабильную морфологию и написание. В качестве примера авторы рассматривают романский урду — язык, где отсутствие единых стандартов орфографии приводит к избыточной фрагментации токенов. В стандартных моделях вроде mBERT это создает проблему, при которой один токен разбивается в среднем на 1,5 подслова, что снижает эффективность обработки текста. Метод FACTOR для адаптивной проверки фактов в генерации текста arXiv · 21.06.2026 Исследователи представили метод FACTOR, направленный на повышение достоверности длинных текстов, создаваемых языковыми моделями. Основная проблема современных LLM заключается в склонности к генерации неподтвержденных утверждений, которые часто остаются незамеченными стандартными инструментами верификации. В отличие от существующих подходов, которые применяют одинаковые правила проверки ко всем частям текста, новая методика учитывает разную степень риска возникновения галлюцинаций для различных типов утверждений. Новый алгоритм VRA-FedSGD для федеративного обучения в условиях шума arXiv · 21.06.2026 Исследователи представили алгоритм VRA-FedSGD, предназначенный для оптимизации федеративного обучения (Federated Learning) в распределенных системах. Метод направлен на решение проблем, возникающих при работе с данными на локальных устройствах, где градиентные шумы с «тяжелыми хвостами» и нестабильность каналов связи существенно снижают точность и скорость сходимости глобальных моделей. Новый метод адаптивного обучения для работы с графовыми данными arXiv · 21.06.2026 Исследователи представили метод Adaptive Recurrent Message Passing, который решает проблему несовместимости предобученных моделей с графовыми структурами данных. Традиционные архитектуры часто оказываются неэффективными при работе с графами из-за фиксированной структуры нейронных сетей, которая не учитывает динамическую природу связей между узлами. Новый подход позволяет моделям адаптироваться непосредственно в процессе вычислений, используя рекуррентную передачу сообщений. Перспективы аналоговых вычислений для ускорения нейросетей Hacker News · 21.06.2026 Традиционные цифровые архитектуры сталкиваются с физическими ограничениями при масштабировании нейронных сетей, что вынуждает исследователей искать альтернативные способы выполнения матричных операций. Аналоговые вычисления предлагают принципиально иной подход: вместо передачи дискретных битов через логические вентили, вычисления происходят непосредственно в физических компонентах, таких как мемристоры или специализированные транзисторы. Это позволяет выполнять операции умножения и сложения с использованием законов физики, что теоретически снижает энергопотребление на порядки по сравнению с современными GPU.