Машинное обучение

Ускорение численного моделирования потоков с помощью графовых нейросетей arXiv · 17.06.2026 Исследователи представили новый метод ускорения алгебраических многосеточных решателей (AMG), используемых для решения уравнения Пуассона при моделировании несжимаемых потоков. Традиционные линейные методы часто сталкиваются с вычислительными сложностями из-за неоднородности расчетных сеток, что делает их узким местом в инженерных расчетах. TGO: новый подход к анализу геометрии представлений в Vision Transformers arXiv · 17.06.2026 Исследователи представили Transformer Geometry Observatory (TGO) — систематический фреймворк для изучения внутренней структуры и размерности представлений в моделях Vision Transformers (ViT). Несмотря на широкое распространение архитектур на базе трансформеров в задачах компьютерного зрения, принципы формирования их скрытых пространств и геометрические свойства признаков до сих пор оставались недостаточно изученными. Метод MAST для точечного удаления нежелательных навыков рассуждения в LLM arXiv · 17.06.2026 Исследователи представили метод MAST (Mechanism-Aligned Selective Targeting), предназначенный для избирательного удаления специфических паттернов рассуждения, привитых моделям через обучение с подкреплением (RLVR). Традиционные подходы к «забыванию» (unlearning) часто приводят к деградации общих способностей модели из-за полнопараметрических обновлений. Новый метод позволяет изолировать и корректировать только те веса, которые отвечают за конкретные логические цепочки, минимизируя побочный ущерб для базовых знаний модели. Метод удаления данных из обученных моделей XGBoost arXiv · 17.06.2026 Исследователи представили подход XGBoost-Forget, предназначенный для удаления влияния конкретных записей из уже обученных моделей градиентного бустинга. В отличие от большинства существующих методов машинного обучения, которые ориентированы на нейронные сети и работу с изображениями, данная разработка сфокусирована на табличных данных. Это критически важно для систем обнаружения сетевых вторжений, где оперативное обновление моделей без необходимости их полного переобучения является ключевым требованием. Геометрия собственных чисел в анализе семантических атак на ИИ arXiv · 17.06.2026 Исследователи представили новый теоретический подход к изучению уязвимостей моделей классификации, основанный на анализе геометрии собственных чисел. Работа фокусируется на проблеме семантических состязательных атак, при которых незначительные перефразирования текста приводят к изменению предсказаний модели, несмотря на сохранение исходного смысла и близость векторных представлений. Новый метод прунинга для оптимизации Transformer-моделей arXiv · 17.06.2026 Исследователи представили метод Complementary Attention Head Pruning (CAHP), направленный на повышение эффективности архитектуры Transformer. Основная проблема современных LLM заключается в избыточном количестве параметров, что затрудняет их развертывание на устройствах с ограниченными вычислительными ресурсами. Существующие подходы к сжатию моделей часто опираются на градиентный анализ важности весов или стохастическое гейтирование, которые не всегда обеспечивают оптимальный баланс между скоростью работы и качеством генерации. OpenAnt: новый подход к автоматическому поиску уязвимостей в коде с помощью LLM arXiv · 17.06.2026 Исследователи представили OpenAnt — фреймворк для автоматизированного поиска уязвимостей в крупных репозиториях программного обеспечения. Система объединяет возможности больших языковых моделей с методами декомпозиции кода, состязательной верификации и динамического тестирования. Такой подход позволяет преодолеть ограничения традиционных инструментов статического анализа, которые часто выдают избыточное количество ложноположительных срабатываний, и динамических фаззеров, требующих сложной инфраструктуры. Новый метод контроля рисков при обновлении моделей arXiv · 17.06.2026 Исследователи представили подход к созданию локальных сертификатов для оценки прироста риска модели при внесении изменений. Метод позволяет строить двусторонние доверительные интервалы для изменения функции потерь в окрестности текущих параметров модели. Это дает возможность математически обоснованно оценивать, как именно обновление весов повлияет на поведение системы на всей популяции данных, а не только на конкретном проверочном наборе. OrthoReg: новый метод обучения гибридных нейросимвольных моделей arXiv · 17.06.2026 Исследователи представили метод OrthoReg, направленный на улучшение обучения гибридных динамических систем. Такие системы объединяют классические механистические модели, основанные на физических законах, с гибкими нейронными сетями. Традиционный подход к их созданию сталкивается с противоречием: символьные модели обладают высокой интерпретируемостью, но часто слишком упрощают реальные процессы, тогда как нейросетевые методы обеспечивают точность, но остаются «черными ящиками» без физического обоснования. ChronoSurv: новый графовый подход к анализу выживаемости пациентов arXiv · 17.06.2026 Исследователи представили ChronoSurv — фреймворк для анализа выживаемости пациентов с онкологическими заболеваниями головы и шеи. В отличие от традиционных моделей, которые рассматривают медицинские данные как статический набор признаков, этот метод учитывает временную динамику клинического пути пациента. Система использует графовые нейронные сети для интеграции разнородных данных, включая результаты визуализации, лабораторные показатели и анамнез, что позволяет точнее прогнозировать развитие болезни. Датасет Urdu Katib для распознавания рукописного текста на урду arXiv · 17.06.2026 Исследователи представили Urdu Katib — новый специализированный датасет для обучения систем распознавания рукописного текста (HTR) на языке урду. Работа направлена на преодоление дефицита данных для языков с курсивным начертанием, которые традиционно считаются сложными для автоматической обработки из-за особенностей соединения символов и высокой вариативности почерка. Метод INDEQS для прогнозирования временных рядов на графах arXiv · 17.06.2026 Исследователи представили новый метод прогнозирования временных рядов — Informed Neural controlled Differential EQuationS (INDEQS). Он расширяет возможности нейронных управляемых дифференциальных уравнений (NCDE), которые традиционно используются для анализа непрерывных данных во времени. В отличие от стандартных подходов, где пространственная структура графа вычисляется исключительно на основе данных, INDEQS позволяет интегрировать априорно известные знания о направленной структуре связей. Алгоритм Pareto Q-Learning для многокритериального обучения с подкреплением arXiv · 17.06.2026 Исследователи представили новый алгоритм Pareto Q-Learning with Reward Machines (PQLRM), предназначенный для решения задач обучения с подкреплением в условиях сложной структуры вознаграждений. Метод объединяет принципы Pareto Q-Learning, позволяющие аппроксимировать фронт Парето для векторных оценок Q-функций, с возможностями Reward Machines, которые позволяют декомпозировать задачи на основе формальных спецификаций. Эквивариантные графовые нейросети ускоряют поиск новых материалов arXiv · 17.06.2026 Исследователи представили новый подход к прогнозированию оптических спектров материалов с использованием эквивариантных графовых нейронных сетей. Традиционные суррогатные модели часто ограничены использованием скалярных признаков, инвариантных к поворотам, что снижает точность описания геометрических свойств молекулярных структур. Применение эквивариантных архитектур позволяет нейросети учитывать пространственную ориентацию атомов и связей, значительно повышая выразительность модели при анализе сложных физических систем. Giskard: новый метод безопасного децентрализованного обучения моделей arXiv · 17.06.2026 Исследователи представили Giskard — протокол для децентрализованного машинного обучения, который решает проблему одновременного обеспечения конфиденциальности данных и защиты от вредоносных узлов. В распределенных системах клиенты обучают модели локально, обмениваясь параметрами или градиентами с соседями. Традиционные подходы часто сталкиваются с конфликтом: методы защиты приватности, такие как дифференциальная приватность или шифрование, затрудняют выявление «византийских» атак, при которых участники сети намеренно передают искаженные данные для саботажа обучения. Новый метод обучения мультимодальных моделей через разделение восприятия и рассуждения arXiv · 17.06.2026 Исследователи представили метод обучения мультимодальных моделей, который решает проблему «коротких путей» при использовании самодистилляции. Традиционный подход, при котором модель обучается на собственных результатах с опорой на эталонные данные, часто приводит к тому, что мультимодальные системы игнорируют визуальный контекст, полагаясь исключительно на текстовые подсказки. Новый алгоритм разделяет процессы восприятия изображения и логического рассуждения, что заставляет модель учитывать визуальные признаки как равноправный источник информации. Применение XAI для анализа европейского рынка электроэнергии arXiv · 17.06.2026 Исследователи представили подход к интерпретации глубоких нейронных сетей, используемых для прогнозирования цен на электроэнергию в Европе. Несмотря на высокую точность нейросетевых моделей в предсказании рыночных колебаний, их «черный ящик» затрудняет понимание факторов, влияющих на ценообразование. Авторы работы применили методы объяснимого искусственного интеллекта (XAI) для декомпозиции сложных нелинейных зависимостей, характерных для энергетических систем. Новый подход к обучению стратегий с распределенными результатами arXiv · 17.06.2026 Исследователи представили метод Wasserstein Policy Learning, предназначенный для обучения стратегий в условиях, когда результатом воздействия является не скалярное значение, а целое распределение вероятностей. Традиционные подходы к причинно-следственному выводу обычно фокусируются на максимизации среднего ожидаемого эффекта, что ограничивает возможности анализа в сложных системах, где важно учитывать вариативность и риски, а не только средний показатель. Next-Latent Prediction Transformers: компактные мировые модели Hacker News · 17.06.2026 Исследователи представили новый подход к созданию мировых моделей — Next-Latent Prediction Transformers (NLP-T). В отличие от традиционных моделей, NLP-T используют компактные представления, что позволяет значительно снизить вычислительные затраты при сохранении высокой точности. Новый метод оценки обобщающей способности моделей через PAC-Bayes arXiv · 17.06.2026 Исследователи представили новый подход к дерандомизации PAC-Bayes оценок для функций потерь с высокой степенью гладкости. Традиционные методы оценки обобщающей способности моделей часто опираются на вероятностные предсказатели, что затрудняет их прямое применение к детерминированным алгоритмам. Авторы работы предлагают математический аппарат, позволяющий переносить теоретические гарантии с ансамблей типа Gibbs на конкретные детерминированные модели, используя свойства гладкости функции потерь и класса предсказателей. ProductConsistency: новый метод сохранения идентичности объектов при редактировании изображений arXiv · 17.06.2026 Исследователи представили метод ProductConsistency, направленный на решение проблемы потери деталей при редактировании изображений с помощью текстовых инструкций. Современные модели часто искажают ключевые характеристики товаров, такие как брендинг, специфические элементы дизайна и текстовые надписи, когда пользователь запрашивает изменение фона или окружения. Новый подход позволяет сохранять визуальную идентичность продукта, что критически важно для коммерческого использования ИИ в маркетинге и электронной коммерции. Новый подход к моделированию динамических систем через явные структуры arXiv · 17.06.2026 Исследователи представили альтернативный подход к обучению динамических систем, который отходит от использования универсальных нелинейных аппроксиматоров. Вместо наращивания сложности нейронных сетей для захвата сложных паттернов, авторы предлагают архитектуру, где моделирующая способность системы определяется её внутренней структурой. Такой метод позволяет эффективнее описывать поведение динамических процессов, опираясь на математически обоснованные взаимодействия, а не на избыточную нелинейность. Укрепление киберфизических систем с помощью обучения с подкреплением arXiv · 17.06.2026 Исследователи проанализировали эффективность контроллеров на базе обучения с подкреплением (Reinforcement Learning, RL) в нелинейных системах, подверженных внешним кибератакам. В работе рассматриваются сценарии с внедрением ложных данных и атаками типа «отказ в обслуживании» (DoS), которые представляют серьезную угрозу для критической инфраструктуры и автоматизированных производственных процессов. Новый метод адаптивного кодирования речи для импульсных нейронных сетей arXiv · 17.06.2026 Исследователи представили метод адаптивного кодирования аудиосигналов для импульсных нейронных сетей (SNN). Основная проблема существующих систем заключается в несовпадении непрерывных акустических данных и дискретной природы импульсной обработки. Традиционные подходы используют фиксированные энкодеры, из-за чего нейросети вынуждены компенсировать неоптимальное представление входных данных, что снижает эффективность распознавания речи.