Машинное обучение
Оценка энтропии в квантовых системах с помощью нейронных сетей
Исследователи представили новый метод оценки энтропии фон Неймана в многокутритных квантовых системах. Работа сравнивает два подхода: использование вариационных квантовых алгоритмов (VQA) и классических сверточных нейронных сетей (CNN). Эксперименты проводились на базе идеального симулятора квантовых вычислений, что позволило исключить влияние шума на результаты.
Роль градиентного шума в обучении нейронных сетей
Исследование механизмов градиентного шума раскрывает его фундаментальное влияние на процесс оптимизации нейронных сетей. В отличие от стандартных представлений о шуме как о помехе, современные подходы рассматривают его как инструмент, помогающий моделям преодолевать локальные минимумы в процессе обучения. Использование контролируемых возмущений позволяет алгоритмам градиентного спуска эффективнее исследовать ландшафт функции потерь, что способствует нахождению более устойчивых и обобщающих решений.
Использование неявных сигналов пользователя для дообучения LLM
Исследователи представили новый подход к дообучению больших языковых моделей, основанный на анализе неявных действий пользователей. Традиционные методы настройки моделей опираются на явную обратную связь, такую как оценки «нравится» или «не нравится», что требует значительных затрат на сбор данных и встречается крайне редко. Новый метод предлагает использовать для обучения данные о поведении пользователя в интерфейсе, включая движения мыши, траекторию взгляда и время взаимодействия с контентом.
Новый взгляд на теорию плоских минимумов в глубоком обучении
Исследователи поставили под сомнение устоявшееся в глубоком обучении представление о том, что стохастический градиентный спуск (SGD) естественным образом стремится к «плоским» минимумам функции потерь, которые обеспечивают лучшую обобщающую способность нейросетей. Основная проблема заключается в том, что традиционные метрики оценки плоскости, такие как след или максимальное собственное значение гессиана, зависят от конкретной параметризации модели. Это означает, что при изменении представления весов, не влияющем на итоговую функцию сети, показатели «плоскости» могут меняться, что делает их ненадежными инструментами для анализа.
Новый подход к устранению предвзятости в моделях машинного обучения
Исследователи представили методологию борьбы с предвзятостью в алгоритмах, которая учитывает пересечение нескольких защищаемых атрибутов, таких как раса и гендер. Традиционные методы часто не справляются с ситуациями, когда дискриминация проявляется только при сочетании нескольких факторов, что приводит к снижению точности моделей для определенных групп населения. Основная проблема заключается в нехватке репрезентативных данных для таких подгрупп и отсутствии четких математических метрик для оценки справедливости.
Новый метод управления генерацией речи через классификаторы
Исследователи представили метод оптимизации генерации речи с помощью диффузионных моделей, который позволяет отказаться от обучения специализированных классификаторов для управления процессом. Традиционный подход к направленной генерации (classifier guidance) требует одновременного использования двух отдельных моделей: диффузионной и классификатора, обученного на зашумленных данных. Это усложняет архитектуру и увеличивает вычислительные затраты при развертывании систем синтеза.
SSH-Net: нейросетевой подход к прогнозированию отказов оборудования
Исследователи представили архитектуру SSH-Net, предназначенную для прогнозирования распределения времени до отказа систем в условиях конкурирующих рисков. Метод адаптирован для сложных инженерных сценариев, где на работоспособность оборудования одновременно влияют несколько независимых факторов, что затрудняет классическое моделирование событий.
Топологический анализ данных для мониторинга динамических процессов
Исследователи представили новый метод мониторинга сложных динамических процессов, основанный на сочетании топологического анализа данных (TDA) и машинного обучения. Подход предназначен для обработки многомерных временных рядов в режиме реального времени, где традиционные статистические методы часто теряют значимые закономерности из-за высокой размерности данных.
Оптимизация гиперпараметров в физически информированных нейросетях
Исследователи представили новый подход к обучению физически информированных нейронных сетей (PINNs), предназначенных для решения дифференциальных уравнений в частных производных. Основная сложность таких моделей заключается в нестабильной сходимости и высокой чувствительности к выбору гиперпараметров, что вызвано невыпуклой структурой функции потерь, включающей множество физических ограничений.
Новый датасет CATCH-ME для борьбы с ненавистью и дезинформацией в ИИ
Исследователи представили датасет CATCH-ME (Contextually Annotated multi-Turn Counterspeech), предназначенный для улучшения навыков языковых моделей в противодействии враждебным высказываниям и дезинформации. Проблема текущих систем заключается в том, что при работе в режиме zero-shot модели часто выдают шаблонные, расплывчатые или повторяющиеся ответы, которые неэффективны в реальных диалогах. Новый набор данных сфокусирован на многоходовых контекстных ответах, что позволяет лучше обучать ИИ-агентов вести аргументированную дискуссию.
Децентрализованный алгоритм локализации для групп мобильных роботов
Исследователи представили новый метод координации групп мобильных роботов, который позволяет им определять свое местоположение относительно друг друга без использования внешней инфраструктуры, такой как GPS или заранее установленные маяки. Алгоритм опирается исключительно на данные измерений дальности между участниками группы, что делает его пригодным для развертывания в неструктурированных и динамически меняющихся условиях.
Автоматическая оптимизация 3D-генерации с помощью VLM-судьи
Исследователи представили новый метод улучшения качества генерации 3D-объектов по одному изображению. В основе подхода лежит использование мультимодальной языковой модели (VLM) в качестве автоматического судьи, который оценивает и ранжирует качество создаваемых мешей. Традиционные метрики, такие как CLIP или упрощенные геометрические прокси, часто оказываются недостаточно точными для оценки сложных 3D-структур, поэтому новая система предлагает более надежный способ фильтрации результатов.
Сравнение методов дообучения и RAG для юридических задач
Исследователи проанализировали эффективность различных подходов к работе с узкоспециализированными правовыми документами на примере закона Онтарио о жилой аренде (RTA). В рамках эксперимента сравнивались четыре стратегии: чистое дообучение (fine-tuning) моделей, использование систем поиска информации (RAG), комбинация этих методов и базовые модели без дополнительной подготовки. Целью работы было определить наиболее надежный способ получения точных ссылок на законодательные акты для арендаторов и арендодателей.
Исследование снижения дисперсии в обучении с подкреплением
Исследователи проанализировали математические свойства метода временных различий (Temporal Difference, TD) в обучении с подкреплением. В работе рассматривается поведение алгоритма в табличной постановке задачи и выявляется ключевой механизм, позволяющий методу эффективно снижать дисперсию при оценке функций ценности. Авторы показывают, что TD-обучение достигает этого за счет агрегации данных по большему числу независимых траекторий, что делает его более устойчивым по сравнению с классическими методами Монте-Карло.
Новый алгоритм Q-обучения для управления в условиях неопределенности
Исследователи представили алгоритм робастного Q-обучения, предназначенный для решения задач управления средним полем (mean-field control) в дискретном времени. Метод ориентирован на работу в условиях неопределенности, описываемой метрикой Вассерштейна для закона общего шума. Это позволяет моделям сохранять стабильность и эффективность даже при наличии непредсказуемых внешних факторов, влияющих на динамику системы.
Квантовые коммуникации для распределенного обучения нейросетей
Исследователи представили новый метод оптимизации распределенного обучения моделей, основанный на принципах квантовых коммуникаций. В центре внимания оказался алгоритм Ring All-Reduce, который является стандартом для синхронизации градиентов между узлами при обучении нейросетей на кластерах. Использование квантовых каналов связи позволяет существенно снизить объем передаваемых данных между вычислительными узлами, сохраняя при этом высокую точность синхронизации параметров.
Гибридные квантово-классические сети KAN для решения дифференциальных уравнений
Исследователи представили QCPIKAN — первую архитектуру, объединяющую сети Колмогорова-Арнольда (KAN) с квантовыми вычислениями для решения дифференциальных уравнений в частных производных (PDE). В основе метода лежат слои на базе полиномов Чебышева, интегрированные с параметризованными квантовыми схемами. Такой подход позволяет использовать преимущества квантовых вычислений для аппроксимации сложных функций, сохраняя при этом гибкость классических нейронных сетей.
Модельно-ориентированный подход к созданию сред для обучения с подкреплением
Исследователи представили новый подход к разработке виртуальных сред, предназначенных для обучения агентов с подкреплением (RL). Традиционно создание таких систем требует значительных затрат времени, так как для успешной сходимости алгоритмов агентам необходимо тренироваться в множестве схожих, но вариативных условий. Авторы работы предлагают использовать модельно-ориентированную методологию, которая позволяет автоматизировать генерацию семейств сред, сохраняя при этом их функциональную близость.
Новый метод обучения систем диагностики неисправностей при дефиците данных
Исследователи представили новый подход к проектированию интеллектуальных систем диагностики неисправностей (IFDS), основанный на анализе вибрационных сигналов. Традиционные методы глубокого обучения с переносом (Deep Transfer Learning) требуют значительных объемов размеченных данных, что создает серьезные препятствия при мониторинге технического состояния промышленного оборудования. В условиях реальной эксплуатации получение больших выборок с описанием поломок часто затруднено или экономически невыгодно.
Физический подход к пониманию обучения и обобщения нейросетей
Исследователи представили работу, анализирующую принципы работы глубокого обучения через призму статистической физики. Авторы отмечают, что современные нейронные сети часто демонстрируют поведение, противоречащее классическим статистическим моделям, что требует пересмотра фундаментальных представлений о процессе обучения и способности моделей к обобщению на новых данных.
Новый метод оптимизируемых линейных релаксаций для функций активации
Исследователи представили новый подход к формальной верификации нейронных сетей, основанный на использовании оптимизируемых линейных релаксаций для функций активации. Традиционные методы верификации, критически важные для обеспечения безопасности моделей в ответственных областях, часто требуют создания специализированных релаксаций вручную для каждой функции активации. Это ограничивает масштабируемость и затрудняет адаптацию к современным архитектурам.
PsyScore: адаптивная система оценки эссе с учетом психометрических данных
Исследователи представили фреймворк PsyScore, объединяющий автоматическую проверку эссе с персонализированной обратной связью. В отличие от традиционных моделей, которые разделяют процесс выставления оценки и написание комментариев, новая система использует психометрические подходы для адаптации к уровню подготовки конкретного учащегося. Это позволяет модели не просто выставлять баллы, но и формировать рекомендации, соответствующие зоне ближайшего развития (ZPD) студента.
Новый метод обучения графовых нейросетей для повышения точности классификации
Исследователи представили метод Boundary Embedding Shaping, направленный на решение проблемы структурной запутанности в графовых нейронных сетях (GNN). Основная сложность при работе с графами заключается в том, что модели часто агрегируют информацию от семантически нерелевантных соседей, что приводит к зашумлению векторных представлений узлов. Особенно остро эта проблема проявляется для узлов, расположенных вблизи границ классов, где структурный шум размывает границы принятия решений и снижает общую точность классификации.
Фреймворк Lagrange для автономного вождения в открытых средах
Исследователи представили Lagrange — новый подход к созданию систем автономного вождения, основанный на энергетических моделях и разреженных вычислениях. В отличие от традиционных плотных сетей, таких как сетки заполнения (occupancy networks), которые требуют значительных вычислительных мощностей для обработки геометрических данных, Lagrange фокусируется на эффективности представления пространства. Это позволяет модели лучше адаптироваться к нестандартным дорожным ситуациям и редким сценариям, с которыми сложно справляться классическим алгоритмам.