Машинное обучение
BLITZ: быстрый непараметрический тест на условную независимость
Учёные представили новый метод BLITZ (Broad-to-Local Independence Testing via residualiZation) для быстрого непараметрического тестирования условной независимости. Он решает проблему калибровки, которая часто возникает у существующих методов при нелинейных зависимостях между переменными и условиями.
Новый метод обучения ИИ в распределённых системах
Исследователи представили новый подход к обучению машинных моделей в распределённых системах, учитывающий изменения данных во времени и пространстве. Метод C2FL (Clustered Continual Federated Learning) позволяет узлам системы обучаться на локальных данных, сохраняя приватность и адаптируясь к изменениям в окружающей среде.
Новый подход к обработке паддинга в языковых моделях
Исследователи предложили новый метод VoidPadding для языковых моделей, основанных на диффузии (MDLMs). В текущих моделях токен [EOS] выполняет двойную роль: он и завершает смысл, и используется для паддинга. Это усложняет обучение и снижает качество генерации текста.
Новый метод прогнозирования временных рядов с учётом межканальных корреляций
Исследователи предложили новый подход к прогнозированию временных рядов, который учитывает межканальные корреляции. В статье, опубликованной на arXiv, авторы утверждают, что существующие модели часто игнорируют взаимосвязи между различными каналами данных, что приводит к менее точным прогнозам.
Исследование: дифференциальная приватность в гауссовых процессах
Учёные изучили вопрос приватности при публикации выборок из гауссовых процессов (GP), когда весь обучающий набор данных, включая ковариаты и ответы, является конфиденциальным. В отличие от стандартных механизмов дифференциальной приватности (DP), которые добавляют внешний шум, выборка из постереориорного распределения случайна по своей природе.
Новый метод улучшает восстановление 3D МРТ-изображений
Исследователи предложили новый подход к восстановлению 3D МРТ-изображений, который сначала восстанавливает семантику, а затем генерирует изображения. Это позволяет значительно улучшить качество синтеза при работе с многоконтрастной магнитно-резонансной томографией (МРТ).
SegDINO: новый метод улучшения сегментации медицинских изображений
Исследователи предложили новый подход SegDINO для повышения эффективности сегментации медицинских изображений. Он основан на модели DINO, которая уже известна своими мощными визуальными представлениями, но её применение для сегментации оставалось сложным.
Новый метод дообучения моделей речи для специфичных задач
Исследователи предложили новый подход к дообучению foundation-моделей речи, которые изначально обучаются на больших объёмах неразмеченных данных. Такие модели создают универсальные представления, полезные для разных задач, но при этом кодируют информацию о ключевых переменных речи распределённо. Это означает, что для конкретных задач требуется только часть этой информации.
Исследование устойчивости позиционного кодирования на основе сходства
Учёные изучили устойчивость similarity-based positional encoding (simPE) — метода, который использует парные отношения для представления позиционной структуры в трансформерах. Исследование показало, что simPE демонстрирует высокую устойчивость к вращениям, что делает его более гибким по сравнению с традиционными методами, такими как абсолютное и синусоидальное кодирование.
Новый метод улучшает сегментацию медицинских изображений без меток
Исследователи предложили новый подход к сегментации медицинских изображений в условиях нехватки аннотированных данных. В статье на arXiv представлен метод, который использует цепочки рассуждений (Chain of Thought, CoT) для улучшения семисупервизорного обучения.
Инициализация параметров влияет на способности LLM
Исследователи из MIT и других университетов выяснили, что инициализация параметров в больших языковых моделях (LLM) играет ключевую роль в их обучении и конечных способностях. В статье, опубликованной на arXiv, авторы утверждают, что уменьшение масштаба инициализации параметров улучшает предобучение моделей.
Новая библиотека KANLib для обучения нейросетей на основе KAN
Исследователи представили KANLib — модульную и масштабируемую библиотеку для работы с Kolmogorov-Arnold Networks (KAN). Эти сети используют обучаемые унивариантные функции вместо линейных весов, что делает их более интерпретируемыми и выразительными по сравнению с традиционными multilayer perceptrons (MLP).
Новый подход к улучшению планирования в Vision-Language-Action моделях
Исследователи предложили новый метод PearlVLA для улучшения планирования в Vision-Language-Action (VLA) моделях. Текущие VLA-модели сталкиваются с компромиссом между эффективностью генерации действий и явным планированием. Прямое декодирование действий из представлений визуально-языкового бэкенда обеспечивает низкую задержку, но явное планирование через текстовые цепочки или поиск действий увеличивает задержку и вычислительные затраты.
Новый метод для улучшения поиска информации в вектоных БД
Исследователи предложили новый подход к поиску информации в вектоных базах данных. В традиционных системах ретриева документы оцениваются по внутреннему произведению их векторных представлений, но этот метод не учитывает контекст других документов.
Исследование: как устранить избыточное рассуждение в LLM
Учёные изучили проблему избыточного рассуждения (overthinking) в языковых моделях, когда они продолжают генерировать ненужные шаги после нахождения правильного ответа. Это явление особенно заметно в задачах, требующих длинных цепочек рассуждений (chain-of-thought reasoning).
Как модульная архитектура влияет на непрерывное обучение
Исследователи изучили, как модульная архитектура, сходство задач и размерность представлений влияют на непрерывное обучение в системах композиционного обучения. В статье, опубликованной на arXiv, рассматривается баланс между пластичностью и стабильностью при выполнении последовательных задач в парадигме A-B-A.
Исследование монотонных нейросетей на основе теоремы Колмогорова-Арнольда
Учёные представили исследование монотонных нейросетей, основанных на теореме Колмогорова-Арнольда. Монотонность — это свойство, при котором выходные данные модели изменяются в одном направлении при изменении входных данных. Это важно в задачах, где такие зависимости известны заранее, например, в экономике или науке.
Как графовые нейросети соотносятся с логическими формализмами
Исследователи изучили связь между графовыми нейросетями (GNN) и логическими формализмами. Они показали, что при определённых архитектурных выборах, таких как функции агрегации, комбинации и активации, GNN могут быть эквивалентны логическим формулам.
Новый подход к распознаванию таблиц в мультизадачном режиме
Исследователи предложили новый метод для распознавания таблиц, который объединяет три задачи: предсказание структуры таблицы, локализацию ячеек и распознавание содержимого ячеек. В отличие от традиционных подходов, которые используют авторегрессивные декодеры, новый метод применяет порядково-независимые представления на уровне ячеек. Это позволяет избежать проблем, связанных с авторегрессивным генерацией, где порядок обработки ячеек может влиять на качество распознавания.
Moebius: легковесная модель для ретуши изображений с качеством уровня 10B-моделей
Исследователи представили Moebius — компактную нейросетевую архитектуру для задачи заполнения пропущенных областей на изображениях (inpainting). Несмотря на крайне малый размер в 0,2 млрд параметров, модель демонстрирует качество генерации, сопоставимое с крупными решениями класса 10B. Разработка оптимизирована для эффективной работы в условиях ограниченных вычислительных ресурсов, сохраняя при этом высокую детализацию и структурную целостность восстанавливаемых фрагментов.
Почему переобучение в нейросетях работает лучше ожиданий
Учёные из EPFL провели исследование, чтобы разобраться в феномене переобученности нейросетей. Оказалось, что переобученные модели часто показывают лучшие результаты, чем ожидалось. Это противоречит традиционным представлениям о том, что переобучение ведёт к ухудшению качества модели.
Meta-Attention: новый подход к архитектуре нейросетей
Исследователи предложили концепцию Meta-Attention, которая может стать важным шагом в развитии архитектур нейросетей. В отличие от традиционного механизма внимания, который фокусируется на конкретных элементах данных, Meta-Attention позволяет модели динамически адаптировать свои параметры внимания в зависимости от контекста. Это может значительно улучшить способность моделей обрабатывать сложные и разнообразные задачи, что особенно важно для ИИ-агентов, которым требуется гибкость и адаптивность.
LEAF-X: новый фреймворк для объяснения работы трансформеров в ASR
Исследователи из MIT и других университетов представили LEAF-X — фреймворк для объяснения работы трансформерных моделей автоматического распознавания речи (ASR), таких как Whisper. Эти модели демонстрируют высокую точность, но их предсказания остаются «чёрными ящиками». Существующие методы объяснения ИИ (XAI) часто страдают от несоответствия между объяснениями и реальной работой модели, а также от отсутствия точной временной привязки.
Трансформеры для решения уравнений на сложных геометриях
Исследователи из MIT и других ведущих университетов представили новый подход к использованию трансформеров для решения задач, связанных с дифференциальными уравнениями на сложных геометриях. Традиционные методы, основанные на нейронных операторах, ограничены фиксированным размером области, что затрудняет их применение в реальных сценариях, где размеры могут варьироваться.