Машинное обучение
BaKron: новый метод квантования нейросетей через аппроксимацию Гессиана
Исследователи представили BaKron — метод эффективного квантования нейронных сетей, использующий аппроксимацию Гессиана в форме произведения Кронекера. В отличие от стандартных алгоритмов типа GPTQ, которые опираются преимущественно на входные активации, новый подход учитывает корреляции между выходными координатами. Это позволяет значительно повысить точность сжатых моделей при сохранении высокой вычислительной эффективности процесса квантования.
Surv-IPTB: новая модель на базе внимания для оценки эффективности лечения
Исследователи представили Surv-IPTB — фреймворк на основе механизмов внимания для оценки индивидуальной вероятности пользы от лечения (IPTB) в задачах анализа выживаемости. Модель напрямую вычисляет вероятность того, что конкретный пациент получит преимущество в продолжительности жизни при назначении терапии по сравнению с контрольной группой, преобразуя задачу в формат бинарной классификации.
OTLesMix: новый метод синтеза медицинских изображений для обучения нейросетей
Исследователи представили метод OTLesMix, использующий барицентры Вассерштейна и карты оптимального транспорта для генерации синтетических поражений на медицинских снимках. Технология позволяет создавать разнообразные по форме и локализации патологии, что значительно улучшает качество аугментации данных и повышает точность сегментации в глубоком обучении при работе с ограниченными наборами медицинских изображений.
Разработка компактной модели для распознавания бангладешского жестового языка
Исследователи представили новый датасет RSBdSL38 и легковесную модель для распознавания бангладешского жестового языка (BdSL). Решение ориентировано на работу непосредственно на пользовательских устройствах, что делает технологию доступной для людей с нарушениями слуха. В отличие от предыдущих систем, проект опирается на верифицированные экспертами данные и оптимизированную архитектуру, пригодную для мобильного инференса.
Оптимизация ранней остановки для классификации смесей Гаусса
Исследователи представили математическое обоснование эффективности ранней остановки (early stopping) при обучении моделей на перепараметризованных данных. В задачах классификации смесей Гаусса стандартный градиентный спуск на логистической функции потерь часто приводит к переобучению и субоптимальным результатам. Авторы доказали, что своевременная остановка процесса позволяет достичь минимаксной оптимальности, исправляя искажения, вызванные неявным смещением классификаторов с максимальным зазором.
Метод DASH улучшает обучение моделей рассуждения через адаптивную дистилляцию
Исследователи представили метод DASH (Divergence-Adaptive Supervision Horizons), оптимизирующий процесс обучения моделей рассуждения с помощью он-полиси самодистилляции. Новый подход решает проблему разреженности сигналов вознаграждения, динамически адаптируя горизонт надзора в зависимости от расхождения между студентом и учителем. Это позволяет эффективно использовать плотные токеновые сигналы, повышая точность логических выводов модели.
PRISM: новый метод генеративного перевода изображений без парных данных
Исследователи представили PRISM — фреймворк на базе flow-matching для перевода изображений без использования парных обучающих выборок. В отличие от диффузионных моделей, применяющих глобальные параметры шума, PRISM использует механизм распределенного управления (distribution-gated), позволяющий точечно разделять сохраняемый контент и изменяемые визуальные атрибуты, что значительно повышает точность и управляемость генерации в задачах unpaired image-to-image translation.
Почему средние значения обманчивы: байесовский вывод и алгоритм Томпсона
Стандартное усреднение рейтингов часто искажает реальную картину, особенно при малом количестве данных. Использование байесовского вывода и алгоритма Томпсона позволяет эффективнее решать задачи выбора, балансируя между исследованием новых вариантов и использованием проверенных решений. Этот подход минимизирует риск принятия неверных выводов на основе статистически незначимых выборок, что критически важно для рекомендательных систем и агентных сред.
TS-RAG: применение RAG для прогнозирования временных рядов
Исследователи представили TS-RAG — метод адаптации архитектуры Retrieval-Augmented Generation для задач прогнозирования временных рядов. В отличие от стандартных LLM, где RAG работает с текстовыми корпусами, TS-RAG извлекает исторически схожие паттерны из базы данных временных рядов. Это позволяет моделям, включая трансформеры, точнее учитывать долгосрочные зависимости и аномалии, повышая общую точность предсказаний на сложных наборах данных.
Обучение роботов через имитацию человеческих движений
Исследователи представили новый подход к обучению роботов через демонстрации, фокусируясь на воспроизведении рукописных траекторий алфавита. Метод позволяет роботам осваивать сложные моторные навыки, имитируя человеческую динамику без необходимости ручного программирования. Основной акцент сделан на достижении высокой степени «человекоподобности» движений, что критически важно для формирования доверия и естественного взаимодействия между человеком и машиной в рабочих процессах.
Новый метод точного обновления для оптимизатора Muon на многообразии Штифеля
Исследователи представили математическое решение для оптимизатора Muon, позволяющее выполнять точное обновление матриц с ортонормированными столбцами на многообразии Штифеля. В отличие от существующих эвристических или итерационных подходов, новый метод использует аналитическую формулу в замкнутом виде. Это значительно повышает вычислительную эффективность при обучении нейронных сетей, где подобные структуры матриц встречаются повсеместно.
Новый метод RLCP для повышения точности предсказаний моделей
Исследователи представили метод Randomly Localized Conformal Prediction (RLCP), решающий проблему локальной неточности в стандартных алгоритмах конформного прогнозирования. В отличие от классических подходов, которые обеспечивают лишь общее покрытие, RLCP калибрует предсказания вблизи конкретной тестовой точки, сохраняя при этом строгие гарантии достоверности и снижая риск ошибок для специфических подмножеств данных.
EnvACE: метод обучения ИИ-агентов через внутреннее моделирование среды
Исследователи представили EnvACE — метод обучения агентных систем, который заменяет взаимодействие с внешними средами или сложными симуляторами на «репетицию мира» (world rehearsal). Подход позволяет LLM-агентам эффективно осваивать долгосрочное использование инструментов, обучаясь на внутренних динамических моделях среды, что значительно снижает затраты на создание и верификацию инфраструктуры для тренировки агентов.
Новый метод обработки пропущенных данных в вероятностных регрессионных деревьях
Исследователи представили новый подход к работе с пропусками в данных для вероятностных регрессионных деревьев (PRTrees). Метод позволяет интегрировать обработку отсутствующих значений непосредственно в процесс построения дерева, исключая необходимость предварительной импутации. Предложенные стратегии используют вероятностные назначения разбиений, что обеспечивает консистентность прогнозов и повышает точность моделей при работе с неполными наборами данных в задачах регрессии.
SAGA: новый метод оптимизации LLM для языков с ограниченными ресурсами
Исследователи представили SAGA (Score-weighted Adaptive Generation Alignment) — фреймворк для оптимизации предпочтений в больших языковых моделях, который не требует дорогостоящей разметки данных человеком. Метод использует парсеры для оценки генерации, что позволяет эффективно адаптировать модели для морфологически сложных языков с малым объемом обучающих данных, где традиционные методы обучения с подкреплением на основе отзывов людей (RLHF) практически неприменимы.
Оптимизация вычислений в бинарных нейронных сетях через раннюю остановку
Исследователи представили метод ранней остановки накопления (early stopping of accumulations) для бинарных нейронных сетей, позволяющий сократить количество операций при инференсе. Вместо полного вычисления суммы всех входных данных нейрон прекращает накопление, как только промежуточный результат достигает определенного порога, что существенно снижает энергопотребление и вычислительную нагрузку без значительной потери точности модели.
Фреймворк для иерархического извлечения данных из неструктурированных текстов
Исследователи представили новый фреймворк для извлечения сложных иерархических данных из неструктурированных документов с помощью генеративного ИИ. Система использует схему-модель для кодирования доменных знаний, что обеспечивает консистентность извлечения вложенных структур. Метод включает автоматизированную семантическую оценку результатов, позволяя сопоставлять полученные данные с эталонными стандартами для повышения точности обработки информации.
iARCS: итеративное обучение с подкреплением для генерации 3D-сцен
Исследователи представили iARCS — метод итеративного агентного обучения с подкреплением для создания 3D-сцен. В отличие от традиционных генераторов, ориентированных только на визуальный реализм, iARCS учитывает функциональные ограничения, такие как проходимость пространства и соблюдение пространственных правил. Это позволяет создавать синтетические данные, пригодные для обучения систем компьютерного зрения и воплощенного ИИ, где критически важна физическая корректность окружения.
Новый критерий регулярности для операторов условного математического ожидания
Исследователи представили математический критерий регулярности для операторов условного математического ожидания (CEO) и соответствующих им вложений условного среднего (CME). Работа решает фундаментальную проблему отображения функциональных пространств, что критически важно для точности непараметрической регрессии, байесовских обратных задач и теории операторов Купмана, обеспечивая теоретическую базу для более стабильных алгоритмов машинного обучения.
CogVis: новый подход к обнаружению изменений на снимках земной поверхности
Исследователи представили CogVis — архитектуру для обнаружения изменений на спутниковых снимках, работающую с произвольными семантическими категориями. В отличие от традиционных методов, которые объединяют временное восприятие, семантическую классификацию и верификацию регионов в единый процесс, CogVis разделяет эти задачи. Это позволяет снизить вычислительную избыточность и повысить стабильность результатов при анализе динамики земной поверхности по текстовым запросам.
PaDoc: новый метод параллельного декодирования для анализа документов
Исследователи представили PaDoc — метод параллельного декодирования с учетом макета для анализа документов. В отличие от стандартных авторегрессионных моделей, которые сериализуют контент в длинные последовательности, PaDoc позволяет обрабатывать независимые регионы документа одновременно. Это решение устраняет проблему избыточного времени генерации, сохраняя при этом целостный визуальный контекст страницы, что значительно повышает эффективность парсинга сложных документов.
Фундаментальный разбор диффузионных моделей от Лилиан Венг
Диффузионные модели стали основой современных генеративных систем, обеспечивая высокое качество синтеза изображений и видео. В своей классической работе Лилиан Венг подробно разбирает математическую базу этих моделей, объясняя процессы прямого и обратного диффузионного шума, а также связь между вариационными автокодировщиками и методами оценки плотности вероятности, которые лежат в основе обучения нейросетей.
Гайд по компиляторам машинного обучения
Опубликован фундаментальный обзор архитектуры компиляторов для машинного обучения, объясняющий процесс трансформации высокоуровневых моделей в эффективный машинный код. Автор подробно разбирает этапы оптимизации графов вычислений, управления памятью и генерации кода для различных аппаратных ускорителей, что критически важно для производительности современных нейросетей и снижения задержек при инференсе.
Адаптация моделей NVIDIA Nemotron для работы с новогреческим языком
Исследователи представили комплексный подход к адаптации стека NVIDIA Nemotron для новогреческого языка, который ранее отсутствовал в популярных моделях поиска и RAG-бенчмарках. Авторы разработали пайплайн, включающий майнинг корпусов данных, создание синтетической разметки и дообучение моделей, что позволяет эффективно применять RAG-системы в специализированных областях, таких как медицина, финансы, энергетика и юриспруденция.