Машинное обучение
Локальное шумоподавление голоса на устройствах
Компания Duration AI представила технологию для очистки аудиозаписей от фонового шума, работающую непосредственно на конечном устройстве. Решение позволяет обрабатывать голос в реальном времени без отправки данных на сервер, что обеспечивает высокую конфиденциальность и минимальную задержку. Технология ориентирована на мобильные приложения и системы, где критически важна приватность пользовательских данных и работа в офлайн-режиме.
Adaptive Financial Transformer: новая архитектура для прогнозирования доходности акций
Исследователи представили Adaptive Financial Transformer (AFT) — специализированную архитектуру для прогнозирования доходности акций в условиях нестабильных рынков. В отличие от стандартных трансформеров, модель использует механизм динамического управления вниманием, который адаптируется к текущему рыночному режиму. Это позволяет эффективнее учитывать семантические связи между финансовыми индикаторами и повышать точность предсказаний в меняющейся экономической среде.
Как архитектура Transformer превращается в современную LLM
Статья детально описывает путь трансформации классической архитектуры Transformer, представленной в 2017 году, в современные большие языковые модели. Автор разбирает ключевые изменения в структуре нейросетей, включая переход к декодер-ориентированным архитектурам, оптимизацию механизмов внимания и внедрение методов нормализации, которые позволили моделям эффективно масштабироваться и обучаться на огромных массивах текстовых данных.
AMR: новый метод адаптивной маршрутизации модальностей для идентификации спикеров
Исследователи представили метод Adaptive Modality Routing (AMR), решающий проблемы идентификации спикеров в сложных условиях. Система эффективно работает при неполных данных, фоновом шуме и языковых различиях между этапами обучения и тестирования. Алгоритм динамически переключает приоритеты между аудио- и визуальными модальностями, что позволяет сохранять высокую точность распознавания даже в многопользовательских сценариях с перекрывающейся речью.
Градиентный бустинг с векторными листьями: новый подход к многомерным задачам
Исследователи представили метод градиентного бустинга, использующий векторные значения в листьях деревьев решений вместо традиционных скалярных предсказаний. Этот подход позволяет более эффективно оптимизировать сложные целевые функции, работающие с векторами, что значительно расширяет возможности классических ансамблевых моделей в задачах многоклассовой классификации и других многомерных сценариях, требующих одновременной обработки нескольких зависимых переменных.
Метод SP-CACW для эффективного федеративного обучения
Исследователи представили метод SP-CACW (Convergence-Aware Client Weighting), решающий проблему неэффективности стандартного федеративного обучения для клиентов с уникальными данными. Алгоритм позволяет целевому участнику сети использовать градиенты других узлов для минимизации собственного риска, избегая при этом негативного переноса знаний. Это повышает точность моделей в сценариях, где распределение данных сильно отличается от среднестатистического по всей системе.
Новый метод Process Advantage Signal Shaping для обучения LLM с рассуждениями
Исследователи представили метод Process Advantage Signal Shaping (PASS), направленный на оптимизацию обучения LLM с использованием подкрепления (RL). Новый подход решает проблему нестабильности сигналов при использовании GRPO, позволяя более эффективно интегрировать пошаговые награды (PRM) в процесс обучения моделей, склонных к сложным логическим рассуждениям, что повышает точность итоговых ответов.
Adaptive Block Diffusion решает проблему несовпадения обучения и инференса в DLM
Исследователи представили метод Adaptive Block Diffusion (ABD), направленный на устранение разрыва между обучением и инференсом в диффузионных языковых моделях (DLM). Традиционные модели ограничены фиксированными контекстными структурами, что приводит к деградации качества при работе с произвольными конфигурациями. Новый подход оптимизирует процесс шумоподавления, позволяя моделям эффективно адаптироваться к различным длинам последовательностей и структурам данных вне обучающей сетки.
Проблема большинства в мультиагентных системах: почему консенсус LLM может быть ошибочным
Исследователи выявили критический недостаток в популярных методах мультиагентных дебатов (MAD), где итоговое решение принимается простым большинством голосов. Из-за схожести обучающих данных модели часто совершают идентичные ошибки, что приводит к подавлению верных ответов, предлагаемых меньшинством. Авторы предложили механизм «Minority Sentinel», позволяющий системе распознавать ситуации, когда мнение меньшинства статистически более вероятно является правильным.
Новый метод кластеризации подпространств на основе нелинейных смешанных моделей
Исследователи представили новый подход к кластеризации подпространств (SC), объединив классические линейные модели объединения подпространств (UoS) с нелинейными смешанными моделями (NMM), применяемыми в слепом разделении сигналов. Метод использует аппроксимацию нелинейного отображения через разложение в ряд Тейлора порядка K, что позволяет эффективнее работать с многомерными данными и скрытыми переменными в сложных нелинейных структурах.
Новый метод графовых нейросетей для анализа повреждений в лазерных установках
Исследователи представили архитектуру Confidence-feedback-weighted graph matching network, предназначенную для автоматического сопоставления данных онлайн-мониторинга и офлайн-эталонов в мощных лазерных установках. Система эффективно отличает реальные повреждения оптики от ложных помех, используя механизм взвешенного графового сопоставления, что критически важно для обеспечения безопасности и долговечности высокоэнергетических оптических систем.
Алгоритмическое обучение стратегиям ставок в аукционах с бюджетными ограничениями
Исследователи представили новый подход к автоматизации стратегий ставок в дискриминационных аукционах с учетом бюджетных ограничений. Модель оптимизирует совокупную полезность участника на протяжении T раундов, учитывая стоимость капитала и жесткие лимиты расходов. Решение преодолевает вычислительную сложность экспоненциального пространства действий, предлагая эффективные методы для динамического управления ставками в условиях неопределенности и конкурентной среды.
Прогнозирование волатильности цен на сельхозпродукцию с помощью ML
Исследователи разработали модель машинного обучения для предсказания резких скачков цен на овощи в условиях изолированных рынков на примере Шри-Ланки. Система учитывает специфику цепочек поставок и сезонные циклы выращивания культур, позволяя точнее прогнозировать ценовую нестабильность. Метод помогает минимизировать риски продовольственной безопасности, возникающие из-за локальных сбоев в поставках и отсутствия возможности оперативного импорта товаров.
Оценка априорных распределений данных в табличных foundation-моделях
Исследователи представили методологию для оценки априорных распределений данных (data priors), которые лежат в основе обучения табличных foundation-моделей. Авторы работы анализируют, как именно выбор генеративных распределений при претрейнинге влияет на итоговую производительность моделей, предлагая стандартизированный подход для сравнения различных архитектур и стратегий обучения, что ранее оставалось «черным ящиком» в разработке табличных ИИ-систем.
Оптимизация пайплайна обработки данных Fable 5 Traces для обучения моделей
Опубликовано руководство по созданию стабильного рабочего процесса для работы с датасетом Fable 5 Traces в среде Google Colab. Авторы предлагают метод ручного парсинга JSONL-файлов, который исключает использование хрупких зависимостей. Процесс включает нормализацию вызовов инструментов, аудит структуры данных, удаление конфиденциальной информации и подготовку очищенных наборов данных для обучения базовых моделей.
Исследование теоретических основ алгоритма GRPO в обучении моделей
Исследователи проанализировали алгоритм Group Relative Policy Optimization (GRPO), который исключает использование обученного критика в PPO, заменяя его средним значением наград группы прогонов. Авторы работы доказали, что при использовании только итоговой награды за весь ответ возникает проблема распределения кредита: каждый токен получает одинаковое преимущество, что ведет к деградации обучения на уровне отдельных токенов.
MoPe: новый метод для стабильного 3D-картографирования в динамических сценах
Исследователи представили метод MoPe (Motion Permanence), решающий проблему нестабильности монокулярного Gaussian Splatting SLAM в динамических средах. В отличие от существующих подходов, которые воспринимают движущиеся объекты как кратковременные помехи, MoPe обеспечивает сохранение целостности карты при изменении сцены. Это позволяет роботам сохранять точность локализации и навигации, даже когда объекты в поле зрения перемещаются или временно скрываются.
Оптимизация инференса LLM через адаптивную глубину декодирования
Исследователи представили метод Depth Exploration, оптимизирующий процесс генерации токенов в авторегрессионных моделях. Вместо прогона каждого токена через все слои нейросети, система динамически определяет глубину вычислений, необходимую для уверенного предсказания. Это позволяет существенно сократить вычислительные затраты при сохранении точности, так как многие токены становятся предсказуемыми на промежуточных этапах обработки данных внутри архитектуры модели.
Алгоритм LinMatch для оптимизации взаимодействия людей и роботов
Исследователи представили LinMatch — новый алгоритм на базе линейных многоруких бандитов (linear matching bandit), предназначенный для динамического распределения роботов между группами людей. Метод позволяет системе в режиме реального времени обучаться на неизвестных характеристиках агентов, минимизируя неопределенность и повышая эффективность командной работы в условиях многораундовых задач.
Multi-Block Diffusion: новый подход к параллельной генерации текста
Исследователи представили архитектуру Multi-Block Diffusion (MultiBD), расширяющую возможности диффузионных языковых моделей. В отличие от традиционных подходов, MultiBD позволяет параллельно декодировать последовательные блоки текста, что значительно ускоряет процесс генерации. Метод решает проблему ограничений Single-Block моделей, внедряя эффективную работу с KV-кэшем и обеспечивая гибкость при создании контента переменной длины.
Архитектура и производительность Apple Neural Engine: глубокий разбор
Исследователи опубликовали детальный технический анализ Apple Neural Engine (ANE) — специализированного блока в чипах Apple Silicon, отвечающего за ускорение задач машинного обучения. Работа раскрывает внутреннюю архитектуру процессора, принципы управления памятью и методы оптимизации вычислений, которые позволяют эффективно запускать нейросети непосредственно на устройствах компании, обеспечивая высокую производительность при низком энергопотреблении.
Архитектура трансформеров: разбор для инженеров
Статья предлагает глубокий технический разбор архитектуры трансформеров, ориентированный на практикующих инженеров. Автор детально описывает механизмы внимания (attention), процесс кодирования последовательностей и математическую логику, лежащую в основе современных LLM. Материал помогает понять, как именно модели обрабатывают контекст и почему трансформеры стали стандартом для задач обработки естественного языка.
Новые подходы к обучению моделей на данных только с положительными примерами
Исследователи представили работу, пересматривающую классическую задачу обучения бинарного классификатора на основе данных, содержащих только положительные примеры (Positive-Only Learning). Авторы выявили неожиданные теоретические ограничения и свойства этого метода, которые ранее оставались вне поля зрения, предложив более точную математическую характеристику процесса обучения в условиях отсутствия размеченных отрицательных данных.
Новые теоретические гарантии для алгоритма Bregman ADMM в невыпуклой оптимизации
Исследователи представили анализ алгоритма Bregman ADMM для решения задач невыпуклой оптимизации с линейными ограничениями. Авторы заменили стандартное предположение о липшицевости градиента на условие относительной гладкости, основанное на сравнении гессианов относительно ядра Брегмана. Это позволяет эффективно оптимизировать сложные полиномиальные целевые функции в матричных и тензорных моделях, где глобальная константа Липшица зачастую отсутствует.