Машинное обучение
SignMuon: сжатие обновлений оптимизатора Muon до одного бита
Исследователи представили методы SignMuon и MuonSign, позволяющие сжимать обновления оптимизатора Muon до одного бита на параметр. Этот подход значительно снижает требования к пропускной способности при обучении моделей, сохраняя при этом эффективность оптимизации. Новые методы превосходят стандартный SignSGD, предлагая более производительное решение для матрично-ориентированной оптимизации в условиях жестких ограничений по передаче данных.
GQ-FSL: новый метод обучения нейросетей для энергоэффективных edge-вычислений
Исследователи представили метод GQ-FSL (Green Quantized Federated Split Learning), оптимизирующий обучение глубоких нейронных сетей на мобильных устройствах. Технология сочетает федеративное и разделенное обучение с квантованием данных, что позволяет снизить нагрузку на вычислительные ресурсы и уменьшить объем передаваемой информации между устройствами и серверами, сохраняя при этом высокую точность моделей в условиях ограниченной энергии.
CENDRe: новый метод интерпретируемости CNN для анализа временных рядов
Исследователи представили CENDRe — метод извлечения концептов для сверточных нейронных сетей, работающих с временными рядами. Решение позволяет выявлять ключевые временные и спектральные паттерны в латентном пространстве моделей. Это повышает прозрачность принятия решений нейросетями в критически важных областях, где понимание логики классификации данных имеет решающее значение для безопасности и надежности систем.
Исследование ограничений обучения с подражанием при неполном представлении эксперта
Исследователи проанализировали эффективность обучения с подражанием (Imitation Learning) и выявили фундаментальные компромиссы при использовании методов Behavior Cloning (BC) и on-policy взаимодействия. Работа показывает, почему стандартные подходы часто сталкиваются с накоплением ошибок и плато производительности, особенно в сценариях, где модель не способна идеально воспроизвести стратегию эксперта, что критически важно для дистилляции моделей и робототехники.
WCM: новый подход к обучению VLA-моделей для робототехники
Исследователи представили World Critic Model (WCM) — метод обучения VLA-моделей (Vision-Language-Action), решающий проблему неполной наблюдаемости в робототехнике. В отличие от традиционных подходов, использующих оценку отдельных кадров, WCM интегрирует временную динамику в процесс обучения критика. Это позволяет агентам лучше учитывать контекст последовательностей при выполнении манипуляционных задач, повышая точность управления в сложных условиях.
Метод TOOD для калибровки OOD-детекторов в системах непрерывного обучения
Исследователи представили метод TOOD (Task-Aware Out-of-Distribution), предназначенный для улучшения обнаружения данных вне распределения в системах непрерывного обучения. Алгоритм решает проблему калибровки оценок уверенности модели при последовательном изучении новых задач, позволяя нейросетям точнее определять входные данные, которые не относятся к ранее освоенным доменам, сохраняя при этом стабильность работы на старых задачах.
ARCTIC: новая система для автоматизированного анализа ИИ-кода
Исследователи представили ARCTIC — систему для критического анализа кода, создаваемого ИИ-агентами. В отличие от стандартных инструментов, фокусирующихся на стиле, ARCTIC оценивает корректность, безопасность и производительность изменений. Система помогает масштабировать процесс ревью, отсеивая низкоуровневые правки и позволяя разработчикам сосредоточиться на архитектурных и логических аспектах, что критически важно при массовой генерации кода нейросетями.
Adaptive FastOPD: новый метод ускорения обучения моделей через дистилляцию
Исследователи представили метод Adaptive FastOPD, оптимизирующий процесс on-policy дистилляции (OPD) в обучении языковых моделей. Технология динамически регулирует горизонт развертывания (rollout horizon) в зависимости от прогресса обучения, что позволяет сократить вычислительные затраты, возникающие из-за неравномерной длины ответов модели, и повысить эффективность использования ресурсов при сохранении качества supervision от учительской модели.
Оптимизация нейросетей для сегментации аффордансов на носимых роботах
Исследователи представили метод оптимизации нейросетей для сегментации аффордансов, предназначенный для носимых роботов с ограниченными вычислительными мощностями. Авторы предложили модифицированный декодер, который позволяет сохранять высокую точность распознавания объектов и их функциональных свойств при значительном снижении требований к ресурсам, что критически важно для работы систем компьютерного зрения в режиме реального времени на мобильных устройствах.
MoPET: новый метод эффективного дообучения моделей для медицинской визуализации
Исследователи представили MoPET — метод параметрически эффективного обучения (PEFT) на основе архитектуры Mixture-of-Experts для задач классификации медицинских изображений. Подход позволяет объединять знания из различных диагностических задач в единой модели, избегая переобучения и необходимости создания отдельных адаптеров для каждого типа исследования, что критически важно при работе с ограниченными клиническими данными.
Новый алгоритм для задач с «тяжелыми хвостами» в распределениях
Исследователи представили алгоритм для решения задач многоруких бандитов в условиях распределений с «тяжелыми хвостами» (heavy-tailed). В отличие от классических подходов, новый метод не требует предварительной настройки параметров, что позволяет эффективно оптимизировать принятие решений в средах, где редкие, но экстремальные события оказывают решающее влияние на итоговый результат и общую производительность системы.
Анализ доверительных интервалов в методе Double Machine Learning
Исследователи представили работу по оценке точности метода Double Machine Learning (DML), который широко применяется для анализа причинно-следственных связей. Авторы сравнили аналитические и бутстреп-методы построения доверительных интервалов, чтобы понять, как выбор алгоритмов машинного обучения для оценки мешающих параметров влияет на надежность статистических выводов в прикладных задачах, включая анализ данных о здоровье населения.
Анализ причин превосходства весов GPT-2: роль переобучения
Исследователь Джайлс Томас опубликовал третью часть цикла статей, посвященного сравнению собственных обученных моделей с оригинальными весами GPT-2 от OpenAI. Автор анализирует влияние переобучения (overtraining) на качество генерации текста и перплексию, пытаясь понять, почему официальные веса показывают более стабильные результаты при схожих архитектурных параметрах и наборах данных.
Оптимизация разреженных тензорных вычислений на векторных процессорах
Исследователи представили новый подход к выполнению разреженных тензорных операций на векторных архитектурах, позволяющий достичь производительности, близкой к теоретическому пределу (Roofline model). Метод существенно ускоряет инференс нейросетей, эффективно используя пропускную способность памяти и вычислительные ресурсы процессоров при работе с разреженными матрицами, что критически важно для оптимизации современных моделей с высокой степенью разреженности весов.
Разбор критических ошибок при обучении языковых моделей
Исследователь Джайлс Томас опубликовал детальный разбор причин, по которым его попытки воспроизвести обучение GPT-2 уступали оригинальным весам OpenAI. Основная проблема заключалась в скрытых ошибках реализации алгоритмов нормализации и инициализации весов, которые приводили к деградации градиентов. Исправление этих нюансов позволило существенно приблизить качество модели к эталонным показателям.
PAC-MAN: новый подход к безопасности гуманоидных роботов в динамической среде
Исследователи представили фреймворк PAC-MAN, объединяющий обучение с подкреплением (RL) и функции барьера управления (CBF) для обеспечения безопасности гуманоидных роботов. Система позволяет роботам эффективно уклоняться от объектов в динамических сценариях, таких как игра в вышибалы, используя только данные с бортовых камер и сегментированные карты глубины в реальном времени.
Метод VAD для улучшения обучения мультимодальных моделей через дистилляцию
Исследователи представили метод VAD (Visual Attribution for Distillation), решающий проблему «смешанных сигналов» при обучении мультимодальных моделей методом on-policy дистилляции. Новый подход позволяет точно определять, какие корректировки предсказаний модели основаны на реальных визуальных данных, а какие — на языковых априорных знаниях или особенностях учителя, что значительно повышает качество реконструкции объектов.
MixFrag: метод адаптивной квантования для Vision Transformers
Исследователи представили MixFrag — новый метод квантования после обучения (PTQ) для Vision Transformers (ViT). В отличие от стандартных подходов с фиксированной битностью, MixFrag анализирует чувствительность различных компонентов модели к потере точности. Это позволяет динамически распределять битовую глубину, сохраняя высокую производительность нейросетей при их развертывании на устройствах с ограниченными вычислительными ресурсами.
Метод β-OPSD для повышения качества рассуждений языковых моделей
Исследователи представили метод β-OPSD, который оптимизирует процесс обучения моделей через самодистилляцию. Авторы доказали, что стандартная техника OPSD является частным случаем более широкого семейства алгоритмов, где коэффициент β регулирует штраф KL-дивергенции. Настройка этого параметра позволяет значительно повысить стабильность обучения и качество логических рассуждений моделей, устраняя необходимость в сложных инженерных доработках, характерных для классических подходов.
ScaFE: новый метод классификации патологических рубцов с помощью LLM-программ
Исследователи представили ScaFE — метод классификации келоидных и гипертрофических рубцов по фотографиям, решающий проблему нехватки размеченных данных. Вместо обучения тяжелых end-to-end моделей, система использует LLM для генерации программ, которые извлекают клинические признаки из изображений. Это позволяет достичь высокой точности при ограниченной выборке и соблюсти требования безопасности данных, исключая передачу снимков во внешние облачные VLM.
Новый подход к универсальному восстановлению изображений через устранение двойной неоднозначности
Исследователи представили метод Dual-Ambiguity Rectification (DAR), направленный на повышение качества универсальных систем восстановления изображений. Технология решает проблему запутанности признаков деградации и контента, разделяя семантическую и пространственную неоднозначности. Это позволяет моделям эффективнее очищать снимки от различных искажений, таких как шум, размытие или артефакты сжатия, сохраняя при этом важные детали исходного изображения.
Новые протоколы для кросс-задачного обучения на графовых нейросетях
Исследователи представили методологию для эффективного переноса знаний между различными задачами на одном и том же графе, такими как классификация узлов и предсказание связей. Авторы работы выявили несоответствия в существующих подходах к оценке и предложили унифицированные протоколы, которые позволяют более надежно использовать накопленные данные для обучения моделей в условиях ограниченной разметки.
ABSL: фреймворк для обучения нейросетей на целочисленной арифметике на Rust
Проект ABSL представляет собой реализацию обучения нейронных сетей с использованием исключительно целочисленной арифметики (integer-only), написанную на языке Rust. Использование целых чисел вместо стандартных чисел с плавающей запятой позволяет значительно снизить требования к вычислительным ресурсам и упростить аппаратную реализацию моделей, что критически важно для эффективного инференса и обучения на устройствах с ограниченной мощностью.
Новый метод кластеризованного федеративного обучения с защитой данных
Исследователи предложили новый подход к кластеризованному федеративному обучению (CFL), позволяющий эффективно группировать клиентов с похожими распределениями данных при сохранении конфиденциальности. Метод использует распределенный алгоритм максимизации ожидания (EM) над метаданными, что позволяет преодолеть «трилемму CFL», связанную с необходимостью балансировать между приватностью, затратами на коммуникацию и вычислительной эффективностью при обучении моделей на распределенных данных.