Машинное обучение
Новый метод GR-RTRMC для оптимизации матриц с графовой регуляризацией
Исследователи представили метод GR-RTRMC, который улучшает задачу восстановления матриц низкого ранга за счет интеграции графовой регуляризации в существующий фреймворк Riemannian Trust-Region Matrix Completion (RTRMC). Подход использует геометрию ограничений низкого ранга, преобразуя задачу в нелинейную оптимизацию на многообразии Грассмана, что позволяет эффективнее учитывать структурные связи в данных при их восстановлении.
GatedLinear: новый метод адаптивной маршрутизации для прогнозирования временных рядов
Исследователи представили архитектуру GatedLinear, решающую проблему неспособности стандартных моделей эффективно обрабатывать разнородные временные динамики. Метод использует адаптивную маршрутизацию между взаимодополняющими линейными базисами, что позволяет модели гибко переключаться между анализом трендов, нестационарными сдвигами и фазовыми повторениями. Подход значительно повышает точность прогнозирования по сравнению с традиционными архитектурами, ограниченными фиксированными индуктивными смещениями.
Новый метод терминальных эмбеддингов для анализа временных рядов
Исследователи представили новый подход к снижению размерности данных с использованием терминальных эмбеддингов, адаптированный для временных рядов. Метод позволяет отображать точки из пространства высокой размерности в низкоразмерное, сохраняя при этом попарные расстояния между объектами с минимальными искажениями. Это решение значительно упрощает обработку сложных последовательностей данных, сохраняя их структурную целостность для последующего анализа и обучения моделей.
Сравнение моделей машинного обучения в поиске низкомолекулярных лекарств
Исследователи провели сравнительный анализ эффективности различных моделей машинного обучения при поиске низкомолекулярных соединений для фармацевтических разработок. В работе оценивается способность алгоритмов предсказывать биологическую активность молекул и их пригодность для создания лекарственных препаратов. Результаты подчеркивают критическую зависимость точности прогнозов от качества обучающих выборок и архитектурных особенностей используемых нейросетей в задачах хемоинформатики.
Автоматизированная миграция кода с использованием формальной верификации
Исследователи из Logos Research представили метод автоматизированной миграции кодовых баз между языками программирования, основанный на формальной верификации. В отличие от стандартных LLM-подходов, полагающихся на вероятностную генерацию, новая методика гарантирует семантическую эквивалентность исходного и целевого кода, что критически важно для сложных систем, где ошибки при ручном или автоматическом переводе могут привести к потере данных или нарушению логики.
Как архитектура Transformer справляется с логикой игры в крестики-нолики
Исследование демонстрирует, как стандартная архитектура Transformer обучается играть в крестики-нолики без явного программирования правил. Автор статьи проанализировал процесс обучения модели на наборе данных из всех возможных партий, показав, что нейросеть способна выучить логику игры, опираясь исключительно на последовательности ходов, и достичь высокой точности предсказаний в рамках ограниченного игрового поля.
Новая модель эмбеддингов Fusion-Embedding-1-2B с 16 млн параметров
Команда Eximius Labs представила Fusion-Embedding-1-2B — компактную модель для создания векторных представлений текста. Несмотря на крайне малый размер (всего 16 млн обучаемых параметров), модель демонстрирует производительность, сопоставимую с Gemini Embedding 2 от Google. Это достижение подчеркивает эффективность новых методов обучения и оптимизации архитектур для задач семантического поиска и RAG-систем.
Fable достигла SOTA в CIFAR Speedrun: уроки автоматизации R&D в ИИ
Компания Fable установила новый стандарт в задаче CIFAR Speedrun, продемонстрировав эффективность автоматизированных систем в исследовательских процессах машинного обучения. Команда использовала специализированную инфраструктуру для ускорения итераций, что позволило достичь рекордных показателей точности при минимальных временных затратах. Этот кейс иллюстрирует переход от ручного подбора гиперпараметров к полностью автоматизированным циклам разработки моделей.
Google открыла доступ к AlphaEvolve для поиска алгоритмов на Google Cloud
Google предоставила публичный доступ к AlphaEvolve — системе на базе обучения с подкреплением, предназначенной для автоматического поиска и оптимизации алгоритмов. Инструмент, ранее использовавшийся для научных открытий, теперь доступен разработчикам на платформе Google Cloud. Технология позволяет находить эффективные решения задач, которые традиционно требовали ручного проектирования алгоритмов экспертами в области компьютерных наук.
Глубокий анализ производительности механизмов внимания в PyTorch
Hugging Face опубликовала третью часть руководства по профилированию моделей в PyTorch, сосредоточившись на оптимизации механизмов внимания (Attention). Авторы детально разбирают, как выявлять «узкие места» в вычислениях, анализировать использование памяти GPU и эффективно интерпретировать данные профилировщика для ускорения обучения и инференса трансформеров, что критически важно для работы с современными LLM.
Формальная верификация ИИ-сгенерированных GPU-ядер
Исследователи представили метод формальной верификации GPU-ядер, созданных с помощью нейросетей. Подход позволяет математически доказать корректность кода, генерируемого ИИ для выполнения низкоуровневых вычислений на видеокартах. Это решает критическую проблему надежности автоматизированной разработки, где ошибки в оптимизированных ядрах могут приводить к непредсказуемым сбоям и некорректным результатам вычислений в высокопроизводительных системах.
Представлен датасет MulTTiPop для автоматической транскрипции музыки
Исследователи представили MulTTiPop — специализированный набор данных, включающий 572 сегмента поп-музыки и соответствующие им многодорожечные MIDI-записи. Датасет общим объемом 3,5 часа аудио предназначен для обучения и оценки моделей автоматической транскрипции музыки (AMT). В выборку вошли композиции различных жанров, охватывающие период с 1930-х по 2000-е годы, что обеспечивает высокую вариативность музыкального материала для тестирования алгоритмов.
SLORR: новый метод обучения для эффективного сжатия нейросетей
Исследователи представили SLORR — метод регуляризации при обучении, который упрощает низкоранговую факторизацию нейронных сетей. В отличие от существующих подходов, требующих дорогостоящего SVD-разложения или изменения архитектуры модели, SLORR позволяет эффективно сжимать веса без существенной потери точности, делая современные модели более компактными и пригодными для развертывания на устройствах с ограниченными ресурсами.
Новый подход к анализу данных через kNN-графы UMAP
Исследователи предложили использовать внутренний k-ближайших соседей (kNN) граф алгоритма UMAP для анализа данных, вместо привычной визуализации в низкоразмерном пространстве. Авторы доказывают, что этот граф сохраняет структуру данных в исходном многомерном пространстве без искажений, неизбежно возникающих при проецировании на плоскость, что открывает новые возможности для интерпретации сложных датасетов и поиска скрытых закономерностей.
Применение глубокого обучения для подавления помех в OFDM-системах
Исследователи представили новый метод борьбы с узкополосными помехами (NBI) в системах мультиплексирования с ортогональным частотным разделением каналов (OFDM) с помощью глубокого обучения. Подход заменяет традиционные методы сжатого зондирования, устраняя их высокую задержку и проблемы с нелинейными искажениями, что значительно повышает точность мягкой демодуляции и общую надежность передачи данных в условиях зашумленного радиоэфира.
Оптимизация GPU-коммуникаций для масштабного молекулярного моделирования
NVIDIA представила руководство по использованию GPU-initiated communication для ускорения молекулярной динамики. Метод позволяет графическим процессорам напрямую управлять передачей данных между узлами, минуя центральный процессор. Это значительно снижает задержки в высоконагруженных вычислительных системах, где симуляции атомных взаимодействий требуют обмена огромными массивами данных в реальном времени, повышая общую эффективность масштабируемых научных вычислений.
Оптимизация ликвидности в сети Bitcoin Lightning через глубокое обучение на графах
Исследователи представили MPFlow — метод оптимизации ликвидности в сети Bitcoin Lightning с использованием глубокого обучения с подкреплением на графах. Алгоритм решает задачу выбора каналов для открытия при ограниченном бюджете, максимизируя пропускную способность маршрутизации. Подход позволяет эффективно находить оптимальные конфигурации сети, превосходя традиционные эвристические методы в задачах комбинаторной оптимизации на графах.
Autodata: агентный подход к генерации высококачественных синтетических данных
Исследователи представили Autodata — агентную систему для автоматизированного создания синтетических наборов данных, предназначенных для обучения моделей машинного обучения. Система имитирует работу дата-сайентиста, самостоятельно выполняя итеративный цикл генерации, фильтрации и проверки данных. Это позволяет значительно повысить качество обучающих выборок, минимизируя шум и ошибки, характерные для стандартных методов синтеза данных.
Оптимизация выбора LLM: перевыборка против маршрутизации
Исследователи проанализировали методы оптимизации затрат при использовании LLM, сравнив стратегии маршрутизации между моделями и технику перевыборки (resampling) во время инференса. Работа показывает, что текущие системы маршрутизации часто уступают идеальным оракулам, а использование перевыборки позволяет значительно улучшить качество ответов при сохранении бюджетных ограничений, если правильно учитывать метрики корректности и вычислительные ресурсы.
EdgeRefine: новый метод защиты приватности в графовых нейросетях
Исследователи представили EdgeRefine — метод обеспечения дифференциальной приватности на уровне ребер в графовых нейронных сетях (GNN). Технология использует сэмплирование по Жаккару для фильтрации шума, добавляемого в матрицу смежности. Это позволяет сбалансировать защиту конфиденциальных данных о связях между узлами и точность предсказаний модели, решая проблему избыточного зашумления графовых структур.
Децентрализованное федеративное обучение с защитой через виртуальное голосование
Исследователи представили новый метод децентрализованного федеративного обучения, который исключает необходимость в центральном сервере или блокчейн-реестрах. Система использует протоколы gossip-обмена и механизм виртуального голосования для достижения консенсуса. Это решение повышает устойчивость обучения к византийским отказам и недобросовестным участникам, обеспечивая при этом высокую точность модели без ущерба для конфиденциальности данных и масштабируемости сети.
Новый метод обучения ИИ-агентов через мультимодальное машинное обучение
Исследователи представили новый подход к обучению ИИ-агентов, направленный на создание устойчивых функций вознаграждения. Метод позволяет моделям эффективно извлекать цели из человеческих предпочтений в различных средах, предотвращая переобучение под конкретные условия. Это критически важно для автономных систем, которые должны сохранять предсказуемое поведение при смене операционного контекста и внешних факторов.
UltraX: новый метод адаптивной очистки данных для обучения LLM
Исследователи представили UltraX — фреймворк для масштабной автоматизированной очистки данных, решающий проблему исчерпания качественных обучающих корпусов. Метод использует адаптивное программное редактирование для фильтрации и улучшения текстов, что позволяет повысить эффективность обучения моделей без необходимости бесконечного расширения датасетов. Подход демонстрирует значительное превосходство над традиционными методами фильтрации при работе с огромными массивами данных.
BiSCo-LLM: новый метод сжатия LLM до экстремально низких битов
Исследователи представили BiSCo-LLM — метод сжатия больших языковых моделей, который позволяет достичь экстремально низких значений бит на параметр без использования таблиц поиска (lookup-free). Технология решает проблему деградации качества при квантовании ниже 2 бит, предлагая эффективную альтернативу традиционным скалярным и групповым методам, что критически важно для развертывания тяжелых моделей на устройствах с ограниченной памятью.