Машинное обучение
Представлен метод градиентного сэмплирования GRiLS для сложных распределений
Исследователи представили Gradient-free Riemannian Langevin Sampler (GRiLS) — новый метод сэмплирования для работы с мультимодальными вероятностными распределениями. Алгоритм решает проблему «застревания» в локальных модах, характерную для классических методов Монте-Карло, и при этом не требует вычисления градиентов целевой плотности, что значительно упрощает применение метода в задачах с недифференцируемыми функциями или сложными ландшафтами данных.
Ant Group представила LingBot-Vision: компактную модель для пространственного восприятия
Ant Group открыла исходный код LingBot-Vision — семейства моделей компьютерного зрения с 1 миллиардом параметров, ориентированных на плотное пространственное восприятие. Инновационный метод обучения с использованием маскированного моделирования границ (Masked Boundary Modeling) позволяет модели эффективно распознавать контуры объектов, достигая производительности, сопоставимой с гораздо более крупными архитектурами, и выступая фундаментом для специализированных систем оценки глубины.
Neuronpedia представила Jacobian Lenses для интерпретируемости нейросетей
Команда Neuronpedia выпустила набор предобученных Jacobian Lenses — специализированных инструментов для анализа и интерпретации внутренних состояний нейронных сетей. Технология позволяет исследователям визуализировать и отслеживать, как конкретные входные данные активируют определенные нейроны внутри модели, обеспечивая более глубокое понимание механизмов принятия решений и выявления скрытых паттернов в работе архитектур трансформеров.
Механизированный вывод типов для конкатенации записей
В статье рассматривается математический подход к решению проблемы вывода типов при объединении записей (record concatenation) в языках программирования. Автор предлагает формализованный метод, который позволяет автоматизировать проверку типов в сложных структурах данных, что критически важно для надежности систем, работающих с динамическими схемами данных, часто встречающимися в задачах обработки данных и построения пайплайнов для ИИ.
Использование LLM для поиска уязвимостей в криптографических библиотеках
Исследователи применили большие языковые модели для анализа исходного кода библиотеки Circl от Cloudflare, специализирующейся на криптографических протоколах. Использование ИИ позволило автоматизировать поиск логических ошибок и уязвимостей в сложных криптографических реализациях, которые зачастую пропускаются при стандартном аудите. Этот подход демонстрирует эффективность нейросетей в поиске специфических багов в коде, требующем глубокого понимания математических алгоритмов и протоколов безопасности.
Метод Final Token Preference Optimization для борьбы с «петлями смерти» в LLM
Исследователи Liquid AI представили метод Final Token Preference Optimization (FTPO), направленный на устранение «петель смерти» (doom loops) в генеративных моделях. Техника фокусируется на оптимизации вероятности финального токена, что позволяет значительно снизить вероятность зацикливания модели при генерации длинных текстов и повысить общую стабильность ответов без необходимости сложной перестройки архитектуры или значительных вычислительных затрат.
GraphBU: новый метод генерации задач смешанно-целочисленного линейного программирования
Исследователи представили GraphBU — новый подход к генерации синтетических данных для задач смешанно-целочисленного линейного программирования (MILP). Метод использует графовые блочные единицы для создания реалистичных экземпляров задач, сохраняя их структурную сложность. Это решает проблему нехватки качественных данных для обучения оптимизационных алгоритмов, когда реальные промышленные наборы данных недоступны из-за конфиденциальности или специфики бизнес-процессов.
Оценка социально-экономического уровня городов через анализ спутниковых снимков
Исследователи разработали масштабируемый фреймворк для анализа социально-экономического неравенства в городах через морфологию зданий. Используя данные спутниковых снимков из открытых источников, модель классифицирует городские районы по уровню благосостояния. Метод позволяет эффективно картографировать инфраструктурные различия в развивающихся регионах, где традиционные статистические данные часто отсутствуют или недостаточно детализированы для принятия управленческих решений.
Оптимизация OCR на базе Vision Language Models для высокой пропускной способности
Разработчики представили подход к созданию высокопроизводительных систем оптического распознавания символов (OCR) на базе мультимодальных моделей (VLM). Метод позволяет значительно снизить затраты на инференс и увеличить скорость обработки документов по сравнению с традиционными проприетарными API, сохраняя при этом высокую точность извлечения данных из сложных визуальных форматов и таблиц.
Выпущен RMISC: масштабный датасет для обучения моделей временных рядов
Исследователи представили RMISC — крупномасштабный корпус реальных многомерных данных, предназначенный для обучения фундаментальных моделей временных рядов (TSFM). В отличие от существующих решений, опирающихся на синтетические данные, этот набор данных лучше отражает сложные временные зависимости и корреляции между переменными, что критически важно для повышения точности zero-shot прогнозирования в реальных бизнес-задачах и аналитических системах.
EntroPath: новый метод обучения на многообразиях через ансамбли путей
Исследователи представили EntroPath — метод обучения на многообразиях, который восстанавливает геодезическую геометрию данных через ансамбли диффузионных путей. В отличие от традиционных подходов, опирающихся на случайные блуждания или кратчайшие расстояния, EntroPath эффективно нивелирует влияние шума в графах и неравномерной плотности выборки, обеспечивая более точное представление структуры данных в низкоразмерном пространстве.
Liquid AI представила метод Antidoom для борьбы с зацикливанием LLM
Компания Liquid AI выпустила Antidoom — метод оптимизации предпочтений финальных токенов (FTPO), предназначенный для устранения «петель гибели» (doom loops) в рассуждениях языковых моделей. Технология выявляет токен, провоцирующий бесконечное повторение фрагмента текста, и проводит точечное дообучение этой позиции, что радикально снижает частоту ошибок генерации при сохранении производительности модели.
PACR-Video: новый метод генерации длинных видео с сохранением консистентности
Исследователи представили PACR-Video — фреймворк для генерации длинных видеороликов, состоящих из нескольких сцен. Метод позволяет сохранять визуальный стиль, структуру сцен и ключевых персонажей без необходимости полной дообучения (fine-tuning) базовой модели. Система использует замороженный диффузионный трансформер, дополненный низкоранговыми временными адаптерами, которые управляются обучаемыми токенами ролей для каждой сцены.
Новый фреймворк PINN для моделирования волновых процессов в биматериальных системах
Исследователи представили фреймворк на базе нейронных сетей, информированных физикой (PINN), предназначенный для моделирования распространения упругих волн в биматериальных системах. Метод интегрирует фундаментальные физические законы непосредственно в процесс обучения модели, что позволяет эффективно решать уравнения линейной упругости в осесимметричной постановке для сред, состоящих из различных материалов, таких как сталь и алюминий.
Метод TILDE для удаления концептов из диффузионных моделей
Исследователи представили TILDE (TILt-based Distributional Erasure) — новый метод «забывания» концептов в диффузионных моделях генерации изображений. Технология позволяет эффективно удалять нежелательные объекты или стили из обученных моделей, сохраняя при этом общее качество генерации и избегая деградации весов, что критически важно для соблюдения авторских прав, защиты приватности и соответствия стандартам безопасности при развертывании систем.
ExplAIner: декларативный язык запросов для интерпретации моделей машинного обучения
Исследователи представили ExplAIner — новый декларативный язык запросов, предназначенный для унификации методов интерпретации моделей машинного обучения (XAI). Система позволяет специалистам по данным формализовать, комбинировать и анализировать различные метрики объяснимости для булевых моделей в рамках единого синтаксиса, что упрощает работу с разрозненными методами оценки предсказаний и повышает прозрачность сложных алгоритмов.
Автоматизация комплаенса в облачной безопасности с помощью Sentence Transformers
Исследователи предложили метод автоматизации сопоставления облачных стандартов безопасности с техническими метриками с помощью дообученных моделей Sentence Transformers. Авторы создали специализированный корпус из 3 499 семантических пар, который был расширен до 13 996 образцов с помощью методов обратного перевода и парафразирования через LLM, что позволило значительно повысить точность классификации требований в четырех различных сценариях безопасности.
Метод Dithered Gaussian Mechanism для повышения эффективности дифференциальной приватности
Исследователи представили механизм Dithered Gaussian, предлагающий новый подход к обеспечению дифференциальной приватности в машинном обучении. В отличие от традиционного дискретного гауссовского механизма, новый метод выполняет дискретизацию выходных данных, а не самого шума. Это позволяет сохранять строгие гарантии приватности, значительно снижая требования к вычислительным ресурсам и объему генерируемой случайности при обучении моделей.
Кросс-языковое обучение для улучшения распознавания речи в малоресурсных языках
Исследователи представили метод улучшения систем автоматического распознавания речи (ASR) для дивехи — государственного языка Мальдивских островов, для которого критически не хватает обучающих данных. Авторы использовали стратегию кросс-языкового переноса знаний (transfer learning) на основе сингальского языка, который лингвистически близок к дивехи и обладает значительно большими объемами доступных речевых корпусов для обучения моделей.
Создание трансформера на 350 млн параметров с нуля на PyTorch
Автор опубликовал подробное руководство по обучению трансформерной модели с нуля, используя библиотеку PyTorch. В материале разбирается архитектура модели объемом 350 миллионов параметров, процесс подготовки данных, настройка гиперпараметров и технические аспекты реализации слоев внимания. Это практический разбор, который помогает понять внутреннюю механику современных LLM через написание чистого кода.
Фундаментальное руководство по алгоритмам и машинному обучению
Опубликован комплексный учебный материал, охватывающий путь от базовых алгоритмов сортировки до проектирования стратегических ИИ-агентов. Документ систематизирует ключевые концепции компьютерных наук и машинного обучения, предлагая структурированный подход к пониманию того, как математические модели трансформируются в интеллектуальные системы, способные принимать решения в динамических условиях и взаимодействовать со средой.
Выпуклая аппроксимация для байесовских обратных задач на базе нейросетей
Исследователи представили новый фреймворк для решения сложных байесовских обратных задач, объединяющий нейросетевое моделирование правдоподобия с методами выпуклой оптимизации. Подход позволяет преодолеть вычислительные ограничения классических методов, таких как марковские цепи Монте-Карло, обеспечивая эффективную работу в высокоразмерных пространствах, где традиционное моделирование физических процессов становится слишком затратным или неточным из-за неопределенности измерений.
TOFFEE: новый подход к синтезу траекторий для обучения ИИ-агентов в аналитике
Исследователи представили TOFFEE — систему для автоматизированного синтеза высококачественных траекторий поведения ИИ-агентов, работающих с данными. Решение решает проблему плохой обобщаемости LLM-агентов в сложных корпоративных средах. Генерируя разнообразные сценарии аналитических рабочих процессов, система позволяет эффективнее обучать модели выполнению сложных задач, с которыми агенты ранее не сталкивались в процессе своего обучения или настройки.
PuzzleMoE: новый метод сжатия моделей Mixture-of-Experts
Исследователи представили PuzzleMoE — метод эффективного сжатия моделей с архитектурой Mixture-of-Experts (MoE). Технология позволяет значительно сократить количество параметров и вычислительные затраты при сохранении высокой точности нейросети. Подход оптимизирует структуру экспертов, делая крупные языковые модели более доступными для развертывания на ограниченных аппаратных ресурсах без существенной потери качества генерации.