Машинное обучение

O-VAD: новый подход к выявлению аномалий в промышленном видеопотоке arXiv · 20.07.2026 Исследователи представили O-VAD — специализированный метод для обнаружения аномалий в промышленном производстве, основанный на объектно-ориентированном трекинге и логическом выводе. В отличие от универсальных VLM, которые часто ошибаются в сложных производственных условиях, O-VAD эффективно анализирует динамику объектов, что позволяет точнее выявлять дефекты и нарушения технологических процессов в режиме реального времени. SGA: новый агент для геометрической корректности в обучающем видео arXiv · 20.07.2026 Исследователи представили Symbolic Geometric Agent (SGA) — специализированный модуль для повышения точности визуализации в образовательных видео, создаваемых с помощью LLM. Система решает проблему пространственных искажений и наложений объектов при генерации кода для анимационных библиотек, таких как Manim, обеспечивая высокую геометрическую достоверность и читаемость контента без необходимости переобучения базовых моделей. LLM-as-a-Coach: новый подход к обучению моделей через качественную обратную связь arXiv · 20.07.2026 Исследователи представили метод Experiential Learning (EL), который меняет парадигму обучения LLM с простого скалярного вознаграждения на использование детальной текстовой обратной связи. Вместо того чтобы сжимать оценку до одного числа, модель-тренер анализирует действия агента и предоставляет структурированные рекомендации, что позволяет эффективнее обучать системы в задачах с открытым финалом, где стандартные метрики часто оказываются неэффективными. Управление процессом рассуждения LLM через активационное воздействие arXiv · 20.07.2026 Исследователи представили метод Activation Steering, позволяющий управлять процессом рассуждения больших языковых моделей на уровне их внутренних состояний. В отличие от стандартных промпт-инжиниринговых подходов, работающих на входных данных, новый метод позволяет корректировать траектории мышления модели в реальном времени, предотвращая зацикливание и повышая точность выполнения сложных логических задач. Проблема покрытия классов при сдвиге распределения в системах распознавания arXiv · 20.07.2026 Исследователи проанализировали ограничения метода раздельного конформного прогнозирования (split conformal prediction) при работе с данными, подверженными сдвигу распределения. Выяснилось, что при сохранении общего уровня покрытия на целевом уровне, точность распознавания отдельных классов может критически падать. Это создает иллюзию надежности системы, скрывая ошибки в специфических условиях, что критично для систем компьютерного зрения и классификации. MSE-GLM: детерминированная графовая языковая модель с нулевым весом Hacker News · 20.07.2026 Исследователи представили MSE-GLM — новую архитектуру графовой языковой модели, работающую по принципу детерминированного вычисления без использования обучаемых весов. В отличие от традиционных LLM, требующих масштабного обучения параметров, данная модель опирается на математические свойства графовых структур для обработки и генерации данных, что открывает возможности для создания сверхлегких и предсказуемых систем обработки информации. Neural Drive: модель мира для симуляции SuperTuxKart в браузере Hacker News · 20.07.2026 Исследователи представили Neural Drive — компактную модель мира, способную имитировать физику и визуальную среду гоночной игры SuperTuxKart непосредственно в браузере. Модель предсказывает будущие кадры на основе действий игрока, демонстрируя возможности генеративного моделирования сложных динамических систем в реальном времени без необходимости запуска полноценного игрового движка на стороне клиента. Реализация дискретной диффузионной модели для генерации текста Hacker News · 17.07.2026 Автор проекта представил учебную реализацию диффузионной модели, адаптированной для работы с текстовыми данными. В качестве обучающего набора использован классический датасет с произведениями Шекспира. Проект демонстрирует принципы работы диффузионных процессов в дискретном пространстве токенов, предлагая альтернативный взгляд на генерацию текста, отличный от стандартных авторегрессионных архитектур, используемых в современных LLM. Zyphra представила ZUNA1.1: фундаментальную модель для анализа данных ЭЭГ MarkTechPost · 17.07.2026 Компания Zyphra выпустила ZUNA1.1 — обновленную фундаментальную модель на базе маскированного диффузионного автокодировщика, предназначенную для обработки данных электроэнцефалографии (ЭЭГ). Модель с 380 млн параметров позволяет реконструировать, очищать от шумов и повышать разрешение сигналов ЭЭГ при произвольной конфигурации каналов, предлагая гибкость работы с входными данными переменной длительности от 0,5 до 30 секунд. Применение оптимизатора Muon в агентном обучении с подкреплением arXiv · 17.07.2026 Исследователи изучили эффективность оптимизатора Muon в задачах агентного обучения с подкреплением (RL) при работе с разреженными наградами. В ходе экспериментов на модели Qwen2.5-0.5B-Instruct в среде ALFWorld выяснилось, что применение Muon к скрытым весовым матрицам в рамках алгоритма GiGPO обеспечивает значительный прирост производительности по сравнению с традиционным оптимизатором AdamW, демонстрируя потенциал для оптимизации агентных систем. Оптимизация алгоритмов Kernel PLS для ускорения калибровки моделей arXiv · 17.07.2026 Исследователи представили метод оптимизации алгоритмов Improved Kernel Partial Least Squares (IKPLS) версий 1 и 2, которые считаются одними из самых быстрых инструментов для калибровки моделей. Авторы работы переработали этапы вычисления ротаций матрицы X и нагрузок Y, заменив поэлементное накопление данных на стратегию прямого вычисления, что значительно повышает вычислительную эффективность алгоритмов при сохранении точности. ToolSciVer: новый подход к проверке научных утверждений с помощью мультимодальных агентов arXiv · 17.07.2026 Исследователи представили ToolSciVer — систему для проверки научных гипотез, объединяющую визуальный анализ и обучение с подкреплением. Модель эффективно извлекает данные из графиков, таблиц и схем в научных статьях, решая проблему нехватки точности при интерпретации визуального контента. Метод позволяет агентам автономно находить доказательства и выстраивать логические цепочки для верификации сложных утверждений. DADiff: новый метод адаптации стратегий обучения с подкреплением через диффузионные модели arXiv · 17.07.2026 Исследователи представили DADiff — метод адаптации стратегий обучения с подкреплением (RL) при переходе между различными доменами. Решение использует диффузионные модели для преодоления разрыва в динамике сред. Подход позволяет эффективно переносить навыки, обученные в исходном домене с большим объемом данных, в целевой домен, где количество доступных взаимодействий крайне ограничено, что критично для реальных робототехнических задач. Методология Pick-to-Learn для калибровки MPC-политик arXiv · 17.07.2026 Исследователи представили методологию Pick-to-Learn, предназначенную для эффективной калибровки политик управления с прогнозирующими моделями (MPC). Подход позволяет оптимизировать параметры системы в условиях высокой неопределенности внешней среды. Авторы демонстрируют работоспособность метода на примере планирования траектории полета воздушного судна, сталкивающегося с непредсказуемыми боковыми ветрами и зонами ограниченной связи. Новая нейросетевая архитектура HCIG для распознавания сарказма и кибербуллинга arXiv · 17.07.2026 Исследователи представили архитектуру HCIG (Hierarchical Cross-Modal Incongruity Graph), предназначенную для выявления сарказма и кибербуллинга в мультимодальном контенте. Модель анализирует противоречия между текстовыми и визуальными данными, используя иерархический графовый подход. Это позволяет системе эффективнее улавливать скрытые смыслы и агрессивный подтекст, которые часто ускользают от стандартных методов анализа, полагающихся лишь на простое объединение признаков. Слияние моделей против совместного обучения в задачах с подкреплением arXiv · 17.07.2026 Исследователи проанализировали эффективность слияния моделей (model merging) как альтернативы совместному обучению (multi-task learning) в задачах обучения с подкреплением. Авторы провели прямое сравнение, обучив специализированные агенты Qwen3-8B на разных уровнях сложности, и оценили, насколько метод «векторов задач» (task vectors) способен заменить полноценное обучение на объединенных данных, выявив геометрические закономерности в пространстве весов. Применение табличных foundation-моделей для оценки безопасности энергосистем arXiv · 17.07.2026 Исследователи представили новый подход к динамической оценке безопасности (DSA) энергосистем, основанный на использовании табличных foundation-моделей. Метод позволяет преодолеть ограничения традиционных ML-решений, требующих обучения отдельных моделей для каждой аварийной ситуации. Использование предобученных архитектур значительно сокращает потребность в размеченных данных и повышает скорость анализа рисков в критической инфраструктуре, обеспечивая более эффективное прогнозирование стабильности энергосетей при различных сбоях. Метод QEWC для борьбы с катастрофическим забыванием в квантовых моделях arXiv · 17.07.2026 Исследователи представили метод Quantum Elastic Weight Consolidation (QEWC), предназначенный для решения проблемы катастрофического забывания в вариационных квантовых классификаторах (VQC). Новый подход использует квантовую информацию Фишера для регуляризации обучения, позволяя квантовым моделям последовательно осваивать новые задачи без потери знаний, полученных на предыдущих этапах при нестационарных распределениях данных. Валидация правок кода от LLM без его исполнения Hacker News · 17.07.2026 Разработчики представили методологию верификации изменений кода, вносимых языковыми моделями, в условиях невозможности запуска программы. Подход опирается на статический анализ и семантическую проверку, позволяя выявлять логические ошибки и нарушения структуры до интеграции правок. Это решение критически важно для автоматизированных систем разработки, где выполнение кода в изолированной среде затруднено или небезопасно. Применение LLM для оптимизации управления памятью в ядре Linux Hacker News · 17.07.2026 Разработчики представили два экспериментальных патч-сета, использующих возможности больших языковых моделей для автоматизации управления памятью в ядре Linux. Решения направлены на оптимизацию распределения ресурсов и минимизацию фрагментации, что является критически важной задачей для производительности систем. Использование ИИ позволяет динамически адаптировать стратегии выделения памяти на основе анализа паттернов нагрузки в реальном времени. KV-Cache Grafting: новый метод повышения точности LLM без дообучения Hacker News · 17.07.2026 Исследователи представили метод KV-Cache Grafting, позволяющий значительно повысить производительность замороженных 12-миллиардных языковых моделей в задачах математического рассуждения. Техника достигает 93,3% точности на бенчмарке AIME, используя манипуляции с кэшем ключей и значений (KV-cache) во время инференса, что позволяет улучшить способности модели без необходимости дорогостоящего дообучения или изменения весов нейросети. Вышло практическое руководство по обучению с подкреплением Hacker News · 16.07.2026 Опубликована книга «The Little Book of Reinforcement Learning», представляющая собой сжатый и структурированный обзор методов обучения с подкреплением (RL). Автор систематизировал ключевые концепции дисциплины, от основ марковских процессов принятия решений до современных алгоритмов глубокого обучения, предоставляя читателям теоретическую базу и математический аппарат, необходимые для понимания принципов работы интеллектуальных агентов в динамических средах. Оптимизация обработки видеоданных для обучения роботов: ускорение в 15 раз Hacker News · 16.07.2026 Команда Eventual оптимизировала процесс чтения видеоданных для библиотеки LeRobot, добившись 15-кратного прироста производительности. Основным узким местом была медленная декомпрессия кадров при подготовке датасетов для обучения моделей управления роботами. Инженеры переработали пайплайн обработки, внедрив более эффективные методы декодирования и кэширования, что позволило значительно сократить время подготовки данных для обучения нейросетей. Мониторинг процессов обучения с подкреплением (RL) Hacker News · 16.07.2026 Команда Castform представила подход к мониторингу обучения моделей с подкреплением (RL), который решает проблему низкой прозрачности тренировочных циклов. Разработчики сфокусировались на отслеживании метрик в реальном времени, позволяя оперативно выявлять деградацию агентов и ошибки в среде до завершения дорогостоящих вычислительных сессий, что критически важно для стабильности сложных ML-пайплайнов.