Машинное обучение

Управление обучением нейросетей через интерпретируемые ограничения arXiv · 09.07.2026 Исследователи представили метод, позволяющий корректировать процесс обучения нейронных сетей с помощью ограничений на основе частичной зависимости (Partial Dependence). Подход направлен на создание моделей, чьи объяснения решений соответствуют экспертным знаниям или априорным ожиданиям. Это решает проблему «черного ящика», обеспечивая более высокую верность интерпретаций без существенной потери точности предсказаний самой модели. Федеративное обучение для прогнозирования сердечно-сосудистых заболеваний arXiv · 09.07.2026 Исследователи представили метод федеративного глубокого обучения для оценки рисков сердечно-сосудистых заболеваний, позволяющий создавать точные предиктивные модели без передачи конфиденциальных данных пациентов между медицинскими учреждениями. Подход решает проблему фрагментации данных в здравоохранении, обеспечивая обучение нейросетей на распределенных локальных наборах данных при соблюдении строгих протоколов приватности и регуляторных требований. Почему LLM ошибаются в датах и времени и как это исправить Hacker News · 09.07.2026 Языковые модели часто демонстрируют низкую точность при работе с календарными данными из-за особенностей токенизации и отсутствия встроенного понимания временных рядов. Исследование показывает, что LLM воспринимают даты как последовательности токенов, а не как математические объекты, что приводит к ошибкам в расчетах интервалов, часовых поясов и форматов, требуя внешних инструментов для корректной обработки. Классика глубокого обучения: эффективность рекуррентных нейронных сетей Hacker News · 08.07.2026 Статья Андрея Карпатого 2015 года остается фундаментальным пособием по пониманию рекуррентных нейронных сетей (RNN). Автор наглядно демонстрирует, как архитектуры с памятью способны обучаться сложным последовательностям данных — от генерации текста на уровне символов до написания кода и математических доказательств, предвосхищая многие современные возможности больших языковых моделей. General Intuition использует данные видеоигр для обучения роботов AI News & Artificial Intelligence | TechCrunch · 08.07.2026 Стартап General Intuition разрабатывает фундаментальные модели для физического ИИ, используя огромные массивы данных из видеоигр. Компания стремится сократить зависимость робототехники от дорогостоящего сбора данных в реальном мире, обучая системы на симулированных средах. Такой подход призван ускорить создание универсальных роботов, способных эффективно обучаться сложным манипуляциям с минимальным количеством физических испытаний. ARDY: новый метод генерации интерактивных движений человека GitHub · 08.07.2026 Исследователи NVIDIA представили ARDY — метод генерации реалистичных движений человека, сочетающий авторегрессионные модели с диффузионными процессами. Система использует гибридное представление данных для создания интерактивной анимации, что позволяет модели эффективно учитывать контекст и физические ограничения. Разработка была принята для публикации на конференции SIGGRAPH 2026, демонстрируя значительный прогресс в области компьютерной графики и генеративного ИИ. Новый метод повышения эффективности RLHF для диффузионных моделей arXiv · 08.07.2026 Исследователи представили метод Selective Timestep Weighting and Advantage-Based Replay, который значительно повышает эффективность обучения с подкреплением на основе отзывов людей (RLHF) для диффузионных моделей. Подход позволяет сократить количество необходимых оценок от человека или модели вознаграждения, решая проблему высокой ресурсоемкости адаптации генеративных моделей под предпочтения пользователей в реальных сценариях. Видеоигры как новый стандарт обучающих данных для ИИ AI News & Artificial Intelligence | TechCrunch · 08.07.2026 Разработчики ИИ всё чаще обращаются к видеоиграм как к источнику данных для обучения моделей, стремящихся к общему искусственному интеллекту (AGI). В отличие от текстовых массивов интернета, игровые среды позволяют моделям усваивать законы физики, причинно-следственные связи и принципы навигации в пространстве, что критически важно для создания систем, способных эффективно взаимодействовать с реальным миром. Any-Dimensional Learning: новый подход к масштабируемости моделей arXiv · 08.07.2026 Исследователи представили метод Any-Dimensional Learning, позволяющий нейросетям эффективно работать с входными данными произвольного размера, выходящими за рамки обучающей выборки. Новый подход решает проблему генерализации моделей, которые при увеличении количества токенов, узлов графа или точек в облаке часто теряют точность или сталкиваются с вычислительными ограничениями, сохраняя стабильность предсказаний на данных любого масштаба. Метод Adaptive Trace Prefix Control для улучшения обучения моделей в задачах рассуждения arXiv · 08.07.2026 Исследователи представили метод Adaptive Trace Prefix Control, решающий проблему застоя алгоритма GRPO при обучении моделей сложным логическим задачам. Когда ни один вариант генерации в группе не оказывается верным, градиент исчезает, и обучение останавливается. Новый подход динамически добавляет префиксы правильных решений, позволяя плавно регулировать сложность задач и обеспечивать стабильное обновление весов модели. PeTeR: новый метод повышения устойчивости вероятностных схем arXiv · 08.07.2026 Исследователи представили метод PeTeR (Post-Training Robustification of Probabilistic Circuits), направленный на повышение устойчивости вероятностных схем (PC) к шуму в данных и сдвигам распределения. Подход использует распределенно-устойчивую оптимизацию для корректировки моделей после завершения основного обучения, что позволяет улучшить точность обобщения в условиях ограниченных выборок и нестабильных входных данных без необходимости полного переобучения архитектуры. Новый метод коррекции Classifier-Free Guidance для диффузионных моделей arXiv · 08.07.2026 Исследователи представили метод Terminal-Fitted Repair, решающий проблему нестабильности Classifier-Free Guidance (CFG) при высоких значениях коэффициента направляющего воздействия. Новый подход устраняет эффект перенасыщения и деградации качества генерации, который обычно заставляет разработчиков увеличивать количество шагов сэмплирования или использовать сложные графики интервалов, что существенно замедляет работу диффузионных моделей и моделей на основе потоков (flow-matching). ALER-TI: новый метод восстановления пропущенных данных во временных рядах arXiv · 08.07.2026 Исследователи представили метод ALER-TI (Aligned Latent Embedding Retrieval), решающий проблему восстановления пропущенных значений во временных рядах. В отличие от стандартных архитектур, фокусирующихся только на локальном контексте, новый подход использует поиск по скрытым представлениям для извлечения глобальных паттернов, что значительно повышает точность реконструкции данных в условиях нестационарной динамики и слабых временных корреляций. Voodoo: новый подход к обработке сигналов без нейросетей и обучения Hacker News · 08.07.2026 Проект Voodoo предлагает альтернативный метод обработки сигналов, который полностью отказывается от использования нейронных сетей, токенизации и этапов обучения. Вместо классического глубокого обучения система полагается на алгоритмические методы анализа данных, обеспечивая высокую скорость работы и предсказуемость результатов. Решение ориентировано на задачи, где критически важна вычислительная эффективность и отсутствие «черного ящика» в логике обработки. Масштабируемое обучение видеомоделей для воплощенного ИИ GitHub · 08.07.2026 Проект LingBot-Video представляет новый подход к масштабированию обучения видеомоделей на основе архитектуры Mixture-of-Experts (MoE). Метод направлен на развитие воплощенного интеллекта (Embodied Intelligence), позволяя моделям эффективнее обрабатывать визуальные данные и обучаться на больших наборах видео, что критически важно для управления робототехническими системами и понимания динамических сред в реальном времени. Квантовые сверточные нейросети для анализа временных рядов arXiv · 08.07.2026 Исследователи представили новый подход к классификации временных рядов, объединяющий квантовые сверточные нейронные сети (QCNN) с ядрами сигнатур путей (Rough Path Signature Kernels). Метод решает проблему инвариантности временных рядов к перепараметризации, позволяя эффективно извлекать сложные темпоральные признаки, что значительно снижает вычислительную нагрузку при обработке данных в научных и инженерных задачах. OpenAI победила в эвристическом турнире AtCoder World Tour Finals 2026 Hacker News · 08.07.2026 Модель от OpenAI заняла первое место в эвристическом соревновании AtCoder World Tour Finals 2026, продемонстрировав способность решать сложные алгоритмические задачи в режиме реального времени. Это достижение подтверждает прогресс нейросетей в области автоматизированного программирования и оптимизации, где требуется не только знание синтаксиса, но и поиск эффективных стратегий для решения нетривиальных вычислительных проблем. Метод Future Confidence Distillation для оценки надежности LLM arXiv · 08.07.2026 Исследователи представили метод Future Confidence Distillation (FCD), который улучшает оценку уверенности больших языковых моделей в своих ответах. В отличие от традиционных подходов, анализирующих готовый текст, FCD учитывает динамику формирования уверенности в процессе генерации. Это позволяет точнее определять надежность модели при выполнении критических задач, таких как использование внешних инструментов или поиск информации. Новый метод оптимизации для нелинейных задач в машинном обучении arXiv · 08.07.2026 Исследователи представили усовершенствованный метод Левенберга-Марквардта, использующий геометрические обновления высшего порядка через нормальные координаты Римана. Новый подход позволяет эффективнее справляться с кривизной параметров в нелинейных задачах наименьших квадратов, что критически важно для обучения физико-информированных нейронных сетей (PINN) и задач регрессии, где стандартные методы часто сталкиваются с ограничениями из-за высокой нелинейности. Асимметричная функция потерь повышает точность GNN в прогнозировании взаимодействий лекарств arXiv · 08.07.2026 Исследователи представили метод улучшения графовых нейронных сетей (GNN) для предсказания побочных эффектов при приеме нескольких лекарств одновременно. Использование асимметричной функции потерь (Asymmetric Focal Loss) вместо стандартной бинарной кросс-энтропии позволяет модели эффективнее фокусироваться на сложных клинически значимых взаимодействиях, которые часто игнорируются при обучении на несбалансированных наборах данных. Автоматизация классификации уязвимостей: сравнение подходов BERT для CVE и CWE arXiv · 08.07.2026 Исследователи проанализировали эффективность моделей BERT при автоматическом сопоставлении записей CVE с категориями CWE. Сравнение мультиклассовой классификации, предполагающей выбор одной категории, и мультилейбл-подхода, допускающего несколько меток, показало, как структура таксономии уязвимостей напрямую влияет на точность и характер ошибок модели. Результаты работы помогают оптимизировать автоматизированные системы анализа безопасности и снизить долю ручного труда в классификации угроз. Расследование галлюцинаций: как LLM цитирует несуществующие данные Hacker News · 08.07.2026 Исследователи провели аудит работы LLM, столкнувшись с регулярным появлением вымышленных цитат в ответах модели. Проанализировав 30 тысяч записей в базе данных, команда обнаружила, что источником «галлюцинаций» стали фрагменты их собственных системных промптов, которые модель ошибочно интерпретировала как часть обучающего корпуса или контекста, искажая итоговую выдачу для пользователя. Новый метод генерации синтетических данных для федеративного обучения arXiv · 08.07.2026 Исследователи представили новый подход к одношаговому федеративному обучению (OSFL), который решает проблему коммуникационных затрат при работе с неоднородными данными. Метод использует коллаборативную генерацию синтетических датасетов для передачи знаний между клиентами за один раунд обучения, что позволяет поддерживать высокую точность моделей даже при значительных различиях в распределении данных на устройствах пользователей. Метод PALS повышает эффективность прунинга LLM через адаптивную разреженность слоев arXiv · 08.07.2026 Исследователи представили PALS (Percentile-Aware Layerwise Sparsity) — новый метод оптимизации больших языковых моделей, который динамически распределяет коэффициент разреженности между слоями нейросети. В отличие от традиционных подходов, применяющих фиксированный коэффициент ко всей архитектуре, PALS учитывает важность каждого слоя на основе 99-го перцентиля амплитуд активаций, что позволяет сохранять точность модели при значительном сокращении количества параметров.