Исследования и наука

ParVL: новый метод параллельного масштабирования мультимодальных LLM arXiv · 04.08.2026 Исследователи представили ParVL — метод масштабирования мультимодальных больших языковых моделей (MLLM), который устраняет жесткую привязку вычислительных ресурсов между визуальным энкодером и текстовым декодером. В отличие от традиционных подходов, увеличивающих задержку или потребление памяти, ParVL динамически распределяет вычисления, позволяя гибко адаптировать архитектуру под конкретные задачи без существенных накладных расходов на инференс. Масштабирование рассуждений LLM на этапе инференса arXiv · 04.08.2026 Исследователи проанализировали феномен «test-time scaling», при котором увеличение вычислительных затрат во время инференса позволяет языковым моделям решать более сложные задачи на логику. Работа систематизирует различные алгоритмы, от простого продления цепочки рассуждений до сложных методов поиска по дереву состояний, и оценивает их эффективность в зависимости от доступных ресурсов и архитектурных подходов. Agogic: новый подход к токенизации музыки для языковых моделей arXiv · 04.08.2026 Исследователи представили метод Agogic, оптимизирующий представление музыкальных данных для LLM. Авторы проанализировали влияние семи различных способов токенизации на качество генерации музыки, зафиксировав архитектуру модели Qwen3.5, объем обучающих данных и вычислительный бюджет. Результаты показывают, что выбор способа представления музыкальных символов критически влияет на итоговую производительность модели, задавая теоретический предел её возможностей. Критическая уязвимость ALiBi: почему модели теряют внимание arXiv · 04.08.2026 Исследователи обнаружили фундаментальную проблему в механизме позиционного кодирования ALiBi, используемом в ряде популярных LLM. Линейное масштабирование смещения приводит к потере точности вычислений с плавающей запятой, из-за чего значительная часть весов внимания обнуляется. Это делает отдельные головы внимания «слепыми», существенно снижая способность модели корректно обрабатывать контекст и длинные последовательности данных. Оценка качества синтетических гистопатологических изображений arXiv · 04.08.2026 Исследователи представили методологию оценки качества синтетических изображений в гистопатологии, направленную на решение проблемы нехватки данных для обучения медицинских ИИ-систем. Авторы проанализировали ограничения существующих метрик для диффузионных моделей и предложили подход, который точнее определяет пригодность сгенерированных гистологических срезов для клинических задач, обеспечивая надежность данных при обучении диагностических алгоритмов. Влияние способа ввода данных на производительность LLM-агентов arXiv · 04.08.2026 Исследователи представили HIVE — инструмент для анализа того, как различные способы ввода (текст против голоса) влияют на точность работы LLM. Работа демонстрирует, что каждый канал передачи данных привносит специфические искажения: опечатки при наборе текста и ошибки распознавания речи или лингвистические неточности при диктовке, что существенно меняет качество ответов моделей в агентных сценариях. Новый метод обучения GFlowNets через информационную геометрию arXiv · 04.08.2026 Исследователи представили новый подход к обучению прямых стратегий в Generative Flow Networks (GFlowNets) через призму информационной геометрии. Метод позволяет оптимизировать процесс сэмплирования траекторий, рассматривая стратегию как распределение вероятностей на пространстве путей. Это повышает эффективность обучения моделей, работающих с дискретными и смешанными данными, где требуется аппроксимация целевой плотности на основе заданных функций вознаграждения. Исследователи доказали фундаментальное превосходство квантовых схем над классическими LLM arXiv · 04.08.2026 Ученые представили доказательство того, что квантовые вычислительные системы принципиально превосходят современные архитектуры больших языковых моделей (LLM) в задачах генерации и предсказания данных. Исследование устанавливает границы вычислительных возможностей классических трансформеров, демонстрируя, что квантовые схемы способны решать определенные распределительные и генеративные задачи, недоступные для моделей с ограниченными ресурсами, даже при масштабировании классических архитектур. Теория игр для фундаментальных моделей: как ИИ-агенты приходят к рациональному сотрудничеству arXiv · 04.08.2026 Исследователи представили новую теоретико-игровую модель, объясняющую механизмы взаимодействия автономных ИИ-агентов. В отличие от классической теории, предполагающей независимость участников, новый подход учитывает «вывод сходства» (similarity inference). Это позволяет моделям предсказывать поведение других агентов на основе общих черт, что открывает пути к устойчивому рациональному сотрудничеству в сложных социально-экономических системах без необходимости в жестком централизованном управлении. TACT: новый метод дообучения LLM для адаптивного обучения английскому языку arXiv · 04.08.2026 Исследователи представили TACT — метод дообучения языковых моделей, ориентированный на педагогическую адаптивность в обучении английскому как второму языку (ESL). В отличие от стандартных LLM, ориентированных на беглость речи, TACT использует таксономию педагогических действий, позволяя модели выбирать стратегию поддержки ученика в зависимости от контекста диалога и поведения обучающегося, что значительно повышает эффективность образовательного процесса. Предварительное обучение на логических выводах ускоряет освоение естественного языка arXiv · 04.08.2026 Исследователи предложили новый метод предобучения языковых моделей, основанный на символьных данных и формальных логических выводах. Эксперименты показывают, что обучение на структурированных логических задачах перед переходом к естественному языку значительно повышает эффективность усвоения навыков и улучшает сжимаемость данных, позволяя моделям лучше улавливать сложные закономерности, чем при использовании традиционных алгоритмических примитивов. Использование трансформеров для моделирования динамики мышечных тканей arXiv · 04.08.2026 Исследователи представили архитектуру нейронной сети на базе трансформеров, адаптированную для анализа динамики сокращения искусственно выращенных скелетных мышц (ESM). Новый подход позволяет эффективно параметризовать сложные биомеханические процессы, заменяя упрощенные метрики силы более точным описанием кинетики тканей, что критически важно для фармацевтического тестирования и моделирования заболеваний в биомедицине. PRISM: новый метод преобразования временных рядов в изображения для поиска аномалий arXiv · 04.08.2026 Исследователи представили метод PRISM (Powerful Time Series to Image), который трансформирует многомерные временные ряды в визуальные представления для эффективного обнаружения аномалий. Подход решает проблему чувствительности моделей к выбору способа обработки данных в сложных высокоразмерных системах, предлагая унифицированный способ маппинга, который повышает точность диагностики в промышленном мониторинге, финансовой аналитике и облачных вычислениях. Новый взгляд на архитектуру Transformer: динамическая обработка данных при инференсе arXiv · 04.08.2026 Исследователи представили концепцию SIDPP (Sequence-level Interactive Dynamic Prompt-dependent Processing), переосмысливающую работу трансформеров во время генерации. Авторы доказывают, что LLM не просто воспроизводят статистические закономерности, а в процессе инференса создают и применяют динамические трансформации, параметры которых зависят от конкретного промпта. Это меняет понимание вычислительных возможностей современных нейросетевых архитектур. Equivariant Music Transformer: новая архитектура для понимания музыкальной структуры arXiv · 04.08.2026 Исследователи представили Equivariant Music Transformer — архитектуру, решающую проблему неспособности стандартных трансформеров сохранять инвариантность при сдвигах музыкальных фрагментов по времени или высоте тона. В отличие от классических моделей, которые при масштабировании теряют способность распознавать транспонированные или смещенные мелодии как идентичные, новая модель эффективно учитывает эквивариантность, обеспечивая более глубокое понимание музыкальных паттернов и их логических связей. EcoFrame: адаптивный метод анализа длинных видео для VLM arXiv · 04.08.2026 Исследователи представили EcoFrame — новый метод для эффективного анализа длинных видео с помощью мультимодальных моделей (VLM). В отличие от стандартных подходов с фиксированным набором кадров или затратных агентных систем, EcoFrame динамически определяет, какие фрагменты видео наиболее важны для понимания контекста, что позволяет значительно сократить вычислительные ресурсы без потери точности при обработке видеопотока. Концепция причинного восприятия в многоагентных системах arXiv · 04.08.2026 Исследователи представили фреймворк причинного восприятия (Causal Perception), описывающий ситуации, когда ИИ-агенты используют конкурирующие структурные причинно-следственные модели (SCM) для анализа одной и той же системы. Различия в моделях приводят к тому, что агенты делают разные выводы о вероятностных распределениях и справедливости принимаемых решений, даже при идентичных внешних воздействиях на среду. Новый метод восстановления траекторий через Acceleration Matching arXiv · 04.08.2026 Исследователи представили метод Acceleration Matching для восстановления непрерывных траекторий по разрозненным временным снимкам данных. Подход позволяет избежать сложных этапов предварительной обработки и ресурсоемкого моделирования, характерных для существующих алгоритмов. Новый метод обеспечивает высокую точность интерполяции динамических процессов, что критически важно для анализа данных в биологии, физике и других научных дисциплинах, где наблюдения фиксируются дискретно. Sparse Weight Decomposition: новый метод интерпретируемости нейросетей arXiv · 04.08.2026 Исследователи представили метод Sparse Weight Decomposition (SWD) для извлечения интерпретируемых схем из предобученных трансформеров. В отличие от существующих подходов, требующих обучения вспомогательных разреженных моделей, SWD позволяет анализировать веса исходной нейросети напрямую. Это устраняет вычислительные затраты и разрыв в точности между анализируемым представлением и оригинальной архитектурой, повышая прозрачность работы сложных моделей. Новый подход к социальному выравниванию ИИ-агентов через теорию множественных перспектив arXiv · 04.08.2026 Исследователи представили концепцию социально обоснованных ИИ-агентов, способных учитывать плюрализм мнений в сложных социальных контекстах. Вместо оптимизации под единый набор ценностей, авторы предлагают архитектуру, которая распознает и интегрирует различные легитимные точки зрения. Это позволяет агентам эффективнее координировать действия в условиях разнородных социальных ожиданий и этических норм, минимизируя конфликты при взаимодействии с пользователями. ANNOTARES: новый датасет для анализа логической структуры немецких правовых текстов arXiv · 04.08.2026 Исследователи представили ANNOTARES — специализированный набор данных для автоматического анализа структуры немецких законодательных актов. Проект фокусируется на сегментации правовых норм, выделяя условия (Tatbestand) и соответствующие им юридические последствия (Rechtsfolge). Инструмент призван автоматизировать извлечение логических компонентов из сложных юридических документов, что является критически важным этапом для развития современных LegalTech-решений и систем правовой аналитики. Управление временными предпочтениями LLM через активационные векторы arXiv · 04.08.2026 Исследователи представили метод коррекции временных предпочтений модели Qwen3-32B с помощью контрастного добавления активаций. Анализируя линейные представления временного горизонта в остаточном потоке модели, авторы научились направлять ответы ИИ в сторону краткосрочных или долгосрочных приоритетов. Это позволяет менять характер рекомендаций и логику принятия решений без необходимости полноценного дообучения весов нейросети. CARE-X: мультимодальная модель для клинической радиологии arXiv · 04.08.2026 Исследователи представили CARE-X — специализированную мультимодальную модель (VLM) для анализа рентгеновских снимков грудной клетки. В отличие от стандартных моделей, генерирующих только текстовое описание, CARE-X объединяет классификацию патологий с настраиваемыми порогами принятия решений, пространственную локализацию находок и автоматическое проведение анатомических измерений, критически важных для постановки точных медицинских диагнозов. Влияние контекста диалога на точность ответов LLM Hacker News · 04.08.2026 Исследователи проанализировали, как история предыдущих сообщений влияет на качество генерации ответов в современных LLM. Работа показывает, что модели склонны к «дрейфу контекста», когда накопленные данные диалога начинают искажать логику ответов на последующие запросы. Авторы предлагают методы минимизации этого эффекта для повышения стабильности агентных систем и чат-ботов при длительных сессиях взаимодействия.