Исследования и наука
ParVL: новый метод параллельного масштабирования мультимодальных LLM
Исследователи представили ParVL — метод масштабирования мультимодальных больших языковых моделей (MLLM), который устраняет жесткую привязку вычислительных ресурсов между визуальным энкодером и текстовым декодером. В отличие от традиционных подходов, увеличивающих задержку или потребление памяти, ParVL динамически распределяет вычисления, позволяя гибко адаптировать архитектуру под конкретные задачи без существенных накладных расходов на инференс.
Масштабирование рассуждений LLM на этапе инференса
Исследователи проанализировали феномен «test-time scaling», при котором увеличение вычислительных затрат во время инференса позволяет языковым моделям решать более сложные задачи на логику. Работа систематизирует различные алгоритмы, от простого продления цепочки рассуждений до сложных методов поиска по дереву состояний, и оценивает их эффективность в зависимости от доступных ресурсов и архитектурных подходов.
Agogic: новый подход к токенизации музыки для языковых моделей
Исследователи представили метод Agogic, оптимизирующий представление музыкальных данных для LLM. Авторы проанализировали влияние семи различных способов токенизации на качество генерации музыки, зафиксировав архитектуру модели Qwen3.5, объем обучающих данных и вычислительный бюджет. Результаты показывают, что выбор способа представления музыкальных символов критически влияет на итоговую производительность модели, задавая теоретический предел её возможностей.
Критическая уязвимость ALiBi: почему модели теряют внимание
Исследователи обнаружили фундаментальную проблему в механизме позиционного кодирования ALiBi, используемом в ряде популярных LLM. Линейное масштабирование смещения приводит к потере точности вычислений с плавающей запятой, из-за чего значительная часть весов внимания обнуляется. Это делает отдельные головы внимания «слепыми», существенно снижая способность модели корректно обрабатывать контекст и длинные последовательности данных.
Оценка качества синтетических гистопатологических изображений
Исследователи представили методологию оценки качества синтетических изображений в гистопатологии, направленную на решение проблемы нехватки данных для обучения медицинских ИИ-систем. Авторы проанализировали ограничения существующих метрик для диффузионных моделей и предложили подход, который точнее определяет пригодность сгенерированных гистологических срезов для клинических задач, обеспечивая надежность данных при обучении диагностических алгоритмов.
Влияние способа ввода данных на производительность LLM-агентов
Исследователи представили HIVE — инструмент для анализа того, как различные способы ввода (текст против голоса) влияют на точность работы LLM. Работа демонстрирует, что каждый канал передачи данных привносит специфические искажения: опечатки при наборе текста и ошибки распознавания речи или лингвистические неточности при диктовке, что существенно меняет качество ответов моделей в агентных сценариях.
Новый метод обучения GFlowNets через информационную геометрию
Исследователи представили новый подход к обучению прямых стратегий в Generative Flow Networks (GFlowNets) через призму информационной геометрии. Метод позволяет оптимизировать процесс сэмплирования траекторий, рассматривая стратегию как распределение вероятностей на пространстве путей. Это повышает эффективность обучения моделей, работающих с дискретными и смешанными данными, где требуется аппроксимация целевой плотности на основе заданных функций вознаграждения.
Исследователи доказали фундаментальное превосходство квантовых схем над классическими LLM
Ученые представили доказательство того, что квантовые вычислительные системы принципиально превосходят современные архитектуры больших языковых моделей (LLM) в задачах генерации и предсказания данных. Исследование устанавливает границы вычислительных возможностей классических трансформеров, демонстрируя, что квантовые схемы способны решать определенные распределительные и генеративные задачи, недоступные для моделей с ограниченными ресурсами, даже при масштабировании классических архитектур.
Теория игр для фундаментальных моделей: как ИИ-агенты приходят к рациональному сотрудничеству
Исследователи представили новую теоретико-игровую модель, объясняющую механизмы взаимодействия автономных ИИ-агентов. В отличие от классической теории, предполагающей независимость участников, новый подход учитывает «вывод сходства» (similarity inference). Это позволяет моделям предсказывать поведение других агентов на основе общих черт, что открывает пути к устойчивому рациональному сотрудничеству в сложных социально-экономических системах без необходимости в жестком централизованном управлении.
TACT: новый метод дообучения LLM для адаптивного обучения английскому языку
Исследователи представили TACT — метод дообучения языковых моделей, ориентированный на педагогическую адаптивность в обучении английскому как второму языку (ESL). В отличие от стандартных LLM, ориентированных на беглость речи, TACT использует таксономию педагогических действий, позволяя модели выбирать стратегию поддержки ученика в зависимости от контекста диалога и поведения обучающегося, что значительно повышает эффективность образовательного процесса.
Предварительное обучение на логических выводах ускоряет освоение естественного языка
Исследователи предложили новый метод предобучения языковых моделей, основанный на символьных данных и формальных логических выводах. Эксперименты показывают, что обучение на структурированных логических задачах перед переходом к естественному языку значительно повышает эффективность усвоения навыков и улучшает сжимаемость данных, позволяя моделям лучше улавливать сложные закономерности, чем при использовании традиционных алгоритмических примитивов.
Использование трансформеров для моделирования динамики мышечных тканей
Исследователи представили архитектуру нейронной сети на базе трансформеров, адаптированную для анализа динамики сокращения искусственно выращенных скелетных мышц (ESM). Новый подход позволяет эффективно параметризовать сложные биомеханические процессы, заменяя упрощенные метрики силы более точным описанием кинетики тканей, что критически важно для фармацевтического тестирования и моделирования заболеваний в биомедицине.
PRISM: новый метод преобразования временных рядов в изображения для поиска аномалий
Исследователи представили метод PRISM (Powerful Time Series to Image), который трансформирует многомерные временные ряды в визуальные представления для эффективного обнаружения аномалий. Подход решает проблему чувствительности моделей к выбору способа обработки данных в сложных высокоразмерных системах, предлагая унифицированный способ маппинга, который повышает точность диагностики в промышленном мониторинге, финансовой аналитике и облачных вычислениях.
Новый взгляд на архитектуру Transformer: динамическая обработка данных при инференсе
Исследователи представили концепцию SIDPP (Sequence-level Interactive Dynamic Prompt-dependent Processing), переосмысливающую работу трансформеров во время генерации. Авторы доказывают, что LLM не просто воспроизводят статистические закономерности, а в процессе инференса создают и применяют динамические трансформации, параметры которых зависят от конкретного промпта. Это меняет понимание вычислительных возможностей современных нейросетевых архитектур.
Equivariant Music Transformer: новая архитектура для понимания музыкальной структуры
Исследователи представили Equivariant Music Transformer — архитектуру, решающую проблему неспособности стандартных трансформеров сохранять инвариантность при сдвигах музыкальных фрагментов по времени или высоте тона. В отличие от классических моделей, которые при масштабировании теряют способность распознавать транспонированные или смещенные мелодии как идентичные, новая модель эффективно учитывает эквивариантность, обеспечивая более глубокое понимание музыкальных паттернов и их логических связей.
EcoFrame: адаптивный метод анализа длинных видео для VLM
Исследователи представили EcoFrame — новый метод для эффективного анализа длинных видео с помощью мультимодальных моделей (VLM). В отличие от стандартных подходов с фиксированным набором кадров или затратных агентных систем, EcoFrame динамически определяет, какие фрагменты видео наиболее важны для понимания контекста, что позволяет значительно сократить вычислительные ресурсы без потери точности при обработке видеопотока.
Концепция причинного восприятия в многоагентных системах
Исследователи представили фреймворк причинного восприятия (Causal Perception), описывающий ситуации, когда ИИ-агенты используют конкурирующие структурные причинно-следственные модели (SCM) для анализа одной и той же системы. Различия в моделях приводят к тому, что агенты делают разные выводы о вероятностных распределениях и справедливости принимаемых решений, даже при идентичных внешних воздействиях на среду.
Новый метод восстановления траекторий через Acceleration Matching
Исследователи представили метод Acceleration Matching для восстановления непрерывных траекторий по разрозненным временным снимкам данных. Подход позволяет избежать сложных этапов предварительной обработки и ресурсоемкого моделирования, характерных для существующих алгоритмов. Новый метод обеспечивает высокую точность интерполяции динамических процессов, что критически важно для анализа данных в биологии, физике и других научных дисциплинах, где наблюдения фиксируются дискретно.
Sparse Weight Decomposition: новый метод интерпретируемости нейросетей
Исследователи представили метод Sparse Weight Decomposition (SWD) для извлечения интерпретируемых схем из предобученных трансформеров. В отличие от существующих подходов, требующих обучения вспомогательных разреженных моделей, SWD позволяет анализировать веса исходной нейросети напрямую. Это устраняет вычислительные затраты и разрыв в точности между анализируемым представлением и оригинальной архитектурой, повышая прозрачность работы сложных моделей.
Новый подход к социальному выравниванию ИИ-агентов через теорию множественных перспектив
Исследователи представили концепцию социально обоснованных ИИ-агентов, способных учитывать плюрализм мнений в сложных социальных контекстах. Вместо оптимизации под единый набор ценностей, авторы предлагают архитектуру, которая распознает и интегрирует различные легитимные точки зрения. Это позволяет агентам эффективнее координировать действия в условиях разнородных социальных ожиданий и этических норм, минимизируя конфликты при взаимодействии с пользователями.
ANNOTARES: новый датасет для анализа логической структуры немецких правовых текстов
Исследователи представили ANNOTARES — специализированный набор данных для автоматического анализа структуры немецких законодательных актов. Проект фокусируется на сегментации правовых норм, выделяя условия (Tatbestand) и соответствующие им юридические последствия (Rechtsfolge). Инструмент призван автоматизировать извлечение логических компонентов из сложных юридических документов, что является критически важным этапом для развития современных LegalTech-решений и систем правовой аналитики.
Управление временными предпочтениями LLM через активационные векторы
Исследователи представили метод коррекции временных предпочтений модели Qwen3-32B с помощью контрастного добавления активаций. Анализируя линейные представления временного горизонта в остаточном потоке модели, авторы научились направлять ответы ИИ в сторону краткосрочных или долгосрочных приоритетов. Это позволяет менять характер рекомендаций и логику принятия решений без необходимости полноценного дообучения весов нейросети.
CARE-X: мультимодальная модель для клинической радиологии
Исследователи представили CARE-X — специализированную мультимодальную модель (VLM) для анализа рентгеновских снимков грудной клетки. В отличие от стандартных моделей, генерирующих только текстовое описание, CARE-X объединяет классификацию патологий с настраиваемыми порогами принятия решений, пространственную локализацию находок и автоматическое проведение анатомических измерений, критически важных для постановки точных медицинских диагнозов.
Влияние контекста диалога на точность ответов LLM
Исследователи проанализировали, как история предыдущих сообщений влияет на качество генерации ответов в современных LLM. Работа показывает, что модели склонны к «дрейфу контекста», когда накопленные данные диалога начинают искажать логику ответов на последующие запросы. Авторы предлагают методы минимизации этого эффекта для повышения стабильности агентных систем и чат-ботов при длительных сессиях взаимодействия.