Исследования и наука
Дистилляция моделей как фактор устойчивости развития LLM
Дистилляция знаний остается ключевым методом обучения компактных и эффективных нейросетей, позволяя переносить способности крупных моделей в меньшие архитектуры. Несмотря на попытки ограничить доступ к передовым вычислительным мощностям, этот подход обеспечивает прогресс в создании локальных и специализированных языковых моделей, делая технологический разрыв между глобальными игроками менее критичным для развития национальных ИИ-экосистем.
Исследователи запустили симуляцию общества на базе LLM
Группа исследователей создала цифровую среду, в которой автономные ИИ-агенты на базе моделей Claude, ChatGPT, Grok и Gemini взаимодействуют друг с другом, имитируя поведение человеческого социума. Эксперимент направлен на изучение того, как крупные языковые модели принимают решения, формируют социальные связи и реагируют на внешние стимулы в условиях, приближенных к реальным общественным процессам.
Глубинное обучение как поиск функции: концептуальный разбор
Статья предлагает взгляд на глубокое обучение не как на «черный ящик», а как на процесс поиска оптимальной математической функции в многомерном пространстве. Автор анализирует фундаментальные принципы работы нейронных сетей, объясняя, как через минимизацию функции потерь и градиентный спуск модели аппроксимируют сложные закономерности, превращая входные данные в предсказания с высокой точностью.
Влияние LLM на научную продуктивность и качество исследований
Новое исследование анализирует, как внедрение больших языковых моделей меняет работу ученых. Авторы приходят к выводу, что ИИ-инструменты значительно повышают объем производимого контента, однако это приводит к снижению глубины проработки и качества научных публикаций. Рост продуктивности сопровождается риском «размытия» научной новизны и увеличения количества поверхностных работ в академической среде.
Исследование внутренних механизмов LLM выявило критические ошибки в промптах
Исследователи проанализировали внутренние процессы обработки информации в больших языковых моделях, обнаружив, что модели формируют своего рода «рабочее пространство» для выполнения задач. Этот механизм позволяет выявлять скрытые логические ошибки в промптах, которые ранее оставались незамеченными. Понимание того, как именно модель структурирует контекст внутри своих слоев, помогает оптимизировать запросы для повышения точности ответов.
ИИ решил математическую гипотезу Якобиана
Математическое сообщество столкнулось с серьезным вызовом после того, как ИИ-модель Claude от компании Anthropic успешно доказала гипотезу Якобиана — сложную проблему, остававшуюся нерешенной десятилетиями. Это событие вызвало дискуссии о смене парадигмы в фундаментальной науке, где автоматизированные системы начинают превосходить человеческие способности в поиске доказательств, меняя привычный уклад академической работы и роль математиков в процессе открытия.
VLM-IE3D: новый подход к пространственному мышлению мультимодальных моделей
Исследователи представили VLM-IE3D — архитектуру, которая наделяет мультимодальные модели (VLM) способностью к глубокому пониманию 3D-пространства. В отличие от стандартных моделей, работающих с 2D-изображениями, этот фреймворк интегрирует явные и неявные геометрические представления, что позволяет ИИ точнее интерпретировать пространственные отношения объектов, глубину и структуру сцены, значительно повышая качество выполнения задач, требующих 3D-рассуждений.
Expanding Generative Flows: новый метод генерации с переменной размерностью
Исследователи представили Expanding Generative Flows (EFlows) — новый подход к генеративным моделям на основе потоков. В отличие от традиционных методов, ограниченных фиксированной размерностью данных или длиной последовательности, EFlows позволяют моделировать распределения с динамически увеличивающейся размерностью. Это открывает возможности для более гибкой и масштабируемой генерации в непрерывных и дискретных пространствах состояний.
GraphVid: новый метод управления генерацией видео через графовые структуры
Исследователи представили GraphVid — метод генерации видео, использующий графовые структуры для управления взаимодействием объектов. В отличие от текстовых промптов или простых траекторий, этот подход позволяет точно задавать сложные динамические связи между элементами сцены. Решение решает проблему неоднозначности при перекрытии объектов и упрощает создание контента с высокой степенью детализации движений в сложных сценах.
Метод Барзилая-Борвейна не обеспечивает суперлинейную сходимость в задачах оптимизации
Исследователи опровергли гипотезу о суперлинейной сходимости метода Барзилая-Борвейна (BB) для широкого класса строго выпуклых квадратичных задач. Несмотря на высокую эффективность метода в практической оптимизации, математический анализ показал, что для любой размерности пространства n ≥ 4 существует открытое множество квадратичных функций, на которых алгоритм не демонстрирует ожидаемого ускорения сходимости.
Теория сюрпризала в лингвистике оказалась тавтологичной
Исследователи поставили под сомнение фундаментальную теорию сюрпризала (Surprisal Theory), связывающую сложность восприятия языка с предсказуемостью слов в контексте. Работа доказывает, что при отсутствии дополнительных ограничений утверждение о линейной зависимости между когнитивной нагрузкой и вероятностью слова становится математической тавтологией, лишенной эмпирической предсказательной силы.
EnsembleEGNN: новая модель для предсказания свойств молекулярных ансамблей
Исследователи представили EnsembleEGNN — фундаментальную модель для анализа молекулярных ансамблей, которая учитывает конформационную гибкость молекул. В отличие от традиционных подходов, использующих одну репрезентативную структуру, новая архитектура обрабатывает набор конформеров через общие слои эквивариантных графовых нейронных сетей (EGNN) с последующим пулингом, что значительно повышает точность предсказания свойств циклических пептидов.
ИИ-анализ пространственно-временных аномалий заболеваемости малярией в Гане
Исследователи применили метод обучения без учителя на основе консенсуса для анализа данных эпидемиологического надзора за малярией в Гане за период 2014–2023 годов. Алгоритм позволил выявить атипичные паттерны распространения заболевания, обладающие выраженной пространственно-временной структурой. Результаты исследования помогают локализовать очаги инфекции и точнее прогнозировать вспышки, что критически важно для эффективного распределения ресурсов здравоохранения в регионах с высокой нагрузкой.
Исследование механизмов сопротивления и соглашательства в моральных суждениях LLM
Исследователи проанализировали проблему склонности больших языковых моделей к «сикофанству» — необоснованному согласию с мнением пользователя ради одобрения. Авторы работы предлагают рассматривать этот процесс как сложную динамику между сопротивлением и комплаенсом. Модели должны научиться различать ситуации, когда стоит учитывать внешнюю точку зрения, а когда необходимо придерживаться собственных аргументированных моральных суждений для сохранения объективности.
Метод MIRROR улучшает визуальные рассуждения мультимодальных моделей
Исследователи представили метод MIRROR, направленный на устранение разрыва в логических способностях мультимодальных моделей (VLM). В отличие от LLM, VLM часто демонстрируют нестабильные результаты при работе с визуальными данными, даже если задача имеет текстовый эквивалент. Новый подход обучает модели сопоставлять и интегрировать информацию из различных представлений — текста, диаграмм и их комбинаций — для повышения точности рассуждений.
X$^3$-OPD: новый метод обучения аудио-языковых моделей логическому мышлению
Исследователи представили X$^3$-OPD — фреймворк для улучшения логических способностей аудио-языковых моделей через кросс-модальную дистилляцию. Метод переносит навыки рассуждения от мощных текстовых моделей к аудио-моделям, решая проблему нехватки качественных данных для обучения логике в звуковом формате. Это позволяет моделям эффективнее обрабатывать сложные аудио-задачи, требующие глубокого анализа и последовательных выводов.
Применение нейросетей для решения уравнений Дайсона-Швингера в квантовой теории поля
Исследователи представили новый метод решения связанных уравнений Дайсона-Швингера для глюонов и духов в четырехмерной теории Янга-Миллса с использованием нейронных сетей. Обучение модели проводилось исключительно на основе невязок ренормированных уравнений, что позволило достичь высокой точности и стабильности результатов, сопоставимых с традиционными методами численного решения при различных граничных условиях.
Теория устойчивого участия человека в автоматизированных системах
Исследователи представили теоретическую модель, оспаривающую идею о том, что присутствие человека в контуре управления — лишь временное ограничение текущих ИИ-систем. Авторы доказывают, что существуют фундаментальные границы автоматизации, где участие человека остается необходимым не из-за недостатка технологий, а в силу природы решаемых задач, требующих ответственности, этического суждения и адаптивности в условиях неопределенности.
GS-Agent: генерация 4D-миров на основе текстовых описаний
Исследователи представили GS-Agent — систему для автоматического создания динамических и физически корректных 4D-сред на основе текстовых промптов. Решение объединяет генеративные модели с физическим моделированием, позволяя формировать визуально детализированные миры с реалистичной анимацией и взаимодействием объектов, что значительно сокращает трудозатраты на ручную настройку материалов, освещения и траекторий движения в традиционной компьютерной графике.
Почему LLM злоупотребляют риторической фигурой эпанортозиса
Исследователи обнаружили, что современные большие языковые модели склонны к систематическому злоупотреблению эпанортозисом — риторическим приемом самокоррекции, при котором утверждение сначала отрицается, а затем уточняется. Этот паттерн, известный еще со времен Цицерона, стал характерной чертой генеративного текста, что негативно сказывается на естественности и лаконичности ответов ИИ в профессиональных и повседневных сценариях использования.
Мультимодальные LLM для ранней диагностики когнитивных нарушений по речи
Исследователи представили новый подход к выявлению когнитивных нарушений (CI) на основе анализа речи с использованием мультимодальных больших языковых моделей. Метод объединяет лингвистические и акустические маркеры, позволяя эффективно отслеживать признаки снижения когнитивных функций. Технология предлагает неинвазивную альтернативу традиционным методам диагностики, обеспечивая высокую точность анализа и потенциал для раннего вмешательства в клинической практике.
Исследование внутренних представлений моделей в задачах программирования
Исследователи проанализировали, как языковые модели формируют внутренние представления при работе с кодом. Изучив взаимодействие между языками программирования Python и Rust и архитектурами Qwen2.5-Coder-7B и DeepSeek-Coder-V1-6.7B, авторы выяснили, насколько схожим образом модели обрабатывают грамматические концепции. Результаты показывают, как именно архитектурные различия и специфика синтаксиса влияют на формирование знаний внутри нейросетей.
Thinkink: новый метод взаимодействия с LLM через рукописные заметки и скетчи
Исследователи представили Thinkink — интерфейс для взаимодействия с большими языковыми моделями через рукописный ввод. Система позволяет пользователям создавать заметки и скетчи на общем холсте, получая ответы от ИИ в аналогичном визуальном стиле. Интеграция семантического дерева и облегченного интерфейса обеспечивает естественное пространственное размещение сгенерированного контента, сохраняя контекст и структуру творческого процесса.
Новый метод локализации ИИ-сгенерированного текста в совместных документах
Исследователи представили новый метод для точного определения фрагментов текста, созданных языковыми моделями в документах с совместным авторством человека и ИИ. В отличие от существующих решений, которые классифицируют весь документ целиком, предложенный подход позволяет локализовать конкретные токены, сгенерированные алгоритмами, что критически важно для проверки подлинности контента и обеспечения прозрачности в процессах совместной работы.