Исследования и наука
Open Meditron: открытый пайплайн для создания клинических LLM
Исследователи представили Open Meditron — прозрачный и воспроизводимый пайплайн для разработки медицинских языковых моделей. Проект решает проблему «черного ящика» в клиническом ИИ, предлагая полностью аудируемый процесс: от подготовки специализированных наборов данных до этапов обучения и оценки качества ответов, что критически важно для обеспечения безопасности и достоверности медицинской информации в автоматизированных системах.
Xiaomi Robotics-1: качество данных важнее масштаба модели в робототехнике
Компания Xiaomi представила модель Xiaomi Robotics-1, обученную на 100 000 часах данных о движении. Исследование показало, что увеличение объема качественных данных дает более значительный прирост производительности роботов, чем простое масштабирование параметров модели. Этот подход позволяет эффективнее обучать манипуляторы сложным действиям, даже при сохранении текущей архитектуры нейросети.
ИИ решил математическую задачу 87-летней давности
Исследователи применили нейросетевую модель для решения фундаментальной математической проблемы, известной как «задача о наборе чисел» (cap set problem), которая оставалась нерешенной с 1937 года. ИИ обнаружил новые способы построения математических объектов, превзойдя результаты, полученные экспертами-математиками вручную, что открывает перспективы для использования алгоритмов в поиске доказательств сложных теоретических теорем.
ИИ-модель Anthropic Claude 3.5 Sonnet опровергла математическую гипотезу
Исследователи использовали модель Claude 3.5 Sonnet от компании Anthropic для решения сложной математической задачи, связанной с гипотезой Якобиана. ИИ смог найти контрпример, который опровергает утверждение, десятилетиями остававшееся открытым вопросом в алгебраической геометрии. Это достижение демонстрирует способность современных языковых моделей к выполнению нетривиальных логических выводов и формальных математических доказательств, выходящих за рамки простого анализа данных.
Проблема глубины в исследованиях агентных систем
Современные исследования ИИ-агентов часто фокусируются на широких бенчмарках, которые не отражают реальную сложность задач. Анализ показывает, что текущие методы оценки не учитывают глубину рассуждений и способность агентов к долгосрочному планированию. В результате модели показывают высокие результаты на простых тестах, но терпят неудачу при решении многоэтапных инженерных или исследовательских задач, требующих глубокой контекстуальной проработки.
Google DeepMind представила Cue AI: исследование способности моделей к планированию
Google DeepMind выпустила Cue AI — исследовательский проект, направленный на изучение навыков долгосрочного планирования у языковых моделей. В рамках работы специалисты протестировали способность ИИ разбивать сложные задачи на последовательные этапы, используя семейство моделей Gemma. Результаты показывают, как именно архитектурные особенности и методы обучения влияют на логическую связность действий агентов в динамических средах.
ИИ решил математическую гипотезу, остававшуюся открытой 20 лет
Исследователи применили методы машинного обучения для решения давней математической задачи в теории графов, которая оставалась нерешенной на протяжении двух десятилетий. Использование ИИ позволило найти контрпример для гипотезы о раскраске графов, что стало значимым достижением в области автоматизированного поиска математических доказательств и подтвердило эффективность нейросетевых подходов в фундаментальной науке.
Концепция агентных моделей мира: переход от предсказания к планированию
Исследователи переосмысливают архитектуру LLM, внедряя концепцию «агентных моделей мира». В отличие от стандартных языковых моделей, которые лишь предсказывают следующий токен, такие системы обучаются моделировать динамику среды и последствия действий. Это позволяет агентам строить долгосрочные планы, учитывая причинно-следственные связи и возможные изменения в окружении, что критически важно для автономного принятия решений в сложных условиях.
Более 30% новых публикаций на arXiv содержат признаки использования ИИ
Исследователи проанализировали динамику публикаций на платформе arXiv и обнаружили, что доля научных работ с характерными лингвистическими паттернами ИИ-генерации превысила 30%. Анализ охватил миллионы текстов, выявив резкий рост использования LLM в академической среде. Это ставит под вопрос качество научной фильтрации и требует пересмотра подходов к верификации контента в академических репозиториях.
Anthropic обучила Claude управлять роботами через визуальный интерфейс
Компания Anthropic представила исследование, демонстрирующее способность модели Claude 3.5 Sonnet управлять робототехническими системами. ИИ анализирует визуальные данные с камер в реальном времени и преобразует их в последовательность команд для манипуляторов. Система демонстрирует высокую точность выполнения задач, требующих координации движений и понимания физического пространства, без необходимости специализированного обучения под конкретное оборудование.
Новая метрика визуального сходства с учетом текстовых промптов
Исследователи представили новый подход к оценке визуального сходства изображений, который учитывает контекстуальные предпочтения человека. В отличие от традиционных метрик, сводящих сравнение к единому скалярному значению, предложенный метод позволяет задавать фокус внимания через текстовые промпты. Это дает возможность оценивать сходство объектов по конкретным признакам, таким как форма, цвет или текстура, что критически важно для развития генеративных моделей.
Patch Policy: новый подход к управлению роботами через плотные визуальные представления
Исследователи представили метод Patch Policy, который оптимизирует управление роботами за счет использования плотных визуальных признаков из предобученных Vision Transformers (ViT). В отличие от традиционных подходов, сжимающих данные в один глобальный токен, этот метод сохраняет пространственную детализацию изображения, что позволяет роботам точнее взаимодействовать с объектами в сложной среде и повышает эффективность обучения моделей управления.
Исследование: системы автоматизированного поиска не имеют универсального превосходства
Исследователи проанализировали эффективность систем автоматизированного поиска, таких как OpenEvolve и TTT-Discover, и пришли к выводу об отсутствии универсально превосходящего метода. Авторы подчеркивают, что текущие системы представляют собой сложные комбинации стратегий выбора родителей, управления архивами и распределения вычислительного бюджета, что делает их сравнение крайне затруднительным из-за высокой стоимости запусков и стохастической природы процессов.
Исследование стабильности логических суждений LLM через мягкие префиксы
Исследователи изучили устойчивость логического мышления языковых моделей при воздействии внешних контекстных факторов. Используя метод мягких префиксов (soft prefixes) — непрерывных векторов, добавляемых к входным данным, — авторы проанализировали, как подобные манипуляции влияют на точность решения силлогизмов. Эксперименты показывают, что даже при неизменных весах модели, специфические векторные префиксы способны существенно изменять логическую стабильность ответов.
Применение RAG для обучения стратегий принятия решений в причинно-следственном анализе
Исследователи предложили новый метод обучения стратегий (policy learning) с использованием RAG, адаптированный для задач причинно-следственного вывода. Подход формулирует выбор действий через фреймворк потенциальных исходов, где векторный поиск используется для подбора релевантных доказательств. Это позволяет моделям точнее оценивать ожидаемые результаты и оптимизировать принятие решений на основе эмпирических данных из векторных баз.
GigaPath-Flash и GigaTIME-Flash: ускоренные модели для анализа гистопатологии
Исследователи представили GigaPath-Flash и GigaTIME-Flash — специализированные foundation-модели для вычислительной патологии. Новые архитектуры оптимизированы для анализа полноразмерных гистологических слайдов и микроокружения опухолей. Модели значительно повышают эффективность обработки крупномасштабных медицинских данных, предлагая ускоренные методы извлечения признаков для задач диагностики, прогнозирования течения заболеваний и подбора персонализированной терапии в онкологии.
Метод ATLAS для выделения инвариантных факторов в гетерогенных данных
Исследователи представили метод ATLAS, предназначенный для анализа многомерных данных из различных сред. Алгоритм разделяет скрытую структуру данных на инвариантные факторы с общими нагрузками и гетерогенные компоненты, специфичные для конкретных условий. Это позволяет эффективно переносить знания между средами, даже если вспомогательные метки доступны лишь для части наборов данных, повышая точность моделей в условиях нестабильности распределений.
Трансформеры как решатели задачи оптимального транспорта
Исследователи обнаружили математическую связь между архитектурой трансформеров и задачей оптимального транспорта (Entropic Optimal Transport, EOT). Оказалось, что процесс внимания (attention) в моделях по сути является итеративным алгоритмом поиска оптимального плана перемещения вероятностных масс. Это открытие дает теоретическое обоснование того, почему трансформеры эффективно обучаются на сложных распределениях данных и как именно они структурируют информацию в скрытых пространствах.
Новый метод генеративного моделирования на основе задачи трех тел
Исследователи представили метод Three-Body Scattering Modeling (TBSM), предлагающий альтернативу традиционным подходам к генерации данных. Вместо использования состязательных сетей, диффузионных путей или авторегрессионных моделей, новый подход опирается на физическую концепцию рассеяния трех тел. Это позволяет задать энергетическое распределение, которое напрямую направляет движение сэмплов и обеспечивает обучение одношаговых генераторов с высокой точностью.
Сертифицированное обучение для защиты моделей зрения от размытия
Исследователи представили метод обучения нейросетей, обеспечивающий устойчивость к динамическим искажениям, таким как размытие при движении камеры. В отличие от стандартной аугментации данных, новый подход позволяет математически гарантировать корректную работу моделей в условиях реальных помех. Это критически важно для систем компьютерного зрения, работающих в автономном транспорте, робототехнике и системах безопасности, где ошибки распознавания недопустимы.
EVOLVE: новый метод нейронного сжатия объемных научных данных
Исследователи представили метод EVOLVE для эффективного сжатия крупномасштабных научных данных с использованием нейронных представлений. В отличие от традиционных алгоритмов, технология обеспечивает высокую степень сжатия при сохранении критически важных структурных деталей. Решение оптимизировано для работы с кросс-доменными базами данных, что позволяет значительно снизить требования к пропускной способности сетей и объему хранилищ при анализе сложных симуляций.
Новый подход к оценке ошибки Байеса в задачах классификации
Исследователи представили математическое обоснование того, как калибровочный канал влияет на оценку ошибки Байеса через прокси-функции. Работа показывает, что стандартные методы оценки неустранимой ошибки на основе мягких меток (soft labels) часто дают неточные результаты, если вероятности отклоняются от истинных апостериорных значений, и предлагает уточненный подход для повышения точности метрик в задачах машинного обучения.
Использование LLM для верификации кода сетевого стека Linux
Исследователи применили LLM для автоматизации поиска критических ошибок в подсистеме nftables ядра Linux. Использование языковых моделей в связке с формальными методами верификации позволило выявить уязвимости, которые ранее оставались незамеченными при стандартном тестировании. Этот подход демонстрирует новый уровень интеграции ИИ в процессы обеспечения безопасности низкоуровневого системного программного обеспечения и критической инфраструктуры.
LLM в дизайне лекарств: бенчмарк молекулярного связывания
Исследователи представили новый подход к использованию больших языковых моделей (LLM) в дизайне лекарств на основе структуры белков (SBDD). В работе проанализирована способность моделей генерировать молекулы-кандидаты с учетом пространственных ограничений. Результаты показывают, что LLM становятся серьезными конкурентами диффузионным моделям, традиционно доминирующим в задачах генерации 3D-структур молекул, демонстрируя высокую точность в условиях связывания с активным центром белка.