Исследования и наука
Исследователи KAIST научили ИИ распознавать жесты мыши как язык
Ученые из Корейского института передовых технологий (KAIST) разработали систему, интерпретирующую движения компьютерной мыши как естественный язык. Технология анализирует траектории, скорость и ускорение курсора, преобразуя их в текстовые команды или смысловые конструкции. Это открывает новые возможности для бесконтактного управления интерфейсами и создания альтернативных методов ввода данных для пользователей с ограниченными возможностями.
Anthropic представила обновленную модель Fable 5 для анализа безопасности ИИ
Компания Anthropic выпустила обновленную версию модели Fable 5, предназначенную для автоматизированного тестирования безопасности ИИ-систем. Инструмент имитирует сложные сценарии атак, позволяя исследователям выявлять уязвимости в поведении моделей до их публичного релиза. Обновление направлено на повышение устойчивости ИИ к попыткам обхода этических ограничений и вредоносному использованию в реальных условиях.
Законы масштабирования LLM применимы к данным с датчиков
Исследователи Empirical Health подтвердили, что эмпирические законы масштабирования, характерные для больших языковых моделей, работают и для данных с носимых устройств. Увеличение вычислительных мощностей, объема обучающей выборки и количества параметров модели приводит к предсказуемому росту точности при анализе биометрических показателей, что открывает новые возможности для предиктивной медицины и анализа временных рядов.
Масштабируемые GAN на базе архитектуры Transformer
Исследователи представили новый подход к обучению генеративно-состязательных сетей (GAN), интегрировав в них архитектуру Transformer. Метод позволяет эффективно масштабировать генерацию изображений высокого разрешения, преодолевая традиционные ограничения GAN в стабильности обучения и качестве синтеза данных. Авторы демонстрируют, что сочетание механизмов внимания с состязательным обучением обеспечивает конкурентоспособные результаты по сравнению с современными диффузионными моделями.
Обучение ИИ в симулированных средах как замена статичным данным
Разработчики ИИ сталкиваются с дефицитом качественных текстовых данных для обучения моделей, что замедляет прогресс в создании продвинутых чат-ботов. В качестве решения исследователи переходят к использованию симулированных миров, где агенты обучаются через взаимодействие с виртуальной средой. Этот подход позволяет моделям самостоятельно генерировать опыт, проверять гипотезы и осваивать сложные логические цепочки, недоступные при пассивном чтении текстов из интернета.
ИИ-модели связывают развитие эмбрионов, экологию и генетические заболевания
Исследователи применяют методы машинного обучения для анализа сложных биологических систем, объединяя данные о развитии эмбрионов, влиянии окружающей среды и механизмах возникновения болезней. Новые вычислительные подходы позволяют выявлять скрытые закономерности в экспрессии генов, что помогает предсказывать последствия внешних воздействий на организм и лучше понимать природу врожденных патологий на молекулярном уровне.
Применение LLM для решения задач оптимизации в научных исследованиях
Исследователь Эллиот Смит представил подход к автоматизации научных изысканий с использованием Claude 3.5 Sonnet для решения задач с ограничениями. Метод заключается в итеративном уточнении параметров поиска и проверке гипотез через программный код, что позволяет эффективно находить оптимальные конфигурации систем, минимизируя ручное вмешательство и повышая точность результатов в сложных вычислительных экспериментах.
Фреймворк для создания верифицируемых синтетических корпоративных данных
Исследователи представили фреймворк для симуляции деятельности корпораций с помощью множества ИИ-агентов. Система позволяет генерировать верифицируемые синтетические наборы данных, имитирующие сложные бизнес-процессы и взаимодействие сотрудников. Такой подход решает проблему дефицита качественных данных для обучения моделей, обеспечивая при этом прозрачность и проверяемость каждой транзакции или коммуникации внутри виртуальной организации.
Метод Introspective Coupling улучшает интерпретируемость языковых моделей
Исследователи представили метод Introspective Coupling, позволяющий языковым моделям генерировать более точные объяснения своих решений. В отличие от стандартного обучения, где модель имитирует поверхностные паттерны, новый подход использует контрфактуальные данные для проверки того, какие именно признаки входных данных действительно влияют на поведение системы, обеспечивая более глубокую связь между логикой модели и её итоговым ответом.
Метакогнитивная обратная связь повышает точность оценки уверенности LLM
Исследователи представили метод обучения с подкреплением (RL), который наделяет большие языковые модели способностью к метапознанию — мониторингу собственных когнитивных процессов. Внедрение метакогнитивной обратной связи позволяет моделям более точно выражать внутреннюю неуверенность, снижая склонность к самоуверенным галлюцинациям и помогая системе лучше распознавать границы своих знаний в сложных задачах.
Исследование ошибок обращения к данным в таблицах при работе с LLM
Исследователи проанализировали проблему ошибок обращения к данным (Data Referencing Errors, DRE) в больших языковых моделях при работе с таблицами. Несмотря на понимание структуры, модели часто некорректно цитируют или пропускают значения, что подрывает надежность промежуточных этапов рассуждений. Авторы работы предложили методы оценки и снижения таких ошибок, повышая точность извлечения информации из структурированных данных.
AdaJEPA: адаптивная модель мира для планирования в условиях неопределенности
Исследователи представили AdaJEPA — адаптивную латентную модель мира, способную корректировать свои прогнозы в режиме реального времени. В отличие от стандартных моделей, которые остаются статичными после обучения, AdaJEPA адаптируется к изменениям среды во время тестирования. Это позволяет системе сохранять точность планирования даже при возникновении значительных отклонений от обучающего распределения данных.
SemRF: новый метод анализа динамики остаточного потока в LLM
Исследователи представили SemRF (Semantic Reference Frames) — формализм для анализа вычислений внутри языковых моделей. Метод решает проблему «дрейфа измерений», возникающую при сравнении промежуточных состояний модели на разных слоях. Использование семантических якорей позволяет исследователям точно отслеживать эволюцию представлений данных, отделяя реальные вычислительные процессы от артефактов интерпретации, вызванных несоответствием координат чтения.
Метод CoMet для оценки неопределенности в мультимодальных моделях
Исследователи представили метод CoMet (Context and Multiplicity Decomposition), предназначенный для оценки неопределенности в мультимодальных больших языковых моделях (MLLM). Новый подход позволяет моделям лучше распознавать границы своих знаний, разделяя факторы неопределенности на контекстуальные и множественные. Это критически важно для повышения надежности ИИ-систем, работающих с текстовыми и визуальными данными в условиях высокой ответственности.
Исследование: можно ли использовать открытые LLM для интерпретации закрытых моделей
Исследователи изучили проблему «суррогатной верности» в механистической интерпретируемости ИИ. Поскольку проприетарные модели предоставляют доступ только к выходным токенам, ученые оценили, насколько анализ открытых моделей позволяет делать выводы о внутренних процессах закрытых систем. Работа охватывает уровни предсказаний, атрибуции и представлений, выявляя границы применимости таких методов в условиях ограниченного доступа к архитектуре нейросетей.
Риски использования синтетических QA-пар при обучении языковых моделей
Исследователи выявили скрытую уязвимость в методах дообучения языковых моделей с помощью синтетических данных. Использование пар «вопрос-ответ», сгенерированных самой моделью на основе исходных документов, искажает процесс обучения. Этот подход не является нейтральным: он неосознанно фильтрует информацию, отдавая предпочтение одним фактам перед другими, что приводит к деградации способности модели к полноценному извлечению знаний из текста.
Геометрия обучения: почему нейросети сначала запоминают данные, а потом обобщают
Исследователи выявили геометрическую причину задержки между запоминанием обучающей выборки и способностью нейросетей к обобщению. Процесс оптимизации через кросс-энтропию вызывает «радиальную инфляцию» скрытых представлений, что препятствует быстрому поиску низкоразмерных алгоритмических структур. Авторы предлагают метод радиального подавления, который ускоряет переход модели от простого заучивания данных к формированию устойчивых алгоритмических закономерностей.
Оптимизация начальной популяции в генетическом программировании для символьной регрессии
Исследователи проанализировали влияние методов инициализации начальной популяции на эффективность генетического программирования (ГП) при решении задач символьной регрессии. Сравнение классических случайных подходов с использованием предварительно оптимизированных решений показало, что качество исходных данных напрямую определяет точность и вычислительную сложность итоговых моделей. Работа предлагает новые стратегии для повышения производительности алгоритмов в задачах поиска математических закономерностей.
LUNA: нейросетевая модель для 3D-анимации человека без использования скининга
Исследователи представили LUNA — универсальную модель для создания фотореалистичных 3D-аватаров, которая отказывается от традиционного метода Linear Blend Skinning (LBS). Система напрямую преобразует 2D-данные, включая изображения, ключевые точки и наброски, в качественную 3D-анимацию. Это позволяет обходить ограничения параметрических моделей тела и избегать артефактов, возникающих при неточном наложении текстур на скелетную структуру.
DigitalCoach: новый датасет для обучения ИИ-агентов навыкам взаимодействия с пользователем
Исследователи представили DigitalCoach — мультимодальный датасет, предназначенный для изучения того, как ИИ-агенты могут обучать людей работе с программным обеспечением. Набор данных включает 72 сессии взаимодействия экспертов и новичков, содержащие более 22 тысяч диалоговых реплик и 28 часов записей экрана. Работа фокусируется на устранении коммуникационных разрывов при передаче навыков использования сложных интерфейсов.
Исследование рисков утечки данных в семантических коммуникационных системах
Исследователи проанализировали угрозы конфиденциальности в семантических коммуникационных системах (SemCom), использующих промежуточные узлы-ретрансляторы. В таких сетях передается не «сырой» поток данных, а семантически значимая информация, извлеченная нейросетями. Авторы работы выявили риск «семантической утечки», при которой промежуточный узел может восстановить конфиденциальные данные из скрытых представлений, передаваемых между отправителем и получателем.
Новый метод выравнивания весов для RMSNorm-трансформеров
Исследователи представили метод Signed-Permutation Coordinate Transport, решающий проблему несовместимости представлений в моделях с RMSNorm. При переносе векторов управления, разреженных автокодировщиков и других нейронных структур между чекпоинтами возникают ошибки из-за различий в «калибровке» потока остатков. Новый подход позволяет математически корректно приводить эти объекты к единой системе координат, сохраняя целостность данных при слиянии моделей.
LuxEmo: первый экспрессивный датасет для люксембургского языка
Исследователи представили LuxEmo — специализированный корпус данных для обучения систем синтеза речи (TTS) на люксембургском языке. Набор включает 21 час разговорной речи с эмоциональной окраской, что критически важно для развития технологий в условиях нехватки данных для редких языков. Датасет охватывает четыре категории эмоций и базируется на материалах медиахолдинга RTL.
Роль тактильных ощущений в визуальном обучении детей: исследование на основе ИИ
Исследователи проанализировали влияние тактильного опыта на формирование визуальных концептов у детей, используя методы контрастивного обучения. Для количественной оценки значимости осязания была создана структурированная система кодирования событий, включающая 264 тысячи видеофрагментов. Работа демонстрирует, как мультимодальные данные помогают лучше понять механизмы когнитивного развития и могут быть применены для совершенствования алгоритмов машинного зрения.