Исследования и наука

Риски использования прокси-функций при оптимизации ИИ-систем arXiv · 22.06.2026 В новой научной работе анализируются фундаментальные проблемы, возникающие при попытке оптимизировать сложные системы через прокси-метрики. Авторы исследуют условия, при которых максимизация промежуточной целевой функции не только не приводит к желаемому результату, но и становится вредной для итоговой производительности модели. Основной акцент сделан на разрыве между математическим представлением задачи и реальными целями, которые преследует разработчик. Исследование методов отслеживания влияния обучающих данных на ответы LLM arXiv · 22.06.2026 Исследователи проанализировали два ключевых подхода к интерпретации поведения больших языковых моделей: оценку сходства данных (data-similarity) и оценку влияния данных (data-influence). Первый метод основан на поиске семантической близости между запросом и обучающей выборкой, что требует значительно меньше вычислительных ресурсов. Второй метод направлен на определение того, как конкретные примеры из обучающего набора напрямую меняют веса модели и влияют на итоговый результат, что считается более точным, но трудоемким процессом. Новый метод анализа некорректных запросов к LLM через топологию данных arXiv · 22.06.2026 Исследователи представили новый подход к выявлению и обработке некорректных запросов в больших языковых моделях, используя методы топологического анализа данных. Проблема «плохо поставленных» вопросов, которые содержат противоречия, двусмысленность или недостаток контекста, остается критической для точности ответов ИИ. Традиционные методы анализа обычно фокусируются на изучении уже готовых ответов модели, что не позволяет эффективно выявлять саму природу ошибки на этапе ввода. Генеративная модель для симуляции транспортных потоков на перекрестках arXiv · 22.06.2026 Исследователи представили Enactor — генеративную модель, предназначенную для микросимуляции движения транспорта на регулируемых перекрестках. В отличие от традиционных систем, опирающихся на жестко заданные правила поведения водителей, новая разработка использует агентно-ориентированный подход. Это позволяет точнее воспроизводить сложные взаимодействия между автомобилями, которые часто упускаются классическими алгоритмами. Децентрализованное управление трафиком для автономных летательных аппаратов arXiv · 22.06.2026 Исследователи представили концепцию децентрализованной системы управления движением для автономных летательных аппаратов, работающих в условиях высокой плотности трафика. С ростом числа беспилотных систем традиционные централизованные методы координации перестают справляться с нагрузкой, что требует перехода к более гибким архитектурам. В качестве решения предложено использование специализированных коридоров для перспективной воздушной мобильности (AAM), которые позволяют организовать потоки автономных аппаратов без участия единого диспетчерского центра. Ян Лекун о концепции мировых моделей для будущего ИИ Hacker News · 22.06.2026 Главный научный сотрудник Meta (признана экстремистской организацией, деятельность запрещена в РФ) Ян Лекун представил подробный разбор архитектуры мировых моделей (World Models). По мнению исследователя, текущие подходы, основанные исключительно на предсказании следующего токена, ограничены в понимании физической реальности и причинно-следственных связей. Для создания систем уровня человеческого интеллекта ИИ должен научиться строить внутреннюю модель мира, которая позволяет предсказывать последствия действий и планировать поведение в динамической среде. Новый метод обучения диффузионных моделей для улучшения логических рассуждений Hacker News · 22.06.2026 Исследователи представили метод Multi-Turn Reflective Masking (MTRM), направленный на повышение способности диффузионных моделей к логическому мышлению. Традиционные диффузионные модели часто сталкиваются с трудностями при решении задач, требующих многошагового планирования или последовательного вывода, так как они генерируют данные итеративно, опираясь на зашумленные представления. Новый подход меняет процесс обучения, внедряя механизм рефлексии в структуру маскирования. Исследование: ограничения механизма внимания в современных LLM Hacker News · 22.06.2026 Ученые проанализировали эффективность архитектуры трансформеров при выполнении задач, требующих длительной концентрации на контексте. В ходе экспериментов выяснилось, что даже самые продвинутые языковые модели демонстрируют снижение точности при обработке длинных последовательностей, если ключевая информация распределена неравномерно или скрыта в середине текста. Этот феномен, известный как «проблема потерянного в середине» (lost in the middle), ставит под вопрос надежность механизмов внимания при работе с большими объемами данных. Малые языковые модели догнали гигантов в задачах извлечения отношений arXiv · 21.06.2026 Исследователи проанализировали возможности компактных языковых моделей (SLM) в задачах извлечения отношений (Relation Extraction) из текстов. В фокусе внимания оказались модели с количеством параметров от 360 миллионов до 3 миллиардов. Результаты показывают, что такие системы способны демонстрировать производительность, сопоставимую с крупными моделями (LLM) уровня frontier, работая при этом в режиме zero-shot. Новый метод дистилляции для генерации кода на предметно-ориентированных языках arXiv · 21.06.2026 Исследователи представили метод контекстно-зависимой дистилляции (Context-Aware Distillation) для автоматического перевода естественного языка в код на предметно-ориентированных языках (DSL). В отличие от стандартных подходов, полагающихся исключительно на промпты, новая методика использует структурированный контекст, включающий грамматику Бэкуса-Наура (BNF) и спецификации API. В качестве «учителя» для обучения компактных моделей выступает DeepSeek-V4-Flash, который генерирует качественные обучающие данные, опираясь на жесткие синтаксические правила целевой среды. Исследование факторов эффективности обучения с подкреплением для рассуждений LLM arXiv · 21.06.2026 Исследователи проанализировали механизмы обучения с подкреплением на основе верифицируемых наград (RLVR), которые активно применяются для улучшения логических способностей больших языковых моделей. Несмотря на популярность метода, текущие подходы к его реализации часто опираются на эмпирические догадки, что приводит к разрозненным и порой противоречивым алгоритмическим решениям. Авторы работы систематизировали ключевые факторы, влияющие на стабильность и результативность процесса обучения. Исследование возможностей мультимодального Chain-of-Thought arXiv · 21.06.2026 Исследователи проанализировали эффективность метода пошаговых рассуждений (Chain-of-Thought, CoT) в мультимодальных моделях. Несмотря на то что CoT стал стандартом для улучшения логических способностей текстовых LLM, его влияние на задачи, требующие обработки изображений и других визуальных данных, до сих пор оставалось недостаточно изученным. Исследование уязвимостей в системах гомоморфного шифрования arXiv · 21.06.2026 Исследователи представили работу, посвященную анализу безопасности фреймворков для полностью гомоморфного шифрования (FHE). Эта технология позволяет проводить вычисления непосредственно над зашифрованными данными, исключая необходимость их расшифровки в процессе обработки. Метод считается перспективным для защиты конфиденциальной информации в облачных вычислениях, финансовом секторе и медицине, где требования к приватности данных являются критическими. Исследование вычислительных возможностей архитектуры Transformer Hacker News · 21.06.2026 Новая работа исследователей ставит под сомнение тезис о полноте по Тьюрингу для стандартных архитектур Transformer. В статье анализируются теоретические ограничения моделей, использующих механизм внимания (attention) с фиксированной точностью вычислений. Авторы доказывают, что при стандартных условиях работы с конечным числом слоев и фиксированной размерностью векторов, такие системы не способны симулировать произвольную машину Тьюринга. Эффект ножниц: как изменение размера изображений влияет на устойчивость ИИ к атакам arXiv · 21.06.2026 Исследователи проанализировали метод Input Diversity (DI), который традиционно используется для повышения эффективности состязательных атак на нейросети. Суть метода заключается в случайном изменении размера и добавлении отступов к входным данным на каждой итерации атаки. Ранее считалось, что такая вариативность неизменно улучшает переносимость атак между различными моделями, однако новое исследование опровергает универсальность этого подхода. SCOPE: новый подход к планированию для ИИ-агентов в открытых средах arXiv · 21.06.2026 Исследователи представили метод SCOPE, направленный на улучшение долгосрочного планирования для воплощенных ИИ-агентов. Современные системы часто объединяют мультимодальные модели (VLM) с классическими алгоритмами планирования, опирающимися на символьные представления среды. Однако в условиях открытого мира, где восприятие агента ограничено, такие представления часто оказываются неполными, что приводит к ошибкам в выполнении сложных задач. Исследование взаимодействия речи и текста в латентном пространстве моделей arXiv · 21.06.2026 Исследователи проанализировали работу моделей, обучаемых на чередующихся последовательностях речевых и текстовых токенов. Основная цель работы заключалась в том, чтобы понять, как именно различные модальности взаимодействуют внутри латентного пространства нейросети и как текстовые данные влияют на развитие навыков обработки аудио. Форма важнее данных: главный барьер для физического ИИ Hacker News · 21.06.2026 Развитие робототехники и физического ИИ сталкивается с фундаментальной проблемой, которую часто упускают из виду в погоне за масштабированием нейросетей. В то время как цифровые модели обучаются на колоссальных массивах данных, физические агенты ограничены своей аппаратной оболочкой. Эффективность обучения робота напрямую зависит от того, насколько его механическая конструкция — «форма» — соответствует решаемым задачам. Без оптимизации физического воплощения даже самые совершенные алгоритмы управления не способны компенсировать неэффективность движений или ограниченность сенсорики. Исследование StoryScope: анализ специфики генеративной художественной литературы Hacker News · 20.06.2026 Исследователи представили StoryScope — методологию для систематического анализа особенностей текстов, созданных большими языковыми моделями в жанре художественной литературы. Работа сфокусирована на выявлении характерных паттернов, которые отличают ИИ-контент от произведений, написанных людьми. Авторы анализируют, как модели справляются с поддержанием долгосрочной связности сюжета, развитием персонажей и стилистической устойчивостью на протяжении длинных повествовательных форм. Успешное долгосрочное использование нейроинтерфейса для речи и управления курсором Hacker News · 20.06.2026 Исследователи представили результаты многолетнего клинического испытания внутрикортикального нейрокомпьютерного интерфейса (BCI), предназначенного для восстановления коммуникативных функций у пациентов с тяжелыми двигательными нарушениями. Система позволяет пользователям управлять курсором на экране и синтезировать речь в режиме реального времени, преобразуя нейронную активность коры головного мозга в цифровые команды. Исследование основ критической ИИ-грамотности Hacker News · 20.06.2026 Исследователи представили работу, анализирующую взаимодействие пользователей с системами искусственного интеллекта через призму критической грамотности. Авторы рассматривают ИИ не просто как технический инструмент, а как сложную социально-техническую среду, где ключевую роль играет понимание механизмов работы алгоритмов, их ограничений и потенциальных искажений. В центре внимания находится процесс формирования пользовательского опыта при столкновении с автоматизированными ответами и рекомендациями. Влияние GitHub Copilot на продуктивность разработки: результаты исследования Hacker News · 20.06.2026 Исследователи проанализировали зависимость между интенсивностью использования GitHub Copilot и производительностью труда программистов. В работе применен метод «доза-реакция», позволяющий оценить, как именно частота обращения к ИИ-ассистенту коррелирует с качеством и скоростью написания кода в реальных рабочих условиях. Tree Transformers: новый подход к архитектуре нейросетей Hacker News · 20.06.2026 Исследователи представили архитектуру Tree Transformers, которая меняет способ обработки иерархических данных в нейронных сетях. В отличие от стандартных трансформеров, работающих с линейными последовательностями токенов через механизмы внимания, новая модель опирается на древовидную структуру данных. Это позволяет эффективнее моделировать зависимости в задачах, где важна вложенность и иерархия, например, при анализе синтаксиса языков программирования или сложных математических выражений. Проблема эффективности обучения моделей на ограниченных данных Hacker News · 19.06.2026 Современные методы обучения больших языковых моделей сталкиваются с проблемой «черной дыры» в эффективности выборки. Исследования показывают, что текущие подходы требуют колоссальных объемов данных для достижения прироста качества, который непропорционален затраченным вычислительным мощностям. При этом значительная часть доступных в интернете текстов уже была использована для тренировки, что создает дефицит качественных обучающих материалов для будущих поколений нейросетей.