Модели и релизы
Новый метод SoftMoE для эффективного масштабирования LLM
Исследователи предложили новый подход SoftMoE для улучшения работы архитектур Mixture-of-Experts (MoE) в языковых моделях. Традиционные MoE используют top-k маршрутизацию, которая активирует только часть экспертов, но из-за недифференцируемости этого оператора число активных экспертов фиксировано, что приводит к неэффективному использованию вычислительных ресурсов.
Новый метод обучения для мультимодального математического мышления
Исследователи предложили новый подход к обучению мультимодальных моделей для решения математических задач. В статье на arXiv представлен метод MathVis-Fine, который учитывает сложные зависимости между текстом и изображениями в процессе решения задач.
Google Cloud представил Open Knowledge Format для ИИ-агентов
Google Cloud анонсировал Open Knowledge Format (OKF) — открытый формат для структурирования знаний, предназначенный для использования ИИ-агентами. OKF представляет собой спецификацию, которая формализует паттерн LLM-wiki, позволяя создавать каталоги знаний в виде markdown-файлов с YAML-фронтматером. Каждый файл описывает концепцию, которая должна содержать хотя бы поле типа.
Locket — система управления доступом к функциям LLM
Исследователи из Stanford University представили Locket — фреймворк для управления доступом к функциям LLM на уровне отдельных API-вызовов. Это позволяет гибко настраивать, какие функции и в каких условиях могут вызываться агентом, что критично для безопасности и контроля поведения ИИ-агентов.
Локальный запуск моделей стал реальностью
В последнее время локальный запуск больших языковых моделей (LLM) стал значительно проще и доступнее. Это связано с развитием технологий, которые позволяют запускать мощные модели даже на обычных ноутбуках. Например, модели вроде GPT-4 или Llama 2 теперь можно развернуть локально с помощью таких фреймворков, как Ollama или LM Studio. Это открывает новые возможности для разработчиков, которые хотят создавать ИИ-агенты с минимальными затратами на инфраструктуру.
GitHub выпустил открытый датасет для обучения многоязычных моделей
GitHub представил новый открытый датасет, содержащий мультиязычный контент из репозиториев. Данные собраны из README, issues и pull requests и доступны под лицензией CC0-1.0.
Модели класса Mythos станут глобальными к 2029 году
По прогнозам экспертов, модели ИИ класса Mythos, обладающие высокой производительностью и доступностью, к 2029 году станут широко распространены по всему миру. Эти модели, которые уже демонстрируют впечатляющие результаты в различных задачах, включая обработку естественного языка и генерацию текста, могут значительно изменить ландшафт индустрии ИИ.
Sakana AI представила коммерческий продукт Sakana Marlin
Sakana AI, компания, специализирующаяся на разработке ИИ-агентов, объявила о запуске своего первого коммерческого продукта — Sakana Marlin. Этот шаг является важным для рынка ИИ-агентов, так как демонстрирует готовность компаний выводить свои решения на коммерческий уровень.
Новый подход к долгосрочному прогнозированию временных рядов
Исследователи из Arxiv представили новый метод HAMON, который использует пассивное оптическое смешивание последовательностей для долгосрочного прогнозирования временных рядов. Этот подход демонстрирует, что простые линейные и частотные модели могут быть конкурентоспособными в задачах долгосрочного прогнозирования, что ставит под сомнение необходимость использования сложных трансформерных моделей в этом контексте.
Локальные модели для кодинга вместо Claude/GPT
На Hacker News обсуждают возможность замены облачных моделей, таких как Claude и GPT, на локальные аналоги для ежедневной работы с кодом. Пользователи делятся опытом использования локальных моделей, таких как Code Llama, Starcoder и другие, которые могут работать на собственных серверах или мощных ноутбуках.
Как улучшить точность небольших моделей кода без переобучения
Исследователи из DeepSeek и других организаций представили новый подход к повышению точности небольших моделей кода без необходимости их переобучения. В работе рассматриваются так называемые «замороженные» модели кода (с параметрами ≤45 миллионов), которые не поддаются стандартным методам улучшения качества вывода.
Как NVIDIA ускорила обучение MoE-моделей на 30%
NVIDIA представила новые методы оптимизации обучения Mixture-of-Experts (MoE) моделей, которые стали ключевым компонентом современных ИИ-систем. Исследователи компании разработали продвинутые ядра слияния (fusion kernels), которые позволяют значительно ускорить процесс обучения.
Natural Language Autoencoders объясняют активации LLM
Исследователи из Transformer Circuits опубликовали работу, в которой предложили использовать Natural Language Autoencoders (NLA) для интерпретации активаций больших языковых моделей (LLM). NLA — это автоэнкодеры, которые преобразуют активации нейронов в естественный язык, делая их более понятными для разработчиков.
Apple представила третье поколение foundation models
Apple анонсировала третье поколение своих foundation models, которые стали более мощными и универсальными. Новые модели демонстрируют улучшенные возможности в обработке естественного языка, компьютерном зрении и других задачах машинного обучения. Это важный шаг для компании, которая активно развивает свои ИИ-капabilities, особенно в контексте интеграции с устройствами и сервисами Apple.
Как выглядит локальная инфраструктура LLM у разработчиков
На Hacker News обсуждают, как разработчики настраивают локальные LLM для работы. Вопрос задал пользователь, интересующийся, какие модели, оборудование и инструменты используют другие участники сообщества. Это важно для Jarv, так как локальный запуск моделей — ключевой элемент для создания автономных агентов, которые могут работать без облачных сервисов.
Gemini 3.5 Flash демонстрирует высокую скорость и качество
Google представила новую версию своей модели Gemini — Gemini 3.5 Flash. Эта модель отличается не только высокой скоростью работы, но и качеством вывода, что делает её конкурентоспособной на рынке ИИ-решений. Gemini 3.5 Flash оптимизирована для работы на устройствах с ограниченными вычислительными ресурсами, что позволяет использовать её в мобильных и встраиваемых системах.
Guardian Angels: персонализация LLM для повышения продуктивности и безопасности
Проект Guardian Angels представляет собой фреймворк для персонализации больших языковых моделей (LLM) с целью повышения продуктивности и безопасности. Разработчики предлагают использовать индивидуальные настройки и адаптацию моделей под конкретные задачи пользователей, что может быть полезно для создания ИИ-агентов.
Brownian Kernel Ladders: новый подход к иерархическим представлениям
Исследователи представили новый метод для построения иерархических представлений в статистическом обучении — Brownian Kernel Ladders (BKLs). Это рекурсивно определённая иерархия интегральных пространств, генерируемых через Brownian-kernel интегральные конструкции. Начиная с линейных функционалов, каждый уровень BKL расширяет пространство функций, сохраняя при этом математически строгую структуру.
Knowledge Trap защищает модели от кражи знаний через ловушки
Исследователи из MIT и других университетов предложили новый способ защиты языковых моделей от кражи знаний. В статье, опубликованной на arXiv, они описывают метод Knowledge Trap, который использует "медовые ловушки" для знаний (Honeypot Knowledge Graph, HKG) и хлебные крошки для направления атак на нерелевантные данные.
Fusion превзошла Frontier по производительности
Команда OpenRouter представила модель Fusion, которая превзошла по производительности модель Frontier от Mistral AI. В тестах Fusion показала лучшие результаты в различных задачах, включая понимание контекста и генерацию текста. Это важно для разработчиков ИИ-агентов, так как новые модели могут значительно улучшить качество взаимодействия с пользователями и выполнение сложных задач.
Как оптимально обрезать экспертов в моделях MoE
Исследователи предложили унифицированный подход к обрезке экспертов в моделях Mixture-of-Experts (MoE), что может существенно снизить память и вычислительные затраты при развёртывании таких моделей. В статье, опубликованной на arXiv, авторы отмечают, что хотя MoE-модели эффективно распределяют вычисления между экспертами, их развёртывание всё равно требует хранения полного пула экспертов. Это создаёт проблемы с памятью, особенно при использовании в агентных системах, где важна эффективность инференса.
Исследование: VLA-модели плохо работают с неанглийскими языками
Недавнее исследование, опубликованное на arXiv, раскрывает значительный пробел в способности Vision-Language-Action (VLA) моделей работать с языками, отличными от английского. Эти модели, которые демонстрируют многообещающие возможности в обучении универсальных политик роботов на основе мультимодальных данных, в основном обучаются и оцениваются на английских инструкциях. Это оставляет их способность понимать и выполнять команды на других языках практически неизученной.
Как мировые модели дают ИИ-агентам «первое лицо»
В новом видео исследователи обсуждают концепцию мировых моделей (World Models) и их роль в формировании «первого лица» у ИИ-агентов. Мировые модели — это подход, при котором ИИ создает внутреннюю репрезентацию окружающего мира, что позволяет ему действовать более автономно и адаптивно.
Исследование: динамика развития языковых моделей
Исследователи из Artificial Analysis провели анализ динамики развития языковых моделей, включая модели от Anthropic и Mistral. В исследовании рассматривается, как меняется интеллект моделей с течением времени, что позволяет лучше понять их эволюцию и потенциал.