Инференс и железо
Запуск мультимодальных моделей на GPU NVIDIA
NVIDIA представила обновление для своей платформы Step 3.7 Flash, которое позволяет запускать мультимодальные ИИ-модели на графических процессорах с повышенной производительностью. Это решение ориентировано на корпоративных пользователей и предоставляет инструменты для работы с изображениями, документами, видео и другими типами данных.
Together AI создала самый быстрый стек для распознавания речи
Together AI представила решение для распознавания речи (ASR), которое, по их заявлению, является самым быстрым в мире. Компания подчеркивает, что подход к ASR рассматривался как задача полного пути системы, а не только как проблема инференса на GPU.
NVIDIA Dynamo Snapshot ускоряет запуск инференса в Kubernetes
NVIDIA представила Dynamo Snapshot — технологию, решающую проблему холодного старта в инференсных развёртываниях на Kubernetes. Это особенно важно для динамически масштабируемых сервисов, где задержки при запуске новых экземпляров могут снижать производительность.
NVIDIA Blackwell установила рекорд в инференсе LLM для финансов
NVIDIA Blackwell установила новый рекорд в инференсе больших языковых моделей (LLM) для финансовых приложений, согласно результатам тестов STAC-AI. Новые графические процессоры Blackwell показали значительное улучшение производительности по сравнению с предыдущими поколениями, что делает их идеальными для обработки сложных финансовых данных.
Reachy Mini: локальный ИИ-агент с открытым исходным кодом
Компания Pollen Robotics представила Reachy Mini — локальный ИИ-агент с открытым исходным кодом, который может работать на обычном ноутбуке. Это важный шаг в развитии локальных решений для ИИ-агентов, так как многие современные системы требуют мощных серверов или облачных вычислений.
Синхронизация дельта-весов для запуска гигантских моделей
Команда Hugging Face представила новую технологию Delta Weight Sync в TRL (Transformers Reinforcement Learning), которая позволяет эффективно синхронизировать веса моделей с триллионами параметров. Это особенно важно для локального запуска крупных моделей, где традиционные методы требуют значительных вычислительных ресурсов.
NVIDIA CUDA Tile для оптимизации GPU-ядер в C++
NVIDIA представила новую возможность для разработчиков — CUDA Tile, которая позволяет создавать высокопроизводительные GPU-ядра прямо внутри существующих C++ кодовых баз. Эта технология ориентирована на оптимизацию вычислений с использованием плиточной структуры, что особенно важно для задач, требующих интенсивной обработки данных на графических процессорах.
NVIDIA CUDA 13.3 ускоряет разработку ИИ-агентов
NVIDIA выпустила обновление CUDA 13.3, которое значительно расширяет возможности разработчиков, работающих с GPU. В новой версии появилась поддержка тайловой программирования на C++, что позволяет более эффективно использовать ресурсы графических процессоров. Это особенно важно для задач, связанных с обработкой больших массивов данных, таких как инференс моделей ИИ.
Mistral представила удалённые агенты в Vibe на базе Mistral Medium 3.5
Mistral анонсировала обновление платформы Vibe, добавив поддержку удалённых агентов. Они работают на модели Mistral Medium 3.5 и могут выполнять задачи без необходимости локального развёртывания.
ThunderKittens: компактный DSL для высокопроизводительных AI-ядер
ThunderKittens — это компактный домен-специфический язык (DSL), разработанный для создания высокопроизводительных AI-ядер. Он позволяет оптимизировать вычисления, необходимые для инференса моделей искусственного интеллекта, что особенно важно для локального запуска и работы с ограниченными ресурсами. Язык ориентирован на эффективность и простоту, что делает его полезным инструментом для разработчиков, стремящихся к максимальной производительности.
Мониторинг GPU в Kubernetes для AI-инфраструктуры
NVIDIA представила решение для мониторинга использования GPU в Kubernetes-кластерах, что критически важно для оптимизации AI-инфраструктуры. Решение позволяет получать данные о загрузке GPU в реальном времени, что помогает эффективно управлять ресурсами и снижать затраты на инференс.
Оптимизация инференса на NVIDIA GB200 с Slurm
NVIDIA представила подход к оптимизации производительности инференса на своих новых GPU GB200 NVL72 с использованием Slurm — популярного менеджера рабочих процессов. В статье на Developer NVIDIA объясняется, как топологически осознанное планирование задач позволяет максимально использовать мощности современных ускорителей.
TurboQuant ускоряет инференс моделей на 30% без потери точности
Команда Baseten представила TurboQuant — метод оптимизации инференса, который ускоряет работу моделей на 30% без потери точности. Разработчики провели 31 час на математических выкладках, чтобы создать алгоритм, который автоматически выбирает оптимальные параметры квантования для различных моделей. Это особенно важно для агентов, где скорость обработки запросов напрямую влияет на пользовательский опыт.
Сравнение производительности кодирующих агентов
Компания Together.ai провела бенчмарк производительности кодирующих агентов в реальных условиях. По результатам тестов, их решение показало 31% больше транзакций в секунду (TPS) по сравнению с TensorRT-LLM. Также отмечено в два раза лучшее время первого ответа (TTFT) при насыщении системы и на 76% более низкие затраты по сравнению с моделью Claude Opus 4.6.
Автономный ИИ для ускорения обучения nanogpt
Команда Prime Intellect представила проект Autonomous AI research, направленный на ускорение обучения модели nanogpt. В основе проекта лежит идея использования ИИ для автоматизации процесса оптимизации гиперпараметров и архитектуры нейросетей, что позволяет значительно сократить время обучения и улучшить качество моделей.
Together AI и Pearl Research Labs снижают стоимость инференса
Together AI и Pearl Research Labs объявили о партнёрстве, направленном на сокращение затрат на инференс. В рамках сотрудничества запущен скидочный инференс-эндпоинт для модели Gemma-4-31B-it-pearl, оптимизированной Pearl Research Labs.
Как платформа NVIDIA Vera Rubin решает проблему масштабирования агентного ИИ
NVIDIA представила платформу Vera Rubin, которая направлена на решение ключевых проблем масштабирования агентного ИИ. Основная сложность заключается в неопределённости траекторий агентов, которые включают действия, наблюдения и взаимодействия с окружающей средой. Это делает традиционные методы инференса менее эффективными, так как агентский ИИ требует гибкости и адаптивности в реальном времени.
Как асинхронность ускоряет обработку запросов в ИИ-агентах
Исследователи из Hugging Face представили новый подход к обработке запросов в ИИ-моделях — асинхронный континуальный батчинг. Этот метод позволяет значительно ускорить обработку запросов, особенно в сценариях с высокой нагрузкой, что критически важно для ИИ-агентов, работающих в реальном времени.
Как токенизация влияет на гибридный поиск
Токенизация играет ключевую роль в эффективности гибридного поиска. Weaviate, векторная база данных, предлагает несколько инструментов для улучшения обработки текста.
Как AWS помогает строить и запускать foundation модели
Amazon Web Services (AWS) представил набор инструментов и сервисов для обучения и развёртывания foundation моделей. Это важно для разработчиков ИИ-агентов, так как позволяет масштабировать инференс и оптимизировать затраты.
DeepSeek-V4 и миллион-токеновый контекст: вызов для инференс-систем
DeepSeek-V4, новая модель от DeepSeek, поддерживает контекст длиной в миллион токенов. Это создаёт новые вызовы для инференс-систем, так как обработка такого объёма данных требует оптимизации на уровне оборудования и алгоритмов.
Развёртывание моделей Hugging Face за один сеанс
Together.ai представила решение для быстрого развёртывания моделей из Hugging Face. Сервис Goose в сочетании с Dedicated Container Inference позволяет запускать модели в производственной среде с GPU без сложной настройки.
vLLM V1: как ServiceNow ускорил инференс без потери точности
ServiceNow представила обновлённую версию vLLM (v1), которая фокусируется на корректности перед исправлениями в RL (reinforcement learning). Новый подход позволяет ускорить инференс моделей без ущерба для точности, что особенно важно для агентов, работающих в реальном времени.
Как масштабировать инференс ИИ-моделей эффективно
Компания Together.ai опубликовала исследование, посвящённое эффективному масштабированию инференса ИИ-моделей. По мере перехода ИИ из исследовательской фазы в промышленное использование ключевой задачей становится не только создание моделей, но и их эффективная, надёжная и масштабируемая эксплуатация.