Инференс и железо
Together AI и Pearl Research Labs снижают стоимость инференса
Together AI и Pearl Research Labs объявили о партнёрстве, направленном на сокращение затрат на инференс. В рамках сотрудничества запущен скидочный инференс-эндпоинт для модели Gemma-4-31B-it-pearl, оптимизированной Pearl Research Labs.
Как платформа NVIDIA Vera Rubin решает проблему масштабирования агентного ИИ
NVIDIA представила платформу Vera Rubin, которая направлена на решение ключевых проблем масштабирования агентного ИИ. Основная сложность заключается в неопределённости траекторий агентов, которые включают действия, наблюдения и взаимодействия с окружающей средой. Это делает традиционные методы инференса менее эффективными, так как агентский ИИ требует гибкости и адаптивности в реальном времени.
Как асинхронность ускоряет обработку запросов в ИИ-агентах
Исследователи из Hugging Face представили новый подход к обработке запросов в ИИ-моделях — асинхронный континуальный батчинг. Этот метод позволяет значительно ускорить обработку запросов, особенно в сценариях с высокой нагрузкой, что критически важно для ИИ-агентов, работающих в реальном времени.
Как токенизация влияет на гибридный поиск
Токенизация играет ключевую роль в эффективности гибридного поиска. Weaviate, векторная база данных, предлагает несколько инструментов для улучшения обработки текста.
Как AWS помогает строить и запускать foundation модели
Amazon Web Services (AWS) представил набор инструментов и сервисов для обучения и развёртывания foundation моделей. Это важно для разработчиков ИИ-агентов, так как позволяет масштабировать инференс и оптимизировать затраты.
DeepSeek-V4 и миллион-токеновый контекст: вызов для инференс-систем
DeepSeek-V4, новая модель от DeepSeek, поддерживает контекст длиной в миллион токенов. Это создаёт новые вызовы для инференс-систем, так как обработка такого объёма данных требует оптимизации на уровне оборудования и алгоритмов.
Развёртывание моделей Hugging Face за один сеанс
Together.ai представила решение для быстрого развёртывания моделей из Hugging Face. Сервис Goose в сочетании с Dedicated Container Inference позволяет запускать модели в производственной среде с GPU без сложной настройки.
vLLM V1: как ServiceNow ускорил инференс без потери точности
ServiceNow представила обновлённую версию vLLM (v1), которая фокусируется на корректности перед исправлениями в RL (reinforcement learning). Новый подход позволяет ускорить инференс моделей без ущерба для точности, что особенно важно для агентов, работающих в реальном времени.
Как масштабировать инференс ИИ-моделей эффективно
Компания Together.ai опубликовала исследование, посвящённое эффективному масштабированию инференса ИИ-моделей. По мере перехода ИИ из исследовательской фазы в промышленное использование ключевой задачей становится не только создание моделей, но и их эффективная, надёжная и масштабируемая эксплуатация.
DeepInfra интегрируется с Hugging Face для инференса моделей
DeepInfra, облачный провайдер для запуска моделей ИИ, теперь доступен в экосистеме Hugging Face. Это интеграция позволяет разработчикам запускать модели из Hugging Face Hub на инфраструктуре DeepInfra с минимальными затратами на настройку.
Together AI добавил Nemotron 3 Nano Omni от NVIDIA
Together AI анонсировал доступ к модели Nemotron 3 Nano Omni от NVIDIA. Это мультимодальная модель, способная обрабатывать видео, изображения, аудио и текст. Разработчики подчёркивают, что модель оптимизирована для агентных нагрузок и может работать в масштабах.
Transformers переезжает на MLX для ускоренного инференса
Hugging Face анонсировал переход библиотеки Transformers на MLX — фреймворк для ускоренного инференса моделей на Apple Silicon. Это важный шаг для разработчиков ИИ-агентов, так как позволяет запускать сложные модели на потребительских устройствах с минимальными затратами.
Waypoint-1.5: генерация миров на обычных GPU
Hugging Face представила обновлённую версию Waypoint-1.5 — модели генерации 3D-миров, оптимизированной для работы на потребительских GPU. Новая версия поддерживает более детализированные и сложные сцены, сохраняя при этом высокую скорость рендеринга. Это важно для разработчиков ИИ-агентов, так как позволяет интегрировать генерацию 3D-контента в локальные системы без необходимости использования мощных серверов.
Deepgram интегрировала модели STT и TTS в Together AI
Компания Deepgram анонсировала доступность своих моделей распознавания речи (STT) и синтеза речи (TTS) на платформе Together AI. Это позволяет разработчикам использовать эти модели для создания голосовых агентов в реальном времени.
Как Together AI ускоряет работу моделей на GPU
Команда Together AI, известная разработками FlashAttention и ThunderKittens, занимается оптимизацией работы моделей на графических процессорах. Их исследования направлены на сокращение разрыва между возможностями GPU и реальными задачами в производстве ИИ.
Aurora: фреймворк для самоподдерживающегося speculative decoding
Together AI представила Aurora — открытый фреймворк для reinforcement learning (RL), который преобразует speculative decoding из одноразовой настройки в самоулучшающуюся систему. Aurora обучается на каждом запросе, что позволяет повысить производительность модели на 25% по сравнению с традиционными методами.
Mamba-3: новая модель для быстрого инференса
Компания Together.ai представила Mamba-3 — новую модель на основе архитектуры Selective State Spaces (SSM). Она предназначена для ускоренного инференса и превосходит трансформеры по скорости декодирования.
Mistral AI и NVIDIA ускорят разработку открытых моделей
Mistral AI и NVIDIA объявили о стратегическом партнёрстве, направленном на ускорение разработки и внедрения открытых моделей. Компании планируют совместно оптимизировать модели Mistral для работы на графических процессорах NVIDIA, что позволит повысить их производительность и доступность.
Together AI представила новые решения для инференса и агентов на NVIDIA GTC 2026
Together AI выступила на конференции NVIDIA GTC 2026 с рядом новых разработок. В фокусе — инференс, агентные технологии, голосовой ИИ и открытые модели. Компания также провела технические сессии, где её исследователи и инженеры поделились деталями новых решений.
Together AI запустила NVIDIA Nemotron 3 Super для разработчиков
Together AI объявила о доступности модели NVIDIA Nemotron 3 Super на своей платформе Dedicated Inference. Это решение обеспечивает эффективное многоагентное рассуждение, поддерживает контекстное окно в 1 миллион токенов и готово к промышленному развёртыванию на управляемой инфраструктуре.
CPD-архитектура ускоряет работу LLM с длинными контекстами на 40%
Together AI представила архитектуру Cache-aware prefill–decode disaggregation (CPD), которая ускоряет обработку длинных контекстов в LLM. Технология разделяет «тёплые» и «холодные» вычисления, что позволяет увеличить пропускную способность на 40% и сократить время до первого токена.
FLUX.2 доступна на Replicate для локального запуска
Компания Replicate добавила поддержку модели FLUX.2, которая предлагает профессиональный уровень генерации и редактирования изображений. FLUX.2 отличается высокой детализацией, поддержкой нескольких ссылок и эффективностью для корпоративных задач.
Torch compile caching для ускорения инференса
Компания Replicate представила технологию Torch compile caching, которая позволяет кэшировать скомпилированные модели для ускорения времени загрузки и выполнения инференса. Это решение особенно полезно для пользователей, работающих с большими моделями, так как значительно сокращает время запуска и обработки запросов.
Mistral Compute: инфраструктура для локального запуска моделей
Mistral AI представила Mistral Compute — инфраструктуру для локального запуска больших языковых моделей. Решение позволяет развернуть модели на собственных серверах или в облаке, обеспечивая контроль над данными и снижая зависимость от сторонних сервисов.