Инференс и железо

DeepInfra интегрируется с Hugging Face для инференса моделей Hugging Face - Blog · 28.04.2026 DeepInfra, облачный провайдер для запуска моделей ИИ, теперь доступен в экосистеме Hugging Face. Это интеграция позволяет разработчикам запускать модели из Hugging Face Hub на инфраструктуре DeepInfra с минимальными затратами на настройку. Together AI добавил Nemotron 3 Nano Omni от NVIDIA Together.ai · 27.04.2026 Together AI анонсировал доступ к модели Nemotron 3 Nano Omni от NVIDIA. Это мультимодальная модель, способная обрабатывать видео, изображения, аудио и текст. Разработчики подчёркивают, что модель оптимизирована для агентных нагрузок и может работать в масштабах. Transformers переезжает на MLX для ускоренного инференса Hugging Face - Blog · 15.04.2026 Hugging Face анонсировал переход библиотеки Transformers на MLX — фреймворк для ускоренного инференса моделей на Apple Silicon. Это важный шаг для разработчиков ИИ-агентов, так как позволяет запускать сложные модели на потребительских устройствах с минимальными затратами. Waypoint-1.5: генерация миров на обычных GPU Hugging Face - Blog · 08.04.2026 Hugging Face представила обновлённую версию Waypoint-1.5 — модели генерации 3D-миров, оптимизированной для работы на потребительских GPU. Новая версия поддерживает более детализированные и сложные сцены, сохраняя при этом высокую скорость рендеринга. Это важно для разработчиков ИИ-агентов, так как позволяет интегрировать генерацию 3D-контента в локальные системы без необходимости использования мощных серверов. Deepgram интегрировала модели STT и TTS в Together AI Together.ai · 01.04.2026 Компания Deepgram анонсировала доступность своих моделей распознавания речи (STT) и синтеза речи (TTS) на платформе Together AI. Это позволяет разработчикам использовать эти модели для создания голосовых агентов в реальном времени. Как Together AI ускоряет работу моделей на GPU Together.ai · 31.03.2026 Команда Together AI, известная разработками FlashAttention и ThunderKittens, занимается оптимизацией работы моделей на графических процессорах. Их исследования направлены на сокращение разрыва между возможностями GPU и реальными задачами в производстве ИИ. Aurora: фреймворк для самоподдерживающегося speculative decoding Together.ai · 30.03.2026 Together AI представила Aurora — открытый фреймворк для reinforcement learning (RL), который преобразует speculative decoding из одноразовой настройки в самоулучшающуюся систему. Aurora обучается на каждом запросе, что позволяет повысить производительность модели на 25% по сравнению с традиционными методами. Mamba-3: новая модель для быстрого инференса Together.ai · 16.03.2026 Компания Together.ai представила Mamba-3 — новую модель на основе архитектуры Selective State Spaces (SSM). Она предназначена для ускоренного инференса и превосходит трансформеры по скорости декодирования. Mistral AI и NVIDIA ускорят разработку открытых моделей Mistral AI Blog · 16.03.2026 Mistral AI и NVIDIA объявили о стратегическом партнёрстве, направленном на ускорение разработки и внедрения открытых моделей. Компании планируют совместно оптимизировать модели Mistral для работы на графических процессорах NVIDIA, что позволит повысить их производительность и доступность. Together AI представила новые решения для инференса и агентов на NVIDIA GTC 2026 Together.ai · 15.03.2026 Together AI выступила на конференции NVIDIA GTC 2026 с рядом новых разработок. В фокусе — инференс, агентные технологии, голосовой ИИ и открытые модели. Компания также провела технические сессии, где её исследователи и инженеры поделились деталями новых решений. Together AI запустила NVIDIA Nemotron 3 Super для разработчиков Together.ai · 10.03.2026 Together AI объявила о доступности модели NVIDIA Nemotron 3 Super на своей платформе Dedicated Inference. Это решение обеспечивает эффективное многоагентное рассуждение, поддерживает контекстное окно в 1 миллион токенов и готово к промышленному развёртыванию на управляемой инфраструктуре. CPD-архитектура ускоряет работу LLM с длинными контекстами на 40% Together.ai · 03.03.2026 Together AI представила архитектуру Cache-aware prefill–decode disaggregation (CPD), которая ускоряет обработку длинных контекстов в LLM. Технология разделяет «тёплые» и «холодные» вычисления, что позволяет увеличить пропускную способность на 40% и сократить время до первого токена. FLUX.2 доступна на Replicate для локального запуска Replicate's blog · 24.11.2025 Компания Replicate добавила поддержку модели FLUX.2, которая предлагает профессиональный уровень генерации и редактирования изображений. FLUX.2 отличается высокой детализацией, поддержкой нескольких ссылок и эффективностью для корпоративных задач. Torch compile caching для ускорения инференса Replicate's blog · 07.09.2025 Компания Replicate представила технологию Torch compile caching, которая позволяет кэшировать скомпилированные модели для ускорения времени загрузки и выполнения инференса. Это решение особенно полезно для пользователей, работающих с большими моделями, так как значительно сокращает время запуска и обработки запросов. Mistral Compute: инфраструктура для локального запуска моделей Mistral AI Blog · 11.06.2025 Mistral AI представила Mistral Compute — инфраструктуру для локального запуска больших языковых моделей. Решение позволяет развернуть модели на собственных серверах или в облаке, обеспечивая контроль над данными и снижая зависимость от сторонних сервисов. OpenAI выпустила GPT-4.1 и GPT-4o на Replicate Replicate's blog · 21.05.2025 Replicate добавила поддержку последних моделей OpenAI, включая GPT-4.1, GPT-4o и серию o-моделей. Теперь разработчики могут запускать эти модели локально или в облаке через API Replicate. NVIDIA H100: новые GPU для ИИ Replicate's blog · 15.05.2025 NVIDIA представила свои новые графические процессоры H100, которые обещают улучшенную производительность и снижение затрат. Эти GPU предназначены для работы с искусственным интеллектом и машинным обучением, что делает их важным инструментом для разработчиков и исследователей. Replicate интегрировал запуск LoRAs на Hugging Face Replicate's blog · 14.05.2025 Replicate и Hugging Face объединили усилия, чтобы предоставить пользователям возможность запускать более 30 000 LoRAs (Low-Rank Adaptations) через платформу Hugging Face. LoRAs — это лёгкие адаптации больших языковых моделей, которые позволяют тонко настраивать их под конкретные задачи без переобучения всей модели. Архитектура Armv9: новые возможности для вычислений и ИИ Lobsters · 31.03.2021 Компания Arm представила архитектуру Armv9, которая стала первым фундаментальным обновлением за десятилетие. Новая архитектура сфокусирована на повышении производительности вычислений, безопасности и специализированной поддержке задач машинного обучения. Внедрение технологий SVE2 позволяет значительно ускорить обработку данных в широком спектре приложений, от мобильных устройств до высокопроизводительных серверов, закладывая основу для следующего поколения аппаратного обеспечения. Глубокий разбор методов квантования нейронных сетей Lobsters · 15.03.2021 Квантование стало ключевым методом оптимизации нейросетей, позволяющим сократить размер моделей и ускорить их работу без существенной потери точности. Статья подробно описывает переход от высокоточных вычислений с плавающей запятой к форматам с низкой разрядностью, таким как INT8, и объясняет математические принципы, лежащие в основе снижения вычислительной сложности при инференсе современных LLM.