Инференс и железо
AMD удаляет шифрование памяти из потребительских процессоров Ryzen
AMD приняла решение отключить функцию шифрования памяти (SEV) в своих потребительских процессорах Ryzen. Эта мера затронет модели Ryzen 7000 и более новые, что ограничит возможности защиты данных на уровне аппаратного обеспечения.
Lexar предлагает хранить локальные модели ИИ на SSD
Компания Lexar разрабатывает решение для размещения локальных моделей ИИ на SSD. Это связано с растущим спросом на вычислительные ресурсы и ограниченной доступностью оперативной памяти.
AMD оптимизировала вычисления для ИИ-моделей на CDNA4
Компания AMD представила оптимизации для вычислений матричных операций (GEMM) в формате FP8 на архитектуре CDNA4. Это позволит ускорить работу ИИ-моделей на графических процессорах Instinct серии MI300X.
AMD представила оптимизированный FP8 GEMM для ускорения ИИ-вычислений
AMD анонсировала новую технологию 4-Wave Interleave FP8 GEMM, направленную на ускорение вычислений в ИИ. Решение оптимизирует работу с тензорными ядрами, что позволяет значительно повысить производительность при инференсе моделей.
AMD оптимизирует инференс для своих GPU Instinct
AMD представила Atom Inference Engine — фреймворк для оптимизации работы моделей машинного обучения на графических процессорах Instinct. Решение сочетает аппаратные и программные компоненты, что позволяет ускорить выполнение задач инференса.
Расчёт стоимости инференса на примере
Разработчики из компании July поделились методом расчёта стоимости инференса для масштабируемых ИИ-систем. В статье объясняется, как оценить затраты на вычисления с учётом различных факторов, включая стоимость оборудования, энергопотребление и время обработки запросов.
Оркестратор OrcaRouter объединил несколько моделей в одну
Компания OrcaRouter представила новый подход к инференсу, который позволяет объединять несколько моделей в одну. Вместо увеличения размера модели разработчики предложили использовать панель, которая объединяет несколько моделей в одну систему. Это позволяет значительно улучшить производительность и точность без увеличения вычислительных затрат.
Запуск модели Gemma на устройствах с Coral Board
Компания Google продемонстрировала возможность запуска модели Gemma на устройствах с Coral Board. Это решение позволяет выполнять инференс на краю сети, что особенно актуально для задач, требующих низкой задержки и автономной работы.
Обработка данных переходит на GPU
Обработка данных всё чаще выполняется на графических процессорах (GPU), что меняет подходы к аналитике и машинному обучению. Это связано с ростом сложности задач и необходимости ускорения вычислений. GPU позволяют обрабатывать большие объёмы данных быстрее, чем традиционные CPU, что особенно важно для задач машинного обучения и анализа в реальном времени.
Расчёт загрузки GPU AMD MI355X для инференса моделей
Инженеры из Indianspeedster опубликовали подробное руководство по расчёту загрузки GPU AMD MI355X. В статье разбираются ключевые параметры, влияющие на производительность при инференсе моделей: количество потоков, блоки вычислений и другие технические аспекты.
Как использовать внешний GPU Nvidia с Mac для локального запуска ИИ
В 2026 году владельцы Mac смогут использовать внешние графические процессоры Nvidia для локального запуска моделей искусственного интеллекта. Это решение особенно актуально для разработчиков, которым требуется высокая вычислительная мощность, но у которых нет доступа к специализированным серверам.
Sors: прокси на Rust для оптимизации кэша vLLM
Разработчики представили Sors — прокси-сервер на Rust, который переупорядочивает запросы к моделям, чтобы максимизировать использование префиксного кэша vLLM. Это позволяет ускорить обработку запросов и снизить нагрузку на вычислительные ресурсы.
Обучение NanoGPT в кластере Slurm с фиксированной средой Nix
Разработчики поделились опытом обучения модели NanoGPT в кластере Slurm с использованием фиксированной среды Nix. Это позволяет обеспечить воспроизводимость экспериментов и упростить развёртывание в вычислительных кластерах.
Google представил пять поколений суперкомпьютеров для обучения ИИ
Google опубликовал исследование, в котором подробно описаны пять поколений своих суперкомпьютеров для обучения ИИ. Линейка начинается с TPU v2 и заканчивается Ironwood, последним на данный момент поколением.
GateGPT: 56k токенов в секунду на FPGA
Исследователи представили GateGPT — решение для ускоренного инференса трансформеров на FPGA. Система достигает скорости 56 000 токенов в секунду при частоте 80 МГц, используя кеш ключ-значение (KV cache). Это открывает новые возможности для развертывания больших языковых моделей на специализированном оборудовании.
INT21: фабрика ядер для ускорения вычислений в ИИ
Команда INT21 представила PTX Kernel Factory — инструмент для автоматической генерации и оптимизации ядер на уровне PTX (Parallel Thread Execution). Это позволяет ускорять вычисления в ИИ-моделях, особенно на графических процессорах NVIDIA.
Ubuntu Core 26 для локального запуска ИИ-моделей
Компания Canonical представила Ubuntu Core 26, новую версию операционной системы, ориентированную на создание локальных устройств для инференса ИИ-моделей. Основное внимание разработчики уделили поддержке высокопроизводительных вычислений и интеграции с популярными фреймворками для работы с искусственным интеллектом.
Qualcomm разрабатывает 40 новых AI-чипов для будущих устройств
Qualcomm активно работает над более чем 40 новыми проектами AI-чипов. Компания планирует стать ключевым поставщиком процессоров для устройств, которые в будущем заменят смартфоны. В рамках этой стратегии Qualcomm представила два новых продукта, направленных на поддержку новых форматов устройств.
Infer0 предлагает альтернативу подпискам для запуска ИИ-моделей
Infer0 — это платформа, которая позволяет запускать ИИ-модели без подписок. Сервис предлагает оплату за использование по факту, что может быть выгодно для разработчиков и пользователей, которым не нужны постоянные подписки.
SubQ 1.1 Small: локальный запуск моделей с улучшенной производительностью
Команда Subquadratic представила обновлённую версию SubQ 1.1 Small — фреймворка для локального запуска моделей. Новая версия предлагает улучшенную производительность и снижение требований к ресурсам, что делает её более доступной для использования на обычных ноутбуках и персональных компьютерах.
Новый фреймворк для JIT-компиляции ускоряет работу ИИ-моделей
Исследователи представили новый фреймворк для JIT-компиляции, который может значительно ускорить выполнение ИИ-моделей. Система использует многоуровневую JIT-компиляцию в рамках мета-трейсинга, что позволяет оптимизировать код на лету и повышать производительность.
Как масштабировать модели на TPU
Команда Jax ML выпустила подробное руководство по масштабированию больших языковых моделей на тензорных процессорах (TPU). Документ охватывает ключевые аспекты инфраструктуры, включая распределение вычислений, оптимизацию памяти и управление ресурсами.
Рост мощности дата-центров для ИИ-инференса
Дата-центры продолжают наращивать мощности для поддержки растущих нагрузок от ИИ-моделей. По данным Next Platform, спрос на вычислительные ресурсы для инференса растёт экспоненциально, что требует как обновления существующих дата-центров, так и строительства новых.
Tensordyne обещает революцию в инференсе благодаря логарифмической математике
Компания Tensordyne заявила о прорыве в области инференса, используя логарифмическую математику для ускорения вычислений. По их словам, новая архитектура позволяет значительно снизить затраты на вычисления и повысить скорость обработки запросов. Это особенно важно для разработчиков ИИ-агентов, так как инференс остается одной из самых затратных частей работы с моделями.