Инференс и железо
Оптимизация инференса моделей через формат NVFP4
Компания Cohere представила обновленную версию своей модели North Mini Code, оптимизированную для работы с использованием нового формата данных NVFP4. Технология позволяет значительно повысить производительность инференса при сохранении исходного качества генерации кода. Использование этого формата обеспечивает ускорение вычислений в 1,65 раза по сравнению со стандартным форматом FP8, при этом потребление видеопамяти снижается на 40%.
ANEForge: прямой доступ к Apple Neural Engine через Python
Исследователи представили ANEForge — программный стек, позволяющий выполнять вычисления непосредственно на Apple Neural Engine (ANE), минуя стандартные высокоуровневые фреймворки. Инструмент предоставляет интерфейс на языке Python, который транслирует операции в низкоуровневые инструкции, понятные нейронному процессору в чипах Apple Silicon.
Orange Pi 6: новый одноплатный компьютер с 45 TOPS для ИИ
Компания Orange Pi представила одноплатный компьютер Orange Pi 6, ориентированный на выполнение задач искусственного интеллекта на периферии. Устройство базируется на 12-ядерном процессоре Rockchip RK3588S2, который обеспечивает производительность нейронного процессора (NPU) на уровне 45 TOPS. Это позволяет запускать современные языковые модели и алгоритмы компьютерного зрения непосредственно на устройстве без обращения к облачным серверам.
Дефицит FP64-вычислений из-за бума ИИ
Бурный рост индустрии искусственного интеллекта меняет ландшафт высокопроизводительных вычислений (HPC). Традиционные научные исследования, требующие высокой точности вычислений с плавающей запятой двойной точности (FP64), сталкиваются с нехваткой специализированного оборудования. Производители чипов переориентируют свои производственные мощности на создание ускорителей, оптимизированных для форматов низкой точности (FP8, FP16, BF16), которые доминируют в задачах обучения и инференса нейросетей.
Project Huginn: распределенное обучение моделей на простаивающих GPU
Проект Huginn предлагает решение для оптимизации затрат на обучение и дообучение нейросетей за счет использования вычислительных мощностей, которые простаивают в распределенных сетях. Платформа позволяет объединять разрозненные графические процессоры в единый кластер, что значительно снижает стоимость аренды облачной инфраструктуры для интенсивных вычислительных задач.
Различия в использовании локальных моделей и облачных API
Сравнение локально запускаемых моделей с флагманскими облачными решениями, такими как Claude 3 Opus, показывает фундаментальную разницу в подходах к проектированию ИИ-систем. Локальные модели, например Qwen, не являются прямой заменой мощных проприетарных систем, а представляют собой специализированный инструмент для задач, требующих высокой приватности, отсутствия задержек при передаче данных и полной автономности. В то время как облачные модели демонстрируют преимущество в сложных логических рассуждениях и обработке контекста большого объема, локальные аналоги выигрывают в предсказуемости затрат и возможности интеграции в закрытые контуры.
Ошибка в проектировании замедляла работу ИИ-моделей
Исследователи из компании Mistral обнаружили, что предполагаемая проблема с производительностью ИИ-моделей была связана не с вычислительными ограничениями, а с ошибкой в проектировании. Они выяснили, что неверное распределение нагрузки между компонентами системы приводило к значительным задержкам, которые изначально списывали на недостаток вычислительных ресурсов.
Новый движок инференса для macOS 14 и новее
Разработчики представили новый движок инференса для macOS 14 и новее. Проект под названием Embershard оптимизирован для работы с моделями машинного обучения на устройствах Apple. Он поддерживает локальный запуск моделей, что позволяет пользователям использовать мощные ИИ-инструменты без необходимости подключения к облачным сервисам.
Whissle Gateway: мультимодальный голосовой ИИ в 500 МБ
Команда Whissle представила Whissle Gateway — локальный Docker-контейнер для мультимодального голосового ИИ. Размер образа составляет всего 500 МБ, что делает его одним из самых компактных решений для локального развёртывания.
Как развернуть AI-приложения на Claude Code и Cloudflare
В новом видео показано, как развернуть AI-приложения с использованием Claude Code и Cloudflare. Автор демонстрирует процесс создания и развертывания приложений, используя возможности облачных сервисов для работы с искусственным интеллектом.
Tokdiet: прокси для локального запуска LLM с экономией токенов
Разработчики представили Tokdiet — прокси-сервер для локального запуска языковых моделей, который сокращает расход токенов на 70% без потери качества. Решение работает как промежуточный слой между пользователем и моделью, оптимизируя запросы и уменьшая объём передаваемых данных.
Ускорение матричных операций на GPU в 2678 раз
Исследователи обнаружили, что графические процессоры (GPU) могут ускорять матричные операции в 2678 раз по сравнению с традиционными методами. Это открытие имеет значительное значение для машинного обучения и обработки больших данных, где матричные вычисления являются ключевым элементом.
AMD удаляет шифрование памяти из потребительских процессоров Ryzen
AMD приняла решение отключить функцию шифрования памяти (SEV) в своих потребительских процессорах Ryzen. Эта мера затронет модели Ryzen 7000 и более новые, что ограничит возможности защиты данных на уровне аппаратного обеспечения.
Lexar предлагает хранить локальные модели ИИ на SSD
Компания Lexar разрабатывает решение для размещения локальных моделей ИИ на SSD. Это связано с растущим спросом на вычислительные ресурсы и ограниченной доступностью оперативной памяти.
AMD оптимизировала вычисления для ИИ-моделей на CDNA4
Компания AMD представила оптимизации для вычислений матричных операций (GEMM) в формате FP8 на архитектуре CDNA4. Это позволит ускорить работу ИИ-моделей на графических процессорах Instinct серии MI300X.
AMD представила оптимизированный FP8 GEMM для ускорения ИИ-вычислений
AMD анонсировала новую технологию 4-Wave Interleave FP8 GEMM, направленную на ускорение вычислений в ИИ. Решение оптимизирует работу с тензорными ядрами, что позволяет значительно повысить производительность при инференсе моделей.
AMD оптимизирует инференс для своих GPU Instinct
AMD представила Atom Inference Engine — фреймворк для оптимизации работы моделей машинного обучения на графических процессорах Instinct. Решение сочетает аппаратные и программные компоненты, что позволяет ускорить выполнение задач инференса.
Расчёт стоимости инференса на примере
Разработчики из компании July поделились методом расчёта стоимости инференса для масштабируемых ИИ-систем. В статье объясняется, как оценить затраты на вычисления с учётом различных факторов, включая стоимость оборудования, энергопотребление и время обработки запросов.
Оркестратор OrcaRouter объединил несколько моделей в одну
Компания OrcaRouter представила новый подход к инференсу, который позволяет объединять несколько моделей в одну. Вместо увеличения размера модели разработчики предложили использовать панель, которая объединяет несколько моделей в одну систему. Это позволяет значительно улучшить производительность и точность без увеличения вычислительных затрат.
Запуск модели Gemma на устройствах с Coral Board
Компания Google продемонстрировала возможность запуска модели Gemma на устройствах с Coral Board. Это решение позволяет выполнять инференс на краю сети, что особенно актуально для задач, требующих низкой задержки и автономной работы.
Обработка данных переходит на GPU
Обработка данных всё чаще выполняется на графических процессорах (GPU), что меняет подходы к аналитике и машинному обучению. Это связано с ростом сложности задач и необходимости ускорения вычислений. GPU позволяют обрабатывать большие объёмы данных быстрее, чем традиционные CPU, что особенно важно для задач машинного обучения и анализа в реальном времени.
Расчёт загрузки GPU AMD MI355X для инференса моделей
Инженеры из Indianspeedster опубликовали подробное руководство по расчёту загрузки GPU AMD MI355X. В статье разбираются ключевые параметры, влияющие на производительность при инференсе моделей: количество потоков, блоки вычислений и другие технические аспекты.
Как использовать внешний GPU Nvidia с Mac для локального запуска ИИ
В 2026 году владельцы Mac смогут использовать внешние графические процессоры Nvidia для локального запуска моделей искусственного интеллекта. Это решение особенно актуально для разработчиков, которым требуется высокая вычислительная мощность, но у которых нет доступа к специализированным серверам.
Sors: прокси на Rust для оптимизации кэша vLLM
Разработчики представили Sors — прокси-сервер на Rust, который переупорядочивает запросы к моделям, чтобы максимизировать использование префиксного кэша vLLM. Это позволяет ускорить обработку запросов и снизить нагрузку на вычислительные ресурсы.