Инференс и железо
Обучение NanoGPT в кластере Slurm с фиксированной средой Nix
Разработчики поделились опытом обучения модели NanoGPT в кластере Slurm с использованием фиксированной среды Nix. Это позволяет обеспечить воспроизводимость экспериментов и упростить развёртывание в вычислительных кластерах.
Google представил пять поколений суперкомпьютеров для обучения ИИ
Google опубликовал исследование, в котором подробно описаны пять поколений своих суперкомпьютеров для обучения ИИ. Линейка начинается с TPU v2 и заканчивается Ironwood, последним на данный момент поколением.
GateGPT: 56k токенов в секунду на FPGA
Исследователи представили GateGPT — решение для ускоренного инференса трансформеров на FPGA. Система достигает скорости 56 000 токенов в секунду при частоте 80 МГц, используя кеш ключ-значение (KV cache). Это открывает новые возможности для развертывания больших языковых моделей на специализированном оборудовании.
INT21: фабрика ядер для ускорения вычислений в ИИ
Команда INT21 представила PTX Kernel Factory — инструмент для автоматической генерации и оптимизации ядер на уровне PTX (Parallel Thread Execution). Это позволяет ускорять вычисления в ИИ-моделях, особенно на графических процессорах NVIDIA.
Ubuntu Core 26 для локального запуска ИИ-моделей
Компания Canonical представила Ubuntu Core 26, новую версию операционной системы, ориентированную на создание локальных устройств для инференса ИИ-моделей. Основное внимание разработчики уделили поддержке высокопроизводительных вычислений и интеграции с популярными фреймворками для работы с искусственным интеллектом.
Qualcomm разрабатывает 40 новых AI-чипов для будущих устройств
Qualcomm активно работает над более чем 40 новыми проектами AI-чипов. Компания планирует стать ключевым поставщиком процессоров для устройств, которые в будущем заменят смартфоны. В рамках этой стратегии Qualcomm представила два новых продукта, направленных на поддержку новых форматов устройств.
Infer0 предлагает альтернативу подпискам для запуска ИИ-моделей
Infer0 — это платформа, которая позволяет запускать ИИ-модели без подписок. Сервис предлагает оплату за использование по факту, что может быть выгодно для разработчиков и пользователей, которым не нужны постоянные подписки.
SubQ 1.1 Small: локальный запуск моделей с улучшенной производительностью
Команда Subquadratic представила обновлённую версию SubQ 1.1 Small — фреймворка для локального запуска моделей. Новая версия предлагает улучшенную производительность и снижение требований к ресурсам, что делает её более доступной для использования на обычных ноутбуках и персональных компьютерах.
Новый фреймворк для JIT-компиляции ускоряет работу ИИ-моделей
Исследователи представили новый фреймворк для JIT-компиляции, который может значительно ускорить выполнение ИИ-моделей. Система использует многоуровневую JIT-компиляцию в рамках мета-трейсинга, что позволяет оптимизировать код на лету и повышать производительность.
Как масштабировать модели на TPU
Команда Jax ML выпустила подробное руководство по масштабированию больших языковых моделей на тензорных процессорах (TPU). Документ охватывает ключевые аспекты инфраструктуры, включая распределение вычислений, оптимизацию памяти и управление ресурсами.
Рост мощности дата-центров для ИИ-инференса
Дата-центры продолжают наращивать мощности для поддержки растущих нагрузок от ИИ-моделей. По данным Next Platform, спрос на вычислительные ресурсы для инференса растёт экспоненциально, что требует как обновления существующих дата-центров, так и строительства новых.
Tensordyne обещает революцию в инференсе благодаря логарифмической математике
Компания Tensordyne заявила о прорыве в области инференса, используя логарифмическую математику для ускорения вычислений. По их словам, новая архитектура позволяет значительно снизить затраты на вычисления и повысить скорость обработки запросов. Это особенно важно для разработчиков ИИ-агентов, так как инференс остается одной из самых затратных частей работы с моделями.
AMD Ryzen AI Halo для разработчиков ИИ
AMD представила Ryzen AI Halo — программу для разработчиков ИИ, которая включает доступ к новейшим процессорам с интегрированными нейросетевыми ускорителями. Это решение может значительно ускорить инференс моделей, что особенно важно для локального запуска ИИ-агентов.
MonoLisa 3: локальный запуск моделей с поддержкой текста
Команда MonoLisa представила третью версию своей платформы для локального запуска моделей, добавив поддержку текста через новую семью моделей MonoLisa Text. Это позволяет использовать платформу не только для работы с изображениями, но и для текстовых задач, что расширяет возможности локального инференса.
NVIDIA Blackwell лидирует в MLPerf Training 6.0
NVIDIA одержала победу во всех категориях MLPerf Training v6.0, превзойдя конкурентов по масштабу и производительности. Компания продемонстрировала лидерство в ключевых задачах обучения моделей, включая трансформеры и рекомендательные системы.
Как вычислительные ресурсы влияют на оценку крупных языковых моделей
Исследование на arXiv показывает, что современные оценки ИИ переходят на более сложные задачи, требующие длительных траекторий с использованием инструментов и итеративного решения проблем. Это делает результаты всё более чувствительными к объёму и распределению вычислительных ресурсов во время инференса.
Tensordyne представила процессор Napier с логарифмической математикой
Компания Tensordyne анонсировала новый AI-процессор под названием Napier, который отличается поддержкой логарифмической математики. Это открывает новые возможности для ускорения вычислений, особенно в задачах, связанных с обработкой больших объемов данных и сложными вычислениями, что критически важно для инференса моделей ИИ.
GPU как ключевой ресурс для ИИ
В статье на Hacker News поднимается тема критичности GPU для развития ИИ. Автор сравнивает графические процессоры с нефтью, подчеркивая их роль в качестве основного ресурса для обучения и инференса моделей. Это особенно актуально в контексте роста популярности локальных решений и агентов, где доступ к мощному железу становится ключевым фактором.
Интерфейсы для агентов как стратегия экономии токенов
Разработчики ИИ-агентов сталкиваются с проблемой эффективного использования токенов. В статье на Nokv.io рассматривается подход, при котором агенты получают доступ к файловой системе напрямую, что позволяет существенно снизить нагрузку на токены. Это особенно актуально для агентов, работающих с большими объемами данных, где передача информации через текстовые интерфейсы может быть неэффективной.
Экономия 67% на инференсе с Ray и vLLM на AMD MI325X
Команда Anyscale опубликовала исследование, в котором продемонстрировала значительную экономию на инференсе моделей большого языка. Используя Ray и vLLM на процессорах AMD MI325X, удалось достичь сокращения затрат на 67% за счёт разнесения (disaggregation) префикса и декодирования.
FlashQwen – новый CUDA-движок для ускоренного инференса Qwen3
Разработчики представили FlashQwen – инференс-движок для модели Qwen3, написанный с нуля на CUDA. Это решение направлено на оптимизацию работы с моделями большого языка, особенно в условиях ограниченных ресурсов. FlashQwen использует современные методы ускорения вычислений, включая кэширование и оптимизацию ядра CUDA, что позволяет значительно сократить время инференса.
Tessera-Hypernetwork: генерация LoRA-адаптеров за секунду
Разработчики представили Tessera-Hypernetwork — инструмент для генерации LoRA (Low-Rank Adaptation) адаптеров за менее чем секунду. Это позволяет быстро настраивать большие языковые модели под конкретные задачи инференса без переобучения всей модели. LoRA-адаптеры значительно уменьшают вычислительные затраты и память, что делает их идеальными для работы с локальными моделями и агентными системами.
Qualcomm ведёт переговоры о покупке Tenstorrent
Qualcomm, один из крупнейших производителей процессоров для мобильных устройств, ведёт переговоры о покупке канадской компании Tenstorrent, специализирующейся на разработке процессоров для искусственного интеллекта. Tenstorrent известна своими решениями для ускорения вычислений ИИ, включая процессоры и программное обеспечение для инференса и обучения моделей.
Nvidia DGX Station для локального развёртывания ИИ-агентов
Nvidia представила DGX Station — компактную рабочую станцию для локального развёртывания и инференса ИИ-моделей. Устройство оснащено восемью графическими процессорами Nvidia H100, что обеспечивает высокую производительность для работы с большими языковыми моделями и другими сложными ИИ-системами.