Инференс и железо
Термодинамические вычисления: новый подход к энергоэффективному ИИ
Компания Extropic представила концепцию термодинамических вычислений, предлагая использовать физические свойства шумящих систем для выполнения вероятностных вычислений. Вместо традиционной цифровой логики, основанной на булевых операциях, этот метод задействует естественную энтропию для ускорения работы генеративных моделей и задач оптимизации, что обещает кратное снижение энергопотребления при выполнении сложных вычислений, критически важных для современных нейросетей.
JetSpec ускоряет инференс LLM до 9.64 раз с помощью параллельного древовидного декодирования
Исследователи представили JetSpec — новый метод оптимизации инференса больших языковых моделей, использующий параллельное древовидное декодирование. Технология позволяет достичь ускорения до 9.64 раз при сохранении точности генерации. В пиковых нагрузках система демонстрирует производительность до 1000 токенов в секунду (TPS), что значительно превосходит стандартные подходы к генерации текста.
Запуск vLLM-сервера на Hugging Face Jobs одной командой
Hugging Face представила возможность развертывания высокопроизводительного сервера vLLM через сервис Jobs. Теперь пользователи могут запускать масштабируемые инференс-решения для LLM без необходимости ручной настройки инфраструктуры. Интеграция позволяет использовать мощные GPU-ресурсы платформы для обслуживания моделей, обеспечивая высокую пропускную способность и оптимизацию памяти, что значительно упрощает процесс перехода от экспериментов к продакшн-инференсу для разработчиков агентных систем.
Оптимизация холодного старта для тяжелых LLM: запуск DeepSeek-V4-Pro за 20 секунд
Инженеры Inferize представили решение, позволяющее сократить время холодного старта для крупных языковых моделей до 20 секунд. Технология фокусируется на ускорении загрузки весов модели в GPU-память, что критически важно для серверных инфраструктур, использующих динамическое масштабирование ресурсов для обслуживания запросов к тяжелым LLM в режиме реального времени.
Apple планирует пропустить поколение M6 и выпустить чипы M7 с упором на ИИ в 2027 году
Apple пересматривает дорожную карту своих процессоров для Mac, планируя пропустить выпуск высокопроизводительных чипов серии M6. Вместо этого компания сфокусируется на архитектуре M7, которая будет оптимизирована под задачи локального инференса ИИ. Ожидается, что переход на новый техпроцесс позволит значительно увеличить вычислительную мощность нейронных движков, обеспечивая работу сложных моделей непосредственно на устройствах пользователей.
Apple меняет стратегию выпуска чипов M6 и M7 ради ускорения ИИ-вычислений
Apple приняла решение пропустить выпуск топовых версий процессоров серии M6 для компьютеров Mac, чтобы сосредоточить ресурсы на разработке линейки M7. Новое поколение чипов будет сфокусировано на расширении возможностей локального инференса ИИ-моделей. Ожидается, что этот шаг позволит компании значительно увеличить производительность нейронных движков и объем доступной памяти для работы с тяжелыми языковыми моделями на устройствах.
Инструмент mlx-chronos для бенчмаркинга инференса на Apple Silicon
Разработчики представили mlx-chronos — специализированный инструмент для оценки производительности инференса моделей на чипах Apple Silicon с использованием фреймворка MLX. Утилита позволяет проводить сравнительное тестирование различных конфигураций и оптимизаций, предоставляя метрики скорости генерации токенов и потребления ресурсов, что критически важно для локального запуска LLM на устройствах Apple.
Решение проблемы утечек VRAM при работе с LLM
Разработчики представили решение проблемы «призрачной» видеопамяти (VRAM), которая часто остается занятой после завершения работы с моделями или некорректного закрытия процессов. Инструмент позволяет принудительно освобождать ресурсы GPU, предотвращая ошибки нехватки памяти и необходимость перезагрузки системы при интенсивном тестировании или развертывании локальных LLM на потребительском железе.
Оптимизация производительности обработки промптов в llama.cpp
Исследователь проанализировал влияние механизма Multi-Token Prediction (MTP) на скорость обработки промптов (Prompt Processing Tokens Per Second) в библиотеке llama.cpp. В ходе экспериментов удалось выявить причины деградации производительности при использовании MTP и разработать прототип (PoC), который восстанавливает показатели TPS, сохраняя при этом архитектурные преимущества многотокенового предсказания для LLM.
Qualcomm расширяет присутствие в дата-центрах: новые CPU и ИИ-ускорители
Qualcomm представила стратегию развития серверного оборудования, сфокусированную на высокопроизводительных вычислениях и задачах искусственного интеллекта. Компания планирует занять значительную долю рынка дата-центров, предлагая альтернативу доминирующим архитектурам за счет оптимизации энергоэффективности и вычислительной мощности своих новых процессоров и специализированных ускорителей, предназначенных для работы с крупными языковыми моделями и сложными аналитическими нагрузками в облачных инфраструктурах.
Кремниевая фотоника как ключ к масштабированию ИИ-вычислений
Джон Бауэрс, эксперт в области фотоники, обсуждает переход от традиционных медных соединений к кремниевой фотонике для передачи данных в дата-центрах. Технология позволяет радикально увеличить пропускную способность и энергоэффективность систем, что становится критическим фактором для обучения и работы сверхкрупных нейросетевых моделей, сталкивающихся с ограничениями текущей физической инфраструктуры передачи данных.
Qualcomm выходит на рынок дата-центров с процессором Dragonfly C1000
Компания Qualcomm представила Dragonfly C1000 — специализированный процессор, предназначенный для работы в дата-центрах. Этот шаг знаменует стратегическое расширение бизнеса компании за пределы мобильного сегмента. Новое решение ориентировано на высокопроизводительные вычисления и задачи, связанные с искусственным интеллектом, что позволяет Qualcomm конкурировать с доминирующими игроками в сфере серверного оборудования и инфраструктуры для облачных вычислений.
OpenAI разрабатывает собственный чип Jalapeño для оптимизации расходов на инференс
OpenAI в партнерстве с Broadcom ведет разработку специализированного ASIC-чипа под кодовым названием Jalapeño. Проект направлен на снижение зависимости компании от сторонних аппаратных решений, в частности от продукции Nvidia. Создание собственного «железа» является стратегическим шагом для оптимизации колоссальных капитальных затрат на инфраструктуру, необходимых для масштабирования работы нейросетевых моделей и обеспечения их эффективного инференса.
Baidu представила Unlimited OCR: 3B-модель с фиксированным потреблением памяти
Baidu выпустила Unlimited OCR — специализированную MoE-модель с 3 млрд параметров, предназначенную для обработки многостраничных документов. Главная особенность архитектуры заключается в использовании механизма Reference Sliding Window Attention (R-SWA), который поддерживает постоянный размер KV-кэша. Это позволяет модели сохранять стабильную скорость работы и потребление памяти независимо от объема входных данных, значительно превосходя существующие аналоги.
Китайский суперкомпьютер занял лидирующую позицию в мировом рейтинге производительности
Китайская вычислительная система вышла на первое место в мире по показателям производительности, сместив американские аналоги с вершины рейтинга. Это достижение подчеркивает значительный прогресс КНР в области высокопроизводительных вычислений (HPC), которые являются критически важной инфраструктурой для обучения масштабных моделей искусственного интеллекта и проведения сложных научных симуляций, требующих огромных вычислительных мощностей.
ASE Technology расширяет мощности для удовлетворения спроса на ИИ-чипы
Тайваньская компания ASE Technology, крупнейший в мире поставщик услуг по тестированию и упаковке полупроводников, объявила о масштабном расширении производственных мощностей. Решение продиктовано резким ростом спроса на передовые технологии корпусирования, необходимые для производства высокопроизводительных графических процессоров и ускорителей, используемых в обучении и работе современных моделей искусственного интеллекта.
OpenAI и Broadcom разрабатывают специализированный чип для инференса LLM
OpenAI объединила усилия с Broadcom для создания специализированного чипа, оптимизированного под задачи инференса крупных языковых моделей. Проект направлен на снижение зависимости от сторонних поставщиков графических процессоров и масштабирование вычислительных мощностей для работы с ИИ-сервисами. Новое решение должно обеспечить высокую энергоэффективность и производительность при выполнении сложных запросов в условиях растущего спроса на вычисления.
DualPath: новый метод оптимизации пропускной способности памяти при работе LLM
Исследователи представили DualPath — архитектурное решение, устраняющее «узкое горлышко» пропускной способности памяти при инференсе агентных LLM. Метод разделяет потоки данных для обработки весов модели и контекста, что позволяет значительно ускорить генерацию токенов в сценариях с длинным контекстом и частыми обращениями к памяти, характерными для современных автономных агентов.
AMD опубликовала руководство по программированию ядер AI Engine
AMD выпустила подробное техническое руководство по разработке ядер и графов для своих специализированных процессоров AI Engine. Документация охватывает архитектурные особенности вычислительных блоков, методы оптимизации кода для параллельных вычислений и принципы управления потоками данных в гетерогенных системах, что критически важно для высокопроизводительного инференса и обработки сигналов на аппаратном уровне.
Sipp: ускорение запуска локальных LLM в браузере
Проект Sipp предлагает новый подход к запуску компактных языковых моделей непосредственно в браузере, обеспечивая трехкратный прирост производительности по сравнению со стандартными методами. Инструмент оптимизирует процесс инференса, позволяя разработчикам интегрировать локальные модели в веб-приложения без необходимости обращения к облачным API, что критически важно для приватности и снижения задержек при работе с ИИ-агентами.
Nvidia представила технологию жидкостного охлаждения для дата-центров
Nvidia разработала новую архитектуру жидкостного охлаждения, позволяющую эксплуатировать серверы при температуре теплоносителя 45°C. Это решение практически исключает потребность в испарительном охлаждении, что снижает расход воды в дата-центрах до околонулевых значений. Технология направлена на повышение энергоэффективности вычислительных кластеров, работающих с высоконагруженными ИИ-системами, и снижение экологического следа инфраструктуры.
Реализация LLM на языке Zig: от архитектуры до инференса
Разработчики представили руководство по созданию минималистичного ядра для запуска больших языковых моделей на языке программирования Zig. Проект фокусируется на низкоуровневой реализации тензорных операций и механизмов внимания, позволяя понять внутреннее устройство нейросетей без использования тяжеловесных библиотек. Это решение демонстрирует возможности оптимизации инференса за счет прямого управления памятью и отсутствия лишних абстракций.
Рейтинг 21 открытой LLM с фильтрацией по возможностям GPU
Northwood Systems представили аналитический обзор 21 популярной модели с открытыми весами, сгруппировав их по требованиям к видеопамяти и производительности. Инструмент позволяет разработчикам подбирать оптимальную LLM под конкретное оборудование, основываясь на реальных тестах инференса, что упрощает выбор модели для локального развертывания и интеграции в собственные агентные системы.
Запуск генерации изображений на iPhone 2020 года
Разработчики реализовали локальную генерацию изображений с использованием нейросетей на базе iPhone 12, выпущенного в 2020 году. Проект демонстрирует возможности оптимизации современных моделей для работы на мобильном «железе» без обращения к облачным серверам. Использование нейронного движка Apple Neural Engine позволяет выполнять инференс диффузионных моделей непосредственно на устройстве, обеспечивая приватность и автономность обработки данных.