Инференс и железо
Оптимизация инференса: объединение шагов декодирования 27B модели в один CUDA-ядро
Исследователи представили метод оптимизации инференса для 27-миллиардных тернарных LLM, объединяющий весь процесс декодирования в единое CUDA-ядро. Это решение радикально снижает накладные расходы на передачу данных между памятью и вычислительными блоками GPU, позволяя значительно увеличить пропускную способность и скорость генерации токенов при сохранении высокой точности работы квантованных моделей на потребительском и серверном железе.
Обзор текущего состояния инференса open-source LLM
Аналитический обзор рынка инференса для открытых языковых моделей описывает ключевые технологические сдвиги, определяющие эффективность запуска моделей на собственном оборудовании. Автор систематизирует современные подходы к оптимизации, включая методы квантования, использование специализированных движков и стратегии управления памятью, которые позволяют снизить задержки и стоимость эксплуатации LLM в продакшн-средах при сохранении высокой точности ответов.
IBM представила сервер Power S1112 для локального ИИ-инференса на периферии
IBM расширила линейку серверов Power, выпустив модель S1112, оптимизированную для задач локального ИИ-инференса на периферийных узлах. Устройство сочетает высокую вычислительную мощность архитектуры Power10 с компактным форм-фактором, что позволяет компаниям обрабатывать данные непосредственно в местах их генерации, снижая задержки и требования к пропускной способности сети при работе с корпоративными моделями машинного обучения.
Обучение моделей методом RL на распределенной сети из 14 компьютеров Mac
Команда Pluralis продемонстрировала возможность проведения пост-тренировки языковых моделей с использованием обучения с подкреплением (RL) на распределенной инфраструктуре из 14 компьютеров Mac, расположенных в четырех странах. Эксперимент доказал эффективность использования потребительского оборудования Apple Silicon для решения сложных задач дообучения, которые традиционно требуют мощных серверных кластеров с GPU.
Hedy переносит обработку ИИ для встреч на локальные устройства
Сервис Hedy представил обновление, позволяющее выполнять транскрибацию и анализ встреч в реальном времени непосредственно на устройствах пользователей. Решение поддерживает работу на macOS, Windows и iOS, обеспечивая полную конфиденциальность данных за счет отказа от передачи аудиопотоков в облако. Технология опирается на локальный инференс, что минимизирует задержки и исключает зависимость от внешних серверов при обработке конфиденциальной корпоративной информации.
Hedos: нативное приложение для запуска локальных моделей на macOS
Hedos — это новое нативное приложение для macOS, объединяющее работу с локальными языковыми моделями и генераторами изображений в едином интерфейсе. Инструмент поддерживает движки llama.cpp, MLX и библиотеку diffusers, позволяя пользователям запускать современные нейросети непосредственно на железе Apple Silicon без необходимости настройки сложных окружений через терминал.
Илон Маск приобрел производителя газовых турбин для энергообеспечения Grok
Илон Маск приобрел компанию APR Energy, специализирующуюся на мобильных газотурбинных установках, за 1 миллиард долларов. Сделка направлена на обеспечение независимого энергоснабжения для дата-центров, где обучается и работает нейросеть Grok. Это стратегическое решение позволит компании xAI минимизировать зависимость от перегруженных электросетей и ускорить масштабирование вычислительных мощностей для своих будущих моделей.
Оптимизация деквантования NF4: новый Triton-ядро ускоряет работу моделей
Разработчики представили новое ядро на языке Triton для деквантования весов формата NF4, которое обеспечивает прирост производительности в 1,41 раза по сравнению с популярной библиотекой bitsandbytes. Решение ориентировано на ускорение инференса больших языковых моделей, работающих в квантованном виде, и позволяет эффективнее использовать вычислительные ресурсы графических процессоров при выполнении операций с низкоразрядными весами.
Goku: запуск LLM в браузере на базе WebAssembly и wllama
Goku — это новый инструмент для локального запуска и управления языковыми моделями непосредственно в браузере. Проект использует технологию WebAssembly и библиотеку wllama для обеспечения инференса без необходимости настройки серверной инфраструктуры. Решение позволяет пользователям загружать, хранить и запускать модели прямо на клиентской стороне, обеспечивая приватность данных и независимость от внешних API.
SiPearl и перспективы европейского рынка высокопроизводительных чипов
Французский стартап SiPearl стремится сократить технологическую зависимость Европы от американских производителей, разрабатывая процессоры архитектуры ARM для суперкомпьютеров и задач ИИ. Компания делает ставку на энергоэффективность и открытую экосистему, пытаясь занять нишу в сегменте высокопроизводительных вычислений (HPC), где доминируют решения от NVIDIA, Intel и AMD.
Bonsai 27B: модель с навыками рассуждения, работающая на iPhone
Компания PrismML представила технологию сжатия, позволившую уместить 27-миллиардную модель Bonsai 27B в объем менее 4 ГБ. Это позволяет запускать полноценную модель с продвинутыми навыками логического вывода локально на смартфонах Apple. Разработка сохраняет до 90% исходной производительности, демонстрируя минимальные потери в задачах по программированию и математике, что открывает новые возможности для мобильного ИИ.
Оптимизация локального инференса на процессорах Ryzen AI Strix Halo
Оптимизация настроек процессоров AMD Ryzen AI серии Strix Halo позволяет повысить скорость локального инференса нейросетей на 10–15%. Автор видео демонстрирует практический подход к настройке параметров аппаратного обеспечения, который помогает эффективнее использовать встроенные вычислительные мощности для запуска LLM и других генеративных моделей непосредственно на пользовательских устройствах без обращения к облачным серверам.
Google представила LiteRT.js для запуска ИИ-моделей в браузере через WebGPU
Google выпустила LiteRT.js — JavaScript-библиотеку для исполнения моделей формата .tflite непосредственно в браузере. Инструмент использует возможности WebGPU, WebAssembly и WebNN для ускорения инференса на стороне клиента. Решение позволяет разработчикам запускать нейросети на CPU, GPU и NPU, обеспечивая кратный прирост производительности по сравнению с предыдущими веб-интерфейсами и стандартными CPU-вычислениями.
Запуск 27-миллиардной модели на 4 ГБ оперативной памяти
Разработчики PrismML продемонстрировали возможность запуска языковой модели с 27 миллиардами параметров на устройстве с 4 ГБ оперативной памяти. Достижение стало возможным благодаря сочетанию экстремального квантования весов и оптимизации алгоритмов вычислений, что позволяет выполнять сложные ИИ-задачи локально на смартфонах без обращения к облачным серверам, обеспечивая высокую скорость и конфиденциальность обработки данных.
PrismML представила Bonsai 27B: экстремально сжатые версии модели Qwen3.6
Компания PrismML выпустила Bonsai 27B — оптимизированные версии языковой модели Qwen3.6-27B, использующие квантование до 1-битных и тернарных значений. Эти сборки позволяют запускать мощную модель с 27 миллиардами параметров на потребительском оборудовании, включая ноутбуки и смартфоны, сохраняя при этом архитектурную целостность оригинальной модели при значительном снижении требований к оперативной памяти.
Moonshine: компактные модели распознавания речи и TTS до 500 КБ
Разработчики представили Moonshine — семейство сверхлегких моделей для автоматического распознавания речи (ASR) и синтеза речи (TTS), размер которых не превышает 500 КБ. Решение оптимизировано для работы на устройствах с крайне ограниченными вычислительными ресурсами, обеспечивая при этом высокую точность транскрипции и генерации звука, что делает его эффективным инструментом для локальной обработки аудио в агентных системах.
Компилятор для оптимизации VLIW-архитектур в задачах ИИ
Разработчик представил специализированный компилятор, решающий задачу оптимизации VLIW (Very Long Instruction Word), предложенную Anthropic. Инструмент направлен на повышение эффективности выполнения кода на архитектурах с параллельным исполнением инструкций, что критически важно для ускорения инференса нейросетей. Решение демонстрирует подходы к эффективному планированию инструкций и управлению ресурсами процессора в условиях жестких ограничений аппаратного обеспечения.
Портирование llm.c на Mojo: ускорение инференса в 1.72 раза по сравнению с PyTorch
Реализация проекта llm.c на языке Mojo с использованием ядер Metal показала значительный прирост производительности при выполнении операций на графических процессорах Apple. Новая архитектура обеспечивает ускорение в 1.72 раза по сравнению с аналогичными задачами, выполняемыми через стандартные механизмы PyTorch MPS (Metal Performance Shaders), что открывает новые возможности для оптимизации локального запуска моделей.
Bonsai 27B: первая 1-битная LLM класса 27B для запуска на смартфонах
Разработчики представили Bonsai 27B — первую языковую модель с 27 миллиардами параметров, оптимизированную для работы на мобильных устройствах. Благодаря использованию 1-битной квантованной архитектуры, модель сохраняет высокую производительность при экстремально низких требованиях к памяти и вычислительным мощностям, что открывает возможности для полноценного локального запуска сложных ИИ-систем на смартфонах без обращения к облачным серверам.
DFSX представила ускоритель DF1000 с архитектурой 3D near-memory
Компания DFSX анонсировала высокопроизводительную карту-ускоритель Peak DF1000, предназначенную для задач инференса ИИ. Ключевой особенностью устройства стало использование архитектуры 3D near-memory, которая позволяет значительно снизить задержки при передаче данных между памятью и вычислительными ядрами, обеспечивая высокую пропускную способность для работы с крупными языковыми моделями и сложными нейросетями в реальном времени.
Оптимизация realtime voice-аватара для работы на CPU
Разработчики представили проект, который дополняет демо-версию голосового помощника от Hugging Face визуальным аватаром, работающим в реальном времени исключительно на центральном процессоре. Решение позволяет запускать интерактивные разговорные интерфейсы на обычном оборудовании без необходимости использования мощных графических ускорителей, что значительно снижает порог входа для развертывания агентных систем с визуальным представлением.
Запуск локальных LLM на Java через OpenJDK Panama FFM
Разработчики представили libargus — инструмент для запуска локальных языковых моделей, использующий возможности OpenJDK Panama FFM (Foreign Function & Memory API). Решение позволяет напрямую взаимодействовать с нативными библиотеками инференса из кода на Java 22, обеспечивая низкую задержку и высокую производительность при работе с LLM без необходимости использования тяжелых JNI-оберток.
Libargus: запуск локальных LLM на Java через OpenJDK Panama FFM
Libargus — это новый инструмент для запуска локальных LLM, использующий возможности API OpenJDK Panama FFM (Foreign Function & Memory) в Java 22. Проект обеспечивает низкую задержку при выполнении моделей, позволяя Java-приложениям напрямую взаимодействовать с нативными библиотеками инференса без традиционных накладных расходов JNI, что упрощает интеграцию нейросетей в экосистему JVM.
Оптимизация пропускной способности GLM-5.2 через автоматизированную настройку
Команда Autoresearch добилась двукратного увеличения пропускной способности модели GLM-5.2, применив автоматизированную настройку параметров инференса. Несмотря на значительный прирост производительности в синтетических тестах, внедрение решения в продакшн выявило критические проблемы со стабильностью под реальной нагрузкой, что потребовало пересмотра подходов к автоматической оптимизации систем машинного обучения в условиях высокого трафика.