Инференс и железо
Релиз abliterated-версии модели Kimi K3 для задач red teaming
На платформе Hugging Face опубликована версия модели Kimi K3.0, прошедшая процедуру «аблитерации» (abliteration). Этот метод направлен на удаление специфических слоев, отвечающих за отказ от выполнения запросов, что делает модель более податливой для проведения стресс-тестирования и поиска уязвимостей в закрытых программных системах (red teaming).
Фракционное разделение GPU без использования Nvidia MiG
Разработчики представили решение для виртуализации графических процессоров, позволяющее разделять ресурсы GPU между несколькими задачами без использования проприетарной технологии Nvidia Multi-Instance GPU (MiG). Система обеспечивает изоляцию вычислительных мощностей на уровне программного обеспечения и поддерживает работу не только с картами Nvidia, но и с оборудованием AMD, что значительно расширяет возможности для оптимизации затрат на инференс.
Запуск SigLIP 2 на CPU с использованием Rust и ONNX
Разработчики представили высокопроизводительное решение для инференса мультимодальной модели SigLIP 2 на центральных процессорах. Проект реализован на языке Rust с использованием среды выполнения ONNX, что позволяет эффективно обрабатывать текстовые эмбеддинги без необходимости использования мощных GPU. Это упрощает интеграцию современных моделей зрения в легковесные агентные системы и локальные сервисы обработки данных.
Инференс на гомоморфно зашифрованных данных для CIFAR-10 за 163 мс
Разработчики представили решение для выполнения инференса нейронных сетей на зашифрованных данных с использованием методов гомоморфного шифрования. Система демонстрирует время обработки одного изображения из набора CIFAR-10 всего за 163 миллисекунды. Это достижение значительно приближает технологии конфиденциальных вычислений к практическому применению в задачах машинного обучения, где критически важна приватность исходных данных.
Запуск Gemma 2 27B на MacBook с 2 ГБ оперативной памяти
Проект turbo-fieldfare представил метод оптимизированного инференса для модели Gemma 2 27B, позволяющий запускать её на устройствах Apple с процессорами серии M, используя всего 2 ГБ оперативной памяти. Решение базируется на архитектуре A4B (Activation-aware 4-bit), которая значительно снижает требования к ресурсам при сохранении работоспособности нейросети на потребительском «железе» без необходимости в мощных GPU.
PagedWeight: оптимизация инференса MoE-моделей через динамическую квантовизацию
Исследователи представили PagedWeight — метод управления памятью для эффективного инференса Mixture-of-Experts (MoE) моделей. Технология решает проблему нехватки видеопамяти при одновременной работе с весами модели и растущим KV-кэшем. За счет динамической квантовизации весов в реальном времени PagedWeight позволяет значительно снизить требования к GPU, сохраняя при этом точность генерации на уровне исходных моделей.
Huawei может выйти на рынок производства DRAM-памяти
Компания Huawei рассматривает возможность запуска собственного производства чипов оперативной памяти DRAM. Этот шаг направлен на преодоление технологических ограничений и обеспечение стабильных поставок компонентов для нужд ИИ-инфраструктуры и центров обработки данных. В случае успеха компания сможет снизить зависимость от глобальных цепочек поставок памяти, которые критически важны для обучения и работы современных нейросетей.
Nvidia представила концепцию AI-RAN для сетей 6G
Nvidia анонсировала стратегию AI-RAN, направленную на интеграцию искусственного интеллекта непосредственно в архитектуру радиосетей 6G. Компания планирует разработать специализированные чипы для радиомодулей, которые позволят сетям связи динамически распределять вычислительные ресурсы между передачей данных и выполнением ИИ-задач, превращая базовые станции в распределенные вычислительные узлы для обработки ИИ-нагрузок в реальном времени.
Архитектура аппаратного восстановления при сбоях в обучении LLM
Исследователи представили концепцию совместного проектирования аппаратного и программного обеспечения для повышения отказоустойчивости при обучении крупномасштабных языковых моделей. Решение направлено на минимизацию потерь данных при аппаратных сбоях за счет использования механизмов обхода памяти HBM и интеграции специализированных логических схем, что позволяет значительно сократить время простоя кластеров при обучении моделей с миллиардами параметров.
Roboflow представила архитектуру для запуска тысяч моделей на общем парке GPU
Roboflow оптимизировала процесс инференса, внедрив серверную архитектуру для одновременного обслуживания тысяч специализированных моделей компьютерного зрения на общем парке GPU. Решение позволяет динамически загружать и выгружать веса моделей в видеопамять, минимизируя простои оборудования и обеспечивая высокую плотность размещения задач, что критически важно для масштабируемых агентных систем и приложений реального времени.
Скорость инференса одной и той же LLM различается в 8 раз у разных провайдеров
Исследование производительности LLM показало, что время до получения первого токена (TTFT) для одной и той же модели может отличаться до восьми раз в зависимости от выбранного API-провайдера. Разница обусловлена не только архитектурными особенностями инфраструктуры, но и различиями в реализации стека инференса, методах кэширования и нагрузке на серверы конкретных сервисов.
Переход на self-hosting: почему компании отказываются от проприетарных LLM
Компании всё чаще переходят на самостоятельный хостинг LLM, чтобы снизить зависимость от облачных API и оптимизировать расходы. Рост стоимости токенов и ограничения проприетарных моделей делают локальный запуск open-source решений экономически выгодной альтернативой. Переход позволяет компаниям сохранять полный контроль над данными и предсказуемо масштабировать инфраструктуру без привязки к ценовой политике крупных провайдеров.
Запуск 1-битных LLM в браузере через WebGPU
Сообщество WebML представило демо-проект Bonsai, позволяющий запускать 1-битные языковые модели непосредственно в браузере. Использование технологии WebGPU обеспечивает выполнение вычислений на стороне клиента без необходимости обращения к серверу. Это решение демонстрирует значительный прогресс в оптимизации инференса, позволяя работать с современными архитектурами моделей на пользовательских устройствах с минимальными требованиями к оперативной памяти.
AMD выпустила Lemonade 11.0 для локального запуска ИИ-сервисов
Компания AMD представила версию 11.0 платформы Lemonade, предназначенной для развертывания локальных ИИ-сервисов. Обновление расширяет возможности инфраструктуры, добавляя встроенную поддержку синтеза речи (Text-to-Speech) и оптимизации для работы с моделями на аппаратном обеспечении AMD. Релиз направлен на упрощение интеграции локальных LLM и мультимодальных функций в агентные системы и корпоративные приложения без необходимости обращения к облачным API.
Почему HBM-память стала главным узким местом в развитии ИИ
Развитие систем искусственного интеллекта и достижение AGI напрямую зависят от доступности и пропускной способности памяти с высокой пропускной способностью (HBM). Текущий дефицит этого компонента ограничивает масштабирование вычислительных мощностей, необходимых для обучения и инференса современных моделей. Аналитики прогнозируют, что именно архитектура памяти, а не только производительность GPU, станет определяющим фактором в гонке за вычислительным превосходством.
NIFA: новая архитектура FPGA с аналоговыми вычислениями в памяти для ИИ
Исследователи представили архитектуру NIFA (Nonlinear IMC enhanced FPGA), объединяющую традиционные программируемые логические матрицы с аналоговыми вычислениями в памяти (IMC) на базе ReRAM. Решение позволяет выполнять векторно-матричное умножение непосредственно в кроссбарах памяти, что значительно повышает плотность вычислений и энергоэффективность при работе с глубокими нейронными сетями по сравнению с классическими цифровыми FPGA.
Apple ведет переговоры о покупке PrismML для оптимизации моделей на iPhone
Apple обсуждает приобретение стартапа PrismML, специализирующегося на технологиях сжатия нейросетей. Разработки компании позволяют уменьшать размер ИИ-моделей до 15 раз без существенной потери точности. Интеграция этих решений позволит запускать сложные генеративные модели непосредственно на устройствах iPhone, снижая зависимость от облачных вычислений и повышая скорость обработки данных при сохранении конфиденциальности пользователей.
Ускорение инференса блочных низкоранговых моделей на GPU с ограниченной памятью
Исследователи представили метод оптимизации инференса для блочных низкоранговых (BLR) моделей, позволяющий значительно снизить требования к видеопамяти при сохранении точности вычислений. Технология ориентирована на работу с крупными нейросетями на GPU с ограниченными ресурсами, обеспечивая ускорение обработки данных за счет эффективного управления матричными операциями и снижения объема передаваемой информации между памятью и вычислительными ядрами.
Запуск моделей Gemma на Apple Neural Engine
Разработчики реализовали запуск нейросетей семейства Gemma на аппаратном ускорителе Apple Neural Engine (ANE). Использование специализированного чипа вместо стандартных ядер GPU позволяет значительно оптимизировать энергопотребление и повысить производительность при инференсе локальных моделей на устройствах Mac. Это открывает новые возможности для запуска LLM на потребительском «железе» Apple с высокой энергоэффективностью.
Оптимизация инференса: объединение шагов декодирования 27B модели в один CUDA-ядро
Исследователи представили метод оптимизации инференса для 27-миллиардных тернарных LLM, объединяющий весь процесс декодирования в единое CUDA-ядро. Это решение радикально снижает накладные расходы на передачу данных между памятью и вычислительными блоками GPU, позволяя значительно увеличить пропускную способность и скорость генерации токенов при сохранении высокой точности работы квантованных моделей на потребительском и серверном железе.
Обзор текущего состояния инференса open-source LLM
Аналитический обзор рынка инференса для открытых языковых моделей описывает ключевые технологические сдвиги, определяющие эффективность запуска моделей на собственном оборудовании. Автор систематизирует современные подходы к оптимизации, включая методы квантования, использование специализированных движков и стратегии управления памятью, которые позволяют снизить задержки и стоимость эксплуатации LLM в продакшн-средах при сохранении высокой точности ответов.
IBM представила сервер Power S1112 для локального ИИ-инференса на периферии
IBM расширила линейку серверов Power, выпустив модель S1112, оптимизированную для задач локального ИИ-инференса на периферийных узлах. Устройство сочетает высокую вычислительную мощность архитектуры Power10 с компактным форм-фактором, что позволяет компаниям обрабатывать данные непосредственно в местах их генерации, снижая задержки и требования к пропускной способности сети при работе с корпоративными моделями машинного обучения.
Обучение моделей методом RL на распределенной сети из 14 компьютеров Mac
Команда Pluralis продемонстрировала возможность проведения пост-тренировки языковых моделей с использованием обучения с подкреплением (RL) на распределенной инфраструктуре из 14 компьютеров Mac, расположенных в четырех странах. Эксперимент доказал эффективность использования потребительского оборудования Apple Silicon для решения сложных задач дообучения, которые традиционно требуют мощных серверных кластеров с GPU.
Hedy переносит обработку ИИ для встреч на локальные устройства
Сервис Hedy представил обновление, позволяющее выполнять транскрибацию и анализ встреч в реальном времени непосредственно на устройствах пользователей. Решение поддерживает работу на macOS, Windows и iOS, обеспечивая полную конфиденциальность данных за счет отказа от передачи аудиопотоков в облако. Технология опирается на локальный инференс, что минимизирует задержки и исключает зависимость от внешних серверов при обработке конфиденциальной корпоративной информации.