Инференс и железо
Antirez представил h3.c: легковесный движок для инференса LLM на Mac
Сальваторе Санфилиппо, создатель Redis, опубликовал проект h3.c — минималистичный движок для запуска больших языковых моделей на компьютерах Apple Silicon. Инструмент написан на языке C и ориентирован на максимальную простоту реализации, позволяя выполнять инференс моделей семейства Llama 3 с использованием аппаратного ускорения Metal, при этом сохраняя компактность и отсутствие сложных зависимостей.
Релиз квантованных версий модели Muse Glimmer 30B в формате GGUF
Команда Unsloth опубликовала квантованные версии языковой модели Muse Glimmer 30B в формате GGUF. Доступны варианты с разной степенью сжатия (Q4, Q6, Q8), что позволяет запускать модель на потребительском оборудовании с ограниченным объемом видеопамяти. Этот релиз упрощает локальный инференс мощных моделей среднего размера для широкого круга задач.
Needle2: компактная агентная LLM для мобильных устройств и робототехники
Разработчики представили Needle2 — специализированную языковую модель весом всего 14 МБ, оптимизированную для работы на устройствах с крайне ограниченными ресурсами. Решение предназначено для интеграции в смартфоны, носимую электронику, системы умного дома и робототехнические платформы, обеспечивая локальное выполнение агентных задач без необходимости обращения к облачным серверам.
Оптимизация затрат при запуске LLM на спотовых GPU
Запуск больших языковых моделей на спотовых инстансах облачных провайдеров сопряжен с рисками внезапного отключения мощностей. Исследование показывает, что при аренде GPU по сниженным ценам критически важно учитывать время инициализации и загрузки весов модели. Даже при успешном запуске, неэффективная настройка инфраструктуры может привести к потере часов работы и значительным финансовым издержкам без получения полезного результата.
Локальный инференс ИИ на Go с использованием нового пакета SIMD
В свежем релизе Go 1.27 представлен новый пакет для работы с SIMD-инструкциями, который открывает возможности для высокопроизводительного локального инференса нейросетей на языке Go. Использование векторных вычислений позволяет значительно ускорить математические операции, критически важные для работы LLM, позволяя разработчикам обходить ограничения стандартных библиотек и эффективнее задействовать аппаратные ресурсы процессора при выполнении моделей.
Meta выпустила Muse Glimmer: 30B-модель для локального запуска на потребительских GPU
Meta (признана экстремистской организацией, деятельность запрещена в РФ) представила Muse Glimmer — агентную модель с 30 миллиардами параметров, распространяемую под лицензией Apache 2.0. Архитектура оптимизирована для работы на одном потребительском графическом процессоре с 24 ГБ видеопамяти, обеспечивая высокую скорость генерации благодаря технологии спекулятивного декодирования DFlash, которая ускоряет инференс в 3,1 раза.
Matryoshka Language Model Suites: вложенная архитектура для эффективного инференса
Исследователи представили архитектуру Matryoshka, позволяющую обучать набор языковых моделей разного размера как единую вложенную структуру. Такой подход значительно повышает эффективность обучения и инференса, сокращая общее количество параметров в наборе. Модели меньшего размера извлекаются из основной архитектуры, что упрощает дистилляцию знаний и оптимизирует развертывание систем с динамическими требованиями к вычислительным ресурсам.
Запуск LLM на FPGA: 60 000 токенов в секунду на чипе за $250
Инженер Майк Эйлс продемонстрировал возможность запуска весов LLM непосредственно на кристалле FPGA, используя отладочную плату AMD Kria KV260 стоимостью $250. Проект достигает впечатляющей производительности в 60 000 токенов в секунду, что значительно превышает показатели стандартных программных реализаций на CPU или GPU для аналогичного ценового сегмента, открывая новые пути для оптимизации локального инференса.
Бенчмарк локальных LLM на потребительском железе
Автор провел сравнительное тестирование производительности популярных локальных языковых моделей на стандартном ноутбуке. В ходе эксперимента оценивалась скорость генерации токенов и качество ответов при работе с различными квантованными версиями моделей. Результаты показывают, какие архитектуры и уровни сжатия позволяют эффективно использовать ИИ-инструменты на обычном пользовательском оборудовании без специализированных графических ускорителей.
Meta представила Muse Glimmer: 30B-модель для локального запуска
Meta (признана экстремистской организацией, деятельность запрещена в РФ) выпустила Muse Glimmer — первую открытую модель от подразделения Superintelligence Labs. Это агентная модель с 30 миллиардами параметров, оптимизированная для работы на потребительском оборудовании. При использовании сжатых весов модель требует менее 20 ГБ видеопамяти, что делает её доступной для запуска на мощных домашних рабочих станциях.
Meta представила Muse Glimmer: 30B модель для локальных агентных систем
Meta (признана экстремистской организацией, деятельность запрещена в РФ) выпустила Muse Glimmer — открытую dense-модель с 30 миллиардами параметров, оптимизированную для локального запуска. Модель поддерживает контекстное окно объемом более 120 000 токенов, что позволяет эффективно обрабатывать длинные последовательности данных и сложные агентные сценарии непосредственно на пользовательском оборудовании без обращения к облачным API.
Hetzner запустил API для инференса моделей в рамках экспериментальной платформы
Hetzner представил API для запуска LLM в рамках своей новой экспериментальной платформы. Сервис предоставляет доступ к популярным открытым моделям через стандартный интерфейс, совместимый с OpenAI API. Решение ориентировано на разработчиков, которым требуется масштабируемая инфраструктура для инференса без необходимости самостоятельной настройки серверов, управления GPU-контейнерами и сложной оркестрации вычислительных мощностей в облаке.
Запуск обучения нейросетей на Apple Neural Engine через обратный инжиниринг API
Разработчики получили возможность использовать Apple Neural Engine (ANE) для обучения нейронных сетей, минуя официальные ограничения Apple. Благодаря обратному инжинирингу закрытых API, удалось реализовать прямой доступ к вычислительным мощностям чипов серии A и M. Это открывает путь к более эффективному локальному обучению и дообучению моделей на устройствах Apple, используя специализированное «железо» вместо стандартных CPU или GPU.
Запуск DeepSeek-V4 на чипах Apple Silicon через SSD-оффлоадинг
Проект DeepSeekV4SSD позволяет запускать крупную языковую модель DeepSeek-V4-Flash-0731 на компьютерах Apple Mac с процессорами M-серии, используя SSD как расширение оперативной памяти. Это решение решает проблему нехватки VRAM при работе с тяжелыми весами, позволяя выполнять инференс на потребительском железе с ограниченным объемом объединенной памяти.
Оптимизация работы трансформеров класса GPT-2 на GPU
Автор статьи детально разобрал процесс оптимизации инференса для моделей архитектуры GPT-2 при запуске на графических процессорах. В материале рассматриваются методы повышения производительности вычислений, включая эффективное управление памятью и использование специфических библиотек для ускорения матричных операций, что позволяет значительно сократить время генерации токенов и снизить нагрузку на аппаратное обеспечение при работе с локальными моделями.
Intel выпустила LLM Scaler для оптимизации работы LLM на GPU серии Arc Pro
Intel представила проект LLM Scaler, обеспечивающий поддержку и оптимизацию работы больших языковых моделей на графических процессорах Arc Pro B60 и B70. Инструмент направлен на повышение производительности инференса на аппаратном обеспечении Intel, позволяя эффективно использовать ресурсы дискретных видеокарт для запуска локальных моделей, что расширяет возможности развертывания ИИ-решений на рабочих станциях без необходимости использования дорогостоящих серверных ускорителей.
Практика локального хостинга LLM для задач программирования
Локальный запуск специализированных языковых моделей для написания кода становится доступной альтернативой облачным API. Использование собственного оборудования позволяет разработчикам обеспечить полную конфиденциальность данных, исключить задержки при передаче запросов и оптимизировать затраты на инференс. Статья рассматривает технические аспекты развертывания моделей, включая выбор аппаратных мощностей и настройку окружения для эффективной работы с кодовыми базами.
ExpertCache: запуск 120B моделей на 16GB RAM
Проект ExpertCache позволяет запускать массивные LLM (например, GPT-OSS 120B, требующие 63 ГБ памяти) на потребительском железе с 16 ГБ оперативной памяти, таком как MacBook M1 Pro. Технология использует кэширование экспертов (MoE) и эффективное управление памятью, что радикально снижает требования к VRAM/RAM для инференса сверхбольших моделей без существенной потери качества генерации.
Глубокое погружение в квантование нейронных сетей
Квантование стало ключевым методом оптимизации LLM, позволяющим запускать тяжелые модели на потребительском оборудовании. Технология снижает точность весов модели, например, с 16-битных чисел до 4-битных или 8-битных, что радикально уменьшает требования к видеопамяти и ускоряет инференс при минимальной потере качества генерации, делая локальные вычисления доступными для широкого круга задач.
Pokee AI представила модель Pokee-Isaac 28B с контекстным окном 10 млн токенов
Компания Pokee AI выпустила Pokee-Isaac 28B — специализированную текстовую модель с контекстным окном 10 миллионов токенов, оптимизированную для локального развертывания внутри инфраструктуры заказчика. Модель демонстрирует высокую точность извлечения данных из длинных контекстов и превосходит существующие аналоги в агентных бенчмарках, обеспечивая при этом высокую скорость обработки префиллов на современном аппаратном обеспечении.
Возвращение CPU: переосмысление разделения нагрузки между процессором и GPU для LLM
Инженеры Red Hat представили анализ, меняющий подход к запуску LLM, где CPU вновь становится ключевым компонентом инференса. Вместо полной зависимости от GPU, предлагается гибридная архитектура, использующая вычислительные мощности центрального процессора для оптимизации задержек и пропускной способности. Это позволяет эффективнее масштабировать модели на стандартном серверном оборудовании без необходимости в дорогостоящих графических ускорителях.
Цены на оперативную память вернулись к уровню 2007 года из-за спроса на ИИ
Стоимость оперативной памяти перестала снижаться и вернулась к показателям 2007 года с поправкой на инфляцию. Многолетняя тенденция к удешевлению DRAM была прервана резким ростом спроса со стороны производителей ИИ-ускорителей и дата-центров. Этот скачок цен фактически аннулировал два десятилетия технологического прогресса в области доступности памяти, создавая новые барьеры для масштабирования высокопроизводительных вычислительных систем.
Локальный ИИ-инференс на Go с использованием SIMD-инструкций
Новые возможности пакета SIMD в Go 1.27 позволяют значительно ускорить локальный инференс нейросетей на центральных процессорах. Разработчики получили инструменты для прямой работы с векторными инструкциями, что обеспечивает кроссплатформенную производительность без необходимости использования тяжелых GPU-библиотек. Это упрощает развертывание легковесных моделей непосредственно в инфраструктуре на языке Go, повышая эффективность вычислений на стандартном серверном оборудовании.
JEDEC представила стандарт SPHBM4 для снижения стоимости памяти в ИИ-системах
Организация JEDEC анонсировала стандарт SPHBM4, призванный радикально снизить затраты на производство высокопроизводительной памяти для ИИ-ускорителей. Переход на 512-битный интерфейс позволяет отказаться от дорогостоящих кремниевых интерпозеров в пользу более доступных органических подложек, что упрощает архитектуру чипов и делает масштабирование вычислительных мощностей для обучения и инференса моделей более экономически эффективным.