Инференс и железо
Стартап Etched привлек $120 млн на создание специализированного чипа для трансформеров
Стартап Etched вышел из режима скрытности, объявив о привлечении $120 млн инвестиций для разработки специализированного процессора Sohu, предназначенного исключительно для архитектуры Transformer. В отличие от универсальных GPU, чип Etched аппаратно реализует операции, лежащие в основе LLM, что обещает кратное увеличение производительности инференса и снижение энергопотребления при работе с крупными языковыми моделями.
Локальный инференс ИИ на NVIDIA Jetson через Durable Streams
Разработчик представил метод организации локального инференса моделей на платформе NVIDIA Jetson с использованием архитектуры Durable Streams. Решение позволяет эффективно управлять потоками данных при ограниченных вычислительных ресурсах, обеспечивая стабильную работу ИИ-сервисов без обращения к облачным API. Подход фокусируется на минимизации задержек и оптимизации пропускной способности при обработке запросов на периферийных устройствах.
EdgeSync-LLM: оптимизация KV-кэша для локального запуска LLM на Android
EdgeSync-LLM — это специализированный движок для управления фрагментами KV-кэша, разработанный для эффективного инференса больших языковых моделей на мобильных устройствах под управлением Android. Решение написано на Go и фокусируется на минимизации потребления оперативной памяти при работе с контекстом, что критически важно для локального запуска моделей на смартфонах с ограниченными аппаратными ресурсами.
Huawei представила OpenPangu 2 Flash с контекстным окном 512K
Huawei выпустила открытую версию модели OpenPangu 2 Flash, ключевой особенностью которой стало расширенное до 512 тысяч токенов контекстное окно. Релиз включает в себя веса модели, оптимизированный код для инференса и описание процессов обучения, что позволяет разработчикам развертывать высокопроизводительные решения для обработки длинных последовательностей данных на собственной инфраструктуре.
FlexViT: новый FPGA-ускоритель для Vision Transformers на периферийных устройствах
Исследователи представили FlexViT — специализированную архитектуру ускорителя на базе FPGA, предназначенную для эффективного запуска Vision Transformer (ViT) моделей на периферийных устройствах. Решение решает проблему высокой вычислительной сложности и неоднородности гибридных моделей, сочетающих полносвязные и сверточные слои, обеспечивая гибкую обработку тензоров с переменными формами и повышая производительность инференса в условиях ограниченных ресурсов.
Meituan обучила модель на 1,6 трлн параметров без использования чипов Nvidia
Китайская технологическая компания Meituan представила модель LongCat-2.0, насчитывающую 1,6 триллиона параметров. Обучение системы было полностью проведено на вычислительных мощностях китайского производства, без использования графических процессоров Nvidia. Этот кейс демонстрирует возможность масштабирования обучения нейросетей в условиях экспортных ограничений на передовое западное оборудование, опираясь исключительно на внутреннюю инфраструктуру и локальные аппаратные решения.
Генерация изображений на Android: оптимизация инференса моделей
Команда Duration AI представила решение для запуска генеративных моделей на мобильных устройствах, продемонстрировав работу Stable Diffusion на Android-смартфоне 2025 года. Технология фокусируется на оптимизации инференса, позволяя выполнять ресурсоемкие задачи по созданию изображений локально без обращения к облачным серверам, что существенно снижает задержки и обеспечивает приватность пользовательских данных.
Локальный запуск DeepSeek-V3 на MacBook Pro с 128 ГБ оперативной памяти
Разработчики успешно адаптировали и запустили модель DeepSeek-V3 для локального использования на MacBook Pro с объемом памяти 128 ГБ. Благодаря методам квантования и оптимизации инференса, удалось добиться приемлемой скорости генерации кода на потребительском «железе» Apple, что открывает возможности для работы с мощными LLM без обращения к облачным API и передачи конфиденциальных данных сторонним провайдерам.
Безопасное глубокое обучение на Rust для Apple Silicon
Исследователи представили методологию оптимизации глубокого обучения на архитектуре Apple Silicon с использованием языка Rust. Работа фокусируется на повышении производительности и безопасности вычислений при работе с нейронными сетями, предлагая подходы к минимизации ошибок памяти и ускорению инференса за счет эффективного использования аппаратных ускорителей Apple через безопасные абстракции системного программирования.
Ускорение локального запуска LLM на Mac через движок MLX в Ollama
Ollama интегрировала поддержку движка MLX от Apple, что позволило значительно повысить скорость генерации текста на компьютерах Mac с чипами Apple Silicon. Оптимизация позволяет моделям работать в два раза быстрее, эффективно используя возможности объединенной памяти и графических ядер архитектуры M-серии, что делает локальный запуск LLM более доступным для повседневных задач.
TurboPrefill ускоряет инференс Llama-3-70B в 2.7 раза
Разработчики llama.cpp представили механизм TurboPrefill, который значительно повышает скорость обработки промптов (prefill) для крупных языковых моделей. Тестирование на архитектуре Llama-3-70B показало прирост производительности в 2.7 раза по сравнению со стандартным методом конвейерного параллелизма. Это обновление оптимизирует работу с длинными контекстами и снижает время ожидания первого токена в распределенных системах.
Cerebras обеспечила сверхбыстрый инференс для мультимодальной модели Gemma 2
Компания Cerebras представила решение для ускоренного запуска мультимодальной модели Gemma 2, обеспечив беспрецедентную скорость генерации токенов. Использование специализированного аппаратного обеспечения позволяет обрабатывать запросы с минимальной задержкой, что делает систему одной из самых производительных на рынке для задач, требующих работы с текстом и изображениями в режиме реального времени.
Fastllm: запуск DeepSeek-V4 на потребительском железе с 10 ГБ VRAM
Библиотека Fastllm оптимизировала процесс инференса для тяжеловесных моделей, позволив запускать DeepSeek-V4 на видеокартах с объемом памяти всего 10 ГБ. Это значительный шаг в сторону доступности высокопроизводительных LLM для локального использования, так как ранее для работы подобных архитектур требовались серверные мощности с кратно большим объемом видеопамяти.
Обзор Supermicro GB300 Super AI Station: вычислительная мощь для локальных задач
Supermicro представила GB300 Super AI Station — специализированную рабочую станцию, предназначенную для высокопроизводительных вычислений и обучения ИИ-моделей. Система базируется на архитектуре NVIDIA Blackwell и обеспечивает плотность вычислений, сопоставимую с серверными решениями, позволяя компаниям разворачивать сложные агентные системы и проводить инференс тяжелых моделей непосредственно в локальной инфраструктуре без необходимости обращения к облачным провайдерам.
Meta оптимизирует инференс-инфраструктуру с помощью CXL-технологий
Meta (признана экстремистской организацией, деятельность запрещена в РФ) внедрила технологию CXL для повторного использования модулей памяти DDR4 из устаревших серверов в новых вычислительных узлах. Использование специализированных ASIC-чипов позволило компании объединять ресурсы памяти, что привело к сокращению затрат на развертывание инференс-инфраструктуры на 25% и значительному продлению жизненного цикла аппаратного обеспечения.
Локальный запуск мультимодальных ИИ-моделей на macOS
Проект Off-grid AI позволяет запускать чат-ботов, генераторы изображений, системы компьютерного зрения и голосовые модели локально на компьютерах Apple Mac. Решение ориентировано на работу без интернет-соединения, обеспечивая приватность данных и независимость от облачных API. Инструмент оптимизирован для использования аппаратных возможностей чипов Apple Silicon, предоставляя пользователям полноценный локальный стек для работы с ИИ.
Южнокорейские техгиганты инвестируют $550 млрд в производство чипов памяти
Крупнейшие производители чипов памяти объявили о масштабных инвестициях в размере более $550 млрд для расширения производственных мощностей. Эти вложения направлены на преодоление глобального дефицита высокопроизводительной памяти, необходимой для обучения и работы современных ИИ-моделей. Южная Корея стремится укрепить свои позиции в качестве ключевого глобального хаба в цепочке поставок аппаратного обеспечения для искусственного интеллекта.
Теоретическое обоснование механизмов принятия токенов в спекулятивном декодировании
Исследователи представили теоретическую модель процесса принятия токенов в спекулятивном декодировании, которая выходит за рамки классического сохранения распределения вероятностей. Работа анализирует поведение систем при использовании жадных алгоритмов и ослабленных правил верификации, позволяя точнее предсказывать ускорение инференса и качество генерации при работе связки «быстрая модель-черновик — тяжелая целевая модель» в реальных производственных условиях.
Оптимизация визуального инференса через проактивную маршрутизацию запросов
Исследователи предложили метод повышения эффективности мультимодальных моделей при выполнении сложных визуальных задач. Система использует связку из компактной «черновой» модели и крупной целевой модели, применяя адаптивный механизм маршрутизации. В зависимости от сложности запроса, система автоматически определяет, какая модель должна обрабатывать данные, что позволяет сократить избыточные вычисления и ускорить процесс рассуждения.
Kog Laneformer 2B: оптимизированная модель для низкозадержечного инференса
Компания Kog представила Laneformer 2B — специализированную языковую модель, разработанную для минимизации задержек при выполнении задач в реальном времени. Модель оптимизирована для работы в составе собственного инференс-движка Kog, обеспечивая высокую скорость генерации токенов при сохранении компактного размера в 2 миллиарда параметров, что критически важно для высоконагруженных агентных систем.
Tensordyne ускоряет ИИ-инференс через переход к логарифмическим вычислениям
Стартап Tensordyne представил технологию, которая радикально ускоряет инференс нейросетей за счет замены традиционных матричных умножений на операции в логарифмическом пространстве. Этот подход позволяет упростить аппаратную реализацию вычислений, снижая энергопотребление и требования к пропускной способности памяти, что критически важно для эффективного развертывания крупных языковых моделей на специализированном оборудовании.
Squish: новый инструмент для ускоренного запуска локальных LLM на Apple Silicon
Squish — это специализированный инструмент, оптимизированный для запуска больших языковых моделей на чипах Apple Silicon. Решение фокусируется на максимальной производительности инференса, используя архитектурные особенности процессоров Apple для снижения задержек при работе с локальными моделями. Проект ориентирован на разработчиков, которым требуется высокая скорость генерации текста без обращения к облачным API.
xFusion представила масштабируемую инфраструктуру для корпоративного ИИ
Компания xFusion на конференции ISC 2026 продемонстрировала комплексные аппаратные решения для развертывания ИИ, охватывающие спектр от локальных рабочих станций до мощных дата-центров с жидкостным охлаждением. Новая архитектура призвана закрыть потребность бизнеса в безопасной инфраструктуре, позволяя компаниям переходить от прототипирования на периферийных устройствах к полноценным производственным мощностям без утечки проприетарных данных через публичные API.
Sophon PFG-1: новый ИИ-чип с 330 ГБ встроенной DRAM без HBM
Компания Phantafield представила архитектуру Sophon PFG-1 — специализированный ИИ-процессор, использующий монолитную 3D-компоновку для интеграции 330 ГБ DRAM непосредственно на кристалле. Инновационный подход позволяет отказаться от дорогостоящей и энергозатратной памяти HBM, обеспечивая при этом высокую пропускную способность данных, необходимую для работы с крупными языковыми моделями и сложными агентными системами.