Инференс и железо

Стартап Etched привлек $120 млн на создание специализированного чипа для трансформеров Hacker News · 30.06.2026 Стартап Etched вышел из режима скрытности, объявив о привлечении $120 млн инвестиций для разработки специализированного процессора Sohu, предназначенного исключительно для архитектуры Transformer. В отличие от универсальных GPU, чип Etched аппаратно реализует операции, лежащие в основе LLM, что обещает кратное увеличение производительности инференса и снижение энергопотребления при работе с крупными языковыми моделями. Локальный инференс ИИ на NVIDIA Jetson через Durable Streams Lobsters · 30.06.2026 Разработчик представил метод организации локального инференса моделей на платформе NVIDIA Jetson с использованием архитектуры Durable Streams. Решение позволяет эффективно управлять потоками данных при ограниченных вычислительных ресурсах, обеспечивая стабильную работу ИИ-сервисов без обращения к облачным API. Подход фокусируется на минимизации задержек и оптимизации пропускной способности при обработке запросов на периферийных устройствах. EdgeSync-LLM: оптимизация KV-кэша для локального запуска LLM на Android Hacker News · 30.06.2026 EdgeSync-LLM — это специализированный движок для управления фрагментами KV-кэша, разработанный для эффективного инференса больших языковых моделей на мобильных устройствах под управлением Android. Решение написано на Go и фокусируется на минимизации потребления оперативной памяти при работе с контекстом, что критически важно для локального запуска моделей на смартфонах с ограниченными аппаратными ресурсами. Huawei представила OpenPangu 2 Flash с контекстным окном 512K Hacker News · 30.06.2026 Huawei выпустила открытую версию модели OpenPangu 2 Flash, ключевой особенностью которой стало расширенное до 512 тысяч токенов контекстное окно. Релиз включает в себя веса модели, оптимизированный код для инференса и описание процессов обучения, что позволяет разработчикам развертывать высокопроизводительные решения для обработки длинных последовательностей данных на собственной инфраструктуре. FlexViT: новый FPGA-ускоритель для Vision Transformers на периферийных устройствах arXiv · 30.06.2026 Исследователи представили FlexViT — специализированную архитектуру ускорителя на базе FPGA, предназначенную для эффективного запуска Vision Transformer (ViT) моделей на периферийных устройствах. Решение решает проблему высокой вычислительной сложности и неоднородности гибридных моделей, сочетающих полносвязные и сверточные слои, обеспечивая гибкую обработку тензоров с переменными формами и повышая производительность инференса в условиях ограниченных ресурсов. Meituan обучила модель на 1,6 трлн параметров без использования чипов Nvidia The Decoder · 30.06.2026 Китайская технологическая компания Meituan представила модель LongCat-2.0, насчитывающую 1,6 триллиона параметров. Обучение системы было полностью проведено на вычислительных мощностях китайского производства, без использования графических процессоров Nvidia. Этот кейс демонстрирует возможность масштабирования обучения нейросетей в условиях экспортных ограничений на передовое западное оборудование, опираясь исключительно на внутреннюю инфраструктуру и локальные аппаратные решения. Генерация изображений на Android: оптимизация инференса моделей Hacker News · 30.06.2026 Команда Duration AI представила решение для запуска генеративных моделей на мобильных устройствах, продемонстрировав работу Stable Diffusion на Android-смартфоне 2025 года. Технология фокусируется на оптимизации инференса, позволяя выполнять ресурсоемкие задачи по созданию изображений локально без обращения к облачным серверам, что существенно снижает задержки и обеспечивает приватность пользовательских данных. Локальный запуск DeepSeek-V3 на MacBook Pro с 128 ГБ оперативной памяти Hacker News · 30.06.2026 Разработчики успешно адаптировали и запустили модель DeepSeek-V3 для локального использования на MacBook Pro с объемом памяти 128 ГБ. Благодаря методам квантования и оптимизации инференса, удалось добиться приемлемой скорости генерации кода на потребительском «железе» Apple, что открывает возможности для работы с мощными LLM без обращения к облачным API и передачи конфиденциальных данных сторонним провайдерам. Безопасное глубокое обучение на Rust для Apple Silicon Hacker News · 30.06.2026 Исследователи представили методологию оптимизации глубокого обучения на архитектуре Apple Silicon с использованием языка Rust. Работа фокусируется на повышении производительности и безопасности вычислений при работе с нейронными сетями, предлагая подходы к минимизации ошибок памяти и ускорению инференса за счет эффективного использования аппаратных ускорителей Apple через безопасные абстракции системного программирования. Ускорение локального запуска LLM на Mac через движок MLX в Ollama Hacker News · 30.06.2026 Ollama интегрировала поддержку движка MLX от Apple, что позволило значительно повысить скорость генерации текста на компьютерах Mac с чипами Apple Silicon. Оптимизация позволяет моделям работать в два раза быстрее, эффективно используя возможности объединенной памяти и графических ядер архитектуры M-серии, что делает локальный запуск LLM более доступным для повседневных задач. TurboPrefill ускоряет инференс Llama-3-70B в 2.7 раза Hacker News · 30.06.2026 Разработчики llama.cpp представили механизм TurboPrefill, который значительно повышает скорость обработки промптов (prefill) для крупных языковых моделей. Тестирование на архитектуре Llama-3-70B показало прирост производительности в 2.7 раза по сравнению со стандартным методом конвейерного параллелизма. Это обновление оптимизирует работу с длинными контекстами и снижает время ожидания первого токена в распределенных системах. Cerebras обеспечила сверхбыстрый инференс для мультимодальной модели Gemma 2 Hacker News · 30.06.2026 Компания Cerebras представила решение для ускоренного запуска мультимодальной модели Gemma 2, обеспечив беспрецедентную скорость генерации токенов. Использование специализированного аппаратного обеспечения позволяет обрабатывать запросы с минимальной задержкой, что делает систему одной из самых производительных на рынке для задач, требующих работы с текстом и изображениями в режиме реального времени. Fastllm: запуск DeepSeek-V4 на потребительском железе с 10 ГБ VRAM Hacker News · 30.06.2026 Библиотека Fastllm оптимизировала процесс инференса для тяжеловесных моделей, позволив запускать DeepSeek-V4 на видеокартах с объемом памяти всего 10 ГБ. Это значительный шаг в сторону доступности высокопроизводительных LLM для локального использования, так как ранее для работы подобных архитектур требовались серверные мощности с кратно большим объемом видеопамяти. Обзор Supermicro GB300 Super AI Station: вычислительная мощь для локальных задач Hacker News · 29.06.2026 Supermicro представила GB300 Super AI Station — специализированную рабочую станцию, предназначенную для высокопроизводительных вычислений и обучения ИИ-моделей. Система базируется на архитектуре NVIDIA Blackwell и обеспечивает плотность вычислений, сопоставимую с серверными решениями, позволяя компаниям разворачивать сложные агентные системы и проводить инференс тяжелых моделей непосредственно в локальной инфраструктуре без необходимости обращения к облачным провайдерам. Meta оптимизирует инференс-инфраструктуру с помощью CXL-технологий Hacker News · 29.06.2026 Meta (признана экстремистской организацией, деятельность запрещена в РФ) внедрила технологию CXL для повторного использования модулей памяти DDR4 из устаревших серверов в новых вычислительных узлах. Использование специализированных ASIC-чипов позволило компании объединять ресурсы памяти, что привело к сокращению затрат на развертывание инференс-инфраструктуры на 25% и значительному продлению жизненного цикла аппаратного обеспечения. Локальный запуск мультимодальных ИИ-моделей на macOS Hacker News · 29.06.2026 Проект Off-grid AI позволяет запускать чат-ботов, генераторы изображений, системы компьютерного зрения и голосовые модели локально на компьютерах Apple Mac. Решение ориентировано на работу без интернет-соединения, обеспечивая приватность данных и независимость от облачных API. Инструмент оптимизирован для использования аппаратных возможностей чипов Apple Silicon, предоставляя пользователям полноценный локальный стек для работы с ИИ. Южнокорейские техгиганты инвестируют $550 млрд в производство чипов памяти AI News & Artificial Intelligence | TechCrunch · 29.06.2026 Крупнейшие производители чипов памяти объявили о масштабных инвестициях в размере более $550 млрд для расширения производственных мощностей. Эти вложения направлены на преодоление глобального дефицита высокопроизводительной памяти, необходимой для обучения и работы современных ИИ-моделей. Южная Корея стремится укрепить свои позиции в качестве ключевого глобального хаба в цепочке поставок аппаратного обеспечения для искусственного интеллекта. Теоретическое обоснование механизмов принятия токенов в спекулятивном декодировании arXiv · 29.06.2026 Исследователи представили теоретическую модель процесса принятия токенов в спекулятивном декодировании, которая выходит за рамки классического сохранения распределения вероятностей. Работа анализирует поведение систем при использовании жадных алгоритмов и ослабленных правил верификации, позволяя точнее предсказывать ускорение инференса и качество генерации при работе связки «быстрая модель-черновик — тяжелая целевая модель» в реальных производственных условиях. Оптимизация визуального инференса через проактивную маршрутизацию запросов arXiv · 29.06.2026 Исследователи предложили метод повышения эффективности мультимодальных моделей при выполнении сложных визуальных задач. Система использует связку из компактной «черновой» модели и крупной целевой модели, применяя адаптивный механизм маршрутизации. В зависимости от сложности запроса, система автоматически определяет, какая модель должна обрабатывать данные, что позволяет сократить избыточные вычисления и ускорить процесс рассуждения. Kog Laneformer 2B: оптимизированная модель для низкозадержечного инференса Hacker News · 29.06.2026 Компания Kog представила Laneformer 2B — специализированную языковую модель, разработанную для минимизации задержек при выполнении задач в реальном времени. Модель оптимизирована для работы в составе собственного инференс-движка Kog, обеспечивая высокую скорость генерации токенов при сохранении компактного размера в 2 миллиарда параметров, что критически важно для высоконагруженных агентных систем. Tensordyne ускоряет ИИ-инференс через переход к логарифмическим вычислениям Hacker News · 29.06.2026 Стартап Tensordyne представил технологию, которая радикально ускоряет инференс нейросетей за счет замены традиционных матричных умножений на операции в логарифмическом пространстве. Этот подход позволяет упростить аппаратную реализацию вычислений, снижая энергопотребление и требования к пропускной способности памяти, что критически важно для эффективного развертывания крупных языковых моделей на специализированном оборудовании. Squish: новый инструмент для ускоренного запуска локальных LLM на Apple Silicon Hacker News · 29.06.2026 Squish — это специализированный инструмент, оптимизированный для запуска больших языковых моделей на чипах Apple Silicon. Решение фокусируется на максимальной производительности инференса, используя архитектурные особенности процессоров Apple для снижения задержек при работе с локальными моделями. Проект ориентирован на разработчиков, которым требуется высокая скорость генерации текста без обращения к облачным API. xFusion представила масштабируемую инфраструктуру для корпоративного ИИ AI News · 29.06.2026 Компания xFusion на конференции ISC 2026 продемонстрировала комплексные аппаратные решения для развертывания ИИ, охватывающие спектр от локальных рабочих станций до мощных дата-центров с жидкостным охлаждением. Новая архитектура призвана закрыть потребность бизнеса в безопасной инфраструктуре, позволяя компаниям переходить от прототипирования на периферийных устройствах к полноценным производственным мощностям без утечки проприетарных данных через публичные API. Sophon PFG-1: новый ИИ-чип с 330 ГБ встроенной DRAM без HBM Hacker News · 29.06.2026 Компания Phantafield представила архитектуру Sophon PFG-1 — специализированный ИИ-процессор, использующий монолитную 3D-компоновку для интеграции 330 ГБ DRAM непосредственно на кристалле. Инновационный подход позволяет отказаться от дорогостоящей и энергозатратной памяти HBM, обеспечивая при этом высокую пропускную способность данных, необходимую для работы с крупными языковыми моделями и сложными агентными системами.