Инференс и железо
Как кеш ключ-значение влияет на VRAM при работе с длинным контекстом
Работа с длинными контекстами в ИИ-моделях — одна из ключевых задач при разработке агентов. Однако увеличение длины контекста приводит к росту потребления VRAM, что ограничивает возможности инференса на доступном железе. В статье разбирается, как именно кеш ключ-значение (KV cache) влияет на использование памяти и какие стратегии позволяют оптимизировать этот процесс.
Ускоренный локальный запуск Claude 2–8 раз
Команда Functio-AI выпустила оптимизированную версию кода для локального запуска модели Claude от Anthropic. По заявлениям разработчиков, новая версия работает в 2–8 раз быстрее оригинального кода.
Linux 7.0 добавил поддержку BPF-фильтров для IO_uring
Версия ядра Linux 7.0 внесла значительное обновление, добавив поддержку BPF-фильтров для IO_uring. Это расширение позволяет более гибко и эффективно управлять вводом-выводом, что особенно важно для высоконагруженных систем, таких как серверы, работающие с ИИ-агентами.
Исследование: срок службы GPU для ИИ дольше трёх лет
Исследование, проведённое Sean Goedecke, показывает, что графические процессоры, используемые для инференса в ИИ, служат дольше трёх лет. Это важно для разработчиков ИИ-агентов, так как позволяет планировать долгосрочные инвестиции в оборудование без частой замены.
Инструмент для профилирования CUDA на Nvidia
Команда Polar Signals представила Continuous Nvidia CUDA PC Sampling Profiler — инструмент для профилирования CUDA-приложений на графических процессорах Nvidia. Это решение позволяет в реальном времени отслеживать производительность и эффективность использования GPU, что критически важно для оптимизации работы ИИ-моделей, особенно при инференсе.
BLAKE3 на Zen 5: 13 ГБ/с для ускорения ИИ-агентов
Разработчики из компании AMD представили впечатляющие результаты тестирования хеш-функции BLAKE3 на процессорах Zen 5. Новые чипы демонстрируют скорость хеширования до 13 ГБ/с, что в несколько раз превышает показатели предыдущих поколений. Это открывает новые возможности для оптимизации работы ИИ-агентов, особенно в задачах, требующих интенсивной обработки данных.
Token-saviour снижает расход токенов в агентах на 70%
Разработчики ИИ-агентов сталкиваются с проблемой высокого расхода токенов при выборе инструментов. Новый фреймворк Token-saviour предлагает решение, снижая потребление токенов на 70%. Это достигается за счёт умного маршрутизации запросов к инструментам, минимизируя избыточные вызовы и оптимизируя взаимодействие с внешними сервисами.
ActiveSAM ускоряет сегментацию изображений для ИИ-агентов
Исследователи из Meta представили ActiveSAM — метод, который оптимизирует работу Segment Anything Model 3 (SAM 3) для сегментации изображений в задачах с открытым словарём (OVSS). Основная проблема SAM 3 заключается в неэффективности: модель обрабатывает все классы из словаря, хотя в каждом изображении присутствует лишь небольшая их часть.
Pluck: язык для вероятностного программирования с ленивым инференсом
Pluck — это новый язык программирования, ориентированный на вероятностные модели и ленивый инференс. Он позволяет разработчикам строить сложные вероятностные программы, которые могут быть выполнены с минимальными затратами ресурсов, что особенно важно для ИИ-агентов, работающих с ограниченными вычислительными мощностями.
Как снизить задержки в системах с потоковыми данными
Исследователи из MIT и Google предложили новый подход к обработке потоковых данных в системах машинного обучения, который может существенно снизить задержки и нагрузку на серверы. В статье, опубликованной на arXiv, они описывают метод, который отделяет процесс инференса от обновления состояния, используя вероятностное прореживание (probabilistic thinning).
Fastembed-rs: библиотека на Rust для генерации векторных эмбеддингов
Команда Anush008 выпустила Fastembed-rs – библиотеку на Rust для генерации векторных эмбеддингов и переранжирования. Это открытый проект, который позволяет эффективно работать с текстовыми данными, создавая векторы для последующего использования в задачах поиска, классификации и других приложениях, связанных с обработкой естественного языка.
Исследователи создали кластеры из старых смартфонов для инференса
Группа исследователей из Университета Ватерлоо (Канада) предложила необычное решение для создания низкобюджетных вычислительных центров: они собрали кластеры из старых смартфонов. По их данным, современные процессоры в смартфонах демонстрируют более высокую производительность в однопоточном режиме по сравнению с аналогичными серверными процессорами. Это открывает новые возможности для развертывания ИИ-моделей на недорогом оборудовании.
CUDA-подобная разработка для Cerebras WSE
Команда разработчиков представила проект, который позволяет использовать Cerebras WSE (Wafer Scale Engine) с CUDA-подобным подходом. Это открывает новые возможности для локального инференса моделей ИИ, особенно крупных, которые требуют значительных вычислительных ресурсов.
Token-warden: инструмент для контроля токенов в ИИ-агентах
Token-warden — это инструмент, разработанный для оптимизации использования токенов в ИИ-агентах. Он помогает контролировать и управлять расходами на токены, что особенно важно при работе с крупными языковыми моделями, где стоимость инференса может быть значительной.
Flash-KMeans: ускорение K-Means на GPU в 200 раз
Flash-KMeans — это открытая реализация алгоритма K-Means, оптимизированная для работы на GPU с использованием Triton. В отличие от существующих решений, она не меняет математическую основу алгоритма, но значительно ускоряет его выполнение за счёт оптимизации ввода-вывода и устранения проблем с конкуренцией за ресурсы.
Корпоративные ИИ-агенты уходят с серверов
Компании всё чаще переходят на локальный запуск ИИ-агентов, отказываясь от облачных серверов. Это связано с ростом требований к безопасности, конфиденциальности и контролю над данными. Локальные решения позволяют избежать утечек и снизить зависимость от третьих сторон, что особенно важно для корпоративных клиентов.
MLX-Optiq: квантование LLM для Apple Silicon
Команда MLX представила MLX-Optiq — инструмент для переноса больших языковых моделей (LLM) на устройства Apple Silicon с поддержкой смешанной точности. Это решение позволяет значительно сократить потребление памяти и вычислительных ресурсов при инференсе моделей, что особенно важно для мобильных и встраиваемых устройств.
Индексация 669 ГБ видео с помощью локальных моделей на M1 Max
Автор проекта успешно индексировал 669 ГБ видео с GoPro камер с использованием локальных ML-моделей на компьютере с процессором M1 Max. Это демонстрирует возможность обработки больших объемов данных без использования облачных сервисов, что может быть полезно для разработки ИИ-агентов, работающих с мультимедийными данными.
Caddy для zeroserve: 3x скорость и 70% меньше задержек
Разработчики zeroserve анонсировали совместимость с Caddy, что позволяет значительно ускорить работу сервера для локального инференса моделей. Новый вариант демонстрирует трёхкратное увеличение пропускной способности и снижение задержек на 70% по сравнению с предыдущими версиями.
Qwen 3.6 93B на двух RTX 3090 NVLink: 187 токенов в секунду
Команда Augmented Reality Virtual Reality (AR VR) опубликовала результаты тестирования модели Qwen 3.6 93B с использованием MTP (Multi-Query Tensor Parallelism) на конфигурации из двух видеокарт RTX 3090 с NVLink. В результате удалось достичь скорости инференса в 187 токенов в секунду. Это значительное улучшение по сравнению с предыдущими показателями, что делает модель более пригодной для локального использования, включая разработку ИИ-агентов.
InferenceFS: файловая система для удобного инференса
InferenceFS — это файловая система, которая позволяет удобно работать с данными при инференсе моделей. Она предоставляет интерфейс, похожий на обычную файловою систему, но с возможностью кэширования, управления версиями и оптимизации доступа к данным. Это особенно полезно для разработчиков ИИ-агентов, так как позволяет избежать проблем с управлением данными при инференсе.
Cranelift: компилятор для высокопроизводительного инференса
Cranelift — это высокопроизводительный компилятор, разработанный для работы с веб-ассемблером (WASM) и другими низкоуровневыми языками. Он используется в таких проектах, как Rust и WebAssembly, и может быть полезен для оптимизации работы ИИ-агентов, особенно при локальном инференсе.
Home Opus: локальный запуск фронтирных моделей после запрета Fable 5
Команда zanirou представила Home Opus — проект, позволяющий развернуть фронтирные модели ИИ локально после того, как Fable 5 был заблокирован. Это решение особенно актуально для разработчиков, которым важно иметь доступ к мощным моделям без зависимости от облачных сервисов.
AI inequality: от GPU-poor к token-poor
В статье на Substack автор Адриан Роча рассматривает эволюцию неравенства в доступе к ИИ-технологиям. Если раньше основным барьером был доступ к мощным GPU, то теперь ключевым ограничением становятся токены — стоимость вычислений на больших языковых моделях (LLM). Это создает новую форму цифрового разрыва, где даже при наличии вычислительных ресурсов использование ИИ остается недоступным для многих из-за высоких затрат на инференс.