Инференс и железо
OpenAI выпустила GPT-4.1 и GPT-4o на Replicate
Replicate добавила поддержку последних моделей OpenAI, включая GPT-4.1, GPT-4o и серию o-моделей. Теперь разработчики могут запускать эти модели локально или в облаке через API Replicate.
NVIDIA H100: новые GPU для ИИ
NVIDIA представила свои новые графические процессоры H100, которые обещают улучшенную производительность и снижение затрат. Эти GPU предназначены для работы с искусственным интеллектом и машинным обучением, что делает их важным инструментом для разработчиков и исследователей.
Replicate интегрировал запуск LoRAs на Hugging Face
Replicate и Hugging Face объединили усилия, чтобы предоставить пользователям возможность запускать более 30 000 LoRAs (Low-Rank Adaptations) через платформу Hugging Face. LoRAs — это лёгкие адаптации больших языковых моделей, которые позволяют тонко настраивать их под конкретные задачи без переобучения всей модели.
Архитектура Armv9: новые возможности для вычислений и ИИ
Компания Arm представила архитектуру Armv9, которая стала первым фундаментальным обновлением за десятилетие. Новая архитектура сфокусирована на повышении производительности вычислений, безопасности и специализированной поддержке задач машинного обучения. Внедрение технологий SVE2 позволяет значительно ускорить обработку данных в широком спектре приложений, от мобильных устройств до высокопроизводительных серверов, закладывая основу для следующего поколения аппаратного обеспечения.
Глубокий разбор методов квантования нейронных сетей
Квантование стало ключевым методом оптимизации нейросетей, позволяющим сократить размер моделей и ускорить их работу без существенной потери точности. Статья подробно описывает переход от высокоточных вычислений с плавающей запятой к форматам с низкой разрядностью, таким как INT8, и объясняет математические принципы, лежащие в основе снижения вычислительной сложности при инференсе современных LLM.