Инференс и железо

OpenAI выпустила GPT-4.1 и GPT-4o на Replicate Replicate's blog · 21.05.2025 Replicate добавила поддержку последних моделей OpenAI, включая GPT-4.1, GPT-4o и серию o-моделей. Теперь разработчики могут запускать эти модели локально или в облаке через API Replicate. NVIDIA H100: новые GPU для ИИ Replicate's blog · 15.05.2025 NVIDIA представила свои новые графические процессоры H100, которые обещают улучшенную производительность и снижение затрат. Эти GPU предназначены для работы с искусственным интеллектом и машинным обучением, что делает их важным инструментом для разработчиков и исследователей. Replicate интегрировал запуск LoRAs на Hugging Face Replicate's blog · 14.05.2025 Replicate и Hugging Face объединили усилия, чтобы предоставить пользователям возможность запускать более 30 000 LoRAs (Low-Rank Adaptations) через платформу Hugging Face. LoRAs — это лёгкие адаптации больших языковых моделей, которые позволяют тонко настраивать их под конкретные задачи без переобучения всей модели. Архитектура Armv9: новые возможности для вычислений и ИИ Lobsters · 31.03.2021 Компания Arm представила архитектуру Armv9, которая стала первым фундаментальным обновлением за десятилетие. Новая архитектура сфокусирована на повышении производительности вычислений, безопасности и специализированной поддержке задач машинного обучения. Внедрение технологий SVE2 позволяет значительно ускорить обработку данных в широком спектре приложений, от мобильных устройств до высокопроизводительных серверов, закладывая основу для следующего поколения аппаратного обеспечения. Глубокий разбор методов квантования нейронных сетей Lobsters · 15.03.2021 Квантование стало ключевым методом оптимизации нейросетей, позволяющим сократить размер моделей и ускорить их работу без существенной потери точности. Статья подробно описывает переход от высокоточных вычислений с плавающей запятой к форматам с низкой разрядностью, таким как INT8, и объясняет математические принципы, лежащие в основе снижения вычислительной сложности при инференсе современных LLM.