AMD и Cerebras Systems объявили о создании инфраструктурного решения, объединяющего вычислительные мощности процессоров AMD Instinct MI300X и архитектуру Cerebras Wafer-Scale Engine. Система ориентирована на выполнение задач инференса с ультранизкой задержкой и высокой пропускной способностью, что позволяет масштабировать работу с крупными языковыми моделями в корпоративных средах и облачных дата-центрах.
Техническая синергия компаний направлена на устранение узких мест при развертывании моделей с миллиардами параметров. Использование специализированных ускорителей Cerebras в связке с GPU от AMD позволяет достичь показателей производительности, значительно превосходящих стандартные серверные конфигурации на базе традиционных графических процессоров. Это решение упрощает интеграцию тяжелых моделей в реальные бизнес-процессы, где критически важна скорость отклика.
Новый стек оптимизирован для работы с современными фреймворками и стандартами, что снижает порог входа для компаний, стремящихся к локальному запуску или частному облачному хостингу масштабных ИИ-систем. Сочетание высокой плотности вычислений и оптимизированной передачи данных минимизирует задержки при генерации токенов, обеспечивая стабильную работу даже при пиковых нагрузках.
Ключевые факты
- В основе решения лежат ускорители AMD Instinct MI300X и технология Cerebras Wafer-Scale Engine.
- Система обеспечивает сверхнизкую задержку (latency) и высокую пропускную способность (throughput) для LLM.
- Решение предназначено для корпоративных клиентов и облачных провайдеров, работающих с моделями большого объема.
- Интеграция направлена на оптимизацию инференса в режиме реального времени для сложных агентных систем и генеративных приложений.