AMD объявила о приобретении канадского стартапа Taalas, специализирующегося на создании специализированных чипов, в которые веса ИИ-моделей «зашиваются» непосредственно на уровне кремния. Такой подход позволяет достичь экстремальной производительности инференса, исключая необходимость в традиционной загрузке весов из оперативной памяти, что радикально сокращает задержки и энергопотребление при работе с конкретными архитектурами нейросетей.
Технология Taalas ориентирована на создание ASIC-решений, где логика работы модели жестко интегрирована в структуру процессора. В ходе демонстрации прототип чипа показал скорость генерации более 16 000 токенов в секунду при работе с моделью Llama 3.1-8B. Это значительно превышает показатели стандартных GPU, однако требует перепроектирования чипа при каждом обновлении или смене архитектуры модели.
Подобная стратегия аппаратной специализации становится новым трендом в индустрии высокопроизводительных вычислений. По имеющимся данным, Google также ведет разработки в области создания специализированного «железа» для оптимизации работы своих моделей семейства Gemini. Переход к архитектурам, где модель и процессор представляют собой единое целое, может стать ключевым фактором в снижении стоимости инференса для массовых сервисов.
Ключевые факты
- AMD приобрела стартап Taalas для интеграции технологий аппаратного инференса в свои продукты.
- Демонстрационный чип Taalas достиг производительности 16 000 токенов в секунду для Llama 3.1-8B.
- Технология предполагает жесткую прошивку весов модели в кремний, что исключает гибкость, но обеспечивает максимальную скорость.
- Google, по сообщениям СМИ, также работает над аналогичными аппаратными решениями для своих моделей Gemini.
