Инженер Майк Эйлс продемонстрировал возможность запуска весов LLM непосредственно на кристалле FPGA, используя отладочную плату AMD Kria KV260 стоимостью $250. Проект достигает впечатляющей производительности в 60 000 токенов в секунду, что значительно превышает показатели стандартных программных реализаций на CPU или GPU для аналогичного ценового сегмента, открывая новые пути для оптимизации локального инференса.

Реализация опирается на архитектурный подход Taalas, который предполагает перенос вычислений нейронных сетей на аппаратный уровень FPGA. В отличие от традиционных методов, где модель загружается в оперативную память, здесь веса и логика обработки данных «зашиваются» в логические блоки чипа. Это позволяет избежать узких мест, связанных с пропускной способностью шины памяти, и обеспечивает экстремально низкие задержки при выполнении операций.

Данный эксперимент доказывает жизнеспособность специализированного аппаратного ускорения для компактных моделей. Использование FPGA позволяет гибко настраивать архитектуру под конкретные задачи, обеспечивая высокую энергоэффективность и скорость обработки, что критически важно для встраиваемых систем и граничных вычислений, где использование мощных графических ускорителей невозможно из-за ограничений по питанию или габаритам.

Ключевые факты

  • Используемое оборудование: плата AMD Kria KV260 на базе FPGA Xilinx Zynq UltraScale+.
  • Достигнутая скорость: 60 000 токенов в секунду.
  • Стоимость аппаратной платформы: $250.
  • Технологический подход: аппаратная реализация весов модели непосредственно в логике FPGA (архитектура Taalas).
  • Преимущество: устранение задержек при передаче данных между памятью и процессором.