Компания Liquid AI выпустила модель LFM2.5-2.6B, оптимизированную для выполнения сложных агентных задач непосредственно на пользовательских устройствах. Модель с 2,69 млрд параметров поддерживает контекстное окно 128K токенов, обладает встроенными функциями вызова инструментов и демонстрирует высокую скорость генерации до 220 токенов в секунду на чипах Apple M5 Max, потребляя менее 2,5 ГБ оперативной памяти.

Архитектура модели отходит от стандартных трансформеров, используя комбинацию из 22 блоков с двойным гейтированием (double-gated) и короткой сверткой, а также 8 блоков GQA (Grouped Query Attention), распределенных по 30 слоям. Такой подход позволяет эффективно обрабатывать длинные последовательности и выполнять многошаговые логические операции без обращения к облачным серверам, что критически важно для приватности и автономности агентных систем.

Разработчики предоставили открытый доступ к весам модели в форматах GGUF, MLX и ONNX. Это обеспечивает широкую совместимость с локальными средами исполнения и позволяет интегрировать модель в существующие агентные фреймворки для создания высокопроизводительных локальных ассистентов, способных планировать действия и взаимодействовать с внешними API в реальном времени.

Ключевые факты

  • Размер модели составляет 2,69 млрд параметров при объеме менее 2,5 ГБ.
  • Контекстное окно расширено до 131 072 токенов.
  • Скорость инференса достигает 220 токенов в секунду на процессорах Apple M5 Max.
  • Архитектура включает 30 слоев, состоящих из сверточных блоков и GQA-блоков.
  • Модель доступна для скачивания в форматах GGUF, MLX и ONNX для локального развертывания.