Компания Liquid AI выпустила модель LFM2.5-2.6B, оптимизированную для выполнения сложных агентных задач непосредственно на пользовательских устройствах. Модель с 2,69 млрд параметров поддерживает контекстное окно 128K токенов, обладает встроенными функциями вызова инструментов и демонстрирует высокую скорость генерации до 220 токенов в секунду на чипах Apple M5 Max, потребляя менее 2,5 ГБ оперативной памяти.
Архитектура модели отходит от стандартных трансформеров, используя комбинацию из 22 блоков с двойным гейтированием (double-gated) и короткой сверткой, а также 8 блоков GQA (Grouped Query Attention), распределенных по 30 слоям. Такой подход позволяет эффективно обрабатывать длинные последовательности и выполнять многошаговые логические операции без обращения к облачным серверам, что критически важно для приватности и автономности агентных систем.
Разработчики предоставили открытый доступ к весам модели в форматах GGUF, MLX и ONNX. Это обеспечивает широкую совместимость с локальными средами исполнения и позволяет интегрировать модель в существующие агентные фреймворки для создания высокопроизводительных локальных ассистентов, способных планировать действия и взаимодействовать с внешними API в реальном времени.
Ключевые факты
- Размер модели составляет 2,69 млрд параметров при объеме менее 2,5 ГБ.
- Контекстное окно расширено до 131 072 токенов.
- Скорость инференса достигает 220 токенов в секунду на процессорах Apple M5 Max.
- Архитектура включает 30 слоев, состоящих из сверточных блоков и GQA-блоков.
- Модель доступна для скачивания в форматах GGUF, MLX и ONNX для локального развертывания.
