Компания Pokee AI выпустила Pokee-Isaac 28B — специализированную текстовую модель с контекстным окном 10 миллионов токенов, оптимизированную для локального развертывания внутри инфраструктуры заказчика. Модель демонстрирует высокую точность извлечения данных из длинных контекстов и превосходит существующие аналоги в агентных бенчмарках, обеспечивая при этом высокую скорость обработки префиллов на современном аппаратном обеспечении.

Архитектура модели ориентирована на решение задач, требующих анализа массивов документов или длинных логов без передачи данных во внешние облачные сервисы. Разработчики сфокусировались на сохранении целостности данных при работе с экстремально длинными последовательностями, что подтверждается результатами тестирования в RULER, где модель сохраняет работоспособность на всей длине контекста, в то время как конкуренты теряют точность после 2 миллионов токенов.

Высокая производительность достигается за счет оптимизации инференса: на одном ускорителе B200 модель способна обрабатывать до 137 200 токенов в секунду в режиме префилла. Это делает решение пригодным для корпоративных сценариев, где критически важны конфиденциальность данных, низкая задержка и возможность обработки огромных объемов контекстной информации в реальном времени.

Ключевые факты

  • Размер модели составляет 28 миллиардов параметров при поддержке контекстного окна в 10 миллионов токенов.
  • Результат в бенчмарке RULER на 10 млн токенов достиг 93,3%, что значительно выше показателей конкурентов, теряющих эффективность после 2 млн токенов.
  • Модель лидирует в бенчмарке BFCL v4 с показателем 70,94 и занимает второе место в Terminal-Bench 2.1.
  • Скорость обработки префилла при полной загрузке контекста на одном ускорителе B200 достигает 137 200 токенов в секунду.