Лаборатория Thinking Machines Lab выпустила Inkling-Small — мультимодальную модель с архитектурой Mixture-of-Experts (MoE). При общем объеме параметров в 276 млрд, модель задействует лишь 12 млрд активных параметров на токен. Разработка демонстрирует производительность, сопоставимую с оригинальной версией Inkling, при этом занимая в четыре раза меньше вычислительных ресурсов и памяти.

Ключевой особенностью релиза стала оптимизация для работы на потребительском и корпоративном «железе» высокого уровня. Использование формата NVFP4 позволяет запускать модель на одном графическом ускорителе NVIDIA B300. Это значительно снижает порог входа для развертывания тяжелых мультимодальных систем, требующих высокой точности при ограниченной инфраструктуре.

Архитектура MoE позволяет модели эффективно распределять вычислительную нагрузку, активируя только необходимые экспертные блоки для обработки конкретного запроса. Такой подход обеспечивает баланс между глубиной знаний, заложенных в 276 млрд параметров, и скоростью инференса, характерной для гораздо более компактных моделей. Открытые веса Inkling-Small позволяют исследователям и разработчикам интегрировать решение в собственные пайплайны без привязки к проприетарным API.

Ключевые факты

  • Общий объем параметров модели составляет 276 млрд.
  • Количество активных параметров на один токен равно 12 млрд.
  • Модель поддерживает мультимодальную обработку данных.
  • Оптимизированный чекпоинт в формате NVFP4 совместим с одним GPU NVIDIA B300.
  • Релиз включает публикацию открытых весов для широкого использования.