Исследователи представили Celeris-1 — диффузионную языковую модель, демонстрирующую беспрецедентную скорость инференса. В ходе тестов система показала производительность на уровне 2082 токенов в секунду, что значительно превышает показатели большинства современных LLM. Этот результат достигнут благодаря архитектурным особенностям диффузионного подхода, который меняет привычные стандарты скорости генерации текста и открывает новые возможности для высоконагруженных систем.

Традиционные авторегрессионные модели генерируют текст последовательно, что создает «узкое горлышко» при масштабировании. Celeris-1 использует диффузионный процесс, позволяющий предсказывать токены параллельно или блоками. Такой подход кардинально снижает задержки (latency) и позволяет обрабатывать огромные объемы данных в реальном времени, что критически важно для интерактивных сервисов и высокочастотных аналитических систем.

Высокая скорость работы модели делает её перспективным решением для сценариев, где требуется мгновенный отклик при сохранении качества генерации. Хотя диффузионные методы в текстовых задачах все еще находятся на этапе активного развития, текущие показатели Celeris-1 доказывают жизнеспособность архитектуры как альтернативы стандартным трансформерам в задачах, требующих экстремальной пропускной способности.

Ключевые факты

  • Скорость генерации Celeris-1 достигает 2082 токенов в секунду.
  • Модель построена на базе диффузионной архитектуры, а не классического авторегрессионного трансформера.
  • Результаты подтверждены независимым аналитическим ресурсом Artificial Analysis.
  • Технология позволяет радикально сократить время ожидания ответа в сложных агентных системах.