Исследователи представили Celeris-1 — диффузионную языковую модель, демонстрирующую беспрецедентную скорость инференса. В ходе тестов система показала производительность на уровне 2082 токенов в секунду, что значительно превышает показатели большинства современных LLM. Этот результат достигнут благодаря архитектурным особенностям диффузионного подхода, который меняет привычные стандарты скорости генерации текста и открывает новые возможности для высоконагруженных систем.
Традиционные авторегрессионные модели генерируют текст последовательно, что создает «узкое горлышко» при масштабировании. Celeris-1 использует диффузионный процесс, позволяющий предсказывать токены параллельно или блоками. Такой подход кардинально снижает задержки (latency) и позволяет обрабатывать огромные объемы данных в реальном времени, что критически важно для интерактивных сервисов и высокочастотных аналитических систем.
Высокая скорость работы модели делает её перспективным решением для сценариев, где требуется мгновенный отклик при сохранении качества генерации. Хотя диффузионные методы в текстовых задачах все еще находятся на этапе активного развития, текущие показатели Celeris-1 доказывают жизнеспособность архитектуры как альтернативы стандартным трансформерам в задачах, требующих экстремальной пропускной способности.
Ключевые факты
- Скорость генерации Celeris-1 достигает 2082 токенов в секунду.
- Модель построена на базе диффузионной архитектуры, а не классического авторегрессионного трансформера.
- Результаты подтверждены независимым аналитическим ресурсом Artificial Analysis.
- Технология позволяет радикально сократить время ожидания ответа в сложных агентных системах.