Представлена модель DeepSeek-V4-Flash-0731, использующая метод «латентного рассуждения» (latent reasoning). В отличие от стандартных моделей, которые выводят цепочку мыслей в открытом текстовом виде, эта архитектура выполняет когнитивные процессы внутри скрытых слоев нейросети. Это позволяет значительно сократить количество выходных токенов, сохраняя при этом высокую точность логических выводов и снижая задержки при генерации ответов.

Основная инновация заключается в переносе этапа «размышления» из контекстного окна в скрытые состояния модели. Традиционные методы Chain-of-Thought (CoT) требуют генерации длинных последовательностей текста, что увеличивает стоимость инференса и время ожидания. Новый подход сжимает логическую цепочку, позволяя модели оперировать сложными концепциями без необходимости их явной вербализации на каждом шаге.

Такая архитектура оптимизирует использование вычислительных ресурсов, так как системе не нужно тратить токены на промежуточные этапы рассуждений. Это открывает путь к созданию более быстрых и экономичных агентных систем, где скорость принятия решений критически важна для взаимодействия с внешними инструментами и API.

Ключевые факты

  • Модель DeepSeek-V4-Flash-0731 использует архитектуру скрытого рассуждения для минимизации выходной последовательности.
  • Метод позволяет перенести логические вычисления из текстового контекста в латентное пространство нейросети.
  • Снижение количества токенов на этапе размышлений напрямую уменьшает стоимость инференса и время отклика системы.
  • Подход ориентирован на повышение эффективности работы ИИ-агентов, требующих высокой скорости обработки сложных запросов.