Пользователи ChatGPT Pro обнаружили, что OpenAI в течение нескольких месяцев скрыто перенаправляет часть запросов с флагманских моделей на более легкую GPT-4o mini. Анализ трафика показал, что система автоматически выбирает модель для обработки задачи, основываясь на сложности промпта, что позволяет компании оптимизировать вычислительные ресурсы и снижать задержки при ответе для платных подписчиков.

Данная практика отражает общую стратегию развития ИИ-сервисов, где приоритет отдается балансу между качеством генерации и стоимостью инференса. Вместо использования «тяжелых» моделей для простых задач, таких как классификация текста или базовое форматирование, система динамически переключается на более быстрые и дешевые версии. Это позволяет поддерживать высокую пропускную способность платформы даже в периоды пиковых нагрузок.

Для пользователей это означает, что качество ответов может варьироваться в зависимости от того, как алгоритм классифицирует запрос. Хотя GPT-4o mini демонстрирует высокую производительность в задачах с низкой сложностью, переход на нее может быть заметен при выполнении задач, требующих глубокого логического рассуждения или работы с большими контекстами, где флагманские модели показывают более стабильные результаты.

Ключевые факты

  • OpenAI использует автоматическую маршрутизацию запросов для пользователей тарифа Pro, переключая их на GPT-4o mini.
  • Перенаправление происходит на основе оценки сложности входящего промпта системой оркестрации.
  • Практика скрытого переключения применяется на протяжении нескольких месяцев для оптимизации нагрузки на инфраструктуру.
  • Динамический выбор модели позволяет снизить время отклика (latency) и затраты на вычислительные мощности при сохранении подписки.
  • Пользователи могут заметить разницу в качестве ответов при выполнении сложных аналитических задач по сравнению с использованием полноценных флагманских моделей.