Google выпустила новые модели Gemini 3.6 Flash и 3.5 Flash-Lite, ориентированные на снижение задержек и стоимости токенов при работе корпоративных ИИ-агентов. Эти решения призваны сделать эксплуатацию автономных систем в продакшене экономически эффективной, обеспечивая баланс между качеством рассуждений в многошаговых задачах и операционными расходами, что критически важно для масштабируемых бизнес-процессов.
Основная проблема внедрения агентных систем заключается в высокой стоимости инференса при выполнении сложных цепочек действий. Новые модели оптимизированы для сценариев, где требуется быстрая реакция и минимальное потребление ресурсов. Использование облегченных версий позволяет компаниям снизить порог входа для автоматизации задач, требующих постоянного взаимодействия с внешними API и базами данных.
Разработка направлена на устранение разрыва между экспериментальными прототипами и стабильными промышленными решениями. Снижение стоимости токенов напрямую влияет на ROI агентных систем, делая их использование оправданным в высоконагруженных средах, где каждый запрос к модели формирует значительную часть бюджета проекта.
Ключевые факты
- Google представила две новые модели: Gemini 3.6 Flash и 3.5 Flash-Lite.
- Основная цель релиза — снижение задержек (latency) и стоимости токенов для корпоративных ИИ-агентов.
- Модели оптимизированы для выполнения многошаговых задач в производственных средах.
- Решение направлено на улучшение экономики эксплуатации автономных программных агентов.
