Модели и релизы

NVIDIA представила Audex: мультимодальную модель для работы с аудио и текстом MarkTechPost · 07.07.2026 NVIDIA выпустила Audex (Nemotron-Labs-Audex-30B-A3B) — универсальную мультимодальную модель на архитектуре Mixture-of-Experts (MoE). Система объединяет возможности распознавания речи, перевода, синтеза звука и генерации текста. Ключевой особенностью стало сохранение высоких когнитивных способностей базовой модели Nemotron-Cascade-2 при минимальном снижении производительности в текстовых задачах, что делает её эффективным инструментом для комплексной обработки аудиовизуальных данных. OpenAI представила GPT-Live для естественного голосового взаимодействия OpenAI News · 07.07.2026 OpenAI анонсировала GPT-Live — новое поколение голосовых моделей, обеспечивающих более естественное и быстрое взаимодействие между человеком и ИИ. Технология уже интегрирована в голосовой режим ChatGPT, позволяя пользователям вести диалоги с минимальной задержкой, распознавать эмоциональные оттенки речи и получать мгновенные ответы в режиме реального времени без необходимости предварительной обработки текста. Сравнение архитектуры Meta Muse с актуальными моделями генерации изображений Hacker News · 07.07.2026 Meta (признана экстремистской организацией, деятельность запрещена в РФ) представила Muse — модель генерации изображений, использующую архитектуру Masked Generative Transformer. В отличие от диффузионных моделей, Muse работает с токенизированными визуальными данными, что обеспечивает высокую скорость инференса и качество генерации. В материале приводится сравнительный анализ производительности Muse относительно современных лидеров рынка, включая архитектуры Stable Diffusion и DALL-E. Meta представила архитектуру Muse для генерации изображений и видео Hacker News · 07.07.2026 Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) анонсировала семейство моделей Muse, использующих архитектуру Masked Generative Transformer. В отличие от диффузионных моделей, Muse работает с токенами в пространстве признаков, что обеспечивает высокую скорость генерации изображений и видео при сохранении качества, сопоставимого с современными аналогами, и поддержке редактирования контента через текстовые промпты. Meta представила Muse: новую модель для генерации изображений AI News & Artificial Intelligence | TechCrunch · 07.07.2026 Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) выпустила Muse — новую нейросеть для генерации изображений. Модель ориентирована на высокую скорость работы и широкие возможности применения в бизнесе, включая создание рекламных креативов, дизайн интерьеров и инструменты для авторов контента. Muse демонстрирует значительный прогресс в качестве визуального синтеза и скорости обработки запросов. Meta представила Muse Image для генерации изображений Hacker News · 07.07.2026 Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) анонсировала Muse Image — новую модель генерации изображений, интегрированную в экосистему Meta AI. Система ориентирована на высокую скорость работы и улучшенную точность следования текстовым инструкциям, позволяя пользователям создавать визуальный контент непосредственно внутри социальных платформ компании. Meta представила модель Muse Image для генерации изображений The Verge · 07.07.2026 Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) выпустила новую нейросеть Muse Image, разработанную подразделением Superintelligence Labs. Модель уже интегрирована в инструменты генерации изображений внутри Meta AI, Instagram (принадлежит Meta, признанной экстремистской и запрещённой в РФ) и WhatsApp. Технология позволяет создавать визуальный контент, включая возможность добавления других пользователей социальной сети на сгенерированные изображения. Технические секреты успеха DeepSeek: как модель обошла Claude 3 Opus Hacker News · 07.07.2026 Команда DeepSeek раскрыла архитектурные и методологические подходы, позволившие их последним моделям превзойти Claude 3 Opus в ряде бенчмарков. Основной упор был сделан на оптимизацию процесса обучения, использование специфических методов масштабирования и эффективную работу с данными, что позволило достичь высокой производительности при значительно меньших вычислительных затратах по сравнению с конкурентами от ведущих лабораторий. Cohere выпустила открытую модель Transcribe Arabic для распознавания арабской речи The Decoder · 07.07.2026 Компания Cohere представила Transcribe Arabic — специализированную модель с открытым исходным кодом, предназначенную для высокоточного распознавания арабской речи. Решение ориентировано на работу с диалектами, смешанной арабо-английской речью и переключением кодов, демонстрируя превосходство над существующими аналогами, такими как Whisper и OmniASR, в сложных лингвистических условиях. Tencent представила открытую модель Hunyuan-3D с 295 млрд параметров Hacker News · 07.07.2026 Tencent выпустила веса модели Hunyuan-3D (Hy3), насчитывающей 295 миллиардов параметров. Это масштабное решение ориентировано на генерацию высококачественных 3D-объектов по текстовым описаниям или изображениям. Релиз расширяет возможности открытых моделей в области 3D-контента, предоставляя разработчикам доступ к архитектуре, способной создавать сложные геометрические формы и текстуры с высокой детализацией для профессиональных задач. Mistral представила Robostral Navigate для автономной навигации роботов Mistral Blog · 07.07.2026 Компания Mistral AI выпустила Robostral Navigate — специализированную модель с 8 миллиардами параметров, предназначенную для автономной навигации роботов. Система достигает 76,6% точности в бенчмарке R2R-CE, используя данные только с одной RGB-камеры. Решение исключает необходимость в дорогостоящих лидарах или массивах датчиков глубины, упрощая аппаратную архитектуру для мобильных робототехнических платформ. Tencent представила открытую MoE-модель Hy3 с 295 млрд параметров MarkTechPost · 07.07.2026 Компания Tencent выпустила Hy3 — новую Mixture-of-Experts модель с общим объемом 295 млрд параметров, из которых 21 млрд активируются для обработки каждого токена. Модель поддерживает контекстное окно до 256 тысяч токенов и распространяется под лицензией Apache 2.0. Решение ориентировано на сложные агентные задачи, логические рассуждения и работу с длинными документами. OpenAI обновила линейку моделей для работы в реальном времени Hacker News · 07.07.2026 OpenAI представила обновленные модели GPT-realtime-2.1 и GPT-realtime-2.1-mini, предназначенные для низколатентного взаимодействия с аудио и текстом через API. Новые версии обеспечивают улучшенную скорость отклика и повышенную точность обработки голосовых команд, что критически важно для создания интерактивных агентных систем, требующих мгновенной реакции в режиме диалога. Релиз Claude 3.5 Sonnet: новая веха в агентных возможностях Hacker News · 07.07.2026 Anthropic представила обновленную модель Claude 3.5 Sonnet, которая демонстрирует значительный прогресс в выполнении сложных многошаговых задач. Разработчики сфокусировались на улучшении агентных навыков, позволяя модели эффективнее взаимодействовать с внешними инструментами и кодом. При этом стоимость использования API была снижена, что делает внедрение продвинутых ИИ-решений более доступным для бизнеса и разработчиков при сохранении высокой производительности. Speechify Simba 3.2 возглавила рейтинг Speech Arena от Artificial Analysis Hacker News · 06.07.2026 Модель Simba 3.2 от компании Speechify заняла первую строчку в обновленном рейтинге Speech Arena, который составляет аналитическая платформа Artificial Analysis. Модель продемонстрировала лучшие показатели качества синтеза речи, обойдя конкурентов по естественности звучания и точности интонаций, что подтверждается результатами слепого тестирования и экспертной оценкой на базе бенчмарков для систем преобразования текста в речь. Tencent представила Hy3: MoE-модель на 295 млрд параметров Simon Willison's Weblog · 06.07.2026 Tencent выпустила Hy3 — новую языковую модель с архитектурой Mixture-of-Experts (MoE), насчитывающую 295 млрд параметров. Модель, распространяемая под лицензией Apache 2.0, прошла масштабный этап дообучения с использованием данных, собранных после тестирования превью-версии в более чем 50 продуктах компании. Разработчики заявляют о существенном превосходстве новинки над предыдущими итерациями в производительности и качестве генерации. Anthropic представила функцию анализа данных в Claude через Artifacts Hacker News · 06.07.2026 Компания Anthropic анонсировала обновление для своих языковых моделей, позволяющее пользователям работать с данными в интерактивном режиме. Новая функциональность превращает чат-интерфейс в полноценное рабочее пространство, где ИИ может генерировать, визуализировать и редактировать контент в реальном времени, обеспечивая более глубокую интеграцию с аналитическими задачами и кодом внутри единого окна браузера. Speechify представила модель Simba 3.2 для синтеза речи Hacker News · 06.07.2026 Компания Speechify выпустила новую версию своей модели синтеза речи Simba 3.2, которая заняла лидирующие позиции в рейтинге LMSYS Voice Arena. Разработчики заявляют о достижении оптимального баланса между качеством аудиопотока и стоимостью инференса, что делает решение конкурентоспособным для масштабируемых бизнес-приложений, требующих высокой скорости генерации голоса при сохранении естественности звучания. Tencent представила открытую модель Hy3 с архитектурой Mixture-of-Experts The Decoder · 06.07.2026 Компания Tencent выпустила открытую языковую модель Hy3, использующую архитектуру Mixture-of-Experts (MoE). При общем объеме в 295 миллиардов параметров, модель задействует лишь 21 миллиард параметров для обработки каждого токена. Разработчики заявляют, что Hy3 сопоставима по качеству с моделями, превосходящими её по размеру в 2–5 раз, при этом уровень галлюцинаций снижен до 5,4%. Tencent представила Hy3: эффективная модель для рассуждений и агентных задач Hacker News · 06.07.2026 Tencent выпустила Hy3 (Hunyuan-3), специализированную модель с 295 миллиардами параметров, ориентированную на сложные логические рассуждения и выполнение агентных задач. Разработчики сделали упор на высокую вычислительную эффективность, оптимизировав архитектуру для снижения затрат на инференс при сохранении производительности, сопоставимой с ведущими проприетарными решениями в задачах планирования и работы с инструментами. Sakana AI добавила функцию автоматического перевода в свой чат-интерфейс Hacker News · 06.07.2026 Компания Sakana AI обновила свой чат-сервис, внедрив встроенные возможности машинного перевода. Теперь пользователи могут общаться с моделями на разных языках, получая ответы на языке запроса или целевом языке. Это обновление направлено на расширение доступности японских LLM для международной аудитории и упрощение взаимодействия с многоязычными данными в реальном времени. Meituan представила LongCat-2.0: MoE-модель на 1,6 трлн параметров с контекстом 1 млн токенов MarkTechPost · 05.07.2026 Китайская компания Meituan анонсировала выпуск LongCat-2.0 — масштабной модели архитектуры Mixture-of-Experts (MoE) с общим объемом 1,6 триллиона параметров. Ключевой особенностью релиза стала поддержка нативного контекстного окна в 1 миллион токенов, реализованная за счет проприетарного механизма LongCat Sparse Attention. Модель оптимизирована для обучения и инференса на специализированных отечественных ASIC-кластерах. Китайская модель LongCat-2.0 обучена без использования чипов Nvidia Hacker News · 05.07.2026 Китайская исследовательская группа представила LongCat-2.0 — масштабную языковую модель, обучение которой прошло без использования графических процессоров Nvidia. Разработчики сфокусировались на оптимизации вычислительных процессов, что позволило достичь высокой производительности на альтернативном аппаратном обеспечении. Этот релиз демонстрирует возможность создания конкурентоспособных ИИ-систем в условиях экспортных ограничений на передовые западные чипы. Обзор Mistral AI: ключевые аспекты развития французского разработчика AI News & Artificial Intelligence | TechCrunch · 04.07.2026 Французская компания Mistral AI, основанная в 2023 году, стала одним из главных конкурентов OpenAI, делая ставку на развитие открытых и эффективных языковых моделей. Стартап привлекает значительные инвестиции для реализации стратегии по демократизации доступа к передовым технологиям искусственного интеллекта, предлагая как проприетарные решения, так и модели с открытым исходным кодом для широкого круга разработчиков и бизнеса.