Модели и релизы
Китайский стартап MiniMax готовит к выпуску модель на 2,7 трлн параметров
Китайская компания MiniMax анонсировала разработку крупной языковой модели с архитектурой Mixture-of-Experts, насчитывающей 2,7 триллиона параметров. Разработчики планируют опубликовать модель в открытом доступе до конца текущего года. Этот шаг может существенно изменить ландшафт открытых ИИ-решений, предоставляя сообществу доступ к одной из самых масштабных моделей на рынке.
Анонс выхода новой модели Grok 4.5
Компания xAI официально анонсировала скорый релиз Grok 4.5. Новая версия модели призвана расширить возможности текущей линейки ИИ-решений, доступных пользователям платформы X. Разработчики делают ставку на улучшение логических способностей и точности ответов, продолжая конкурентную борьбу в сегменте больших языковых моделей, ориентированных на работу с актуальными данными в реальном времени.
OpenAI готовится к запуску GPT-5.6 после периода задержек
OpenAI анонсировала официальный релиз новой языковой модели GPT-5.6, который состоится в ближайший четверг. Ранее выпуск был отложен из-за необходимости прохождения дополнительных этапов проверки безопасности и получения регуляторных одобрений в США. Обновленная версия призвана расширить возможности текущей линейки моделей, предлагая улучшенные показатели производительности и более глубокую интеграцию в корпоративные рабочие процессы.
OpenAI выпускает модель GPT-5.6 после проверки правительством США
OpenAI анонсировала запуск модели GPT-5.6, который был отложен из-за требований правительства США по проведению дополнительных проверок безопасности. Новая модель, получившая внутреннее название Sol, по заявлениям разработчиков, превосходит Claude Mythos 5 от Anthropic в задачах программирования, при этом стоимость её использования сокращена вдвое. Релиз состоится в ближайший четверг.
NVIDIA представила Audex: мультимодальную модель для работы с аудио и текстом
NVIDIA выпустила Audex (Nemotron-Labs-Audex-30B-A3B) — универсальную мультимодальную модель на архитектуре Mixture-of-Experts (MoE). Система объединяет возможности распознавания речи, перевода, синтеза звука и генерации текста. Ключевой особенностью стало сохранение высоких когнитивных способностей базовой модели Nemotron-Cascade-2 при минимальном снижении производительности в текстовых задачах, что делает её эффективным инструментом для комплексной обработки аудиовизуальных данных.
OpenAI представила GPT-Live для естественного голосового взаимодействия
OpenAI анонсировала GPT-Live — новое поколение голосовых моделей, обеспечивающих более естественное и быстрое взаимодействие между человеком и ИИ. Технология уже интегрирована в голосовой режим ChatGPT, позволяя пользователям вести диалоги с минимальной задержкой, распознавать эмоциональные оттенки речи и получать мгновенные ответы в режиме реального времени без необходимости предварительной обработки текста.
Сравнение архитектуры Meta Muse с актуальными моделями генерации изображений
Meta (признана экстремистской организацией, деятельность запрещена в РФ) представила Muse — модель генерации изображений, использующую архитектуру Masked Generative Transformer. В отличие от диффузионных моделей, Muse работает с токенизированными визуальными данными, что обеспечивает высокую скорость инференса и качество генерации. В материале приводится сравнительный анализ производительности Muse относительно современных лидеров рынка, включая архитектуры Stable Diffusion и DALL-E.
Meta представила архитектуру Muse для генерации изображений и видео
Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) анонсировала семейство моделей Muse, использующих архитектуру Masked Generative Transformer. В отличие от диффузионных моделей, Muse работает с токенами в пространстве признаков, что обеспечивает высокую скорость генерации изображений и видео при сохранении качества, сопоставимого с современными аналогами, и поддержке редактирования контента через текстовые промпты.
Meta представила Muse: новую модель для генерации изображений
Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) выпустила Muse — новую нейросеть для генерации изображений. Модель ориентирована на высокую скорость работы и широкие возможности применения в бизнесе, включая создание рекламных креативов, дизайн интерьеров и инструменты для авторов контента. Muse демонстрирует значительный прогресс в качестве визуального синтеза и скорости обработки запросов.
Meta представила Muse Image для генерации изображений
Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) анонсировала Muse Image — новую модель генерации изображений, интегрированную в экосистему Meta AI. Система ориентирована на высокую скорость работы и улучшенную точность следования текстовым инструкциям, позволяя пользователям создавать визуальный контент непосредственно внутри социальных платформ компании.
Meta представила модель Muse Image для генерации изображений
Компания Meta (признана экстремистской организацией, деятельность запрещена в РФ) выпустила новую нейросеть Muse Image, разработанную подразделением Superintelligence Labs. Модель уже интегрирована в инструменты генерации изображений внутри Meta AI, Instagram (принадлежит Meta, признанной экстремистской и запрещённой в РФ) и WhatsApp. Технология позволяет создавать визуальный контент, включая возможность добавления других пользователей социальной сети на сгенерированные изображения.
Технические секреты успеха DeepSeek: как модель обошла Claude 3 Opus
Команда DeepSeek раскрыла архитектурные и методологические подходы, позволившие их последним моделям превзойти Claude 3 Opus в ряде бенчмарков. Основной упор был сделан на оптимизацию процесса обучения, использование специфических методов масштабирования и эффективную работу с данными, что позволило достичь высокой производительности при значительно меньших вычислительных затратах по сравнению с конкурентами от ведущих лабораторий.
Cohere выпустила открытую модель Transcribe Arabic для распознавания арабской речи
Компания Cohere представила Transcribe Arabic — специализированную модель с открытым исходным кодом, предназначенную для высокоточного распознавания арабской речи. Решение ориентировано на работу с диалектами, смешанной арабо-английской речью и переключением кодов, демонстрируя превосходство над существующими аналогами, такими как Whisper и OmniASR, в сложных лингвистических условиях.
Tencent представила открытую модель Hunyuan-3D с 295 млрд параметров
Tencent выпустила веса модели Hunyuan-3D (Hy3), насчитывающей 295 миллиардов параметров. Это масштабное решение ориентировано на генерацию высококачественных 3D-объектов по текстовым описаниям или изображениям. Релиз расширяет возможности открытых моделей в области 3D-контента, предоставляя разработчикам доступ к архитектуре, способной создавать сложные геометрические формы и текстуры с высокой детализацией для профессиональных задач.
Mistral представила Robostral Navigate для автономной навигации роботов
Компания Mistral AI выпустила Robostral Navigate — специализированную модель с 8 миллиардами параметров, предназначенную для автономной навигации роботов. Система достигает 76,6% точности в бенчмарке R2R-CE, используя данные только с одной RGB-камеры. Решение исключает необходимость в дорогостоящих лидарах или массивах датчиков глубины, упрощая аппаратную архитектуру для мобильных робототехнических платформ.
Tencent представила открытую MoE-модель Hy3 с 295 млрд параметров
Компания Tencent выпустила Hy3 — новую Mixture-of-Experts модель с общим объемом 295 млрд параметров, из которых 21 млрд активируются для обработки каждого токена. Модель поддерживает контекстное окно до 256 тысяч токенов и распространяется под лицензией Apache 2.0. Решение ориентировано на сложные агентные задачи, логические рассуждения и работу с длинными документами.
OpenAI обновила линейку моделей для работы в реальном времени
OpenAI представила обновленные модели GPT-realtime-2.1 и GPT-realtime-2.1-mini, предназначенные для низколатентного взаимодействия с аудио и текстом через API. Новые версии обеспечивают улучшенную скорость отклика и повышенную точность обработки голосовых команд, что критически важно для создания интерактивных агентных систем, требующих мгновенной реакции в режиме диалога.
Релиз Claude 3.5 Sonnet: новая веха в агентных возможностях
Anthropic представила обновленную модель Claude 3.5 Sonnet, которая демонстрирует значительный прогресс в выполнении сложных многошаговых задач. Разработчики сфокусировались на улучшении агентных навыков, позволяя модели эффективнее взаимодействовать с внешними инструментами и кодом. При этом стоимость использования API была снижена, что делает внедрение продвинутых ИИ-решений более доступным для бизнеса и разработчиков при сохранении высокой производительности.
Speechify Simba 3.2 возглавила рейтинг Speech Arena от Artificial Analysis
Модель Simba 3.2 от компании Speechify заняла первую строчку в обновленном рейтинге Speech Arena, который составляет аналитическая платформа Artificial Analysis. Модель продемонстрировала лучшие показатели качества синтеза речи, обойдя конкурентов по естественности звучания и точности интонаций, что подтверждается результатами слепого тестирования и экспертной оценкой на базе бенчмарков для систем преобразования текста в речь.
Tencent представила Hy3: MoE-модель на 295 млрд параметров
Tencent выпустила Hy3 — новую языковую модель с архитектурой Mixture-of-Experts (MoE), насчитывающую 295 млрд параметров. Модель, распространяемая под лицензией Apache 2.0, прошла масштабный этап дообучения с использованием данных, собранных после тестирования превью-версии в более чем 50 продуктах компании. Разработчики заявляют о существенном превосходстве новинки над предыдущими итерациями в производительности и качестве генерации.
Anthropic представила функцию анализа данных в Claude через Artifacts
Компания Anthropic анонсировала обновление для своих языковых моделей, позволяющее пользователям работать с данными в интерактивном режиме. Новая функциональность превращает чат-интерфейс в полноценное рабочее пространство, где ИИ может генерировать, визуализировать и редактировать контент в реальном времени, обеспечивая более глубокую интеграцию с аналитическими задачами и кодом внутри единого окна браузера.
Speechify представила модель Simba 3.2 для синтеза речи
Компания Speechify выпустила новую версию своей модели синтеза речи Simba 3.2, которая заняла лидирующие позиции в рейтинге LMSYS Voice Arena. Разработчики заявляют о достижении оптимального баланса между качеством аудиопотока и стоимостью инференса, что делает решение конкурентоспособным для масштабируемых бизнес-приложений, требующих высокой скорости генерации голоса при сохранении естественности звучания.
Tencent представила открытую модель Hy3 с архитектурой Mixture-of-Experts
Компания Tencent выпустила открытую языковую модель Hy3, использующую архитектуру Mixture-of-Experts (MoE). При общем объеме в 295 миллиардов параметров, модель задействует лишь 21 миллиард параметров для обработки каждого токена. Разработчики заявляют, что Hy3 сопоставима по качеству с моделями, превосходящими её по размеру в 2–5 раз, при этом уровень галлюцинаций снижен до 5,4%.
Tencent представила Hy3: эффективная модель для рассуждений и агентных задач
Tencent выпустила Hy3 (Hunyuan-3), специализированную модель с 295 миллиардами параметров, ориентированную на сложные логические рассуждения и выполнение агентных задач. Разработчики сделали упор на высокую вычислительную эффективность, оптимизировав архитектуру для снижения затрат на инференс при сохранении производительности, сопоставимой с ведущими проприетарными решениями в задачах планирования и работы с инструментами.