Модели и релизы
Sakana AI добавила функцию автоматического перевода в свой чат-интерфейс
Компания Sakana AI обновила свой чат-сервис, внедрив встроенные возможности машинного перевода. Теперь пользователи могут общаться с моделями на разных языках, получая ответы на языке запроса или целевом языке. Это обновление направлено на расширение доступности японских LLM для международной аудитории и упрощение взаимодействия с многоязычными данными в реальном времени.
Meituan представила LongCat-2.0: MoE-модель на 1,6 трлн параметров с контекстом 1 млн токенов
Китайская компания Meituan анонсировала выпуск LongCat-2.0 — масштабной модели архитектуры Mixture-of-Experts (MoE) с общим объемом 1,6 триллиона параметров. Ключевой особенностью релиза стала поддержка нативного контекстного окна в 1 миллион токенов, реализованная за счет проприетарного механизма LongCat Sparse Attention. Модель оптимизирована для обучения и инференса на специализированных отечественных ASIC-кластерах.
Китайская модель LongCat-2.0 обучена без использования чипов Nvidia
Китайская исследовательская группа представила LongCat-2.0 — масштабную языковую модель, обучение которой прошло без использования графических процессоров Nvidia. Разработчики сфокусировались на оптимизации вычислительных процессов, что позволило достичь высокой производительности на альтернативном аппаратном обеспечении. Этот релиз демонстрирует возможность создания конкурентоспособных ИИ-систем в условиях экспортных ограничений на передовые западные чипы.
Обзор Mistral AI: ключевые аспекты развития французского разработчика
Французская компания Mistral AI, основанная в 2023 году, стала одним из главных конкурентов OpenAI, делая ставку на развитие открытых и эффективных языковых моделей. Стартап привлекает значительные инвестиции для реализации стратегии по демократизации доступа к передовым технологиям искусственного интеллекта, предлагая как проприетарные решения, так и модели с открытым исходным кодом для широкого круга разработчиков и бизнеса.
DeepSeek представила новую архитектуру для эффективного обучения моделей
Компания DeepSeek выпустила обновление, которое существенно меняет подход к обучению крупномасштабных языковых моделей. Разработчики представили архитектурные решения, позволяющие значительно сократить вычислительные затраты при сохранении высокой производительности. Новые методы оптимизации направлены на повышение эффективности работы с параметрами и ускорение процесса обучения, что делает передовые ИИ-технологии более доступными для широкого спектра задач.
Mistral AI представила Leanstral 1.5 для формальной верификации кода
Компания Mistral AI выпустила Leanstral 1.5 — специализированную языковую модель, предназначенную для работы с языком формальной верификации Lean 4. Инструмент демонстрирует высокую эффективность в решении математических задач и поиске логических ошибок в программном обеспечении. В ходе тестирования на 57 открытых репозиториях модель успешно обнаружила пять ранее неизвестных багов, подтвердив применимость формальных методов в реальной разработке.
Mistral AI представила Leanstral-1.5-119B-A6B для формальной верификации
Компания Mistral AI выпустила Leanstral-1.5-119B-A6B — специализированную модель, предназначенную для автоматизации формальной верификации и математических доказательств в среде Lean 4. Модель с 119 миллиардами параметров оптимизирована для работы с кодом и логическими выводами, что позволяет значительно ускорить процесс проверки корректности алгоритмов и математических теорем в автоматизированных системах.
Meta догоняет OpenAI: новая LLM сравнялась по возможностям с флагманами рынка
Главный ученый по ИИ в Meta (признана экстремистской организацией, деятельность запрещена в РФ) Ян Лекун заявил, что готовящаяся к выпуску большая языковая модель компании достигла уровня производительности флагманских решений OpenAI. Новая разработка демонстрирует значительный прогресс в логических рассуждениях и качестве генерации, фактически ликвидируя технологический разрыв между исследовательскими лабораториями двух крупнейших игроков индустрии.
Mistral AI представила Leanstral 1.5 для формальной верификации кода
Компания Mistral AI выпустила Leanstral 1.5 — специализированную модель, предназначенную для работы с языком формальной верификации Lean 4. Модель демонстрирует высокую эффективность в решении математических задач, успешно справившись с 587 из 672 проблем в бенчмарке PutnamBench. Релиз распространяется под лицензией Apache-2.0, что делает его доступным для широкого использования в исследовательских и инженерных задачах.
Interfaze представила diffusion-gemma-asr-small: модель распознавания речи на базе диффузии
Компания Interfaze выпустила open-source модель diffusion-gemma-asr-small, которая использует диффузионный подход вместо традиционной авторегрессии для транскрибации аудио. Решение базируется на замороженной архитектуре DiffusionGemma от Google и дополняется компактным адаптером. Инновация позволяет перевести процесс распознавания речи в параллельный формат, где стоимость вычислений зависит от количества шагов шумоподавления, а не от длительности аудиозаписи.
Релиз GLM-5.2: открытая модель с производительностью уровня Claude при низкой стоимости
Разработчики представили GLM-5.2 — новую открытую языковую модель, которая демонстрирует результаты, сопоставимые с Claude 3.5 Sonnet, при этом стоимость её эксплуатации в пять раз ниже. Релиз ориентирован на создание эффективных альтернатив проприетарным решениям, позволяя компаниям снижать расходы на инференс без потери качества обработки сложных запросов и генерации контента.
Qwen-Image-Agent: новый подход к генерации изображений через агентные системы
Исследователи представили Qwen-Image-Agent — специализированную систему, решающую проблему нехватки контекста при генерации изображений. В отличие от стандартных моделей, этот агент использует итеративный процесс уточнения промптов и анализа визуальных данных, что позволяет точнее следовать сложным инструкциям пользователя и сохранять согласованность объектов в рамках многошаговых генеративных задач.
Португалия представила свою первую LLM с открытым исходным кодом
Португалия официально представила свою первую национальную языковую модель с открытым исходным кодом, стремясь укрепить технологический суверенитет страны в рамках общеевропейской стратегии развития ИИ. Проект направлен на поддержку португальского языка и культурных особенностей, обеспечивая локальным компаниям и государственным структурам доступ к независимым инструментам генеративного ИИ, не зависящим от крупных американских корпораций.
Вышла первая open-source диффузионная модель для распознавания речи
Команда Interfaze представила первую модель автоматического распознавания речи (ASR), построенную на архитектуре диффузии с открытым исходным кодом. В отличие от традиционных трансформеров, использующих авторегрессионный подход, новая модель генерирует транскрипцию через итеративное уточнение данных. Это позволяет достичь высокой точности распознавания при работе с аудиосигналами, открывая новые возможности для развития систем обработки естественного языка.
Китайская модель Qwen-2.5 от Alibaba догоняет лидеров рынка
Китайская технологическая компания Alibaba представила новую версию языковой модели Qwen-2.5, которая демонстрирует производительность, сопоставимую с ведущими западными аналогами от OpenAI и Anthropic. Разработчики сделали ставку на высокую эффективность и низкую стоимость инференса, что позволяет модели конкурировать с флагманскими решениями GPT-4o и Claude 3.5 Sonnet при значительно меньших затратах на эксплуатацию.
Google интегрировала возможности генерации и редактирования видео в Gemini 1.5 Flash
Google обновила API модели Gemini 1.5 Flash, добавив нативные инструменты для работы с видеоконтентом. Теперь разработчики могут использовать модель для генерации видеороликов, а также для их покадрового редактирования и анализа. Обновление направлено на ускорение создания мультимедийного контента за счет прямой интеграции возможностей модели в сторонние приложения и сервисы через API.
Anthropic обновила лимиты контекстного окна для моделей Claude
Компания Anthropic пересмотрела параметры контекстного окна для своих платных тарифов. Модель Claude 3 Opus теперь поддерживает до 100 000 токенов, что вдвое меньше прежнего значения. При этом модель Claude 3.5 Sonnet сохраняет расширенную поддержку до 1 миллиона токенов, предлагая пользователям более гибкие возможности для обработки объемных документов и длинных программных кодов в рамках подписки.
BamiBERT: новая языковая модель для вьетнамского языка с расширенным контекстом
Исследователи представили BamiBERT — новую предобученную модель на архитектуре BERT, оптимизированную для работы с вьетнамским языком. Разработка призвана устранить ограничения существующего стандарта PhoBERT. Модель обучена на корпусе объемом 129 ГБ и поддерживает контекстное окно до 2048 токенов, что значительно расширяет возможности обработки длинных текстов по сравнению с предыдущими решениями для данного языка.
Mistral AI представила Leanstral 1.5 для автоматизации математических доказательств
Компания Mistral AI выпустила Leanstral 1.5 — специализированную языковую модель, обученную на языке формальной верификации Lean. Система предназначена для автоматизации математических доказательств и проверки корректности кода. Модель демонстрирует высокую эффективность в решении сложных логических задач, делая инструменты формальной верификации более доступными для широкого круга исследователей и разработчиков, работающих с математическими вычислениями.
Почему Claude автоматически меняет модель в ходе диалога
Anthropic официально разъяснила механизм автоматического переключения между моделями Claude в рамках одного чата. Система динамически выбирает наиболее подходящую версию нейросети, основываясь на сложности запроса, текущем контексте и доступности вычислительных мощностей. Это позволяет оптимизировать скорость ответов и качество обработки данных, обеспечивая баланс между производительностью и точностью для пользователей платформы.
Anthropic представила Claude Science для работы с научными данными
Компания Anthropic выпустила специализированную версию модели Claude, оптимизированную для анализа научных исследований и обработки сложных технических данных. Новый инструмент призван ускорить работу ученых с массивами публикаций, помогая извлекать инсайты из неструктурированных текстов и формулировать гипотезы. Релиз подчеркивает тренд на создание вертикально ориентированных ИИ-решений для глубокой аналитики в академической и R&D-средах.
Анализ возможностей и ограничений модели Claude 3.5 Sonnet
Claude 3.5 Sonnet демонстрирует высокую эффективность в прикладных задачах, несмотря на то, что не является моделью «фронтирного» уровня в широком смысле. Анализ показывает, что модель оптимизирована для специфических рабочих процессов, где важны скорость и точность выполнения инструкций, что делает её надежным инструментом для повседневной разработки и автоматизации, даже если она уступает топовым решениям в решении сверхсложных логических задач.
Anthropic представила новые модели Claude Fable 5 и Claude Mythos 5
Компания Anthropic расширила линейку своих языковых моделей, выпустив Claude Fable 5 и Claude Mythos 5. Эти релизы направлены на повышение производительности в задачах, требующих сложного логического вывода и творческой генерации контента. Новые модели предлагают улучшенную точность ответов и оптимизированную работу с контекстом, что делает их более эффективными инструментами для профессиональной разработки и анализа данных.
GitHub Copilot интегрировал языковую модель Kimi K2.7 для задач программирования
GitHub объявил о доступности специализированной модели Kimi K2.7 Code для пользователей Copilot. Новая модель оптимизирована для генерации кода, отладки и архитектурных задач, обеспечивая повышенную точность при работе со сложными репозиториями. Интеграция направлена на ускорение разработки за счет улучшения понимания контекста проекта и снижения количества ошибок в предлагаемых фрагментах кода.