Модели и релизы
Выпущена предобученная версия GPT-2 124M на 27.5 млрд токенов
Разработчики из проекта ml-by-hand выпустили предобученную версию модели GPT-2 с 124 миллионами параметров. Модель была обучена на наборе данных OpenWebText, содержащем 27.5 миллиарда токенов.
MiniMax представила MSA: эффективный механизм сжатого внимания
Компания MiniMax анонсировала MSA (MiniMax Sparse Attention) — новый механизм сжатого внимания, основанный на Grouped Query Attention (GQA). MSA использует двухветвую архитектуру: лёгкий Index Branch выбирает Top-k блоков ключ-значение для каждого запроса и группы GQA, а Main Branch обрабатывает только эти блоки.
Cursor обучает модель с 1.5 триллионами параметров на 100 тысячах GPU
Компания Cursor анонсировала обучение новой языковой модели с 1.5 триллионами параметров. Для этого процесса используется 100 тысяч графических процессоров, что делает этот проект одним из самых масштабных в области искусственного интеллекта.
Claude Sonnet 4.6 испытывает ошибки
Компания Anthropic сообщила о проблемах с моделью Claude Sonnet 4.6. На странице статуса сервиса указаны текущие неполадки, которые могут влиять на работу пользователей.
Как мелкие модели могут конкурировать с крупными
Исследователи из DeepClause предложили метод, позволяющий мелким языковым моделям демонстрировать производительность, сопоставимую с крупными аналогами. В статье на Substack они объясняют, что ключевым фактором является не количество параметров, а эффективность архитектуры и стратегии обучения.
Wolfram Language и Mathematica 15: интеграция ИИ и новые возможности
Компания Wolfram выпустила новую версию Wolfram Language и Mathematica 15, которая включает в себя встроенного ИИ-ассистента и множество других функций. Новый ассистент предназначен для автоматизации задач и упрощения работы с системой.
VibeThinker-3B показал результат 80.2 на LCBv6
Новая модель VibeThinker-3B продемонстрировала высокий результат 80.2 на бенчмарке LCBv6. Это значительное достижение для модели такого размера, что подтверждает её конкурентоспособность на рынке ИИ.
GLM-5.2: открытые веса модели от Frontier Intelligence
Компания Frontier Intelligence выпустила модель GLM-5.2 с открытыми весами. Это крупная языковая модель, доступная для загрузки и использования без ограничений.
DeepSeek V4 Pro: мощь за пятую часть стоимости Claude
Компания DeepSeek представила новую версию своей модели V4 Pro, которая по заявлениям разработчиков превосходит аналогичные решения, но при этом стоит в пять раз дешевле, чем аналогичный продукт от Claude. Это достижение стало возможным благодаря оптимизации архитектуры и использованию новых методов обучения, которые позволили значительно снизить затраты на вычислительные ресурсы.
MambAdapter: лёгкие адаптеры на основе Mamba для трансфер-обучения
Исследователи представили MambAdapter — лёгкие адаптеры на основе архитектуры Mamba, предназначенные для трансфер-обучения. Новый подход позволяет эффективно переносить знания между задачами, сохраняя при этом низкие вычислительные затраты.
Как мигрировать с Claude на DeepSeek без потерь
Компания FireTiger поделилась опытом перехода с модели Claude на DeepSeek, избегая сбоев и потерь в работе. В блоге описаны ключевые шаги и подходы, которые помогли сохранить стабильность и эффективность системы.
Z.ai представила модель GLM 5.2
Компания Z.ai выпустила новую версию своей языковой модели GLM 5.2. Обновлённая модель демонстрирует улучшенные показатели в понимании контекста и генерации текста.
GPT-NL: национальная языковая модель для Нидерландов
В Нидерландах представлена GPT-NL — первая национальная языковая модель, обученная на местных данных. Разработка велась при участии исследователей из TNO, Delft University of Technology и других организаций. Модель предназначена для использования в государственных и коммерческих проектах, где требуется понимание голландского языка и контекста.
GLM-5.2: новая модель для сложных задач
Компания Zhipu AI представила модель GLM-5.2, оптимизированную для выполнения сложных задач, требующих длительного контекста. Новая версия поддерживает до 128K токенов, что позволяет обрабатывать большие объёмы текста и выполнять задачи, требующие глубокого анализа.
Claude сообщает о массовых ошибках в моделях
Компания Anthropic, разработчик ИИ-моделей Claude, сообщила о массовых ошибках в работе своих моделей. Инцидент затронул несколько версий, включая Claude 3.5 Sonnet, Claude 3 Opus и более ранние версии. Пользователи столкнулись с проблемами, такими как некорректные ответы, сбои в генерации текста и другие аномалии.
Как создать модель для анализа транзакций
NVIDIA опубликовала руководство по созданию собственной модели для анализа транзакций. В материале объясняется, как обрабатывать данные о платежах для выявления паттернов поведения пользователей.
Qwen-RobotWorld: новый подход к обучению мультимодальных агентов
Команда из Alibaba Group представила Qwen-RobotWorld — новый подход к обучению мультимодальных агентов. В техническом отчёте, опубликованном на arXiv, описаны методы, позволяющие моделям лучше понимать и взаимодействовать с физическим миром. Исследователи использовали комбинацию текстовых и визуальных данных, а также данные из симуляторов роботов для дообучения моделей.
Новая модель для реального времени взаимодействия с изображениями и текстом
Исследователи представили модель JoyAI-VL-Interaction, предназначенную для взаимодействия с изображениями и текстом в реальном времени. Она способна обрабатывать визуальные и текстовые данные одновременно, что открывает возможности для новых приложений в области компьютерного зрения и обработки естественного языка.
SubQ 1.1: линейное масштабирование внимания с 98% точностью
Исследователи представили обновлённую версию SubQ 1.1, модели, использующей линейно-масштабируемое разреженное внимание. Новый алгоритм обеспечивает 98% точность извлечения данных при работе с 12 миллионами токенов.
Выпущена серия моделей Boogu-Image для генерации и редактирования изображений
Представлено семейство открытых моделей Boogu-Image-0.1, предназначенных для генерации и редактирования визуального контента. Разработчики заявляют, что архитектура позволяет достигать качества, сопоставимого с проприетарными решениями, при использовании значительно меньшего объема обучающих данных. Проект распространяется под лицензией Apache-2.0, что делает его доступным для широкого круга исследовательских и прикладных задач в области компьютерного зрения.
Qwen-RobotSuite: три модели для робототехники
Команда Qwen представила Qwen-RobotSuite — набор из трёх моделей для робототехники. Каждая модель решает свою задачу: манипуляции, моделирование мира и навигацию.
Qwen3.6-27B: эффективная локальная модель для кодинга
Разработчик Georgi Gerganov поделился опытом использования локальной модели Qwen3.6-27B для задач программирования. В течение последнего месяца и полу он активно применял её на M2 Ultra и RTX 5090, отмечая её полезность в повседневных задачах.
Новый метод улучшения генерации изображений по тексту
Исследователи предложили новый подход к дообучению моделей генерации изображений по тексту. В статье на arXiv представлен метод STAR (SpatioTemporal Adaptive Reward Allocation), который учитывает временную и пространственную структуру процесса генерации.
Новый метод SoftMoE для эффективного масштабирования LLM
Исследователи предложили новый подход SoftMoE для улучшения работы архитектур Mixture-of-Experts (MoE) в языковых моделях. Традиционные MoE используют top-k маршрутизацию, которая активирует только часть экспертов, но из-за недифференцируемости этого оператора число активных экспертов фиксировано, что приводит к неэффективному использованию вычислительных ресурсов.