Модели и релизы

Выпущена предобученная версия GPT-2 124M на 27.5 млрд токенов Hacker News · 17.06.2026 Разработчики из проекта ml-by-hand выпустили предобученную версию модели GPT-2 с 124 миллионами параметров. Модель была обучена на наборе данных OpenWebText, содержащем 27.5 миллиарда токенов. MiniMax представила MSA: эффективный механизм сжатого внимания MarkTechPost · 17.06.2026 Компания MiniMax анонсировала MSA (MiniMax Sparse Attention) — новый механизм сжатого внимания, основанный на Grouped Query Attention (GQA). MSA использует двухветвую архитектуру: лёгкий Index Branch выбирает Top-k блоков ключ-значение для каждого запроса и группы GQA, а Main Branch обрабатывает только эти блоки. Cursor обучает модель с 1.5 триллионами параметров на 100 тысячах GPU Hacker News · 17.06.2026 Компания Cursor анонсировала обучение новой языковой модели с 1.5 триллионами параметров. Для этого процесса используется 100 тысяч графических процессоров, что делает этот проект одним из самых масштабных в области искусственного интеллекта. Claude Sonnet 4.6 испытывает ошибки Hacker News · 17.06.2026 Компания Anthropic сообщила о проблемах с моделью Claude Sonnet 4.6. На странице статуса сервиса указаны текущие неполадки, которые могут влиять на работу пользователей. Как мелкие модели могут конкурировать с крупными Hacker News · 16.06.2026 Исследователи из DeepClause предложили метод, позволяющий мелким языковым моделям демонстрировать производительность, сопоставимую с крупными аналогами. В статье на Substack они объясняют, что ключевым фактором является не количество параметров, а эффективность архитектуры и стратегии обучения. Wolfram Language и Mathematica 15: интеграция ИИ и новые возможности Hacker News · 16.06.2026 Компания Wolfram выпустила новую версию Wolfram Language и Mathematica 15, которая включает в себя встроенного ИИ-ассистента и множество других функций. Новый ассистент предназначен для автоматизации задач и упрощения работы с системой. VibeThinker-3B показал результат 80.2 на LCBv6 Hacker News · 16.06.2026 Новая модель VibeThinker-3B продемонстрировала высокий результат 80.2 на бенчмарке LCBv6. Это значительное достижение для модели такого размера, что подтверждает её конкурентоспособность на рынке ИИ. GLM-5.2: открытые веса модели от Frontier Intelligence Hacker News · 16.06.2026 Компания Frontier Intelligence выпустила модель GLM-5.2 с открытыми весами. Это крупная языковая модель, доступная для загрузки и использования без ограничений. DeepSeek V4 Pro: мощь за пятую часть стоимости Claude Hacker News · 16.06.2026 Компания DeepSeek представила новую версию своей модели V4 Pro, которая по заявлениям разработчиков превосходит аналогичные решения, но при этом стоит в пять раз дешевле, чем аналогичный продукт от Claude. Это достижение стало возможным благодаря оптимизации архитектуры и использованию новых методов обучения, которые позволили значительно снизить затраты на вычислительные ресурсы. MambAdapter: лёгкие адаптеры на основе Mamba для трансфер-обучения Hacker News · 16.06.2026 Исследователи представили MambAdapter — лёгкие адаптеры на основе архитектуры Mamba, предназначенные для трансфер-обучения. Новый подход позволяет эффективно переносить знания между задачами, сохраняя при этом низкие вычислительные затраты. Как мигрировать с Claude на DeepSeek без потерь Hacker News · 16.06.2026 Компания FireTiger поделилась опытом перехода с модели Claude на DeepSeek, избегая сбоев и потерь в работе. В блоге описаны ключевые шаги и подходы, которые помогли сохранить стабильность и эффективность системы. Z.ai представила модель GLM 5.2 Hacker News · 16.06.2026 Компания Z.ai выпустила новую версию своей языковой модели GLM 5.2. Обновлённая модель демонстрирует улучшенные показатели в понимании контекста и генерации текста. GPT-NL: национальная языковая модель для Нидерландов Hacker News · 16.06.2026 В Нидерландах представлена GPT-NL — первая национальная языковая модель, обученная на местных данных. Разработка велась при участии исследователей из TNO, Delft University of Technology и других организаций. Модель предназначена для использования в государственных и коммерческих проектах, где требуется понимание голландского языка и контекста. GLM-5.2: новая модель для сложных задач Hacker News · 16.06.2026 Компания Zhipu AI представила модель GLM-5.2, оптимизированную для выполнения сложных задач, требующих длительного контекста. Новая версия поддерживает до 128K токенов, что позволяет обрабатывать большие объёмы текста и выполнять задачи, требующие глубокого анализа. Claude сообщает о массовых ошибках в моделях Hacker News · 16.06.2026 Компания Anthropic, разработчик ИИ-моделей Claude, сообщила о массовых ошибках в работе своих моделей. Инцидент затронул несколько версий, включая Claude 3.5 Sonnet, Claude 3 Opus и более ранние версии. Пользователи столкнулись с проблемами, такими как некорректные ответы, сбои в генерации текста и другие аномалии. Как создать модель для анализа транзакций NVIDIA Technical Blog · 16.06.2026 NVIDIA опубликовала руководство по созданию собственной модели для анализа транзакций. В материале объясняется, как обрабатывать данные о платежах для выявления паттернов поведения пользователей. Qwen-RobotWorld: новый подход к обучению мультимодальных агентов Hacker News · 16.06.2026 Команда из Alibaba Group представила Qwen-RobotWorld — новый подход к обучению мультимодальных агентов. В техническом отчёте, опубликованном на arXiv, описаны методы, позволяющие моделям лучше понимать и взаимодействовать с физическим миром. Исследователи использовали комбинацию текстовых и визуальных данных, а также данные из симуляторов роботов для дообучения моделей. Новая модель для реального времени взаимодействия с изображениями и текстом Hacker News · 16.06.2026 Исследователи представили модель JoyAI-VL-Interaction, предназначенную для взаимодействия с изображениями и текстом в реальном времени. Она способна обрабатывать визуальные и текстовые данные одновременно, что открывает возможности для новых приложений в области компьютерного зрения и обработки естественного языка. SubQ 1.1: линейное масштабирование внимания с 98% точностью Hacker News · 16.06.2026 Исследователи представили обновлённую версию SubQ 1.1, модели, использующей линейно-масштабируемое разреженное внимание. Новый алгоритм обеспечивает 98% точность извлечения данных при работе с 12 миллионами токенов. Выпущена серия моделей Boogu-Image для генерации и редактирования изображений GitHub · 16.06.2026 Представлено семейство открытых моделей Boogu-Image-0.1, предназначенных для генерации и редактирования визуального контента. Разработчики заявляют, что архитектура позволяет достигать качества, сопоставимого с проприетарными решениями, при использовании значительно меньшего объема обучающих данных. Проект распространяется под лицензией Apache-2.0, что делает его доступным для широкого круга исследовательских и прикладных задач в области компьютерного зрения. Qwen-RobotSuite: три модели для робототехники MarkTechPost · 16.06.2026 Команда Qwen представила Qwen-RobotSuite — набор из трёх моделей для робототехники. Каждая модель решает свою задачу: манипуляции, моделирование мира и навигацию. Qwen3.6-27B: эффективная локальная модель для кодинга Simon Willison's Weblog · 16.06.2026 Разработчик Georgi Gerganov поделился опытом использования локальной модели Qwen3.6-27B для задач программирования. В течение последнего месяца и полу он активно применял её на M2 Ultra и RTX 5090, отмечая её полезность в повседневных задачах. Новый метод улучшения генерации изображений по тексту arXiv · 16.06.2026 Исследователи предложили новый подход к дообучению моделей генерации изображений по тексту. В статье на arXiv представлен метод STAR (SpatioTemporal Adaptive Reward Allocation), который учитывает временную и пространственную структуру процесса генерации. Новый метод SoftMoE для эффективного масштабирования LLM arXiv · 16.06.2026 Исследователи предложили новый подход SoftMoE для улучшения работы архитектур Mixture-of-Experts (MoE) в языковых моделях. Традиционные MoE используют top-k маршрутизацию, которая активирует только часть экспертов, но из-за недифференцируемости этого оператора число активных экспертов фиксировано, что приводит к неэффективному использованию вычислительных ресурсов.