Модели и релизы

VibeThinker-3B показал результат 80.2 на LCBv6 Hacker News · 16.06.2026 Новая модель VibeThinker-3B продемонстрировала высокий результат 80.2 на бенчмарке LCBv6. Это значительное достижение для модели такого размера, что подтверждает её конкурентоспособность на рынке ИИ. GLM-5.2: открытые веса модели от Frontier Intelligence Hacker News · 16.06.2026 Компания Frontier Intelligence выпустила модель GLM-5.2 с открытыми весами. Это крупная языковая модель, доступная для загрузки и использования без ограничений. DeepSeek V4 Pro: мощь за пятую часть стоимости Claude Hacker News · 16.06.2026 Компания DeepSeek представила новую версию своей модели V4 Pro, которая по заявлениям разработчиков превосходит аналогичные решения, но при этом стоит в пять раз дешевле, чем аналогичный продукт от Claude. Это достижение стало возможным благодаря оптимизации архитектуры и использованию новых методов обучения, которые позволили значительно снизить затраты на вычислительные ресурсы. MambAdapter: лёгкие адаптеры на основе Mamba для трансфер-обучения Hacker News · 16.06.2026 Исследователи представили MambAdapter — лёгкие адаптеры на основе архитектуры Mamba, предназначенные для трансфер-обучения. Новый подход позволяет эффективно переносить знания между задачами, сохраняя при этом низкие вычислительные затраты. Как мигрировать с Claude на DeepSeek без потерь Hacker News · 16.06.2026 Компания FireTiger поделилась опытом перехода с модели Claude на DeepSeek, избегая сбоев и потерь в работе. В блоге описаны ключевые шаги и подходы, которые помогли сохранить стабильность и эффективность системы. Z.ai представила модель GLM 5.2 Hacker News · 16.06.2026 Компания Z.ai выпустила новую версию своей языковой модели GLM 5.2. Обновлённая модель демонстрирует улучшенные показатели в понимании контекста и генерации текста. GPT-NL: национальная языковая модель для Нидерландов Hacker News · 16.06.2026 В Нидерландах представлена GPT-NL — первая национальная языковая модель, обученная на местных данных. Разработка велась при участии исследователей из TNO, Delft University of Technology и других организаций. Модель предназначена для использования в государственных и коммерческих проектах, где требуется понимание голландского языка и контекста. GLM-5.2: новая модель для сложных задач Hacker News · 16.06.2026 Компания Zhipu AI представила модель GLM-5.2, оптимизированную для выполнения сложных задач, требующих длительного контекста. Новая версия поддерживает до 128K токенов, что позволяет обрабатывать большие объёмы текста и выполнять задачи, требующие глубокого анализа. Claude сообщает о массовых ошибках в моделях Hacker News · 16.06.2026 Компания Anthropic, разработчик ИИ-моделей Claude, сообщила о массовых ошибках в работе своих моделей. Инцидент затронул несколько версий, включая Claude 3.5 Sonnet, Claude 3 Opus и более ранние версии. Пользователи столкнулись с проблемами, такими как некорректные ответы, сбои в генерации текста и другие аномалии. Как создать модель для анализа транзакций NVIDIA Technical Blog · 16.06.2026 NVIDIA опубликовала руководство по созданию собственной модели для анализа транзакций. В материале объясняется, как обрабатывать данные о платежах для выявления паттернов поведения пользователей. Qwen-RobotWorld: новый подход к обучению мультимодальных агентов Hacker News · 16.06.2026 Команда из Alibaba Group представила Qwen-RobotWorld — новый подход к обучению мультимодальных агентов. В техническом отчёте, опубликованном на arXiv, описаны методы, позволяющие моделям лучше понимать и взаимодействовать с физическим миром. Исследователи использовали комбинацию текстовых и визуальных данных, а также данные из симуляторов роботов для дообучения моделей. Новая модель для реального времени взаимодействия с изображениями и текстом Hacker News · 16.06.2026 Исследователи представили модель JoyAI-VL-Interaction, предназначенную для взаимодействия с изображениями и текстом в реальном времени. Она способна обрабатывать визуальные и текстовые данные одновременно, что открывает возможности для новых приложений в области компьютерного зрения и обработки естественного языка. SubQ 1.1: линейное масштабирование внимания с 98% точностью Hacker News · 16.06.2026 Исследователи представили обновлённую версию SubQ 1.1, модели, использующей линейно-масштабируемое разреженное внимание. Новый алгоритм обеспечивает 98% точность извлечения данных при работе с 12 миллионами токенов. Выпущена серия моделей Boogu-Image для генерации и редактирования изображений GitHub · 16.06.2026 Представлено семейство открытых моделей Boogu-Image-0.1, предназначенных для генерации и редактирования визуального контента. Разработчики заявляют, что архитектура позволяет достигать качества, сопоставимого с проприетарными решениями, при использовании значительно меньшего объема обучающих данных. Проект распространяется под лицензией Apache-2.0, что делает его доступным для широкого круга исследовательских и прикладных задач в области компьютерного зрения. Qwen-RobotSuite: три модели для робототехники MarkTechPost · 16.06.2026 Команда Qwen представила Qwen-RobotSuite — набор из трёх моделей для робототехники. Каждая модель решает свою задачу: манипуляции, моделирование мира и навигацию. Qwen3.6-27B: эффективная локальная модель для кодинга Simon Willison's Weblog · 16.06.2026 Разработчик Georgi Gerganov поделился опытом использования локальной модели Qwen3.6-27B для задач программирования. В течение последнего месяца и полу он активно применял её на M2 Ultra и RTX 5090, отмечая её полезность в повседневных задачах. Новый метод улучшения генерации изображений по тексту arXiv · 16.06.2026 Исследователи предложили новый подход к дообучению моделей генерации изображений по тексту. В статье на arXiv представлен метод STAR (SpatioTemporal Adaptive Reward Allocation), который учитывает временную и пространственную структуру процесса генерации. Новый метод SoftMoE для эффективного масштабирования LLM arXiv · 16.06.2026 Исследователи предложили новый подход SoftMoE для улучшения работы архитектур Mixture-of-Experts (MoE) в языковых моделях. Традиционные MoE используют top-k маршрутизацию, которая активирует только часть экспертов, но из-за недифференцируемости этого оператора число активных экспертов фиксировано, что приводит к неэффективному использованию вычислительных ресурсов. Новый метод обучения для мультимодального математического мышления arXiv · 16.06.2026 Исследователи предложили новый подход к обучению мультимодальных моделей для решения математических задач. В статье на arXiv представлен метод MathVis-Fine, который учитывает сложные зависимости между текстом и изображениями в процессе решения задач. Google Cloud представил Open Knowledge Format для ИИ-агентов MarkTechPost · 16.06.2026 Google Cloud анонсировал Open Knowledge Format (OKF) — открытый формат для структурирования знаний, предназначенный для использования ИИ-агентами. OKF представляет собой спецификацию, которая формализует паттерн LLM-wiki, позволяя создавать каталоги знаний в виде markdown-файлов с YAML-фронтматером. Каждый файл описывает концепцию, которая должна содержать хотя бы поле типа. Locket — система управления доступом к функциям LLM Hacker News · 16.06.2026 Исследователи из Stanford University представили Locket — фреймворк для управления доступом к функциям LLM на уровне отдельных API-вызовов. Это позволяет гибко настраивать, какие функции и в каких условиях могут вызываться агентом, что критично для безопасности и контроля поведения ИИ-агентов. Локальный запуск моделей стал реальностью Hacker News · 15.06.2026 В последнее время локальный запуск больших языковых моделей (LLM) стал значительно проще и доступнее. Это связано с развитием технологий, которые позволяют запускать мощные модели даже на обычных ноутбуках. Например, модели вроде GPT-4 или Llama 2 теперь можно развернуть локально с помощью таких фреймворков, как Ollama или LM Studio. Это открывает новые возможности для разработчиков, которые хотят создавать ИИ-агенты с минимальными затратами на инфраструктуру. GitHub выпустил открытый датасет для обучения многоязычных моделей The GitHub Blog · 15.06.2026 GitHub представил новый открытый датасет, содержащий мультиязычный контент из репозиториев. Данные собраны из README, issues и pull requests и доступны под лицензией CC0-1.0. Модели класса Mythos станут глобальными к 2029 году Hacker News · 15.06.2026 По прогнозам экспертов, модели ИИ класса Mythos, обладающие высокой производительностью и доступностью, к 2029 году станут широко распространены по всему миру. Эти модели, которые уже демонстрируют впечатляющие результаты в различных задачах, включая обработку естественного языка и генерацию текста, могут значительно изменить ландшафт индустрии ИИ.