Модели и релизы

EPFL представила первые полностью открытые медицинские LLM Hacker News · 18.06.2026 Исследователи из Федеральной политехнической школы Лозанны (EPFL) выпустили серию специализированных языковых моделей Meditron, предназначенных для работы в сфере здравоохранения. Это первые медицинские модели с полностью открытыми весами, кодом и набором данных для обучения, что позволяет медицинским организациям и разработчикам разворачивать их локально без передачи конфиденциальных данных сторонним облачным провайдерам. Релиз компактной модели для транскрибации китайского языка Hacker News · 18.06.2026 Разработчики представили специализированную модель для распознавания речи на китайском языке с параметрами 150 млн. Решение ориентировано на высокую скорость работы и оптимизировано для задач транскрибации в реальном времени. Ключевой особенностью системы является встроенная функция автоматического определения метаданных, что позволяет извлекать контекстную информацию непосредственно в процессе обработки аудиопотока. Выпущена открытая LLM GLM-5.2 с 753 миллиардами параметров Simon Willison's Weblog · 17.06.2026 Китайская лаборатория Z.ai представила модель GLM-5.2, которая на текущий момент претендует на звание самой мощной текстовой языковой модели с открытыми весами. Релиз состоялся спустя несколько дней после ограниченного доступа для подписчиков, и теперь веса модели доступны под лицензией MIT. Архитектура новинки основана на принципе Mixture of Experts (MoE), что позволяет эффективно использовать ресурсы при колоссальном объеме параметров. Выпущена специализированная модель KALYPSO-v1.1L для задач программирования Hacker News · 17.06.2026 Компания Genoma Labs представила открытую языковую модель KALYPSO-v1.1L с 14 миллиардами параметров. Релиз ориентирован на автоматизацию задач разработки программного обеспечения и агентные сценарии использования. Модель прошла обучение на специализированном наборе данных Kraken, который был подготовлен для улучшения навыков написания кода, отладки и понимания архитектурных паттернов. Zhipu AI представила модель GLM-5.2 с контекстным окном в 1 млн токенов The Decoder · 17.06.2026 Китайская лаборатория Zhipu AI выпустила новую языковую модель GLM-5.2, распространяемую под лицензией MIT. Ключевой особенностью релиза стала поддержка контекстного окна объемом 1 миллион токенов, что позволяет обрабатывать значительные массивы данных за один запрос. Модель ориентирована на решение сложных задач, требующих длительного удержания контекста и глубокого анализа информации. DreamReasoner-8B: ускорение логических рассуждений через блочную диффузию arXiv · 17.06.2026 Исследователи представили DreamReasoner-8B — открытую языковую модель, использующую метод блочной диффузии для генерации цепочек рассуждений (Chain-of-Thought). В отличие от стандартных авторегрессионных моделей, которые генерируют текст токен за токеном, блочные диффузионные модели позволяют выполнять параллельное шумоподавление сразу для нескольких сегментов текста. Это решение направлено на преодоление ограничений скорости при выполнении сложных логических задач, требующих длинных последовательностей рассуждений. GLM-5.2 обогнала Fable 5 в логических задачах Hacker News · 17.06.2026 Китайская модель GLM-5.2 от компании Zhipu AI показала лучшие результаты в логических тестах по сравнению с Fable 5 от Mistral. Это произошло всего через 24 часа после введения США ограничений на экспорт ИИ-технологий в Китай. Sumi: новая архитектура диффузионных языковых моделей arXiv · 17.06.2026 Исследователи представили Sumi — первую языковую модель, основанную на принципе равномерной диффузии (Uniform Diffusion Language Model, UDLM), которая была обучена с нуля на значительном объеме данных и с большим количеством параметров. В отличие от традиционных авторегрессионных моделей, которые генерируют текст последовательно, токен за токеном, подход UDLM позволяет обновлять любой токен на любом этапе генерации. Это открывает возможности для более гибкого управления процессом создания текста и потенциально меняет подход к архитектуре больших языковых моделей. Qwen и Fable объединили усилия для создания открытой модели кодирования Hacker News · 17.06.2026 Команды Qwen и Fable представили Qwable-v1 — открытую модель кодирования на 35 миллиардов параметров с архитектурой Mixture-of-Experts. Это первая модель такого масштаба, специально обученная для выполнения задач программирования с использованием агентных подходов. GLM-5.2 возглавил рейтинг открытых моделей на Artificial Analysis Hacker News · 17.06.2026 GLM-5.2 от Tsinghua University и Zhipu AI занял первое место в рейтинге открытых моделей на платформе Artificial Analysis. Это обновлённая версия модели, которая теперь демонстрирует лучшие результаты по сравнению с предыдущими версиями и конкурентами. GLM-5.2: новая модель для сложных задач с долгим горизонтом Hacker News · 17.06.2026 Команда ZAI представила GLM-5.2 — модель, оптимизированную для задач с долгим горизонтом. Это значит, что она лучше справляется с задачами, требующими последовательного выполнения шагов или анализа больших объёмов информации. Сравнение Claude и ChatGPT в ревью кода Hacker News · 17.06.2026 В новом исследовании сравнили возможности моделей Claude и ChatGPT в задачах ревью кода. Обе модели показали высокую точность в выявлении ошибок, но у каждой есть свои сильные и слабые стороны. GLM-5.2 возглавила рейтинг открытых моделей в Intelligence Index v4.1 Hacker News · 17.06.2026 GLM-5.2, модель от китайской компании Tsinghua University, заняла первое место в рейтинге открытых моделей Intelligence Index v4.1. Это значительное достижение для открытых моделей, так как ранее лидерство обычно принадлежало закрытым решениям от крупных компаний. Claude Code научился рефлексии Hacker News · 17.06.2026 Команда Anthropic представила обновление для Claude Code, добавив в модель способность к рефлексии. Новый функционал позволяет ИИ анализировать свои собственные ответы и корректировать их на основе полученной обратной связи. GLM 5.2 вошла в топ-2 Code Arena по фронтенду Hacker News · 17.06.2026 Новая версия модели GLM 5.2 заняла второе место в рейтинге Code Arena по фронтенд-задачам. Это подтверждает её способность эффективно генерировать и оптимизировать код для веб-разработки. Mistral AI анонсировала новую линейку моделей Hacker News · 17.06.2026 Mistral AI объявила о планах по выпуску новой линейки моделей. Компания намерена расширить своё портфолио, предложив пользователям более разнообразные и мощные решения для работы с искусственным интеллектом. Common Corpus: крупнейший набор данных для предобучения LLM Hacker News · 17.06.2026 Исследователи представили Common Corpus — крупнейший на сегодняшний день набор данных для предобучения языковых моделей. Проект включает более 1,5 триллиона токенов, собранных из открытых источников с соблюдением этических норм. GLM 5.2 показал высокие результаты в бенчмарках Hacker News · 17.06.2026 Новая версия модели GLM 5.2 продемонстрировала впечатляющие результаты в различных бенчмарках. Согласно последним тестам, модель превзошла своих предшественников по ряду ключевых метрик, включая точность и скорость обработки запросов. Выпущена предобученная версия GPT-2 124M на 27.5 млрд токенов Hacker News · 17.06.2026 Разработчики из проекта ml-by-hand выпустили предобученную версию модели GPT-2 с 124 миллионами параметров. Модель была обучена на наборе данных OpenWebText, содержащем 27.5 миллиарда токенов. MiniMax представила MSA: эффективный механизм сжатого внимания MarkTechPost · 17.06.2026 Компания MiniMax анонсировала MSA (MiniMax Sparse Attention) — новый механизм сжатого внимания, основанный на Grouped Query Attention (GQA). MSA использует двухветвую архитектуру: лёгкий Index Branch выбирает Top-k блоков ключ-значение для каждого запроса и группы GQA, а Main Branch обрабатывает только эти блоки. Cursor обучает модель с 1.5 триллионами параметров на 100 тысячах GPU Hacker News · 17.06.2026 Компания Cursor анонсировала обучение новой языковой модели с 1.5 триллионами параметров. Для этого процесса используется 100 тысяч графических процессоров, что делает этот проект одним из самых масштабных в области искусственного интеллекта. Claude Sonnet 4.6 испытывает ошибки Hacker News · 17.06.2026 Компания Anthropic сообщила о проблемах с моделью Claude Sonnet 4.6. На странице статуса сервиса указаны текущие неполадки, которые могут влиять на работу пользователей. Как мелкие модели могут конкурировать с крупными Hacker News · 16.06.2026 Исследователи из DeepClause предложили метод, позволяющий мелким языковым моделям демонстрировать производительность, сопоставимую с крупными аналогами. В статье на Substack они объясняют, что ключевым фактором является не количество параметров, а эффективность архитектуры и стратегии обучения. Wolfram Language и Mathematica 15: интеграция ИИ и новые возможности Hacker News · 16.06.2026 Компания Wolfram выпустила новую версию Wolfram Language и Mathematica 15, которая включает в себя встроенного ИИ-ассистента и множество других функций. Новый ассистент предназначен для автоматизации задач и упрощения работы с системой.