Оценка и бенчмарки

AdvertBench: новый бенчмарк для оценки рекламного креатива LLM Hacker News · 21.06.2026 Исследователи представили AdvertBench — специализированный набор тестов для оценки способности больших языковых моделей генерировать визуальную рекламу. Инструмент фокусируется на ключевых аспектах маркетингового контента: соответствии заданным визуальным стилям, точности передачи рекламного посыла и способности моделей следовать сложным инструкциям при создании изображений. Обновление бенчмарка DeepSWE для оценки навыков ИИ в разработке ПО Hacker News · 21.06.2026 Опубликована актуальная версия бенчмарка DeepSWE, предназначенного для оценки способности больших языковых моделей решать задачи по написанию и отладке программного кода в реальных проектах. В обновлении представлена интеграция модели GLM 5.2, а также пересмотрены показатели производительности для ряда других популярных нейросетевых архитектур. Инструмент сфокусирован на проверке того, насколько эффективно ИИ справляется с комплексными задачами, требующими понимания структуры репозитория и внесения правок в существующий код. Новый фреймворк PRIME для оценки поведения LLM при противоречивых инструкциях arXiv · 21.06.2026 Исследователи представили фреймворк PRIME (Prompt Resolution under Incompatible Meta-Instructions Evaluation), предназначенный для анализа того, как большие языковые модели справляются с конфликтующими командами. Существующие бенчмарки часто тестируют следование инструкциям в изолированных условиях, что не позволяет оценить поведение моделей в реальных сценариях, где пользовательские запросы могут содержать логические противоречия или взаимоисключающие требования. FunnyBench: новый бенчмарк для оценки чувства юмора у ИИ-моделей Hacker News · 20.06.2026 Исследователи представили FunnyBench — специализированный набор данных и методологию для оценки способности больших языковых моделей понимать и генерировать юмор. В отличие от стандартных тестов на логику или программирование, этот бенчмарк фокусируется на когнитивных аспектах комического: распознавании иронии, сарказма, каламбуров и неожиданных сюжетных поворотов, которые лежат в основе человеческого смеха. LLM достигли предела в интерпретации контринтуитивных графиков Hacker News · 20.06.2026 Исследователи проанализировали способности современных языковых моделей в интерпретации визуальных данных с помощью бенчмарка Bluffbench. Тестирование показало, что топовые модели достигли уровня насыщения: они успешно распознают закономерности даже на контринтуитивных графиках, где визуальное представление данных противоречит логическим выводам. Это означает, что текущие архитектуры практически полностью освоили базовые навыки визуальной аналитики, заложенные в этот набор тестов. Google представила методологию оценки агентного веб-серфинга в Lighthouse Lobsters · 20.06.2026 Команда Chrome представила обновленный подход к оценке производительности и эффективности ИИ-агентов, взаимодействующих с веб-интерфейсами. Новый стандарт Lighthouse ориентирован на измерение того, насколько успешно автономные системы справляются с навигацией по сайтам, заполнением форм и выполнением целевых действий в браузере. Методология фокусируется на ключевых метриках: точности выполнения задач, времени отклика и надежности взаимодействия с элементами DOM. Hex представила лабораторию для оценки ИИ-агентов в аналитике данных Hacker News · 20.06.2026 Компания Hex запустила специализированную среду для тестирования и оценки производительности ИИ-агентов, работающих с данными. Инструмент позволяет количественно измерять точность выполнения SQL-запросов, корректность интерпретации аналитических выводов и надежность работы с кодом в реальных рабочих процессах. Лаборатория предоставляет стандартизированный набор метрик, которые помогают разработчикам выявлять слабые места в логике агентов до их внедрения в продакшн. Методологии тестирования агентных систем в интерфейсе командной строки Hacker News · 19.06.2026 Оценка эффективности агентных систем, работающих через интерфейс командной строки (CLI), требует комплексного подхода, выходящего за рамки стандартных тестов для языковых моделей. Основная сложность заключается в проверке способности агента взаимодействовать с файловой системой, выполнять системные вызовы и корректно интерпретировать результаты выполнения команд в реальном времени. Сравнительный анализ производительности моделей GLM-5.2 и Claude Opus 4.8 Hacker News · 19.06.2026 Опубликовано детальное сравнение возможностей двух актуальных языковых моделей: GLM-5.2 и Claude Opus 4.8. Исследование сфокусировано на оценке эффективности нейросетей в задачах логического вывода, написании программного кода и работе с длинным контекстом. Авторы проанализировали поведение моделей на специализированных наборах данных, чтобы выявить сильные и слабые стороны каждой архитектуры в реальных сценариях использования. Сравнение производительности моделей MiniMax M3 и GLM 5.2 в задачах программирования Hacker News · 19.06.2026 Исследователи провели сравнительный анализ двух актуальных языковых моделей, MiniMax M3 и GLM 5.2, сфокусировавшись на их способности к автономной генерации программного кода. В ходе тестирования использовались специализированные наборы задач, имитирующие реальные сценарии разработки, где ИИ должен не просто дополнять фрагменты кода, но и самостоятельно проектировать архитектуру решений, исправлять ошибки и реализовывать функциональность с нуля. Сравнение частоты галлюцинаций в моделях GPT-5.5 и GLM-5.2 Hacker News · 19.06.2026 Исследователи представили сравнительный анализ точности генерации ответов для крупных языковых моделей GPT-5.5 и GLM-5.2. Согласно полученным данным, модель GPT-5.5 демонстрирует в три раза более высокий уровень галлюцинаций по сравнению с GLM-5.2, распространяемой под лицензией MIT. Тестирование проводилось на наборах данных, требующих высокой фактологической точности и логической последовательности. CEO-Bench: тестирование способности ИИ управлять стартапом в течение 500 дней Hacker News · 19.06.2026 Исследователи представили CEO-Bench — новый бенчмарк для оценки автономных ИИ-агентов в условиях долгосрочного бизнес-планирования. В отличие от стандартных тестов, проверяющих разовые задачи, этот инструмент моделирует работу стартапа на временном отрезке в 500 виртуальных дней. Агенты должны принимать стратегические решения, управлять ресурсами, реагировать на рыночные изменения и адаптироваться к меняющимся условиям конкуренции. Новый бенчмарк показал низкую эффективность ИИ в реальных интеллектуальных задачах The Decoder · 19.06.2026 Исследователи представили новый бенчмарк, предназначенный для оценки способности нейросетей справляться с комплексной интеллектуальной работой. В отличие от стандартных тестов, проверяющих знание фактов или написание кода, этот инструмент имитирует реальные рабочие процессы, требующие многоэтапного планирования, анализа контекста и принятия решений. Результаты показали, что даже самые передовые языковые модели демонстрируют крайне низкие показатели в таких условиях. Представлен Terminal-Bench для оценки ИИ-агентов в терминальной среде Hacker News · 19.06.2026 Разработчики представили Terminal-Bench — новый набор тестов, предназначенный для оценки способностей ИИ-агентов к выполнению сложных задач в среде командной строки. В отличие от стандартных бенчмарков, которые часто фокусируются на коротких запросах, этот инструмент моделирует сценарии с длинным горизонтом планирования. Он требует от модели последовательного выполнения множества операций, управления файловой системой и обработки большого объема промежуточных данных. Сервис In the Weights анализирует глубину знаний ИИ о личностях The Decoder · 19.06.2026 Бывшие сотрудники OpenAI запустили платформу In the Weights, которая позволяет оценить, насколько глубоко информация о конкретных людях «зашита» в веса популярных языковых моделей. Инструмент анализирует способность нейросетей воспроизводить факты о личностях, основываясь исключительно на данных, полученных в процессе обучения. Пользователи могут проверить, как модель «помнит» того или иного человека, и увидеть соответствующий показатель силы связи. Artificial Analysis представила методику оценки ИИ в интеллектуальной работе Hacker News · 18.06.2026 Аналитическая платформа Artificial Analysis выпустила инструмент Briefcase, предназначенный для оценки эффективности языковых моделей в решении сложных задач интеллектуального труда. В отличие от стандартных тестов, ориентированных на проверку академических знаний или написание кода, новая методика фокусируется на многоэтапных процессах, требующих анализа документов, синтеза информации и принятия решений в условиях неопределенности. Новый бенчмарк для оценки ИИ в повседневной медицинской помощи Hacker News · 18.06.2026 Исследователи из Mass General Brigham представили специализированный бенчмарк для оценки эффективности больших языковых моделей в клинической практике. Инструмент предназначен для проверки того, насколько корректно ИИ справляется с типичными задачами врача: постановкой предварительных диагнозов, интерпретацией симптомов и формированием планов лечения на основе данных пациентов. Споры вокруг модели VibeThinker-3B и проблемы оценки ИИ Hacker News · 18.06.2026 Китайская социальная сеть Weibo представила компактную языковую модель VibeThinker-3B, которая вызвала дискуссии в профессиональном сообществе. Несмотря на небольшой размер в 3 миллиарда параметров, модель демонстрирует высокие показатели в ряде тестов, что заставило экспертов вновь поднять вопрос о достоверности существующих методов оценки производительности нейросетей. Почему текущие бенчмарки для программирования не подходят для ИИ-агентов Hacker News · 18.06.2026 Авторы исследования указывают на фундаментальный разрыв между тем, как оцениваются способности ИИ в написании кода, и реальными задачами агентной разработки. Современные бенчмарки, такие как SWE-bench, фокусируются на решении изолированных задач в рамках одного репозитория, где модель должна лишь исправить конкретную ошибку. Однако работа полноценного ИИ-агента требует навыков, которые выходят за рамки простого написания функций: планирования, навигации по сложным кодовым базам, взаимодействия с внешними инструментами и итеративной отладки в условиях неопределенности. Медицинские ИИ-модели успешно проходят экзамены, но ошибаются в реальной практике Hacker News · 18.06.2026 Современные модели искусственного интеллекта демонстрируют высокие результаты при сдаче стандартизированных медицинских экзаменов, однако их эффективность резко снижается при работе с реальными клиническими случаями. Исследование показало, что академические тесты, на которых обучаются и тестируются алгоритмы, не отражают сложности диагностики и ведения пациентов в условиях стационара. Представлен Eot-bench для оценки точности определения конца фразы в голосовом ИИ Hacker News · 18.06.2026 Разработчики представили Eot-bench — открытый набор инструментов для тестирования систем распознавания речи и голосовых интерфейсов. Основная задача бенчмарка заключается в оценке качества работы алгоритмов End-of-Turn (EoT), которые определяют момент завершения реплики пользователя. Точность этого процесса критически важна для естественного взаимодействия с ИИ, так как ошибки приводят к преждевременным прерываниям или неоправданным задержкам в ответе. Исследование StylisticBias: как визуальные стили влияют на предвзятость мультимодальных ИИ arXiv · 18.06.2026 Исследователи представили бенчмарк StylisticBias, предназначенный для анализа того, как визуальные признаки на изображениях провоцируют социальные предубеждения в мультимодальных больших языковых моделях (MLLM). В отличие от предыдущих подходов, которые сравнивали реакции моделей на разных людей, новый метод изолирует конкретные визуальные стилистические сигналы, такие как одежда, прическа или аксессуары, сохраняя при этом идентичность субъекта неизменной. Расширение бенчмарка LiveCodeBench на несколько языков программирования arXiv · 18.06.2026 Исследователи представили Multi-LCB — расширенную версию бенчмарка LiveCodeBench, предназначенную для комплексной оценки навыков генерации кода у больших языковых моделей. Оригинальный проект LiveCodeBench стал стандартом в индустрии благодаря использованию актуальных задач с площадок для спортивного программирования и строгому контролю за утечкой данных, что позволяет объективно проверять способности моделей решать новые, ранее не встречавшиеся задачи. Новый бенчмарк CWE-Trace для проверки навыков LLM в поиске уязвимостей arXiv · 18.06.2026 Исследователи представили фреймворк CWE-Trace, предназначенный для оценки способности больших языковых моделей обнаруживать уязвимости в системном программном обеспечении. Основная проблема существующих решений заключается в том, что модели часто показывают высокие результаты на тестах лишь благодаря заучиванию данных, а не реальному пониманию принципов безопасности. Новый набор данных включает 834 тщательно отобранных примера из ядра Linux, охватывающих 74 типа типичных ошибок программирования (CWE).