Исследователи представили бенчмарк Handwritten-edit, оценивающий способность языковых моделей исправлять рукописный текст и выполнять точные манипуляции с данными. Результаты показали, что даже передовые модели демонстрируют значительные провалы в логике и счете: например, производительность Claude 3 Opus упала на 55% при выполнении задач на подсчет символов, в то время как модель Fable 5 заняла лидирующую позицию.

Бенчмарк фокусируется на сценариях, где модели должны не просто генерировать текст, а вносить точечные правки в уже существующий контент, сохраняя структуру и точность. Это критически важный навык для агентных систем, работающих с документами, кодом или сложными табличными данными, где любая ошибка в подсчете или форматировании делает результат непригодным для дальнейшего использования.

Результаты тестирования подчеркивают проблему «галлюцинаций внимания», когда модель теряет контекст при выполнении рутинных операций. Значительное снижение точности у флагманских моделей при усложнении задачи указывает на то, что текущие методы обучения не всегда гарантируют стабильность при работе с точными данными, требующими строгой последовательной обработки.

Ключевые факты

  • Модель Fable 5 показала лучшие результаты в бенчмарке, опередив конкурентов в задачах на редактирование.
  • Claude 3 Opus продемонстрировала регрессию в 55% при выполнении задач на подсчет элементов в тексте.
  • Бенчмарк Handwritten-edit специально разработан для проверки устойчивости моделей к ошибкам при внесении правок в рукописный или структурированный контент.
  • Тестирование выявило критические различия в производительности между моделями при переходе от простых задач к операциям, требующим высокой концентрации внимания.