Исследователи представили бенчмарк Handwritten-edit, оценивающий способность языковых моделей исправлять рукописный текст и выполнять точные манипуляции с данными. Результаты показали, что даже передовые модели демонстрируют значительные провалы в логике и счете: например, производительность Claude 3 Opus упала на 55% при выполнении задач на подсчет символов, в то время как модель Fable 5 заняла лидирующую позицию.
Бенчмарк фокусируется на сценариях, где модели должны не просто генерировать текст, а вносить точечные правки в уже существующий контент, сохраняя структуру и точность. Это критически важный навык для агентных систем, работающих с документами, кодом или сложными табличными данными, где любая ошибка в подсчете или форматировании делает результат непригодным для дальнейшего использования.
Результаты тестирования подчеркивают проблему «галлюцинаций внимания», когда модель теряет контекст при выполнении рутинных операций. Значительное снижение точности у флагманских моделей при усложнении задачи указывает на то, что текущие методы обучения не всегда гарантируют стабильность при работе с точными данными, требующими строгой последовательной обработки.
Ключевые факты
- Модель Fable 5 показала лучшие результаты в бенчмарке, опередив конкурентов в задачах на редактирование.
- Claude 3 Opus продемонстрировала регрессию в 55% при выполнении задач на подсчет элементов в тексте.
- Бенчмарк Handwritten-edit специально разработан для проверки устойчивости моделей к ошибкам при внесении правок в рукописный или структурированный контент.
- Тестирование выявило критические различия в производительности между моделями при переходе от простых задач к операциям, требующим высокой концентрации внимания.