Новое исследование выявило значительные трудности у современных больших языковых моделей при генерации Base64-кодирования. Несмотря на способность моделей легко декодировать данные, процесс обратного преобразования часто приводит к ошибкам из-за особенностей токенизации. Авторы проекта представили специализированный бенчмарк, позволяющий оценить точность работы популярных LLM с этим форматом данных в различных условиях.
Проблема заключается в том, что стандартная токенизация текста не учитывает структуру Base64, где каждый символ несет строго определенное значение. Модели часто «галлюцинируют» или допускают пропуски при попытке перевести сложные строки в этот формат. Это создает риски при использовании ИИ для задач, требующих точной обработки бинарных данных или специфических протоколов передачи информации.
Бенчмарк включает в себя серию тестов, проверяющих как короткие, так и длинные последовательности. Результаты показывают, что даже продвинутые модели демонстрируют низкую надежность в задачах кодирования, что делает их непригодными для критически важных систем без дополнительных инструментов проверки или внешних функций-обработчиков.
Ключевые факты
- Исследование сфокусировано на фундаментальной неспособности LLM корректно обрабатывать Base64-кодирование из-за ограничений токенизатора.
- Представлен открытый бенчмарк, содержащий набор тестов для оценки точности кодирования в различных языковых моделях.
- Выявлено, что способность моделей к декодированию значительно превышает их возможности по генерации корректного Base64-кода.
- Ошибки при кодировании возникают даже у передовых моделей, что требует использования внешних программных библиотек для подобных операций.