Новое исследование выявило значительные трудности у современных больших языковых моделей при генерации Base64-кодирования. Несмотря на способность моделей легко декодировать данные, процесс обратного преобразования часто приводит к ошибкам из-за особенностей токенизации. Авторы проекта представили специализированный бенчмарк, позволяющий оценить точность работы популярных LLM с этим форматом данных в различных условиях.

Проблема заключается в том, что стандартная токенизация текста не учитывает структуру Base64, где каждый символ несет строго определенное значение. Модели часто «галлюцинируют» или допускают пропуски при попытке перевести сложные строки в этот формат. Это создает риски при использовании ИИ для задач, требующих точной обработки бинарных данных или специфических протоколов передачи информации.

Бенчмарк включает в себя серию тестов, проверяющих как короткие, так и длинные последовательности. Результаты показывают, что даже продвинутые модели демонстрируют низкую надежность в задачах кодирования, что делает их непригодными для критически важных систем без дополнительных инструментов проверки или внешних функций-обработчиков.

Ключевые факты

  • Исследование сфокусировано на фундаментальной неспособности LLM корректно обрабатывать Base64-кодирование из-за ограничений токенизатора.
  • Представлен открытый бенчмарк, содержащий набор тестов для оценки точности кодирования в различных языковых моделях.
  • Выявлено, что способность моделей к декодированию значительно превышает их возможности по генерации корректного Base64-кода.
  • Ошибки при кодировании возникают даже у передовых моделей, что требует использования внешних программных библиотек для подобных операций.