Исследователи представили CryptanalysisBench — специализированный набор тестов для оценки способностей больших языковых моделей в решении задач криптоанализа. Бенчмарк охватывает широкий спектр методов: от классических шифров до современных криптографических алгоритмов. Результаты показывают, что, несмотря на продвинутые навыки рассуждения, текущие модели сталкиваются с существенными трудностями при выполнении сложных криптографических операций, требующих высокой точности и математической строгости.

Криптоанализ традиционно считается областью, требующей глубоких знаний в теории чисел, комбинаторике и алгоритмическом мышлении. Авторы работы проанализировали, насколько эффективно нейросети могут дешифровать сообщения, находить уязвимости в реализации алгоритмов и проводить частотный анализ. Исследование выявило, что модели часто демонстрируют «галлюцинации» в логических цепочках, когда задача выходит за рамки стандартных паттернов, встречающихся в обучающей выборке.

Этот бенчмарк позволяет количественно измерить прогресс LLM в узкоспециализированных технических доменах. Полученные данные помогают разработчикам понять границы применимости ИИ в задачах, где цена ошибки критически высока, а также определить направления для дообучения моделей в области формальных методов и точных вычислений.

Ключевые факты

  • CryptanalysisBench включает задачи по взлому классических шифров, анализу симметричных алгоритмов и поиску криптографических уязвимостей.
  • Исследование подтвердило, что LLM показывают низкую эффективность в задачах, требующих многошаговых математических доказательств без опоры на готовые примеры из кода.
  • Бенчмарк выявил корреляцию между сложностью алгоритма и частотой логических ошибок, совершаемых моделями при попытке дешифровки.
  • Работа направлена на создание стандартизированной метрики для оценки способностей ИИ в области кибербезопасности и криптографии.