Исследователи представили новый подход к защите исходного кода от анализа с помощью больших языковых моделей. Метод использует состязательную обфускацию, которая делает код нечитаемым или вводящим в заблуждение для ИИ-агентов, при этом сохраняя его функциональность для компиляторов. Это решение направлено на предотвращение автоматизированного реверс-инжиниринга и кражи интеллектуальной собственности, выполняемых с помощью LLM.

Современные модели способны эффективно декомпилировать и анализировать программное обеспечение, что создает риски для проприетарных алгоритмов. Предложенный метод вносит в структуру кода специфические искажения, которые эксплуатируют особенности токенизации и внимания (attention mechanism) в архитектурах трансформеров. В результате ИИ-модели теряют точность при попытке интерпретировать логику программы или восстановить её исходную структуру.

Технология базируется на автоматизированной генерации защитных трансформаций, которые затрудняют работу инструментов статического анализа на базе ИИ. В отличие от классических методов обфускации, ориентированных на человека, этот подход сфокусирован на создании «шума», который критически снижает вероятность корректного предсказания кода нейросетью. Исследование демонстрирует, что даже при использовании мощных моделей для анализа, эффективность их работы падает до уровня случайного угадывания.

Ключевые факты

  • Метод использует состязательные атаки на этапе токенизации для дезориентации LLM при анализе кода.
  • Обфускация сохраняет полную работоспособность программы для стандартных компиляторов и интерпретаторов.
  • Исследование подтверждает значительное снижение точности (до 70-80%) популярных LLM при попытке интерпретации защищенных фрагментов кода.
  • Подход позволяет защищать критические участки бизнес-логики от автоматизированного сбора данных и анализа конкурентами.